AI 爬虫进店先看什么?一天半内 robots.txt 16 次、sitemap 3 次、llms.txt 0 次
仪器窗一天半:robots.txt 16 次、sitemap 3 次、llms.txt 0 次。标配要做,顺序要对;单站短窗,不做全称断言。
最近常有人问:要不要为 AI 写一份 llms.txt?各种「AI 时代网站标配清单」也越开越长:robots.txt、sitemap、llms.txt、rss,一项都不敢漏。清单越长,就越需要知道:哪些文件真的有机器在读?与其互相猜测,不如直接看机器的手伸向了哪里。我们把自家网站当成仪器,逐笔记录每一次「机器文件」被拉取的实况。答案很直白:爬虫抢着看门禁告示,偶尔翻导览图,而那本特地为 AI 印的手册,没有人拿。
先说怎么量,以及样本有多年轻
所谓仪器,就是不做问卷、不引用传言,直接看自家服务器的逐笔访问记录。谁来过、拿了哪个文件、拿了几次,机器不会客气,也不会说谎。本站观测仪器于 2026-08-10 07:52 UTC 开机。到本文统计为止,窗只有一天半,对象是单一网站。这代表:下面每个数字,都只回答「本站、这扇窗内」的问题。样本很年轻,我们选择先把这件事说清楚,再谈结论。这也是本专栏一贯的做法:先亮仪器与限制,再亮数字。
一天半的机器文件点名簿
四种机器文件的被拉取次数:
- robots.txt:16 次
- sitemap.xml:3 次
- llms.txt:0 次
- rss:0 次
逐一点名:YandexBot 12 次、Facebook 2 次、Googlebot 2 次、GPTBot 1 次、OAI-SearchBot 1 次、Bingbot 1 次。
最值得看的细节:OpenAI 的两只爬虫各来了 1 次,拉的都是 robots.txt——不是 llms.txt。
名单比名次更有意思
读机器文件最勤的,不是想象中的 AI 明星。排行由 YandexBot 的 12 次遥遥领先,Facebook 与 Googlebot 各 2 次。与 AI 检索直接相关的三家——GPTBot、OAI-SearchBot、Bingbot——各只来 1 次。
这份名单提醒我们两件事。第一,「谁勤读机器文件」与「谁替你带来读者」是两回事,读取频率不等于影响力。第二,AI 爬虫不是不来;它们来了,只是拿走的是 robots.txt。换句话说,别用「有没有被 AI 爬」安慰自己,也别用「爬得多」吓自己;要看的是它伸手拿了什么,以及拿完之后你得到什么。
换成开店的语言
延续前作的比喻:把网站当成一家店。robots.txt 是门口的门禁告示,写着哪里能进、哪里不能进。sitemap.xml 是楼层导览图。llms.txt 是为 AI 贵宾特制的精装导览手册。rss 则是「新品到货通知」的订阅单。
一天半里的实况是:门禁告示被看了 16 次,导览图被翻了 3 次,精装手册没人拿,订阅单没人填。你花最多心思准备的,未必是客人伸手去拿的。
llms.txt 挂零,其实不意外
先说立场:我们不反对放 llms.txt,它的成本极低。我们反对的是把它排在清单前面,当成「AI 看得见你」的门票。
Google 的官方文件明白写着:它的 AI 功能不需要网站另外提供 AI text files(developers.google.com/search/docs/appearance/ai-features)。也就是说,搜索巨头自己宣告不看这种文件。而在我们店里,OpenAI 的爬虫来了,也只看门禁告示。官方的宣告与机器的行为,这次对上了。
支持 llms.txt 的理由,多半是「以后也许有用」。也许。但「以后也许」不该排在「现在确定」前面——这是优先序问题,不是信仰问题。
sitemap 的价值,不在被读次数
导览图只被翻了 3 次,但别因此小看它。本站实测过一组对照:sitemap 未提交前,Google 对本站页面的回复是「URL is unknown」;提交之后,才被受理。导览图的用处,不是客人翻得多勤,而是大楼管理处愿不愿意把你的柜位登进目录。被读次数低,不等于没有价值,这两件事要分开算。
也别忘了前作账本的大局:五个月内,AI 公司对本站爬取约 3,000 万次,换来 476 次真人点击(可见下限;详见 https://km.idaeo.ai/ai/ai-crawler-shop-ledger )。爬虫真正忙的,是搬你的内容,不是读你为它多写的文件。
限制:这扇窗还很小
- 窗只有一天半,样本天生年轻。
- 只观测了一个站,不能代表别人的店。
- llms.txt 的 0 次,是「本站窗内的观测」,不是「llms.txt 没人读」的全称断言。别的站、别的时间窗,结果可能不同。
- 本文只统计机器文件的拉取;一般内容页的爬取是另一本账,不在本文范围。
窗会继续累积,数字变了我们就更新。
行动:标配要做,顺序要对
这份顺序不是品味,是照本站实际被拉取的次数排出来的。
第一步,把 robots.txt 顾好。它是被拉最多的文件;先确认拿得到、规则写对,别让门禁告示自己挡错人。
第二步,把 sitemap 做好并且提交。重点在「提交后被受理」,不在被读次数。
第三步,llms.txt 想放就放,成本很低;但别把它排在前两步之前,也别期待它带来流量。
省下来的力气,拿去写值得被 AI 引用的内容。机器文件是门面,内容才是货。
FAQ
- llms.txt 到底是什么?
- 一种放在网站根目录的纯文本文件提案,想帮 AI 快速理解网站内容。目前它是社区提案,还不是各家爬虫承诺遵守的标准。
- llms.txtとは何ですか? — ウェブサイトのルートに置くプレーンテキストファイルの提案で、AIがサイト内容を素早く理解する助けを目指したものです。現時点ではコミュニティの提案であり、各社のクローラーが遵守を約束した標準ではありません。
- What exactly is llms.txt? — A community proposal: a plain-text file placed at a website's root, meant to help AI systems quickly understand the site's content. For now it is a proposal, not a standard that major crawlers have committed to honoring.
- llms.txt 是不是完全没用?
- 我们不能这样说。能说的是:本站一天半的窗内,它被读取 0 次。放它的成本很低;指望它带来什么,目前的数字不支持。
- llms.txtはまったく無意味なのですか? — そうは言えません。言えるのは、本サイトの一日半の窓の中で読み取りが0回だったことです。置くコストはごくわずかですが、何かを期待する根拠は、いまの数字にはありません。
- Is llms.txt completely useless, then? — We cannot say that. What we can say: within this site's day-and-a-half window, it was fetched 0 times. Publishing it costs little; expecting much from it is not supported by the current numbers.
- GPTBot 有来吗?来了看什么?
- 有。GPTBot 与 OAI-SearchBot 各来 1 次,拉的都是 robots.txt,不是 llms.txt。
- GPTBotは来ましたか?何を見ましたか? — 来ました。GPTBotとOAI-SearchBotが各1回、取得したのはどちらもrobots.txtで、llms.txtではありません。
- Did GPTBot come? What did it look at? — Yes. GPTBot and OAI-SearchBot came once each, and both fetched robots.txt, not llms.txt.
- sitemap 才被读 3 次,还要做吗?
- 要。本站实测:sitemap 未提交前,Google 对本站页面回复「URL is unknown」;提交后才被受理。它的价值在登记,不在被翻阅的次数。
- sitemapは3回しか読まれていないのに、作るべきですか? — 作るべきです。本サイトの実測では、sitemap提出前はGoogleが本サイトのページに「URL is unknown」と回答し、提出後にはじめて受理されました。価値は登録にあり、閲覧回数にはありません。
- The sitemap was read only 3 times — is it still worth doing? — Yes. Our own test: before the sitemap was submitted, Google answered "URL is unknown" for this site's pages; after submission they were accepted. Its value lies in registration, not readership.
- Google 需要我提供 llms.txt 吗?
- Google 官方文件明言,其 AI 功能不需要网站提供额外的 AI text files(developers.google.com/search/docs/appearance/ai-features)。
- Googleは私のllms.txtを必要としますか? — Googleの公式ドキュメントは、同社のAI機能のためにウェブサイトが追加のAI text filesを提供する必要はないと明言しています(developers.google.com/search/docs/appearance/ai-features)。
- Does Google need me to provide an llms.txt? — Google's official documentation states that its AI features do not require websites to provide additional AI text files (developers.google.com/search/docs/appearance/ai-features).
- 想让 AI 更快读到新文章,关键是什么?
- 前作实测:新内容发布后,ClaudeBot 首爬中位 4.2 小时,OAI-SearchBot 要 332.8 小时(13.9 天)(https://km.idaeo.ai/ai/ai-crawler-marketing )。差异来自各家爬虫自己的节奏,与 llms.txt 无关;能顾好的是索引管道与内容质量。
- AIに新しい記事を早く読ませたいなら、鍵は何ですか? — 前作の実測では、新コンテンツ公開後の初回クロールはClaudeBotが中央値4.2時間、OAI-SearchBotは332.8時間(13.9日)でした( https://km.idaeo.ai/ai/ai-crawler-marketing )。差は各クローラー自身のリズムから来るもので、llms.txtとは関係ありません。手を打てるのはインデックス経路とコンテンツの品質です。
- If I want AI to reach new articles sooner, what matters? — From our earlier measurement: after new content is published, ClaudeBot's median first crawl comes at 4.2 hours, while OAI-SearchBot takes 332.8 hours (13.9 days) ( https://km.idaeo.ai/ai/ai-crawler-marketing ). The gap comes from each crawler's own rhythm, not from llms.txt; what you can actually tend to is your indexing pipeline and content quality.
- rss 也是 0 次,订阅通知没用了吗?
- 同样只能说「本站窗内 0 次」。rss 对真人读者与其他服务可能仍有用,这里量到的只是机器文件拉取。
- RSSも0回でした。購読通知はもう無用ですか? — これも「本サイトの窓の中で0回」としか言えません。RSSは人間の読者や他のサービスにはまだ有用かもしれません。ここで測ったのは機械向けファイルの取得だけです。
- RSS is also at 0 — are subscription feeds useless now? — Again, all we can say is "0 within this site's window." RSS may still serve human readers and other services; what we measured here is only machine-file fetches.
来源锚定
引用本文
TK Lin・《AI 爬虫进店先看什么?一天半内 robots.txt 16 次、sitemap 3 次、llms.txt 0 次》・IDAEO 知識庫・2026-08-11・https://km.idaeo.ai/ai/machine-files-priority