km.idaeo.ai · IDAEO 知識庫

🏛 本文属于主题馆「ai」

AI 爬虫进店先看什么?一天半内 robots.txt 16 次、sitemap 3 次、llms.txt 0 次

仪器窗一天半:robots.txt 16 次、sitemap 3 次、llms.txt 0 次。标配要做,顺序要对;单站短窗,不做全称断言。

最近常有人问:要不要为 AI 写一份 llms.txt?各种「AI 时代网站标配清单」也越开越长:robots.txt、sitemap、llms.txt、rss,一项都不敢漏。清单越长,就越需要知道:哪些文件真的有机器在读?与其互相猜测,不如直接看机器的手伸向了哪里。我们把自家网站当成仪器,逐笔记录每一次「机器文件」被拉取的实况。答案很直白:爬虫抢着看门禁告示,偶尔翻导览图,而那本特地为 AI 印的手册,没有人拿。

先说怎么量,以及样本有多年轻

所谓仪器,就是不做问卷、不引用传言,直接看自家服务器的逐笔访问记录。谁来过、拿了哪个文件、拿了几次,机器不会客气,也不会说谎。本站观测仪器于 2026-08-10 07:52 UTC 开机。到本文统计为止,窗只有一天半,对象是单一网站。这代表:下面每个数字,都只回答「本站、这扇窗内」的问题。样本很年轻,我们选择先把这件事说清楚,再谈结论。这也是本专栏一贯的做法:先亮仪器与限制,再亮数字。

一天半的机器文件点名簿

四种机器文件的被拉取次数:

  • robots.txt:16 次
  • sitemap.xml:3 次
  • llms.txt:0 次
  • rss:0 次

逐一点名:YandexBot 12 次、Facebook 2 次、Googlebot 2 次、GPTBot 1 次、OAI-SearchBot 1 次、Bingbot 1 次。

最值得看的细节:OpenAI 的两只爬虫各来了 1 次,拉的都是 robots.txt——不是 llms.txt。

名单比名次更有意思

读机器文件最勤的,不是想象中的 AI 明星。排行由 YandexBot 的 12 次遥遥领先,Facebook 与 Googlebot 各 2 次。与 AI 检索直接相关的三家——GPTBot、OAI-SearchBot、Bingbot——各只来 1 次。

这份名单提醒我们两件事。第一,「谁勤读机器文件」与「谁替你带来读者」是两回事,读取频率不等于影响力。第二,AI 爬虫不是不来;它们来了,只是拿走的是 robots.txt。换句话说,别用「有没有被 AI 爬」安慰自己,也别用「爬得多」吓自己;要看的是它伸手拿了什么,以及拿完之后你得到什么。

换成开店的语言

延续前作的比喻:把网站当成一家店。robots.txt 是门口的门禁告示,写着哪里能进、哪里不能进。sitemap.xml 是楼层导览图。llms.txt 是为 AI 贵宾特制的精装导览手册。rss 则是「新品到货通知」的订阅单。

一天半里的实况是:门禁告示被看了 16 次,导览图被翻了 3 次,精装手册没人拿,订阅单没人填。你花最多心思准备的,未必是客人伸手去拿的。

llms.txt 挂零,其实不意外

先说立场:我们不反对放 llms.txt,它的成本极低。我们反对的是把它排在清单前面,当成「AI 看得见你」的门票。

Google 的官方文件明白写着:它的 AI 功能不需要网站另外提供 AI text files(developers.google.com/search/docs/appearance/ai-features)。也就是说,搜索巨头自己宣告不看这种文件。而在我们店里,OpenAI 的爬虫来了,也只看门禁告示。官方的宣告与机器的行为,这次对上了。

支持 llms.txt 的理由,多半是「以后也许有用」。也许。但「以后也许」不该排在「现在确定」前面——这是优先序问题,不是信仰问题。

sitemap 的价值,不在被读次数

导览图只被翻了 3 次,但别因此小看它。本站实测过一组对照:sitemap 未提交前,Google 对本站页面的回复是「URL is unknown」;提交之后,才被受理。导览图的用处,不是客人翻得多勤,而是大楼管理处愿不愿意把你的柜位登进目录。被读次数低,不等于没有价值,这两件事要分开算。

也别忘了前作账本的大局:五个月内,AI 公司对本站爬取约 3,000 万次,换来 476 次真人点击(可见下限;详见 https://km.idaeo.ai/ai/ai-crawler-shop-ledger )。爬虫真正忙的,是搬你的内容,不是读你为它多写的文件。

限制:这扇窗还很小

  • 窗只有一天半,样本天生年轻。
  • 只观测了一个站,不能代表别人的店。
  • llms.txt 的 0 次,是「本站窗内的观测」,不是「llms.txt 没人读」的全称断言。别的站、别的时间窗,结果可能不同。
  • 本文只统计机器文件的拉取;一般内容页的爬取是另一本账,不在本文范围。

窗会继续累积,数字变了我们就更新。

行动:标配要做,顺序要对

这份顺序不是品味,是照本站实际被拉取的次数排出来的。

第一步,把 robots.txt 顾好。它是被拉最多的文件;先确认拿得到、规则写对,别让门禁告示自己挡错人。

第二步,把 sitemap 做好并且提交。重点在「提交后被受理」,不在被读次数。

第三步,llms.txt 想放就放,成本很低;但别把它排在前两步之前,也别期待它带来流量。

省下来的力气,拿去写值得被 AI 引用的内容。机器文件是门面,内容才是货。

FAQ

llms.txt 到底是什么?
一种放在网站根目录的纯文本文件提案,想帮 AI 快速理解网站内容。目前它是社区提案,还不是各家爬虫承诺遵守的标准。
llms.txtとは何ですか?ウェブサイトのルートに置くプレーンテキストファイルの提案で、AIがサイト内容を素早く理解する助けを目指したものです。現時点ではコミュニティの提案であり、各社のクローラーが遵守を約束した標準ではありません。
What exactly is llms.txt?A community proposal: a plain-text file placed at a website's root, meant to help AI systems quickly understand the site's content. For now it is a proposal, not a standard that major crawlers have committed to honoring.
llms.txt 是不是完全没用?
我们不能这样说。能说的是:本站一天半的窗内,它被读取 0 次。放它的成本很低;指望它带来什么,目前的数字不支持。
llms.txtはまったく無意味なのですか?そうは言えません。言えるのは、本サイトの一日半の窓の中で読み取りが0回だったことです。置くコストはごくわずかですが、何かを期待する根拠は、いまの数字にはありません。
Is llms.txt completely useless, then?We cannot say that. What we can say: within this site's day-and-a-half window, it was fetched 0 times. Publishing it costs little; expecting much from it is not supported by the current numbers.
GPTBot 有来吗?来了看什么?
有。GPTBot 与 OAI-SearchBot 各来 1 次,拉的都是 robots.txt,不是 llms.txt。
GPTBotは来ましたか?何を見ましたか?来ました。GPTBotとOAI-SearchBotが各1回、取得したのはどちらもrobots.txtで、llms.txtではありません。
Did GPTBot come? What did it look at?Yes. GPTBot and OAI-SearchBot came once each, and both fetched robots.txt, not llms.txt.
sitemap 才被读 3 次,还要做吗?
要。本站实测:sitemap 未提交前,Google 对本站页面回复「URL is unknown」;提交后才被受理。它的价值在登记,不在被翻阅的次数。
sitemapは3回しか読まれていないのに、作るべきですか?作るべきです。本サイトの実測では、sitemap提出前はGoogleが本サイトのページに「URL is unknown」と回答し、提出後にはじめて受理されました。価値は登録にあり、閲覧回数にはありません。
The sitemap was read only 3 times — is it still worth doing?Yes. Our own test: before the sitemap was submitted, Google answered "URL is unknown" for this site's pages; after submission they were accepted. Its value lies in registration, not readership.
Google 需要我提供 llms.txt 吗?
Google 官方文件明言,其 AI 功能不需要网站提供额外的 AI text files(developers.google.com/search/docs/appearance/ai-features)。
Googleは私のllms.txtを必要としますか?Googleの公式ドキュメントは、同社のAI機能のためにウェブサイトが追加のAI text filesを提供する必要はないと明言しています(developers.google.com/search/docs/appearance/ai-features)。
Does Google need me to provide an llms.txt?Google's official documentation states that its AI features do not require websites to provide additional AI text files (developers.google.com/search/docs/appearance/ai-features).
想让 AI 更快读到新文章,关键是什么?
前作实测:新内容发布后,ClaudeBot 首爬中位 4.2 小时,OAI-SearchBot 要 332.8 小时(13.9 天)(https://km.idaeo.ai/ai/ai-crawler-marketing )。差异来自各家爬虫自己的节奏,与 llms.txt 无关;能顾好的是索引管道与内容质量。
AIに新しい記事を早く読ませたいなら、鍵は何ですか?前作の実測では、新コンテンツ公開後の初回クロールはClaudeBotが中央値4.2時間、OAI-SearchBotは332.8時間(13.9日)でした( https://km.idaeo.ai/ai/ai-crawler-marketing )。差は各クローラー自身のリズムから来るもので、llms.txtとは関係ありません。手を打てるのはインデックス経路とコンテンツの品質です。
If I want AI to reach new articles sooner, what matters?From our earlier measurement: after new content is published, ClaudeBot's median first crawl comes at 4.2 hours, while OAI-SearchBot takes 332.8 hours (13.9 days) ( https://km.idaeo.ai/ai/ai-crawler-marketing ). The gap comes from each crawler's own rhythm, not from llms.txt; what you can actually tend to is your indexing pipeline and content quality.
rss 也是 0 次,订阅通知没用了吗?
同样只能说「本站窗内 0 次」。rss 对真人读者与其他服务可能仍有用,这里量到的只是机器文件拉取。
RSSも0回でした。購読通知はもう無用ですか?これも「本サイトの窓の中で0回」としか言えません。RSSは人間の読者や他のサービスにはまだ有用かもしれません。ここで測ったのは機械向けファイルの取得だけです。
RSS is also at 0 — are subscription feeds useless now?Again, all we can say is "0 within this site's window." RSS may still serve human readers and other services; what we measured here is only machine-file fetches.

引用本文

TK Lin・《AI 爬虫进店先看什么?一天半内 robots.txt 16 次、sitemap 3 次、llms.txt 0 次》・IDAEO 知識庫・2026-08-11・https://km.idaeo.ai/ai/machine-files-priority

更新 2026-08-11T12:20:10.717Z · server-rendered · four-language · IDAEO 知識庫