AI 爬蟲進店先看什麼?一天半內 robots.txt 16 次、sitemap 3 次、llms.txt 0 次
儀器窗一天半:robots.txt 16 次、sitemap 3 次、llms.txt 0 次。標配要做,順序要對;單站短窗,不做全稱斷言。
最近常有人問:要不要為 AI 寫一份 llms.txt?各種「AI 時代網站標配清單」也愈開愈長:robots.txt、sitemap、llms.txt、rss,一項都不敢漏。清單愈長,就愈需要知道:哪些檔案真的有機器在讀?與其互相猜測,不如直接看機器的手伸向了哪裡。我們把自家網站當成儀器,逐筆記錄每一次「機器檔」被拉取的實況。答案很直白:爬蟲搶著看門禁告示,偶爾翻導覽圖,而那本特地為 AI 印的手冊,沒有人拿。
先說怎麼量,以及樣本有多年輕
所謂儀器,就是不做問卷、不引用傳言,直接看自家伺服器的逐筆存取紀錄。誰來過、拿了哪個檔案、拿了幾次,機器不會客氣,也不會說謊。本站觀測儀器於 2026-08-10 07:52 UTC 開機。到本文統計為止,窗只有一天半,對象是單一網站。這代表:下面每個數字,都只回答「本站、這扇窗內」的問題。樣本很年輕,我們選擇先把這件事說清楚,再談結論。這也是本專欄一貫的做法:先亮儀器與限制,再亮數字。
一天半的機器檔點名簿
四種機器檔的被拉取次數:
- robots.txt:16 次
- sitemap.xml:3 次
- llms.txt:0 次
- rss:0 次
逐一點名:YandexBot 12 次、Facebook 2 次、Googlebot 2 次、GPTBot 1 次、OAI-SearchBot 1 次、Bingbot 1 次。
最值得看的細節:OpenAI 的兩隻爬蟲各來了 1 次,拉的都是 robots.txt——不是 llms.txt。
名單比名次更有意思
讀機器檔最勤的,不是想像中的 AI 明星。排行由 YandexBot 的 12 次遙遙領先,Facebook 與 Googlebot 各 2 次。與 AI 檢索直接相關的三家——GPTBot、OAI-SearchBot、Bingbot——各只來 1 次。
這份名單提醒我們兩件事。第一,「誰勤讀機器檔」與「誰替你帶來讀者」是兩回事,讀檔頻率不等於影響力。第二,AI 爬蟲不是不來;它們來了,只是拿走的是 robots.txt。換句話說,別用「有沒有被 AI 爬」安慰自己,也別用「爬得多」嚇自己;要看的是它伸手拿了什麼,以及拿完之後你得到什麼。
換成開店的語言
延續前作的比喻:把網站當成一家店。robots.txt 是門口的門禁告示,寫著哪裡能進、哪裡不能進。sitemap.xml 是樓層導覽圖。llms.txt 是為 AI 貴賓特製的精裝導覽手冊。rss 則是「新品到貨通知」的訂閱單。
一天半裡的實況是:門禁告示被看了 16 次,導覽圖被翻了 3 次,精裝手冊沒人拿,訂閱單沒人填。你花最多心思準備的,未必是客人伸手去拿的。
llms.txt 掛零,其實不意外
先說立場:我們不反對放 llms.txt,它的成本極低。我們反對的是把它排在清單前面,當成「AI 看得見你」的門票。
Google 的官方文件明白寫著:它的 AI 功能不需要網站另外提供 AI text files(developers.google.com/search/docs/appearance/ai-features)。也就是說,搜尋巨頭自己宣告不看這種檔案。而在我們店裡,OpenAI 的爬蟲來了,也只看門禁告示。官方的宣告與機器的行為,這次對上了。
支持 llms.txt 的理由,多半是「以後也許有用」。也許。但「以後也許」不該排在「現在確定」前面——這是優先序問題,不是信仰問題。
sitemap 的價值,不在被讀次數
導覽圖只被翻了 3 次,但別因此小看它。本站實測過一組對照:sitemap 未提交前,Google 對本站頁面的回覆是「URL is unknown」;提交之後,才被受理。導覽圖的用處,不是客人翻得多勤,而是大樓管理處願不願意把你的櫃位登進目錄。被讀次數低,不等於沒有價值,這兩件事要分開算。
也別忘了前作帳本的大局:五個月內,AI 公司對本站爬取約 3,000 萬次,換來 476 次真人點擊(可見下限;詳見 https://km.idaeo.ai/ai/ai-crawler-shop-ledger )。爬蟲真正忙的,是搬你的內容,不是讀你為它多寫的檔案。
限制:這扇窗還很小
- 窗只有一天半,樣本天生年輕。
- 只觀測了一個站,不能代表別人的店。
- llms.txt 的 0 次,是「本站窗內的觀測」,不是「llms.txt 沒人讀」的全稱斷言。別的站、別的時間窗,結果可能不同。
- 本文只統計機器檔的拉取;一般內容頁的爬取是另一本帳,不在本文範圍。
窗會繼續累積,數字變了我們就更新。
行動:標配要做,順序要對
這份順序不是品味,是照本站實際被拉取的次數排出來的。
第一步,把 robots.txt 顧好。它是被拉最多的檔案;先確認拿得到、規則寫對,別讓門禁告示自己擋錯人。
第二步,把 sitemap 做好並且提交。重點在「提交後被受理」,不在被讀次數。
第三步,llms.txt 想放就放,成本很低;但別把它排在前兩步之前,也別期待它帶來流量。
省下來的力氣,拿去寫值得被 AI 引用的內容。機器檔是門面,內容才是貨。
FAQ
- llms.txt 到底是什麼?
- 一種放在網站根目錄的純文字檔提案,想幫 AI 快速理解網站內容。目前它是社群提案,還不是各家爬蟲承諾遵守的標準。
- llms.txtとは何ですか? — ウェブサイトのルートに置くプレーンテキストファイルの提案で、AIがサイト内容を素早く理解する助けを目指したものです。現時点ではコミュニティの提案であり、各社のクローラーが遵守を約束した標準ではありません。
- What exactly is llms.txt? — A community proposal: a plain-text file placed at a website's root, meant to help AI systems quickly understand the site's content. For now it is a proposal, not a standard that major crawlers have committed to honoring.
- llms.txt 是不是完全沒用?
- 我們不能這樣說。能說的是:本站一天半的窗內,它被讀取 0 次。放它的成本很低;指望它帶來什麼,目前的數字不支持。
- llms.txtはまったく無意味なのですか? — そうは言えません。言えるのは、本サイトの一日半の窓の中で読み取りが0回だったことです。置くコストはごくわずかですが、何かを期待する根拠は、いまの数字にはありません。
- Is llms.txt completely useless, then? — We cannot say that. What we can say: within this site's day-and-a-half window, it was fetched 0 times. Publishing it costs little; expecting much from it is not supported by the current numbers.
- GPTBot 有來嗎?來了看什麼?
- 有。GPTBot 與 OAI-SearchBot 各來 1 次,拉的都是 robots.txt,不是 llms.txt。
- GPTBotは来ましたか?何を見ましたか? — 来ました。GPTBotとOAI-SearchBotが各1回、取得したのはどちらもrobots.txtで、llms.txtではありません。
- Did GPTBot come? What did it look at? — Yes. GPTBot and OAI-SearchBot came once each, and both fetched robots.txt, not llms.txt.
- sitemap 才被讀 3 次,還要做嗎?
- 要。本站實測:sitemap 未提交前,Google 對本站頁面回覆「URL is unknown」;提交後才被受理。它的價值在登記,不在被翻閱的次數。
- sitemapは3回しか読まれていないのに、作るべきですか? — 作るべきです。本サイトの実測では、sitemap提出前はGoogleが本サイトのページに「URL is unknown」と回答し、提出後にはじめて受理されました。価値は登録にあり、閲覧回数にはありません。
- The sitemap was read only 3 times — is it still worth doing? — Yes. Our own test: before the sitemap was submitted, Google answered "URL is unknown" for this site's pages; after submission they were accepted. Its value lies in registration, not readership.
- Google 需要我提供 llms.txt 嗎?
- Google 官方文件明言,其 AI 功能不需要網站提供額外的 AI text files(developers.google.com/search/docs/appearance/ai-features)。
- Googleは私のllms.txtを必要としますか? — Googleの公式ドキュメントは、同社のAI機能のためにウェブサイトが追加のAI text filesを提供する必要はないと明言しています(developers.google.com/search/docs/appearance/ai-features)。
- Does Google need me to provide an llms.txt? — Google's official documentation states that its AI features do not require websites to provide additional AI text files (developers.google.com/search/docs/appearance/ai-features).
- 想讓 AI 更快讀到新文章,關鍵是什麼?
- 前作實測:新內容發布後,ClaudeBot 首爬中位 4.2 小時,OAI-SearchBot 要 332.8 小時(13.9 天)(https://km.idaeo.ai/ai/ai-crawler-marketing )。差異來自各家爬蟲自己的節奏,與 llms.txt 無關;能顧好的是索引管道與內容品質。
- AIに新しい記事を早く読ませたいなら、鍵は何ですか? — 前作の実測では、新コンテンツ公開後の初回クロールはClaudeBotが中央値4.2時間、OAI-SearchBotは332.8時間(13.9日)でした( https://km.idaeo.ai/ai/ai-crawler-marketing )。差は各クローラー自身のリズムから来るもので、llms.txtとは関係ありません。手を打てるのはインデックス経路とコンテンツの品質です。
- If I want AI to reach new articles sooner, what matters? — From our earlier measurement: after new content is published, ClaudeBot's median first crawl comes at 4.2 hours, while OAI-SearchBot takes 332.8 hours (13.9 days) ( https://km.idaeo.ai/ai/ai-crawler-marketing ). The gap comes from each crawler's own rhythm, not from llms.txt; what you can actually tend to is your indexing pipeline and content quality.
- rss 也是 0 次,訂閱通知沒用了嗎?
- 同樣只能說「本站窗內 0 次」。rss 對真人讀者與其他服務可能仍有用,這裡量到的只是機器檔拉取。
- RSSも0回でした。購読通知はもう無用ですか? — これも「本サイトの窓の中で0回」としか言えません。RSSは人間の読者や他のサービスにはまだ有用かもしれません。ここで測ったのは機械向けファイルの取得だけです。
- RSS is also at 0 — are subscription feeds useless now? — Again, all we can say is "0 within this site's window." RSS may still serve human readers and other services; what we measured here is only machine-file fetches.
來源錨定
引用本文
TK Lin・《AI 爬蟲進店先看什麼?一天半內 robots.txt 16 次、sitemap 3 次、llms.txt 0 次》・IDAEO 知識庫・2026-08-11・https://km.idaeo.ai/ai/machine-files-priority