AI 爬蟲分眾行為誌 · washinmura.jp × idaeo.ai · 開站至 2026-07-24

每一隻 AI 爬蟲,都有自己的個性

五個月來三十幾隻 AI 爬蟲來我們家搬了約 3,000 萬次內容。這份文件把它們一隻一隻拆開: 它什麼時候來、來拿什麼、多久來一次、會不會帶人回來。所有數字都是我們自己伺服器的紀錄(來源:bot_visits 實測),不是估計值。

本文正本發布於 idaeo.ai,正本網址 https://idaeo.ai/reports/ai-crawler-profiles-20260724(和心村 washinmura.jp × idaeo.ai 聯合觀測)。資料來源:本站伺服器 bot_visits 爬蟲紀錄(全史日彙總 2026-03-03 起|URL 明細窗 2026-06-24–07-24)、ai_referrer_visits 引用導流紀錄、ida_entity_crawl_by_entity 實體級爬取表、ank_docs 發布紀錄;爬蟲身分經 IP 反查與官方網段比對驗真。凡標「實測」者皆出自上述來源,非估計值。

IDAEO 數據團隊(主分析親跑數據與整合+多個獨立 AI 模型交叉審查:挑錯/實證 SQL/素材盤點/逆向/覆蓋審計)|2026-07-24

先講一個觀念:沒有請求,就沒有真人流量

「沒有爬蟲的請求,就沒有引用;沒有引用,就沒有真人流量。」

這句話值得講清楚,因為它決定了所有事情的先後順序。

在 AI 這條路上,任何一次「AI 提到你」的背後,一定有過一次對你網頁的 HTTP 請求。可能是它自己來抓的, 也可能是別人(像 Common Crawl)抓走之後它拿去用的。沒有那一次請求,你就不在它的世界裡—— 不是排名低,是根本不存在。

但這是必要條件,不是充分條件,這點必須誠實講:

  • 被抓 ≠ 被引用。我們實測的轉化率大約 10–12%(來源:歷史引用對帳)。
  • 被引用 ≠ 有人點進來。AI 直接把答案講完、不給連結(零點擊),我們什麼都收不到。
  • 有人來 ≠ 我們看得見。手機 App 內點擊不帶來源標記,所以我們量到的 476 次(實測)是下界,真實數字一定更高。

所以正確的做法是兩件事:先確保被請求(沒有這個,後面全免談),再提高每次請求的轉化。 這份文件的每一隻爬蟲,都要放回這個順序裡看。

三種請求,三種未來

爬蟲不是同一種東西。從我們自己的紀錄就分得出三類,而且只有後兩類會帶人回來

訓練型
GPTBot · ClaudeBot · Meta AI · Bytespider · CCBot
把內容帶回去餵大模型。幾個月後才反映、看不到出處、不帶流量。但它是你在 AI 世界長期存在感的地基。
索引型
OAI-SearchBot · Bingbot · Applebot · PerplexityBot · Amazonbot
進答案引擎的資料庫。數小時到數週反映、會給引用連結。——這才是流量的來源。
真人代抓
ChatGPT-User · Claude-User · Perplexity-User
真人此刻正在 AI 裡讀你的頁面,AI 代他去取。幾秒鐘反映。它出現,代表你已經成功了。

這個分類的實用價值:你想要流量,就餵索引型;你想要長期被記得,就餵訓練型;看到代抓型,代表前面兩步做對了。

兩個這次才量出來的發現

發現一:好內容的回報在「人」那一層,不在「機器」那一層

我們一直以為「內容做好,爬蟲會更愛爬」。實測是:機器來者不拒,人才挑。

兩條完全獨立的量法,得到同一個方向:

量法好內容一般內容倍率
人工 ANK 深卡 vs 自動頁(ChatGPT 真人代抓)4.7 次/頁2.5 次/頁1.9 倍(實測)
品質分級 green vs red(ChatGPT 真人代抓)3.141.392.26 倍(實測)
同樣測試,ClaudeBot(機器)2.562.62持平(red 還略高)· 實測

意思是:做好內容不會讓機器多爬你,但會讓真人到了之後更常讀你、更常被 AI 端調出來給人看。 所以「把內容做好」的投資報酬,要在引用與導流那一端收,不要用爬蟲量來驗收。

發現二:我們最需要的兩隻,反應最慢——這是正在流失的東西

我們發布一張新的 ANK 深卡之後,各家多久第一次來看(中位數):

ClaudeBot4.2 小時訓練實測
GPTBot21.8 小時訓練實測
Amazonbot52.3 小時實測·索引
Meta AI74.3 小時訓練實測
Applebot154.7 小時(6.4 天)實測·索引
ChatGPT 真人276.6 小時(11.5 天)實測·真人
OAI-SearchBot332.8 小時(13.9 天)實測·索引→引用
Bingbot374.6 小時(15.6 天)實測·索引→Copilot

不帶流量的訓練型爬蟲 4 小時就到;能帶流量的兩隻要等兩個星期。 換句話說,我們辛苦做的好內容,會先被拿去訓練,兩星期後才進到能被引用、能帶人來的索引裡。中間這兩週就是損失。

而且這個差距只會比數字更大——統計窗只有 30 天,發布太晚的卡根本來不及等到慢的爬蟲,慢的被系統性低估了。

好消息是這條有解:Bingbot 是 sitemap 重度依賴者(30 天抓了 32,993 次 sitemap,來源:bot_visits 實測), Amazonbot 和 GPTBot 則重度消費 llms.txt。推 sitemap/IndexNow/llms.txt,是對這幾隻最直接的加速槓桿。

「我一做大整合,它們就來」——這件事查證了

這是 owner 長期的觀察。我們用資料庫紀錄驗證,答案比是非題有意思:

時序成立。2026-05-23,我們一天之內建了 550,807 筆 llms 摘要來源:ida_entities.llms_summary_built_at 實測;5/23=550,807、5/24=11,678,其餘日子都只有幾千)。 九天後的 6/01,三家爬蟲同時開機——ClaudeBot 五月整月只來 669 次,6/01 跳到 53,468、6/02 再跳到 354,414;GPTBot、Meta 同一天一起動(來源:bot_visits_daily 實測)。

「月初排程」這個替代解釋已經被殺掉:4/01 只有 92 次、5/01 只有 464 次,只有 6/01 爆掉,不是月曆效應(實測)。

但「為什麼來」,這份資料分不出來。那次動作同時做了兩件事:讓資料變好,以及一口氣開出 55 萬個新網址。 再加上 6/01 我們把 llms.txt 正規化、6/05 新聞 sitemap 從 20 頁擴到 155 頁、39.5 萬則全量收錄(出處:git commit f85a0918)—— 我們不是把門打開(robots.txt 查證過沒動),而是把「看得見的表面積」一次放大好幾倍。 爬蟲看到的是「這個站突然變大了」,還是「這個站變好了」?兩個變數一起動,這份資料無法分辨。

要分辨,得做一次乾淨實驗:只改好既有頁面的品質、完全不新增任何網址,然後看爬蟲反應。 這種事件我們庫裡目前一次都沒有——這是下一次該刻意做的一件事

各家行為誌

每一張卡:它是哪一類、量多大、什麼時候來、拿什麼、對品質敏不敏感、會不會帶人回來。 數字窗口不同的地方都標了(全史=開站至今;30 天窗=6/24–7/24 明細)。

GPTBot訓練型
  • :全史 562 萬次|30 天窗 253.5 萬次,重複率 1.90(同一頁平均爬 1.9 次)實測·本站紀錄
  • 作息:24 小時幾乎完全均勻(離散度 0.05,峰值時段只佔 4.52%)=純機器排程,不看人類作息實測·本站紀錄
  • 抓什麼:30 天抓 llms.txt 7,873 次(全場最高之一)、sitemap 只有 108 次 — 它靠的是 llms.txt 不是 sitemap實測·本站紀錄
  • 語言:中日英各約三分之一,最均衡的一家(未知語言只佔 0.74%,路徑解析度最高)實測·本站紀錄
  • 新內容反應:ANK 新卡發布後中位數 21.8 小時到,覆蓋 115 篇(全場覆蓋最廣)實測·本站紀錄
  • 對品質:green 3.03 / yellow 2.47 / red 2.05 — 有輕微偏好,但差距不大實測·本站紀錄
怎麼對待它:它是我們長期存在感的地基。餵飽 llms.txt 就是餵飽它。不要期待它帶流量。
OAI-SearchBot索引型 → 會帶引用
  • :全史 28.9 萬次|30 天 14.2 萬次 — 量小,但含金量最高實測·本站紀錄
  • 選擇性:ChatGPT 引用過的網址 85.6% 在它的爬取集裡;GPTBot 爬得廣 14 倍、重合卻只有 34.9%實測·本站紀錄
  • 對品質:green 5.94 / yellow 5.69 / red 3.54 — 全場對品質最敏感的機器爬蟲實測·本站紀錄
  • 致命弱點:新卡發布後要 332.8 小時(13.9 天)才來 — 全場倒數第二慢實測·本站紀錄
  • 作息:峰值 23 時(UTC),離散度 0.22,略有節奏實測·本站紀錄
怎麼對待它:全案最重要的一隻。它挑什麼,ChatGPT 就引什麼。它慢,就是我們的損失——加速它是第一優先。
ChatGPT-User真人代抓 → 已經是流量
  • :全史 24.2 萬次|30 天 12.8 萬次,重複率 2.48(偏高=同一頁被反覆讀)實測·本站紀錄
  • 作息:峰值 1 時(UTC)=日本時間上午 10 點,離散度 0.39 — 有明顯人類作息實測·本站紀錄
  • 對好內容的偏好:ANK 人工深卡 4.7 次/頁 vs 自動頁 2.5 次/頁=1.9 倍;品質分級測試 green 3.14 vs red 1.39=2.26 倍實測·本站紀錄
  • 它出現=有人此刻正在讀我們:不是未來的流量,是現在進行式
怎麼對待它:它是成功的訊號燈,不是要優化的對象。它多,代表前面兩層做對了。
ClaudeBot訓練型 · 陣發收割
  • :全史 644 萬次(總量冠軍)|30 天 229.3 萬次實測·本站紀錄
  • 最極端的陣發性:日量中位數只有 97 次,單日最高 354,414 次=3,654 倍落差;單日破 10 萬有 20 天(全場最多)實測·本站紀錄
  • 兩次典型收割:4/19 從 144 次暴衝到 143,399,連爬四天後歸零;6/01–6/17 連續兩週高原實測·本站紀錄
  • 新內容反應最快:ANK 新卡發布後中位數 4.2 小時就到 — 主要爬蟲裡最快實測·本站紀錄
  • 對品質完全無感:green 2.56 / yellow 2.51 / red 2.62(最高)實測·本站紀錄
  • 抓什麼:唯一一家 robots.txt(680 次)和 llms.txt(1,715 次)同時偏高的實測·本站紀錄
怎麼對待它:來得快、吃得多、但不帶人回來(全史只帶回 8 次真人,實測)。當成長期存在感的投資,別當業績。
Applebot搜尋索引(Siri/Spotlight)
  • :全史 500 萬次|30 天 484.7 萬次 — 7 月最大戶實測·本站紀錄
  • 爆量起點 6/28:前一天正是 idaeo.ai 品牌遷移,隔天從每天幾百次跳到 6.7 萬、再跳 23.2 萬,之後穩在 18–25 萬高原實測·本站紀錄
  • 目的是搜尋不是訓練:AI 訓練旗標 Applebot-Extended 五個月只出現 2 次實測·本站紀錄
  • 作息:離散度 0.06 = 幾乎完全均勻的機器排程實測·本站紀錄
  • 幾乎不看系統頁:sitemap 只有 227 次、llms.txt 515 次(相對它 484 萬的量幾乎是零)實測·本站紀錄
  • 回報:目前零次可辨識的引用點擊(Siri 端多為零點擊)
怎麼對待它:量最大、回報最不明。先觀察不投資——大,不等於值得優化。
Bingbot索引型 → 餵 Copilot
  • :全史 472 萬次|30 天 255.8 萬次實測·本站紀錄
  • 最穩定的心跳:max/median 只有 21.6 倍(相對 ClaudeBot 的 3,654 倍),日日來、量穩定實測·本站紀錄
  • sitemap 重度依賴者:30 天抓 sitemap 32,993 次+llms.txt 21,503 次 — 全場第一,靠站點地圖當心跳做增量發現實測·本站紀錄
  • 但反應最慢:ANK 新卡要 374.6 小時(15.6 天)才到,覆蓋率也最低(47 篇)實測·本站紀錄
  • 價值:Bing 索引供 Copilot 檢索引用,Copilot 是我們第二大回流來源(66 次,13.9%)實測·本站紀錄
怎麼對待它:看 sitemap 吃飯——這是我們手上最直接的加速槓桿。推 sitemap/IndexNow 對它最有效。
Google 系(標籤混併)最大不確定點
  • :DB 記的「Google AI」217 萬次,其實是 GoogleOther + Google-Extended 兩種標籤的合併計數(源碼實證)實測·本站紀錄
  • 所以這筆帳無法歸因到 Gemini 訓練或任何單一產品 — 本案最大的不確定點
  • 可辨識回流:Gemini 僅 29 次;但 Google 系的 AI 答案點擊會混在一般 Google 搜尋 referrer 裡,系統性被低估實測·本站紀錄
  • 小量代抓:NotebookLM 132 次、Gemini DeepResearch 8 次 — 用戶任務觸發實測·本站紀錄
怎麼對待它:先把標籤拆開再談策略。現在講 Google 的任何結論都建立在混併數字上。
Amazonbot索引(Alexa/Rufus 生態)
  • :全史 90.6 萬次|30 天 22.4 萬次實測·本站紀錄
  • 最穩定的一家:max/median 僅 4.74 倍 — 幾乎沒有爆發,天天固定來實測·本站紀錄
  • llms.txt 消費比例最高:30 天 5,015 次,佔它總量的 2.2%(GPTBot 只佔 0.31%)實測·本站紀錄
  • 對人工深卡有偏好:ANK 2.8 次/頁 vs 自動頁 1.8 次/頁實測·本站紀錄
  • 警示:它在 idaeo.ai 佔 AI 爬量 61%,但其中有掉進垃圾路徑黑洞的放大成分實測·本站紀錄
怎麼對待它:低調但穩定。llms.txt 對它特別有效。
Meta AI訓練型
  • :全史 125 萬次|30 天 126.1 萬次實測·本站紀錄
  • 陣發倍率名目最高(5,886 倍)— 但中位數只有 26 次/天,分母太小造成放大,這個數字不可直接拿來比實測·本站紀錄
  • 重複率最高:2.47 — 同一頁反覆爬實測·本站紀錄
  • 對人工深卡最無感:ANK 1.0 次/頁 vs 自動頁 3.4 次/頁實測·本站紀錄
  • 路徑解析最乾淨:未知語言只佔 0.17%實測·本站紀錄
怎麼對待它:純訓練型,不帶流量。不需要為它做任何事。
PerplexityBot索引 → 高含金量
  • :全史 5.9 萬次+真人代抓 182 次 — 小而精實測·本站紀錄
  • 作息最像人:離散度 0.42(全場最高),峰值 13 時佔 10.18% — 強烈的人類作息特徵實測·本站紀錄
  • 回流僅 17 次,但包含 ANK 深卡史上第一次真引用(7/08)實測·本站紀錄
  • 在 idaeo.ai 幾乎不存在:日均個位數
怎麼對待它:量小但引用轉化率最高。按「每次爬取換到多少引用」排,它應該排在很前面。
Bytespider/CCBot/長尾其他
  • Bytespider(字節跳動):全史 7.8 萬次,明顯偏中文;量僅 GPTBot 的 1.4% — 主戰場在中文生態,我們的台日內容只是順手帶走實測·本站紀錄
  • CCBot(Common Crawl):全史 3.6 千次,「一頁抓一次」的快照型(重複率 1.01)。washinmura.jp 已被收進 2026 年 6 月版公共語料(1,515 筆,其中 1,089 筆完整頁面正本),這是全球開源模型共用的水源;idaeo.ai 尚未被收錄實測·本站紀錄
  • 長尾:PetalBot(華為)4.2 萬、YandexBot、DuckAssistBot、YouBot、ExaBot、CohereBot、Mistral(2 次)— 各有來頭,量皆零星實測·本站紀錄
  • 唯一抓到的假貨:一隻從 AWS 新加坡機房冒充的 Bytespider — UA 偽裝確實存在,但屬邊緣量
怎麼對待它:CCBot 值得特別注意:它是唯一能把我們送進「所有開源模型」的通道,而 idaeo.ai 還沒進去。

誠實帳:這份文件的邊界