AI 爬蟲全歷史分析報告
washinmura.jp × idaeo.ai(開站 → 2026-07-24)

IDAEO 數據團隊|多模型交叉驗證報告|2026-07-24
所有請求數字=伺服器資料庫真值(非 CF 估計);爬蟲身分經 IP 反查驗明正身。標記說明: 實測我方親手驗證 官方文件各家公開文件(訓練知識時點) 推斷合理推斷、未定案 警示

① 一頁看懂(執行摘要)

≈3,000 萬
開站以來 AI/搜尋爬蟲總請求(2026-03-03 起有帳)
30+ 隻
observed 爬蟲家數(AI 訓練/搜尋索引/用戶代抓三類)
476 次
全歷史「AI 帶真人上門」引用點擊(已排除自家測試)
6 大家全真貨
Apple/OpenAI/Anthropic/Microsoft/Amazon/Meta 身分驗真通過

用一句話說:五個月來,全世界的 AI 公司真金白銀地派爬蟲來搬我們的內容——搬得最兇的四家是 Anthropic(644 萬)、OpenAI(562 萬)、Apple(500 萬)、Microsoft(472 萬)——但「搬走」轉成「帶真人回來」的,目前 88.7% 集中在 ChatGPT+Copilot 這條 OpenAI 技術系。

五個最重要的發現:

  1. 爬蟲全是真貨,不是冒牌貨。我們親手把爬蟲 IP 逐一反查:Apple 565 個 IP 全部反查回 applebot.apple.com,OpenAI 三隻全部命中官方公布 IP 段,Amazon/Bing/Meta 同樣過關。只抓到一隻從 AWS 新加坡機房冒充的假 Bytespider。實測
  2. OpenAI 是三層分工,且從我們自己的 log 就看得出來。GPTBot(訓練)抓「系統頁」:sitemap、每家公司一份的 llms.txt(30 天抓了 8,618 次);OAI-SearchBot(搜尋索引)和 ChatGPT-User(真人代抓)抓「個別文章」。實測
  3. 7 月的 Applebot 大爆量是 Siri/Spotlight 搜尋索引,不是 Apple 拿去練 AI。Apple 的 AI 訓練旗標(Applebot-Extended)五個月只出現 2 次。爆量起點 6/28——恰好是 idaeo.ai 品牌遷移(6/27)的隔天。實測推斷
  4. 「被引用」偏英文是真的,而且偏差從索引選擇那一層就開始。我們供給的中文頁最多,但引用落點裡中文只佔 3.2%、英文佔 67.2%;OAI-SearchBot 挑去建索引的內容本身就已偏英文(en 42.9% vs ja 26.2%)。實測
  5. 「轉載」在伺服器 log 裡看不到,但擴散是真的。washinmura.jp 已確認被收進 Common Crawl 公共語料 2026 年 6 月版(全球模型訓練的共用水源);idaeo.ai 還沒進。實測

② 五個月的時間軸:冠軍一直在換人

爬蟲請求量(每期總量;最後一欄為 30 天滾動明細期) 73.7 萬 3 月 162.7 萬 4 月 170.4 萬 5 月 1,100.6 萬 6 月(前 22 天) 1,477.8 萬 6/23〜7/24(30 天)

帳的來源:3/03〜6/22 走永久日彙總表;6/23 之後走 30 天滾動明細表(兩段無重疊、無漏接)。爬蟲追蹤器 2026 年 3 月初上線,基本等於平台全生命期。

每一期都有不同的主角:

  • 3 月(安靜期):GPTBot 一家獨大(23.7 萬),OpenAI 最早注意到我們。
  • 4 月:GPTBot(43.3 萬)+ClaudeBot(36.2 萬)+Amazonbot(34.9 萬)三強並進。
  • 5 月:Bingbot 衝上 75.4 萬;ClaudeBot 幾乎歸零(整月 669 次)——它是「陣發型」。
  • 6 月(大爆發):單月 1,100 萬起跳,ClaudeBot 一家 390 萬——典型的批次收割。
  • 6/28 之後(Applebot 時代):6/27 idaeo.ai 品牌遷移,隔天 Applebot 從每天幾百次跳到 6.7 萬、再隔天 23.2 萬,之後穩定在每天 18〜25 萬的高原,30 天累計 484 萬。

③ 全歷史總榜:誰搬得最多

ClaudeBot(Anthropic) 644 萬 GPTBot(OpenAI)  562 萬 Applebot(Apple)  500 萬 Bingbot(Microsoft)  472 萬 Google AI(GoogleOther 等)  217 萬 Googlebot(Google 搜尋)  194 萬 Meta AI(meta-externalagent)  176 萬 Amazonbot(Amazon)  90.6 萬 YandexBot  32.0 萬 OAI-SearchBot(OpenAI 搜尋)  28.9 萬 ChatGPT-User(真人代抓)  24.2 萬 Bytespider(字節跳動)  7.8 萬 PerplexityBot +其他長尾  5.9 萬+

深藍=OpenAI 的「引用轉化通道」(量小但含金量最高,見第⑥節)。長尾還有:PetalBot(華為)4.2 萬、CCBot(Common Crawl)3.6 千、Claude-SearchBot 430(只活了一個月)、Claude-User 382、Perplexity-User 182、NotebookLM 132、Gemini DeepResearch 8、Mistral 2 等。

④ 驗明正身:這些爬蟲是真貨嗎?

UA(爬蟲自報的名字)可以偽造,所以我們從 Caddy 原始日誌抽出真實來源 IP(藏在 Cloudflare 的 CF-Connecting-IP 標頭裡),逐一做反向 DNS+官方 IP 段比對+ASN 歸屬查證:

爬蟲驗證方法結果
Applebot565 個獨立 IP 反查 DNS實測全部 *.applebot.apple.com(Apple 自有 17.x 網段)✅
GPTBot/OAI-SearchBot/ChatGPT-User官方 openai.com 公布 IP 段逐一比對實測三隻全部命中官方段(OpenAI 跑在微軟 Azure 上)✅
ClaudeBotASN 歸屬+網段分析實測Amazon 2024 年新分配的專用小網段、只用 2 個 IP 集中出口(Anthropic 架在 AWS 上,方向一致)✅
Amazonbot123 個 IP 反查 DNS實測*.crawl.amazonbot.amazon
Bingbot22 個 IP 反查 DNS實測msnbot-*.search.msn.com
MetaIPv6 網段歸屬實測Meta 自有 2a03:2880:: 段 ✅
Bytespider同上警示抽樣中抓到 1 隻從 AWS 新加坡機房「冒充」的假貨——UA 偽裝確實存在,但屬邊緣量

教訓一枚:第一版腳本直接讀 remote_ip,所有爬蟲都顯示同一個內網 IP(Docker 閘道假象)。親手執行、當場修正,才有上面這張表——這正是「AI 說的要自己驗」的活教材。

⑤ 逆向各家:抓回去到底做什麼?

每家的處理管線分三類用途:訓練(餵大模型,幾個月後才反映、且看不到出處)、搜尋索引(進答案引擎的資料庫,數小時〜數週反映、會給引用連結)、真人代抓(用戶當下要求 AI 讀網頁,幾秒鐘反映)。「會帶流量回來的」只有後兩類。

OpenAI —— 三層分工最清楚,也是唯一成規模的回流來源

  • GPTBot(訓練,562 萬):廣度優先、三語均衡(zh/ja/en 各約三分之一)。它抓的是「系統頁層」——sitemap、區段索引、以及每家公司一份的 llms.txt(30 天抓 8,618 次);抓走的內容經抽取→去重→品質過濾後成為訓練語料候選。實測官方文件
  • OAI-SearchBot(搜尋索引,28.9 萬):高選擇性。ChatGPT 引用過的網址 85.6% 在它的爬取集裡(GPTBot 廣 14 倍卻只覆蓋 34.9%)——它挑什麼,ChatGPT 就引什麼。它挑的內容已偏英文。實測
  • ChatGPT-User(真人代抓,24.2 萬):真人在 ChatGPT 裡點到、要求讀取我們頁面時的即時抓取,抓的全是個別文章頁。實測

Anthropic —— 陣發式批量收割(總量冠軍 644 萬)

平日近乎靜默(每天 <400),然後突然一波吃掉全站:6 月一個月 390 萬、7/17-18 兩天 11 萬。這種「批次排程」型態與訓練語料的週期性收集一致,但也可能是佇列釋放/重試潮,我們不把話說死。實測推斷曾短暫出現 Claude-SearchBot(4/15〜5/15,430 次)之後消失——Anthropic 官方文件查無此 UA 說明,推斷是搜尋功能的實驗性爬蟲。帶真人回來極少(8 次)。

Apple —— 7 月最大戶,但目的是搜尋、不是訓練

爆量起點 6/28(前一天正是 idaeo.ai 品牌遷移),推斷是遷移觸發的全站重爬+收錄。推斷爬的內容:350 萬次砸在 /ai/ 公司頁目錄、132 萬次在 /ainews/ 新聞。Apple 的 AI 訓練旗標 Applebot-Extended 五個月只來過 2 次——所以這 500 萬次的目的是 Siri/Spotlight 搜尋索引實測它目前沒有帶回任何一次可辨識的引用點擊(Siri 端多為零點擊)。

Microsoft —— sitemap 重度依賴者,餵 Copilot 的水源

Bingbot 30 天抓 sitemap 33,155 次+llms.txt 22,025 次——靠站點地圖當心跳做增量發現。實測Bing 索引供 Copilot 檢索引用(Copilot 是我們第二大回流來源:66 次,13.9%)。官方文件

Google —— 標籤混併,最大的不確定點

我們 DB 的「Google AI」(217 萬)其實是 GoogleOther+Google-Extended 兩種標籤的合併計數(源碼實證),無法歸因到 Gemini 訓練或某單一產品。實測警示Gemini 可辨識回流僅 29 次——但 Google 系的 AI 答案(如 AI Overviews)點擊會混在一般 Google 搜尋 referrer 裡,系統性被低估。NotebookLM(132)與 Gemini DeepResearch(8)是用戶任務觸發的小量代抓。

Amazon/ByteDance/Common Crawl/其他

  • Amazonbot(90.6 萬):Alexa 類問答的網頁收錄。官方文件特別偏愛新站 idaeo(佔其 AI 爬量 61%)——但其中有掉進 /a/a/null 垃圾路徑黑洞的放大成分。推斷
  • Bytespider(7.8 萬):字節跳動(豆包/頭條系)訓練與索引,明顯偏中文內容。量僅 GPTBot 的 1.4%——它的主戰場在中文生態,我們的台日內容只是順手帶走。官方文件推斷
  • CCBot(3.6 千):Common Crawl 公共語料庫,「一頁抓一次」的快照型(重複率 1.01)。我們親手反查+下載封存原件驗證:washinmura.jp 在 2026 年 6 月版被收錄 1,515 筆(其中 1,089 筆為完整頁面正本:AINews 730+AEO 公司頁 329+官網 28),且 4 月版、5 月版就已在收——這是全球開源模型(LLaMA、Mistral 等)共用的訓練水源,內容會沿此路擴散到我們看不到的模型裡;idaeo.ai 尚未被收錄。實測
  • Perplexity(5.9 萬+182):小而精的索引+真人代抓。回流僅 17 次,但包含 ANK 深卡史上第一次真引用(7/08)。實測
  • 長尾:PetalBot(華為搜尋)、YandexBot、DuckAssistBot(DuckDuckGo AI 答案)、YouBot、ExaBot(AI 代理搜尋 API)、CohereBot、Mistral(真人代抓 2 次)——各有來頭,量皆屬零星。官方文件

⑥ 引用/導流的真相:搬走 3,000 萬次,帶回來 476 個真人

ChatGPT  356(74.8%) Copilot  66(13.9%) Gemini  29 Perplexity  17 Claude  8
  • 時間軸:4 月 3 次 → 5 月 48 → 6 月 281 → 7 月(至 7/24)144。警示7 月日均 6.0 次,比 6 月的 9.4 次少了 36%——需要在執行期監控裡盯住。
  • 這是「下界」:五家全部來自網頁版 referrer;手機 App 內點擊不帶 referrer、零點擊回答完全不可見,真實影響力一定高於 476。實測
  • 語言真相:引用落點 英文 67.2%/日文 28.2%/中文 3.2%。我們的中文頁供給反而最多——所以不是我們英文寫太多,是 AI 端從索引選擇層就偏英文。結論:想被引用,英文版是主戰場。實測
  • 落點:washinmura 的 /ainews/ 文章與 idaeo 的 CNA 英文新聞平分秋色;被爬≠被引用(歷史經驗 10〜12%)。

⑦ 轉載:log 看不到,但有三條偵測路

AI 把我們的內容「講出來但沒給連結」(零點擊復現)、以及他站轉貼,都不會在我們伺服器留下任何痕跡——這是結構性盲區,不是我們沒查到。可行的偵測手段(交叉審查提出、主分析已驗證其中一條可跑通):

  1. 特徵句探針:在文章裡佈置獨特短句,定期去各 AI 問答引擎查詢是否被複現。成本低。
  2. 定期查詢採樣:對高價值主題自動化查詢各引擎,監測「有內容、無引用」的復現。成本中。
  3. Common Crawl 反查實測已跑通——用公開索引 API 反查我們域名的收錄狀況,也可反查特徵句找他站轉貼。

⑧ 這輪交叉驗證翻掉了什麼(誠實帳)

被修正的四件事——多模型對抗審查+主分析親手執行的成果:

  1. 「20 倍富集」口徑作廢。外部模型算術重驗:85.6%÷34.9%×14 倍廣度=34.3 倍,20 倍無法由凍結數字重現。正確講法:「OAI-SearchBot 的爬取選擇性至少高一個數量級」——原口徑反而是低估。
  2. 「Applebot 爆量=表格換代的假象」被推翻。內部挑錯提出質疑,主分析用邊界日查詢裁決:6/23(換表日)當天 331 次、與前期完全連續,爆發在 6/28——是真實行為,且時點指向品牌遷移觸發。
  3. 「引用偏英文=我們英文供給多」被推翻。供給面重驗數據:中文路徑最多、引用卻最少——供給效應排除,偏差在 AI 端。
  4. 「Google AI=217 萬都是 Gemini」不成立。標籤混併(源碼實證),這筆帳無法歸因單一產品,列為本案最大不確定點。

經受住考驗的結論:OpenAI 三層分工(log 直接可辨)、ClaudeBot 陣發式收割、身分驗真六家全真、引用高度集中於 ChatGPT 系、llms.txt 有真實消費量(但「抓」不等於「官方承諾採用」)。

⑨ 方法論與分工(誰做了什麼)

  • 主分析(親自執行):全歷史兩段拼接重建(永久日彙總+30 天明細)、爬蟲 IP 反查驗真(565 IP rDNS+OpenAI 官方段比對+ASN 查證)、Common Crawl 反查實跑、llms.txt 存活驗證、源碼追溯(UA 分類器、標籤映射、彙總排程)、交叉質疑的邊界日裁決、全部交叉審查交付的親驗與整合。
  • 內部交叉審查:獨立挑錯審查的三大質疑促成兩處修正;15 條重驗 SQL 全過——陣發指紋、時刻表、重複抓取、語言供需對比;另以輕量模型機械抽取上輪素材 168 條。
  • 外部模型交叉驗證:GPT 系模型 17 家管線逆向+算術實驗室(含故意錯誤數字的反向測試);Gemini(3.1 Pro)UA 覆蓋缺口審計+爬取方法歸類;DeepSeek 中國系生態+轉載偵測三法;MiniMax 數字保真對帳表。外部模型交付全部回主分析親驗,其中 其中一路的前提錯誤(爆量日期)被主分析實測數據糾正。
  • 數據紀律:所有請求數=伺服器 DB 真值;引用數已排除自家合成測試 UA;推斷與實測分開標記;不可測的(轉載、零點擊)誠實標注不可測。