① 一頁看懂(執行摘要)
≈3,000 萬
開站以來 AI/搜尋爬蟲總請求(2026-03-03 起有帳)
30+ 隻
observed 爬蟲家數(AI 訓練/搜尋索引/用戶代抓三類)
476 次
全歷史「AI 帶真人上門」引用點擊(已排除自家測試)
6 大家全真貨
Apple/OpenAI/Anthropic/Microsoft/Amazon/Meta 身分驗真通過
用一句話說: 五個月來,全世界的 AI 公司真金白銀地派爬蟲來搬我們的內容——搬得最兇的四家是 Anthropic(644 萬)、OpenAI(562 萬)、Apple(500 萬)、Microsoft(472 萬)——但「搬走」轉成「帶真人回來」的,目前 88.7% 集中在 ChatGPT+Copilot 這條 OpenAI 技術系。
五個最重要的發現:
爬蟲全是真貨,不是冒牌貨。 我們親手把爬蟲 IP 逐一反查:Apple 565 個 IP 全部反查回 applebot.apple.com,OpenAI 三隻全部命中官方公布 IP 段,Amazon/Bing/Meta 同樣過關。只抓到一隻從 AWS 新加坡機房冒充的假 Bytespider。實測
OpenAI 是三層分工,且從我們自己的 log 就看得出來。 GPTBot(訓練)抓「系統頁」:sitemap、每家公司一份的 llms.txt(30 天抓了 8,618 次);OAI-SearchBot(搜尋索引)和 ChatGPT-User(真人代抓)抓「個別文章」。實測
7 月的 Applebot 大爆量是 Siri/Spotlight 搜尋索引,不是 Apple 拿去練 AI。 Apple 的 AI 訓練旗標(Applebot-Extended)五個月只出現 2 次。爆量起點 6/28——恰好是 idaeo.ai 品牌遷移(6/27)的隔天。實測 推斷
「被引用」偏英文是真的,而且偏差從索引選擇那一層就開始。 我們供給的中文頁最多,但引用落點裡中文只佔 3.2%、英文佔 67.2%;OAI-SearchBot 挑去建索引的內容本身就已偏英文(en 42.9% vs ja 26.2%)。實測
「轉載」在伺服器 log 裡看不到,但擴散是真的。 washinmura.jp 已確認被收進 Common Crawl 公共語料 2026 年 6 月版(全球模型訓練的共用水源);idaeo.ai 還沒進。實測
② 五個月的時間軸:冠軍一直在換人
爬蟲請求量(每期總量;最後一欄為 30 天滾動明細期)
73.7 萬
3 月
162.7 萬
4 月
170.4 萬
5 月
1,100.6 萬
6 月(前 22 天)
1,477.8 萬
6/23〜7/24(30 天)
帳的來源:3/03〜6/22 走永久日彙總表;6/23 之後走 30 天滾動明細表(兩段無重疊、無漏接)。爬蟲追蹤器 2026 年 3 月初上線,基本等於平台全生命期。
每一期都有不同的主角:
3 月(安靜期) :GPTBot 一家獨大(23.7 萬),OpenAI 最早注意到我們。
4 月 :GPTBot(43.3 萬)+ClaudeBot(36.2 萬)+Amazonbot(34.9 萬)三強並進。
5 月 :Bingbot 衝上 75.4 萬;ClaudeBot 幾乎歸零(整月 669 次)——它是「陣發型」。
6 月(大爆發) :單月 1,100 萬起跳,ClaudeBot 一家 390 萬——典型的批次收割。
6/28 之後(Applebot 時代) :6/27 idaeo.ai 品牌遷移,隔天 Applebot 從每天幾百次跳到 6.7 萬、再隔天 23.2 萬,之後穩定在每天 18〜25 萬的高原,30 天累計 484 萬。
③ 全歷史總榜:誰搬得最多
ClaudeBot(Anthropic)
644 萬
GPTBot(OpenAI)
562 萬
Applebot(Apple)
500 萬
Bingbot(Microsoft)
472 萬
Google AI(GoogleOther 等)
217 萬
Googlebot(Google 搜尋)
194 萬
Meta AI(meta-externalagent)
176 萬
Amazonbot(Amazon)
90.6 萬
YandexBot
32.0 萬
OAI-SearchBot(OpenAI 搜尋)
28.9 萬
ChatGPT-User(真人代抓)
24.2 萬
Bytespider(字節跳動)
7.8 萬
PerplexityBot +其他長尾
5.9 萬+
深藍=OpenAI 的「引用轉化通道」(量小但含金量最高,見第⑥節)。長尾還有:PetalBot(華為)4.2 萬、CCBot(Common Crawl)3.6 千、Claude-SearchBot 430(只活了一個月)、Claude-User 382、Perplexity-User 182、NotebookLM 132、Gemini DeepResearch 8、Mistral 2 等。
④ 驗明正身:這些爬蟲是真貨嗎?
UA(爬蟲自報的名字)可以偽造,所以我們從 Caddy 原始日誌抽出真實來源 IP(藏在 Cloudflare 的 CF-Connecting-IP 標頭裡),逐一做反向 DNS+官方 IP 段比對+ASN 歸屬查證:
爬蟲 驗證方法 結果
Applebot 565 個獨立 IP 反查 DNS 實測 全部 *.applebot.apple.com(Apple 自有 17.x 網段)✅
GPTBot/OAI-SearchBot/ChatGPT-User 官方 openai.com 公布 IP 段逐一比對 實測 三隻全部命中官方段(OpenAI 跑在微軟 Azure 上)✅
ClaudeBot ASN 歸屬+網段分析 實測 Amazon 2024 年新分配的專用小網段、只用 2 個 IP 集中出口(Anthropic 架在 AWS 上,方向一致)✅
Amazonbot 123 個 IP 反查 DNS 實測 *.crawl.amazonbot.amazon ✅
Bingbot 22 個 IP 反查 DNS 實測 msnbot-*.search.msn.com ✅
Meta IPv6 網段歸屬 實測 Meta 自有 2a03:2880:: 段 ✅
Bytespider 同上 警示 抽樣中抓到 1 隻從 AWS 新加坡機房「冒充」的假貨——UA 偽裝確實存在,但屬邊緣量
教訓一枚:第一版腳本直接讀 remote_ip,所有爬蟲都顯示同一個內網 IP(Docker 閘道假象)。親手執行、當場修正,才有上面這張表——這正是「AI 說的要自己驗」的活教材。
⑤ 逆向各家:抓回去到底做什麼?
每家的處理管線分三類用途:訓練 (餵大模型,幾個月後才反映、且看不到出處)、搜尋索引 (進答案引擎的資料庫,數小時〜數週反映、會給引用連結)、真人代抓 (用戶當下要求 AI 讀網頁,幾秒鐘反映)。「會帶流量回來的」只有後兩類。
OpenAI —— 三層分工最清楚,也是唯一成規模的回流來源
GPTBot(訓練,562 萬) :廣度優先、三語均衡(zh/ja/en 各約三分之一)。它抓的是「系統頁層」——sitemap、區段索引、以及每家公司一份的 llms.txt(30 天抓 8,618 次) ;抓走的內容經抽取→去重→品質過濾後成為訓練語料候選。實測 官方文件
OAI-SearchBot(搜尋索引,28.9 萬) :高選擇性。ChatGPT 引用過的網址 85.6% 在它的爬取集裡(GPTBot 廣 14 倍卻只覆蓋 34.9%)——它挑什麼,ChatGPT 就引什麼。它挑的內容已偏英文。實測
ChatGPT-User(真人代抓,24.2 萬) :真人在 ChatGPT 裡點到、要求讀取我們頁面時的即時抓取,抓的全是個別文章頁。實測
Anthropic —— 陣發式批量收割(總量冠軍 644 萬)
平日近乎靜默(每天 <400),然後突然一波吃掉全站:6 月一個月 390 萬、7/17-18 兩天 11 萬。這種「批次排程」型態與訓練語料的週期性收集一致,但也可能是佇列釋放/重試潮,我們不把話說死。實測 推斷 曾短暫出現 Claude-SearchBot(4/15〜5/15,430 次)之後消失——Anthropic 官方文件查無此 UA 說明,推斷是搜尋功能的實驗性爬蟲。帶真人回來極少(8 次)。
Apple —— 7 月最大戶,但目的是搜尋、不是訓練
爆量起點 6/28(前一天正是 idaeo.ai 品牌遷移),推斷是遷移觸發的全站重爬+收錄。推斷 爬的內容:350 萬次砸在 /ai/ 公司頁目錄、132 萬次在 /ainews/ 新聞。Apple 的 AI 訓練旗標 Applebot-Extended 五個月只來過 2 次——所以這 500 萬次的目的是 Siri/Spotlight 搜尋索引 。實測 它目前沒有帶回任何一次可辨識的引用點擊(Siri 端多為零點擊)。
Microsoft —— sitemap 重度依賴者,餵 Copilot 的水源
Bingbot 30 天抓 sitemap 33,155 次+llms.txt 22,025 次——靠站點地圖當心跳做增量發現。實測 Bing 索引供 Copilot 檢索引用(Copilot 是我們第二大回流來源:66 次,13.9%)。官方文件
Google —— 標籤混併,最大的不確定點
我們 DB 的「Google AI」(217 萬)其實是 GoogleOther+Google-Extended 兩種標籤的合併計數(源碼實證),無法歸因到 Gemini 訓練或某單一產品。實測 警示 Gemini 可辨識回流僅 29 次——但 Google 系的 AI 答案(如 AI Overviews)點擊會混在一般 Google 搜尋 referrer 裡,系統性被低估 。NotebookLM(132)與 Gemini DeepResearch(8)是用戶任務觸發的小量代抓。
Amazon/ByteDance/Common Crawl/其他
Amazonbot(90.6 萬) :Alexa 類問答的網頁收錄。官方文件 特別偏愛新站 idaeo(佔其 AI 爬量 61%)——但其中有掉進 /a/a/null 垃圾路徑黑洞的放大成分。推斷
Bytespider(7.8 萬) :字節跳動(豆包/頭條系)訓練與索引,明顯偏中文內容。量僅 GPTBot 的 1.4%——它的主戰場在中文生態,我們的台日內容只是順手帶走。官方文件 推斷
CCBot(3.6 千) :Common Crawl 公共語料庫,「一頁抓一次」的快照型(重複率 1.01)。我們親手反查+下載封存原件驗證:washinmura.jp 在 2026 年 6 月版被收錄 1,515 筆(其中 1,089 筆為完整頁面正本:AINews 730+AEO 公司頁 329+官網 28),且 4 月版、5 月版就已在收 ——這是全球開源模型(LLaMA、Mistral 等)共用的訓練水源,內容會沿此路擴散到我們看不到的模型裡;idaeo.ai 尚未被收錄。實測
Perplexity(5.9 萬+182) :小而精的索引+真人代抓。回流僅 17 次,但包含 ANK 深卡史上第一次真引用(7/08)。實測
長尾 :PetalBot(華為搜尋)、YandexBot、DuckAssistBot(DuckDuckGo AI 答案)、YouBot、ExaBot(AI 代理搜尋 API)、CohereBot、Mistral(真人代抓 2 次)——各有來頭,量皆屬零星。官方文件
⑥ 引用/導流的真相:搬走 3,000 萬次,帶回來 476 個真人
ChatGPT
356(74.8%)
Copilot
66(13.9%)
Gemini
29
Perplexity
17
Claude
8
時間軸 :4 月 3 次 → 5 月 48 → 6 月 281 → 7 月(至 7/24)144。警示 7 月日均 6.0 次,比 6 月的 9.4 次少了 36% ——需要在執行期監控裡盯住。
這是「下界」 :五家全部來自網頁版 referrer;手機 App 內點擊不帶 referrer、零點擊回答完全不可見,真實影響力一定高於 476。實測
語言真相 :引用落點 英文 67.2%/日文 28.2%/中文 3.2%。我們的中文頁供給反而最多——所以不是我們英文寫太多,是 AI 端從索引選擇層就偏英文。結論:想被引用,英文版是主戰場。 實測
落點 :washinmura 的 /ainews/ 文章與 idaeo 的 CNA 英文新聞平分秋色;被爬≠被引用(歷史經驗 10〜12%)。
⑦ 轉載:log 看不到,但有三條偵測路
AI 把我們的內容「講出來但沒給連結」(零點擊復現)、以及他站轉貼,都不會在我們伺服器留下任何痕跡——這是結構性盲區,不是我們沒查到。可行的偵測手段(交叉審查提出、主分析已驗證其中一條可跑通):
特徵句探針 :在文章裡佈置獨特短句,定期去各 AI 問答引擎查詢是否被複現。成本低。
定期查詢採樣 :對高價值主題自動化查詢各引擎,監測「有內容、無引用」的復現。成本中。
Common Crawl 反查 :實測 已跑通——用公開索引 API 反查我們域名的收錄狀況,也可反查特徵句找他站轉貼。
⑧ 這輪交叉驗證翻掉了什麼(誠實帳)
被修正的四件事 ——多模型對抗審查+主分析親手執行的成果:
「20 倍富集」口徑作廢。 外部模型算術重驗:85.6%÷34.9%×14 倍廣度=34.3 倍,20 倍無法由凍結數字重現。正確講法:「OAI-SearchBot 的爬取選擇性至少高一個數量級」——原口徑反而是低估。
「Applebot 爆量=表格換代的假象」被推翻。 內部挑錯提出質疑,主分析用邊界日查詢裁決:6/23(換表日)當天 331 次、與前期完全連續,爆發在 6/28——是真實行為,且時點指向品牌遷移觸發。
「引用偏英文=我們英文供給多」被推翻。 供給面重驗數據:中文路徑最多、引用卻最少——供給效應排除,偏差在 AI 端。
「Google AI=217 萬都是 Gemini」不成立。 標籤混併(源碼實證),這筆帳無法歸因單一產品,列為本案最大不確定點。
經受住考驗的結論 :OpenAI 三層分工(log 直接可辨)、ClaudeBot 陣發式收割、身分驗真六家全真、引用高度集中於 ChatGPT 系、llms.txt 有真實消費量(但「抓」不等於「官方承諾採用」)。
⑨ 方法論與分工(誰做了什麼)
主分析(親自執行) :全歷史兩段拼接重建(永久日彙總+30 天明細)、爬蟲 IP 反查驗真(565 IP rDNS+OpenAI 官方段比對+ASN 查證)、Common Crawl 反查實跑、llms.txt 存活驗證、源碼追溯(UA 分類器、標籤映射、彙總排程)、交叉質疑的邊界日裁決、全部交叉審查交付的親驗與整合。
內部交叉審查 :獨立挑錯審查的三大質疑促成兩處修正;15 條重驗 SQL 全過——陣發指紋、時刻表、重複抓取、語言供需對比;另以輕量模型機械抽取上輪素材 168 條。
外部模型交叉驗證 :GPT 系模型 17 家管線逆向+算術實驗室(含故意錯誤數字的反向測試);Gemini(3.1 Pro)UA 覆蓋缺口審計+爬取方法歸類;DeepSeek 中國系生態+轉載偵測三法;MiniMax 數字保真對帳表。外部模型交付全部回主分析親驗,其中 其中一路的前提錯誤(爆量日期)被主分析實測數據糾正。
數據紀律 :所有請求數=伺服器 DB 真值;引用數已排除自家合成測試 UA;推斷與實測分開標記;不可測的(轉載、零點擊)誠實標注不可測。