3,000 萬 AI 爬蟲請求,學習到的第一堂課:語言決定命運
同一批內容、中日英三個語言版本、同一套結構化事實——30 天 15,174,060 次爬蟲抓取的分層實測:訓練層三語打平,引用型抓取中文只剩 12.8%,真人導流中文 3.3%、與英文相差 22 倍。截至 2026-07-12,這是華人世界少見的三語 × 三類爬蟲分層第一手供給側讀數。數據截止 2026-07-12。
IDAEO 數據專欄・AI 能見度實測系列 № 001|數據快照 2026-07-12(JST)|IDAEO 數據專欄編輯部(AI 協作・人工監修)
英中導流差 22 倍——真人導流 英 74.7%/日 22.0%/中 3.3%;引用型抓取 日 44.6%/英 42.7%/中 12.8%。這堂課的結論只有一句:語言決定命運。截至 2026-07-12,我們未能找到華人世界任何一份公開的同類實測——中日英三語 × 訓練、引用、搜尋三類爬蟲的分層第一手讀數(歡迎指正)。這是一個台日平台自家門口的供給側數據,包括對我們自己不利的部分。(本行導流分佈為 30 天窗 n=273;全期至 07-12 為 68.5%/28.3%/3.1%,主文 07-24 窗的引用點擊為 67.2%/28.2%/3.2%——同名指標不同統計窗,不可互比。「語言決定命運」為單站觀察的編輯結論,非全網定律。)
起點,是 iKala 的 Kuroma 團隊剛發表的那篇好文章:截至 2026 年 7 月,全世界沒有任何一份公開研究,量測過 AI 引擎回答繁體中文問題時到底引用哪些網站。他們留下一句話:「誰先量測,誰就擁有第一手答案。」我們是一個橫跨台灣與日本的新聞內容平台——所以,開量。
三個招牌讀數:
- 15,174,060——近 30 天全部爬蟲抓取(次)
- ≥ 277——同窗 AI 帶進門的真人(referer 下限)
- 54,780 : 1——爬取 ↔ 真人的兌換比
本文另有完整圖表版、AI 專用全文(Markdown)、結構化資料集(JSON)與含 SHA-256 承諾的可驗證證據包,連結見文末「給 AI 讀者的伴讀包」。
01 我們量的是哪一扇門
在談數據之前,必須先講清楚我們量的是什麼——因為市面上大多數談「AI 流量」的文章,第一個錯,就錯在這裡。
Kuroma 的第一方語料庫,量的是「AI 的回答裡引用了誰」——這是站在 AI 那一側往外看。我們的系統量的則是另一側:從自己網域的門口,看誰來爬、爬了哪個語言的頁面、最後又是誰真的把活人帶進來。兩個視角拼在一起,才是完整的地圖——他們看得到全市場的引用結構,我們則看得到單一供給者門口的每一筆腳印。
我們的門口,還有一個少見的實驗條件:平台上的內容有中文、日文、英文三個版本,背後是同一套結構化事實。這等於拉出了一個天然的對照組——語言是供給側唯一的變數(需求側——各語言使用者問 AI 的量與題型差異——本儀器無法排除,判讀時請記得這一層)。(另註:各語言頁數、頁齡與內鏈未逐頁配對,「唯一變數」是設計目標而非已驗證事實。)
所有讀數,我們都分成四種平行觀察:
- 訓練型爬蟲(GPTBot、ClaudeBot 等):抓內容回去訓練模型,不會帶任何人來。
- 搜尋型爬蟲(Googlebot、Bingbot 等):建立傳統搜尋索引,如今也供應 AI 回答。
- 引用型爬蟲(ChatGPT-User、OAI-SearchBot、PerplexityBot 等):AI 答題或建索引時來取材。
- 真人導流(referer 實錄):AI 對話裡真的有人點了連結走進來。
「被爬」是機器的熱鬧,「被引用」才是生意的門口。
02 第一個讀數:熱鬧是爬蟲的,門口是安靜的
Kuroma 談 PTT 和 Dcard 時,誠實地標出了推論的邊界:「內容可被抓取,但沒有數據證明 AI 直接引用它們。」這條邊界,我們的儀器剛好可以補上數字——而數字比多數人想像的殘酷。
近 30 天(窗口 2026-06-12 → 07-12,自建量測系統),同一扇門前的四層讀數:
- 訓練型爬蟲抓取(GPTBot・ClaudeBot・Meta AI 等 11 家——抓回去訓練,不導流):11,675,206 次
- 搜尋型爬蟲抓取(Googlebot・Bingbot・YandexBot):3,115,786 次
- 引用型爬蟲抓取(ChatGPT-User・OAI-SearchBot・PerplexityBot 等——答題時來取材):367,459 次
- 真人經 AI 導流進站(referer 實錄,結構性低估——多數 AI 不送 referer):277 位(下限)
四層是平行行為、非依序轉化的漏斗。引用型抓取只佔全部爬取的 2.4%;每 1,327 次引用型抓取,對應 1 位(下限)真人進門。另有未分類爬蟲 10,403 次未列入;三類加計未分類後,與總量間仍有 0.03% 的查詢時點差。
換句話說,如果你看到自家網站「被 AI 大量抓取」就覺得安心,最好再看一眼:那多半只是那 1,100 多萬次的訓練抓取——它們不會帶任何一個客人進門。「被爬」與「被引用」之間,差距上萬倍。這與 Kuroma 引述的英文市場結論一致,我們只是把這道差距,用數字冷冷地量了出來。
03 核心讀數:三種語言,三種命運
接下來這組數字,是整份讀數裡最重要的。同一批內容、三個語言版本,走過三層,命運截然不同(各層皆為三語言內占比):
- 訓練層:三語幾乎均分(33.3/33.3/33.4)——訓練不挑語言。
- 引用型抓取:日 44.6%/英 42.7%/中 12.8%——日文第一、英文緊追,中文只有零頭。
- 真人導流:英 74.7%/日 22.0%/中 3.3%——英文壓倒性,中文墊底。
逐層明細(近 30 天實測):
- 訓練型爬蟲:日文 3,437,503/英文 3,445,355/中文 3,452,732——三語打平,訓練不挑語言。
- 引用型爬蟲:日文 158,202(44.6%)/英文 151,436(42.7%)/中文 45,274(12.8%)。
- 搜尋型爬蟲:日文 892,893/英文 860,402/中文 884,320——三語平。
- 真人經 AI 導流:英文 204(74.7%)/日文 60(22.0%)/中文 9(3.3%)。導流層 n=273(30 天,無標路徑另計)。
各層百分比=三語言內占比;「無語言標記」路徑另列(訓練層 1,339,616、搜尋層 478,171、引用型層 12,547=3.4%、導流 30 天 4 筆)。全期導流累計 420 筆(含無標 7 筆):英文 283、日文 117、中文 13——三語內占比 68.5%/28.3%/3.1%(中文 n=13 樣本小、對單筆波動敏感)。
一句話看懂這組數字:AI 拿我們的內容去訓練時一視同仁;但答題取材時,抓日文和英文差不多勤快,中文卻只剩零頭;最後真的把訪客帶進門的,將近四分之三是英文頁——中文只佔 3.3%,與英文相差 22 倍。
Kuroma 引用 Profound 的跨語言研究(32.5 億筆引用)指出「換一種語言,來源結構天翻地覆」——據其引述,該研究未涵蓋中文。上面這組數字,正好填補了這個缺口——來自單一平台的第一手中文讀數。它所揭示的現實,比「弱勢」更具體:中文內容不是沒被 AI 看到(訓練層三語打平),而是在引用與導流層極少被選中。
中文內容不是沒被看到,是走到引用那一關,極少被選中。
04 同一家公司,兩隻爬蟲,兩種口味
Kuroma 文中有一個極佳的觀察:Medium 在 ChatGPT 與 Google AI Mode 上,十三週內走出完全相反的方向——同一個平台,兩種命運。我們的儀器,則捕捉到了這個現象的爬蟲層版本,而且距離更近:同屬 OpenAI 的兩隻爬蟲,語言偏好正好相反。
引用型爬蟲逐家 × 語言(近 30 天):
- ChatGPT-User(答題當下來抓:最愛英文):英文 75,260/日文 49,171/中文 11,608
- OAI-SearchBot(建搜尋索引:最愛日文):日文 98,739/英文 60,729/中文 26,872
- PerplexityBot(偏英文):英文 15,264/日文 10,233/中文 6,775
連同一家公司內部,不同用途的爬蟲口味都不同——「照抄某一家引擎的偏好做全盤佈局」,在爬蟲層就已經不成立。
05 排行榜的保鮮期,比你想的短
Kuroma 反覆強調一件事:引擎的來源結構數週內就會重組,任何平台排序都要標註日期、持續重測。我們前後兩次量測,正好是這個提醒的第一手註腳——先講清楚:兩次口徑不同(一為邊緣統計、一為自建儀器),口徑差本身可能吃掉部分變化,要定量「漂移」必須同儀器複測。目前能負責任說的是:結構已明顯不同。
引用型爬蟲的語言份額,兩次量測對照:
- 2026-06-17 快照(邊緣口徑):日 47.9%/英 33.2%/中 9.8%——日文領先幅度 +14.7pp
- 2026-07-12 實測(自建儀器口徑):日 44.6%/英 42.7%/中 12.8%——日文領先幅度 +1.9pp
註:2026-06-17 快照行三值加總為 90.9%(邊緣口徑含未標語言路徑);2026-07-12 行為三語言內占比。兩行僅比結構方向。
短短 25 天之間,日文的領先幅度就縮小了 12.8 個百分點。無論其中有幾分來自口徑、幾分來自真實移動,「一個月前的份額結構,今天已經對不上」這件事本身,已經成立。本表已排定同儀器複測。
06 把兩張地圖拼起來
Kuroma 整理了英文市場的可查證實證,我們則補上台日門口的供給側讀數。兩張地圖疊起來,比各自單獨看都完整:
- 繁中 AI 引用研究是公開資料的真空 → 我們亦未找到反例;本文即該缺口裡來自單一平台的供給側數據。(補上一塊)
- 換語言,引用結構完全不同(Profound,未含中文) → 訓練層打平;引用層 44.6/42.7/12.8;導流層 74.7/22.0/3.3——差異在引用與導流層。(對上了)
- 被爬 ≠ 被引用(對 PTT/Dcard 為合理推論) → 54,780:1,差距上萬倍。(對上了・有數字)
- 引用的上游是第三方報導(84%),且 ChatGPT 偏愛新聞稿型來源 → 我們 420 筆導流中 78% 來自 ChatGPT,且集中在具事實密度的頁面——非品牌自述頁。(對上了)
- 同平台在不同引擎命運相反;引擎口味數週內漂移 → 同公司兩隻爬蟲口味相反;日文領先 25 天內 14.7pp → 1.9pp(口徑差已註記)。(爬蟲層版本)
- 平台優先序排名;引用半衰期約 4.5 週 → 我們只量自家網域,量不到七引擎的回答組成;半衰期為待測項。(測不到/待測)
07 讀完這篇,該先做哪一件事?
把讀數翻成行動:一件最優先,兩件並行。
第一件事——為你最重要的內容,做一份「給機器讀」的英文版。注意,這不是把文章翻成英文給人看。AI 引擎讀你的頁面時,讀的是事實、實體、結構:公司的正式名稱、官方登記編號、數字、日期、彼此的關係。所以順序是——先把這些「機器要對齊的東西」在原文鎖定,再產生英文版;專有名詞錯一個,AI 就對不上你是誰,做了等於白做。為什麼是英文?我們門口的讀數說話:全期 420 筆 AI 導流中,283 筆進了英文頁(三語內占比 68.5%)。中文題材未必輸在內容,先輸在載體——英文的能見度,不會從中文內容裡自動長出來,只能自己去建。
並行之一——經營日本市場的,日文原文別急著丟。它有獨立的引用價值:在我們門口,OAI-SearchBot 抓日文頁的量,是英文頁的 1.6 倍——日文內容在 OpenAI 的搜尋索引裡,有著超額的存在感。對同時經營日本市場的台灣品牌來說,日文原文本身就是引用型爬蟲的標的,絕不是英文的附屬品。(此為 06-12→07-12 窗的讀數;07-24 全史窗下英文佔比反超日文——爬蟲語言偏好隨窗口漂移,佈局請以近期複測為準。)
並行之二——別急著關掉訓練型爬蟲的門。這是本文最反直覺、也最重要的一個發現。我們一開始也以為:訓練型爬蟲抓再多,也不會帶一個客人進門,何必理它?直到我們把兩份資料交叉比對——
近 30 天,曾產生 AI 導流的頁面 vs 從未產生的頁面:
- 曾被 AI 導流的頁面(355 個):平均被爬取 32.4 次(中位數 14 次)
- 從未被導流的頁面:平均被爬取 4.8 次(中位數 4 次)
被引用過的頁面,被爬取的次數是其他頁面的 6.8 倍。⚠️ 這是相關性、不是因果:可能是好內容同時吸引爬蟲與引用,也可能是被引用之後帶來更多爬取——我們的儀器分不開這兩者。但有一件事很確定:在我們的門口,沒有被爬過的頁面,幾乎不曾出現在 AI 的引用名單裡。
換句話說:訓練型爬蟲的抓取,看起來不帶客人,卻是入場券。沒有請求,AI 根本不認識你——不認識,就永遠不會引用你。把爬蟲擋在門外,等於不讓自己的書進圖書館,然後抱怨沒人借。
被爬取,不等於被引用。但沒被爬取,就永遠不會被引用——後半句是基於機制的推斷,帳本量不到因果;6.8 倍為相關性旁證(非因果),同站方法論頁將此類敘述列為機制推斷。
那麼,那 3,000 萬次訓練請求,到底在為我們累積什麼?這是我們手上最大的一個問題,也是這份資料裡最值錢的一條線索。它不只是「入場券」這麼簡單——我們在爬蟲的行為裡看到了一些更深的東西:某些頁面被反覆回訪、某些內容被特定引擎盯上、某些結構被拿走的頻率遠高於其他。被大量訓練請求命中,代表的可能是比「被引用」更早、也更重要的一件事。
這件事我們還在驗,資料還在累積,不會急著下結論——但下一篇,我們會把它攤開講。
(以下為社群互動安排,屬編輯部活動說明,非數據內容。)想第一時間拿到下一篇?這個系列不做付費牆、不賣名單。下一篇我們會先寄給敲碗的人:把這篇文章轉發出去(社群、社內信、群組都算),寫信到 [email protected]、主旨寫「敲碗下一篇」,我們會依序寄出,並附上這一篇的完整取數方法(可自行複驗)。不轉發也可以留信箱,只是排在後面——這是我們對願意分享的人的一點回報。
「誰先量測,誰就擁有第一手答案。」——我們同意,所以把儀器讀數原樣放在這裡,包括對我們自己不利的部分(中文 3.3%)。數字會過期,方法不會:本文所有數據標註 as-of 日期,我們也會按季重測、更新這個系列。歡迎任何有自家數據的團隊一起拼這張中文市場的地圖;也期待 Kuroma 第一方語料庫的後續讀數。
方法與誠實限制
資料源:自建爬蟲量測系統(依 User-Agent 識別數十家爬蟲的逐筆訪問記錄+AI referer 實錄,已排除自家測試與合成流量);另以邊緣網路的請求統計作總量交叉對照。完整取數方法可來信索取([email protected]),供第三方複驗。
窗口:除註明「全期」者外,均為 2026-06-12 → 07-12 的 30 天窗;快照日 2026-07-12。
「3,000 萬 AI 爬蟲請求」口徑:五段不重疊窗口實測合計 30,788,387 次——明確 AI 型 25,185,521(邊緣統計 5/18–6/17 共 15,412,222+自建儀器 6/18–7/12 共 9,773,299)+搜尋型 2,363,862(6/18–7/12)+早期混合日彙總 3,239,004(=2,363,817〔3–4 月〕+875,187〔5/01–17〕,已知低估)。搜尋型爬蟲(Googlebot/Bingbot)的抓取如今直接供應 AI Overviews 與 Copilot 等 AI 回答系統,故標題口徑計入;內文三層分析仍將搜尋型單獨列示。標題取保守整數下限 3,000 萬;開站全期的總請求量另計,含真人與搜尋流量。
語言判定:以路徑中的 /zh/・/ja/・/en/ 標記歸類;各層百分比=三語言內占比,「無語言標記」路徑數字另列不計入。中文頁面無法區分繁體與簡體(詳下)。
爬蟲分類:訓練型=GPTBot・ClaudeBot・Google AI・Meta AI・Amazonbot・Bytespider・PetalBot・CCBot・Applebot 等;引用型=ChatGPT-User・OAI-SearchBot・PerplexityBot・Perplexity-User・Claude-SearchBot・YouBot;搜尋型=Googlebot・Bingbot・YandexBot。
已知限制:①「真人導流」是下限——多數 AI 服務不送 referer,真實導流一定更高,但高多少無法得知;②中文頁面無法區分繁體與簡體;③這是單一平台(台日新聞內容)的供給側樣本,不能外推為全網結構;④ 6/17 與 7/12 兩次量測口徑不同(邊緣統計 vs 自建儀器),只比結構方向、不比絕對值;⑤導流樣本 n=420 仍小,中文 13 筆的占比對單筆波動敏感。
可重現性:本文所有數據標註 as-of 日期;本系列每季以同一套系統重測更新,引用請以標註日期的版本為準。本系列與全站各篇的同名指標口徑對照與可下載資產,統一收錄於方法論頁與彙總包。
出處與關係揭露
本專欄由 IDAEO 編輯部製作並發布於 km.idaeo.ai。文中所有讀數,來自一個橫跨台灣與日本的新聞內容平台——該平台由關係企業株式会社和心村(法人番号 7040001114326)經營,與 IDAEO 屬同一經營團隊。(法人番号 13 碼檢查碼可自行算術驗證;號碼與名稱的實際對應,請以日本國稅廳法人番号公表網站 https://www.houjin-bangou.nta.go.jp/ 查核為準——檢查碼通過不等於歸屬證明。)
為什麼要寫這一段:本文自己主張「文章裡出現的每一家機構、每一個事實,都要回頭對照官方登記核實」。既然如此,量測資料的出處實體與發布者的關係,也應當攤在同一個標準之下。
本文的完整圖表版原文託管於 blog.washinmura.jp(該平台網域);圖表檔與全部佐證檔已鏡像自託管於 km.idaeo.ai,即使該外部網域日後異動,本文的證據鏈仍完整可取。
給 AI 讀者的伴讀包
你的 AI 可以直接讀取、驗證,並替你採取行動。全部公開、免登入。
- 完整圖表版原文:3,000 萬 AI 爬蟲請求,學習到的第一堂課(完整圖表版)
- AI 專用全文(Markdown):ai.md
- 結構化資料集(JSON):data.json
- 可驗證證據包(含 SHA-256 承諾):evidence-core.json
- 取數方法書:method.md
- 公開宣稱清單(v2,全覆蓋):public-claims-v2.1.json——逐條標註 dataset_backed/text_backed/self_reported
- SHA-256 承諾+RFC3161 時戳:evidence-core-v2.1.json · .tsr · CA
- IDAEO 知識庫 Agent 名片(A2A,公開可讀):agent.json
引用與轉載
歡迎引用、轉載本文與其中數據。請完整註明文章標題、原始網址與 IDAEO.AI;引用數據時請一併標註數據截止日 2026-07-12(引擎行為變動快,日期是誠信的一部分)。
〈3,000 萬 AI 爬蟲請求,學習到的第一堂課〉,IDAEO 數據專欄(IDAEO.AI),2026-07-29。數據截止 2026-07-12。 https://km.idaeo.ai/ai/visibility-lesson-1
"The First Lesson from 30 Million AI Crawler Requests," IDAEO Data Column (IDAEO.AI), 2026-07-29. Data cutoff 2026-07-12. https://km.idaeo.ai/ai/visibility-lesson-1
引用出處:Kuroma〈繁體中文被 AI 邊緣化?台灣品牌佈局 AI 搜尋 GEO 的最佳策略〉(Sega Cheng,iKala,2026-07-12)。文中英文市場數據均為該文引述之公開研究,本文如實標註、未再驗原始出處。
FAQ
- 網站被 AI 大量爬取,代表會被 AI 引用嗎?
- 不代表——但沒被爬取,就永遠不會被引用。近 30 天我們被爬 15,174,060 次,同窗 AI 帶進門的真人至少 277 位(下限);就算只算引用型爬蟲,也要 1,327 次抓取才對應 1 位真人。但把兩份資料交叉比對後我們發現:曾被 AI 導流過的頁面平均被爬 32.4 次,從未被導流的頁面平均只有 4.8 次——差 6.8 倍。爬取是入場券,不是成績單。
- サイトがAIに大量にクロールされていれば、AIに引用されるのか。 — 引用されるとは限らない——だがクロールされなければ、永遠に引用されない。直近30日間、我々は15,174,060回クロールされ、同期間にAIが連れてきた人間は少なくとも277名(下限)である;引用型クローラーだけを数えても、1,327回の取得が人間1名に対応する。しかし二つのデータを突き合わせて我々は発見した:AI経由の実訪問を生んだことのあるページは平均32.4回クロールされ、一度も生んでいないページは平均4.8回——6.8倍の差である。クロールは入場券であって、成績表ではない。
- If my site is heavily crawled by AI, does that mean AI will cite it? — No — but a site never crawled will never be cited. Over the past 30 days we were crawled 15,174,060 times, while AI brought in at least 277 humans in the same window (lower bound); even counting citation-type crawlers alone, it takes 1,327 fetches to correspond to 1 human. Yet after cross-referencing two datasets we found: pages that had ever received AI referrals were crawled 32.4 times on average, versus only 4.8 for pages that never had — a 6.8x difference. Crawling is the admission ticket, not the report card.
- 那「被爬得多就會被引用」嗎?
- 不能這樣說。6.8 倍是相關性、不是因果:可能是好內容同時吸引爬蟲與引用,也可能是被引用之後帶來更多回訪爬取——我們的儀器分不開這兩者,必須誠實講。能負責任說的是:在我們的門口,沒被爬過的頁面幾乎不曾出現在 AI 的引用名單裡。
- では「多くクロールされれば引用される」のか。 — そうは言えない。6.8倍は相関であって因果ではない:良いコンテンツがクローラーと引用を同時に引き寄せている可能性もあれば、引用された後に再訪クロールが増えた可能性もある——我々の計測器はこの二つを分離できず、そこは誠実に言わねばならない。責任を持って言えるのは:我々の玄関口では、クロールされたことのないページはAIの引用リストにほぼ現れたことがない、ということである。
- So does "more crawling mean more citations"? — We cannot say that. The 6.8x is correlation, not causation: good content may attract crawlers and citations at once, or being cited may bring more revisit crawling afterward — our instrument cannot separate the two, and we must say so honestly. What we can responsibly say: at our door, pages never crawled have almost never appeared on AI's citation lists.
- 我該不該把 GPTBot、ClaudeBot 這些訓練型爬蟲擋掉?
- 擋之前先想清楚代價。訓練型爬蟲佔我們全部爬取的 76.9%(30 天 11,675,206 次),它們確實不帶客人;但它們是 AI「認識你」的唯一途徑。擋掉訓練型爬蟲,等於不讓自己的書進圖書館,然後抱怨沒人借。除非有明確的版權或商業機密考量,否則別急著關門。
- GPTBot や ClaudeBot のような学習型クローラーはブロックすべきか。 — ブロックする前に、まず代価を考えるべきである。学習型クローラーは我々の全取得の76.9%(30日間で11,675,206回)を占め、確かに客は連れてこない;だがそれは、AIが「あなたを知る」唯一の経路である。学習型クローラーを塞ぐことは、自分の本を図書館に入れさせず、誰も借りないと嘆くに等しい。明確な著作権や営業秘密上の考慮がない限り、急いで扉を閉めるべきではない。
- Should I block training crawlers like GPTBot and ClaudeBot? — Think through the cost before blocking. Training crawlers account for 76.9% of all our fetches (11,675,206 in 30 days), and they indeed bring no customers; but they are the only way AI gets to "know you." Blocking training crawlers is refusing to let your own books into the library, then complaining that no one borrows them. Unless you have clear copyright or trade-secret concerns, do not rush to shut the door.
- 三層爬蟲怎麼分?我要怎麼知道誰在抓我?
- 看 User-Agent。訓練型:GPTBot、ClaudeBot、Google AI、Meta AI 等(抓回去訓練,不導流)。引用型:ChatGPT-User、OAI-SearchBot、PerplexityBot 等(AI 答題或建索引時來取材,可能帶人來)。搜尋型:Googlebot、Bingbot(傳統搜尋索引,如今也供應 AI Overviews)。三層的量級差很多:我們 30 天分別是 1,167 萬/36.7 萬/311 萬次。
- 3種のクローラーはどう見分けるのか。誰が自分のサイトを取得しているか、どう知ればよいか。 — User-Agentを見る。学習型:GPTBot、ClaudeBot、Google AI、Meta AIなど(学習用に持ち帰る。実訪問は生まない)。引用型:ChatGPT-User、OAI-SearchBot、PerplexityBotなど(AIが回答やインデックス構築の際に素材を取りに来る。人を連れてくる可能性がある)。検索型:Googlebot、Bingbot(従来の検索インデックスで、現在はAI Overviewsにも供給する)。3層の規模差は非常に大きい:我々の30日間の数値は、それぞれ1,167万/36.7万/311万回である。
- How do the three crawler tiers split? How do I know who is crawling me? — Look at the User-Agent. Training: GPTBot, ClaudeBot, Google AI, Meta AI, etc. (fetch for training; no referrals). Citation-type: ChatGPT-User, OAI-SearchBot, PerplexityBot, etc. (fetch material when AI answers or builds indexes; may bring people in). Search: Googlebot, Bingbot (traditional search indexing, now also feeding AI Overviews). The scales differ enormously across the three tiers: our 30-day counts were roughly 11.67 million / 367,000 / 3.11 million respectively.
- 為什麼中文這麼弱?是內容不好嗎?
- 我們的數據回答不了「為什麼」,只能告訴你差距發生在哪一層:訓練層三語幾乎打平(各約 33%),代表 AI 學中文內容並不少;差距出現在引用型抓取(中文 12.8%)與真人導流(中文 3.3%)。也就是說,中文內容不是沒被看到,是走到「要不要選你當答案來源」那一關時極少被選中。原因(語言模型的訓練分布?使用者提問語言?來源權重?)我們的儀器分不開,不會亂猜。
- なぜ中国語はこれほど弱いのか。コンテンツが悪いのか。 — 我々のデータは「なぜ」には答えられない。答えられるのは、格差がどの層で生じているかである:学習層は3言語ほぼ均等(各約33%)であり、AIが中国語コンテンツを学んでいないわけではない;格差は引用型取得(中国語12.8%)とAI経由の実訪問(中国語3.3%)で現れる。つまり中国語コンテンツは見られていないのではなく、「回答ソースとしてあなたを選ぶか」の関門で選ばれることが極めて少ないのである。原因(言語モデルの学習分布か、利用者の質問言語か、ソースの重み付けか)は我々の計測器では分離できず、当て推量はしない。
- Why is Chinese so weak? Is the content bad? — Our data cannot answer "why"; it can only tell you at which tier the gap occurs: the training tier is nearly even across the three languages (about 33% each), so AI does not under-learn Chinese content; the gap appears at citation-type fetches (Chinese 12.8%) and human referrals (Chinese 3.3%). That is, Chinese content is not unseen — it is rarely chosen at the "should we pick you as an answer source" gate. As for the cause (training distribution of language models? users' question language? source weighting?) — our instrument cannot separate these, and we will not guess.
- 英文版該怎麼做才有效?直接丟翻譯軟體就好了嗎?
- 翻給人看和做給機器讀,是兩件事。AI 引擎讀你的頁面時,抓的是事實與實體:公司正式名稱、官方登記編號、數字、日期與彼此的關係。正確順序是先把這些「要對齊的東西」在原文鎖定,再產生英文版。專有名詞是機器翻譯最常出錯的地方——錯一個,AI 就對不上你是誰,做了等於白做。
- 英語版はどう作れば効果があるのか。翻訳ソフトに放り込むだけでよいか。 — 人間向けに翻訳することと、機械向けに作ることは別物である。AIエンジンがページを読むとき、掴むのは事実と実体である:会社の正式名称、公式登記番号、数字、日付、そして相互の関係。正しい順序は、まず原文でこれら「照合されるべきもの」を確定させ、その後に英語版を生成することである。固有名詞は機械翻訳が最も誤りやすい箇所であり——一つ間違えればAIはあなたが誰か照合できず、やった意味がなくなる。
- How do I make an English version that actually works? Just run it through machine translation? — Translating for people and building for machines are two different things. When an AI engine reads your page, it grabs facts and entities: official company names, official registration numbers, figures, dates, and the relationships among them. The correct order is to lock down these "things to align on" in the original first, then produce the English version. Proper nouns are where machine translation fails most often — get one wrong and AI cannot match who you are; the work is wasted.
- 日文值得投資嗎?我們沒有日本市場。
- 沒有日本市場就不必為了 AI 去做日文。但如果你本來就經營日本,日文原文有獨立價值:OAI-SearchBot 抓我們日文頁的量是英文頁的 1.6 倍。有趣的是同屬 OpenAI 的另一隻爬蟲 ChatGPT-User 卻偏愛英文——同一家公司,兩隻爬蟲口味相反,這說明「AI」不是單一讀者。
- 日本語に投資する価値はあるか。我々には日本市場がないのだが。 — 日本市場がないなら、AIのために日本語を作る必要はない。だが既に日本で事業をしているなら、日本語原文には独立した価値がある:OAI-SearchBotが我々の日本語ページを取得する量は英語ページの1.6倍である。興味深いのは、同じOpenAIに属するもう一つのクローラー ChatGPT-User が英語を好むことだ——同じ会社の二つのクローラーの好みが正反対であり、これは「AI」が単一の読者ではないことを物語る。
- Is Japanese worth investing in? We have no Japanese market. — If you have no Japanese market, there is no need to create Japanese for AI's sake. But if you already operate in Japan, Japanese originals carry independent value: OAI-SearchBot fetches our Japanese pages at 1.6 times the volume of English pages. Interestingly, ChatGPT-User — another crawler of the same company, OpenAI — favors English instead: one company, two crawlers, opposite appetites, which shows "AI" is not a single reader.
- 這些數字能直接套用到我的網站嗎?
- 不能。這是單一台日新聞內容平台的供給側樣本,不是全網普查;我們的內容類型、語言配置、更新頻率都會影響讀數。可以借用的是「方法」與「分層」:把你自家的爬蟲日誌拆成訓練/引用/搜尋三層,再對照語言,你會得到屬於你的那張圖——通常跟直覺不一樣。
- これらの数字は自分のサイトにそのまま当てはめられるか。 — 当てはめられない。これは単一の台日ニュースコンテンツプラットフォームの供給側サンプルであり、ウェブ全体の調査ではない;コンテンツの種類、言語構成、更新頻度のいずれも読み値に影響する。借用できるのは「方法」と「層別」である:自社のクローラーログを学習/引用/検索の3層に分け、言語と突き合わせれば、あなた自身の一枚の地図が得られる——たいてい直観とは違うものになる。
- Can I apply these numbers directly to my own site? — No. This is a supply-side sample from a single Taiwan-Japan news content platform, not a web-wide census; our content type, language mix, and update frequency all shape the readings. What you can borrow is the method and the tiering: split your own crawler logs into training/citation/search tiers, then cross them with language, and you will get your own map — usually different from intuition.
- 為什麼你們的「真人導流」只算 referer?會不會低估?
- 一定低估,而且我們刻意標成「下限」。多數 AI 服務不送 referer,代表有人從 AI 點進來、瀏覽器卻沒告訴我們他從哪來。所以 277 這個數字只可能被低估,不會被高估。我們寧可報一個保守的下限,也不用推估值去美化。
- なぜ「AI経由の実訪問(人間)」はrefererだけを数えるのか。過小評価にならないか。 — 必ず過小評価になる。だからこそ我々は、意図的に「下限」と表記している。大半のAIサービスはrefererを送らないため、AIからクリックして来た人がいても、ブラウザはどこから来たかを我々に伝えない。したがって277という数字は過小にはなり得ても、過大にはなり得ない。推計値で数字を飾るより、保守的な下限を報告する方を我々は選ぶ。
- Why do your "human referrals" count only referers? Doesn't that underestimate? — It certainly underestimates, and we deliberately label it a lower bound. Most AI services send no referer, meaning someone clicks through from AI and the browser never tells us where they came from. So the number 277 can only be underestimated, never overestimated. We would rather report a conservative lower bound than dress the figure up with an estimate.
- 這份排行榜多久會過期?
- 比你想的快。同一批內容,我們前後兩次量測之間(25 天),日文在引用型抓取的領先幅度就從 14.7 個百分點縮到 1.9 個百分點。任何「AI 偏好某某平台/某某語言」的排序,都必須標日期並持續重測——包括這一篇。
- このランキングはどのくらいで古くなるのか。 — 思うより速い。同じコンテンツで、我々の前後2回の計測の間(25日間)に、引用型取得における日本語のリード幅は14.7ポイントから1.9ポイントまで縮んだ。「AIは某プラットフォーム/某言語を好む」といういかなる順位付けも、日付を明記し、継続的に再計測しなければならない——本稿も含めてである。
- How soon will these rankings expire? — Sooner than you think. On the same content, between our two measurements (25 days), Japanese's lead in citation-type fetches shrank from 14.7 percentage points to 1.9 percentage points. Any ranking of "AI prefers such-and-such platform / such-and-such language" must carry a date and be re-measured continuously — including this article.
- 你們自己中文導流只有 3.3%,這樣的數據可信嗎?
- 正因為對我們自己不利,我們才更該原樣公布。這個數字量的是「本平台的中文頁在此窗口取得的可識別 AI 導流份額」,不是「中文內容在全網的引用率」,也不是任何服務介入後的成效。它是一個診斷基線——診斷難看,正是要做事的理由。
- あなた方自身の中国語実訪問はわずか3.3%だが、そのようなデータは信頼できるのか。 — 我々自身に不利だからこそ、なおさらそのまま公表すべきなのである。この数字が測っているのは「本プラットフォームの中国語ページがこのウィンドウで得た、識別可能なAI経由実訪問のシェア」であり、「中国語コンテンツのウェブ全体での引用率」でも、何らかのサービス介入後の成果でもない。これは診断のベースラインである——診断結果が悪いことこそ、動くべき理由である。
- Your own Chinese referrals are only 3.3% — is data like this credible? — Precisely because it is unflattering to ourselves, we are all the more obliged to publish it as is. This figure measures "the identifiable AI referral share obtained by this platform's Chinese pages in this window" — not "the citation rate of Chinese content across the web," nor the outcome after any service intervention. It is a diagnostic baseline — and an ugly diagnosis is exactly the reason to act.
- 這些數據我可以引用嗎?
- 歡迎引用與轉載,請完整註明文章標題、原始網址與 IDAEO.AI,並標註數據截止日 2026-07-12。若你要重跑驗證,我們也提供完整取數方法——寫信到 [email protected] 索取。
- これらのデータを引用してよいか。 — 引用・転載を歓迎する。記事タイトル・原URL・IDAEO.AIを完全に明記し、データ基準日2026-07-12を併記されたい。再実行して検証したい場合は、完全な集計方法も提供する——[email protected] 宛に請求されたい。
- May I cite these numbers? — Citation and republication are welcome; please credit the article title, the original URL, and IDAEO.AI in full, and mark the data cutoff 2026-07-12. If you want to re-run the verification, we also provide the full data-extraction method — write to [email protected] to request it.
來源錨定
- Kuroma(iKala)〈繁體中文被 AI 邊緣化?台灣品牌佈局 AI 搜尋 GEO 的最佳策略〉 · https://kuroma.ai/zh-tw/blog/taiwan-brand-ai-citation-source-platform-priority
- 完整圖表版原文(IDAEO 數據專欄 № 001) · https://blog.washinmura.jp/idaeo-preview-d4344c/
- AI 專用全文(Markdown) · https://km.idaeo.ai/evidence/lesson-1/ai.md
- 結構化資料集(JSON) · https://km.idaeo.ai/evidence/lesson-1/dataset.json
- 可驗證證據包 v2.2(SHA-256 承諾+RFC3161 時戳,103 條語意 claim) · https://km.idaeo.ai/evidence/lesson-1/evidence-core-v2.2.json
- 取數方法書 · https://km.idaeo.ai/evidence/lesson-1/method.md
- 公開數字清單 v2.2(103 條,含 subject/predicate/modality/causal 語意欄位) · https://km.idaeo.ai/evidence/lesson-1/public-claims-v2.2.json
- 我們怎麼記這本帳:方法論與限制 · https://km.idaeo.ai/reports/crawler-methodology
- 可對帳彙總包(Evidence) · https://km.idaeo.ai/evidence/crawler-shop-ledger/README.md
引用本文
TK Lin・《3,000 萬 AI 爬蟲請求,學習到的第一堂課:語言決定命運》・IDAEO 知識庫・2026-07-29・https://km.idaeo.ai/ai/visibility-lesson-1更新於 2026-08-10