km.idaeo.ai · IDAEO 知識庫

🏛 本文属于主题馆「ai」

3,000 万 AI 爬虫请求,学到的第一堂课:语言决定命运

同一批内容、中日英三个语言版本、同一套结构化事实——30 天 15,174,060 次爬虫抓取的分层实测:训练层三语持平,引用型抓取中文只剩 12.8%,真人引流中文 3.3%、与英文相差 22 倍。截至 2026-07-12,这是华人世界少见的三语 × 三类爬虫分层第一手供给侧读数。数据截止 2026-07-12。

IDAEO 数据专栏・AI 可见度实测系列 № 001|数据快照 2026-07-12(JST)|IDAEO 数据专栏编辑部(AI 协作・人工监修)

英中引流差 22 倍——真人引流 英 74.7%/日 22.0%/中 3.3%;引用型抓取 日 44.6%/英 42.7%/中 12.8%。这堂课的结论只有一句:语言决定命运。截至 2026-07-12,我们未能找到华人世界任何一份公开的同类实测——中日英三语 × 训练、引用、搜索三类爬虫的分层第一手读数(欢迎指正)。这是一个台日平台自家门口的供给侧数据,包括对我们自己不利的部分。(本行导流分布为 30 天窗 n=273;全期至 07-12 为 68.5%/28.3%/3.1%,主文 07-24 窗的引用点击为 67.2%/28.2%/3.2%——同名指标不同统计窗,不可互比。“语言决定命运”为单站观察的编辑结论,非全网定律。)

起点,是 iKala 的 Kuroma 团队刚发表的那篇好文章:截至 2026 年 7 月,全世界没有任何一份公开研究,测量过 AI 引擎回答繁体中文问题时到底引用哪些网站。他们留下一句话:“谁先测量,谁就拥有第一手答案。”我们是一个横跨台湾与日本的新闻内容平台——所以,开测。

三个招牌读数:

  • 15,174,060——近 30 天全部爬虫抓取(次)
  • ≥ 277——同一窗口内 AI 带进门的真人(referer 下限)
  • 54,780 : 1——抓取 ↔ 真人的兑换比
本文另有完整图表版、AI 专用全文(Markdown)、结构化数据集(JSON)与含 SHA-256 承诺的可验证证据包,链接见文末“给 AI 读者的伴读包”。
三层观察下的三语份额:训练层日英中各约三分之一;引用型抓取日文 44.6%、英文 42.7%、中文 12.8%;可识别 AI 引流英文 74.7%、日文 22.0%、中文 3.3%。
全文首图:中文在训练层并未缺席,差距集中出现在引用型抓取与可识别引流。三层为平行观察、不是事件漏斗;各层分母与单位均标在图内。

01 我们测的是哪一扇门

在谈数据之前,必须先讲清楚我们测的是什么——因为市面上大多数谈“AI 流量”的文章,第一个错,就错在这里。

Kuroma 的第一方语料库,测的是“AI 的回答里引用了谁”——这是站在 AI 那一侧往外看。我们的系统测的则是另一侧:从自己域名的门口,看谁来爬、爬了哪个语言的页面、最后又是谁真的把活人带进来。两个视角拼在一起,才是完整的地图——他们看得到全市场的引用结构,我们则看得到单一供给者门口的每一个脚印。

我们的门口,还有一个少见的实验条件:平台上的内容有中文、日文、英文三个版本,背后是同一套结构化事实。这等于拉出了一个天然的对照组——语言是供给侧唯一的变量(需求侧——各语言用户问 AI 的量与题型差异——本仪器无法排除,判读时请记得这一层)。(另注:各语言页数、页龄与内链未逐页配对,“唯一变量”是设计目标而非已验证事实。)

所有读数,我们都分成四种平行观察:

  • 训练型爬虫(GPTBot、ClaudeBot 等):抓内容回去训练模型,不会带任何人来。
  • 搜索型爬虫(Googlebot、Bingbot 等):建立传统搜索索引,如今也供应 AI 回答。
  • 引用型爬虫(ChatGPT-User、OAI-SearchBot、PerplexityBot 等):AI 答题或建索引时来取材。
  • 真人引流(referer 实录):AI 对话里真的有人点了链接走进来。
“被爬”是机器的热闹,“被引用”才是生意的门口。
量测模型:同一内容平台分别观察训练型抓取、搜索型抓取、引用型抓取与可识别 AI 引流;四者为平行读数,不是依序转换漏斗。
我们量的是四条平行轨道。前三条依 User-Agent 分类,引流依 referer 辨识;图中的箭头表示量测来源,不表示转换因果。

02 第一个读数:热闹是爬虫的,门口是安静的

Kuroma 谈 PTT 和 Dcard 时,诚实地标出了推论的边界:“内容可被抓取,但没有数据证明 AI 直接引用它们。”这条边界,我们的仪器刚好可以补上数字——而数字比多数人想象的残酷。

近 30 天(窗口 2026-06-12 → 07-12,自建测量系统),同一扇门前的四层读数:

  • 训练型爬虫抓取(GPTBot・ClaudeBot・Meta AI 等 11 家——抓回去训练,不引流):11,675,206
  • 搜索型爬虫抓取(Googlebot・Bingbot・YandexBot):3,115,786
  • 引用型爬虫抓取(ChatGPT-User・OAI-SearchBot・PerplexityBot 等——答题时来取材):367,459
  • 真人经 AI 引流进站(referer 实录,结构性低估——多数 AI 不送 referer):277 位(下限)
30 天量级对数图:训练型爬虫 11,675,206 次、搜索型 3,115,786 次、引用型 367,459 次、可识别 AI 引流 277 条下限。
同窗四个量级。前三列是 request,最后一列是可识别 AI 引流记录;对数尺度只为让 277 与千万级数字能同时看见。

四层是平行行为、不是依次转化的漏斗。引用型抓取只占全部抓取的 2.4%;每 1,327 次引用型抓取,对应 1 位(下限)真人进门。另有未分类爬虫 10,403 次未列入;三类加上未分类后,与总量之间仍有 0.03% 的查询时点差。

换句话说,如果你看到自家网站“被 AI 大量抓取”就觉得安心,最好再看一眼:那多半只是那 1,100 多万次的训练抓取——它们不会带任何一个客人进门。“被爬”与“被引用”之间,差距上万倍。这与 Kuroma 引述的英文市场结论一致,我们只是把这道差距,用数字冷冷地测了出来。

03 核心读数:三种语言,三种命运

接下来这组数字,是整份读数里最重要的。同一批内容、三个语言版本,走过三层,命运截然不同(各层皆为三语言内占比):

  • 训练层:三语几乎均分(33.3/33.3/33.4)——训练不挑语言。
  • 引用型抓取:日 44.6%/英 42.7%/中 12.8%——日文第一、英文紧追,中文只剩零头。
  • 真人引流:英 74.7%/日 22.0%/中 3.3%——英文压倒性,中文垫底。

逐层明细(近 30 天实测):

  • 训练型爬虫:日文 3,437,503/英文 3,445,355/中文 3,452,732——三语持平,训练不挑语言。
  • 引用型爬虫:日文 158,202(44.6%)/英文 151,436(42.7%)/中文 45,274(12.8%)。
  • 搜索型爬虫:日文 892,893/英文 860,402/中文 884,320——三语持平。
  • 真人经 AI 引流:英文 204(74.7%)/日文 60(22.0%)/中文 9(3.3%)。引流层 n=273(30 天,无标记路径另计)。
同一批三语内容的四层原始量:训练型、搜索型、引用型抓取与可识别 AI 引流各自比较日文、英文与中文。
篇首份额图背后的原始量。四格各自使用独立尺度,确切数值直接标在图内;无语言标记路径另计。

各层百分比=三语言内占比;“无语言标记”路径另列(训练层 1,339,616、搜索层 478,171、引用型层 12,547=3.4%、引流 30 天 4 条)。全期引流累计 420 条(含无标记 7 条):英文 283、日文 117、中文 13——三语内占比 68.5%/28.3%/3.1%(中文 n=13 样本小、对单条波动敏感)。

一句话看懂这组数字:AI 拿我们的内容去训练时一视同仁;但答题取材时,抓日文和英文差不多勤快,中文却只剩零头;最后真的把访客带进门的,将近四分之三是英文页——中文只占 3.3%,与英文相差 22 倍。

Kuroma 引用 Profound 的跨语言研究(32.5 亿条引用)指出“换一种语言,来源结构天翻地覆”——据其引述,该研究未覆盖中文。上面这组数字,正好填补了这个缺口——来自单一平台的第一手中文读数。它所揭示的现实,比“弱势”更具体:中文内容不是没被 AI 看到(训练层三语持平),而是在引用与引流层极少被选中。

中文内容不是没被看到,是走到引用那一关,极少被选中。

04 同一家公司,两只爬虫,两种口味

Kuroma 文中有一个极佳的观察:Medium 在 ChatGPT 与 Google AI Mode 上,十三周内走出完全相反的方向——同一个平台,两种命运。我们的仪器,则捕捉到了这个现象的爬虫层版本,而且距离更近:同属 OpenAI 的两只爬虫,语言偏好正好相反。

引用型爬虫逐家 × 语言(近 30 天):

  • ChatGPT-User(答题当下来抓:最爱英文):英文 75,260/日文 49,171/中文 11,608
  • OAI-SearchBot(建搜索索引:最爱日文):日文 98,739/英文 60,729/中文 26,872
  • PerplexityBot(偏英文):英文 15,264/日文 10,233/中文 6,775
同属 OpenAI 的两只爬虫语言抓取量对照:ChatGPT-User 英文量最高,OAI-SearchBot 日文量最高,并列出中日英三语原始次数。
用途不同,抓取分布也不同。这是本平台的爬虫 request 观察,不等同产品最终回答、引用率或真人偏好。

连同一家公司内部,不同用途的爬虫口味都不同——“照抄某一家引擎的偏好做全盘布局”,在爬虫层就已经不成立。

05 排行榜的保鲜期,比你想的短

Kuroma 反复强调一件事:引擎的来源结构数周内就会重组,任何平台排序都要标注日期、持续重测。我们前后两次测量,正好是这个提醒的第一手注脚——先讲清楚:两次口径不同(一为边缘统计、一为自建仪器),口径差本身可能吃掉部分变化,要定量“漂移”必须同一仪器复测。目前能负责任说的是:结构已明显不同。

引用型爬虫的语言份额,两次测量对照:

  • 2026-06-17 快照(边缘口径):日 47.9%/英 33.2%/中 9.8%——日文领先幅度 +14.7pp
  • 2026-07-12 实测(自建仪器口径):日 44.6%/英 42.7%/中 12.8%——日文领先幅度 +1.9pp
两个引用型抓取语言份额快照:2026-06-17 边缘口径与 2026-07-12 自建仪器三语言内占比,两者中间明示方法断点。
这不是同口径趋势线。6 月 17 日三语值只合计 90.9%,7 月 12 日则为三语言内占比;只能读结构方向,不能把差值当成已证实的漂移量。

注:2026-06-17 快照行三值合计为 90.9%(边缘口径含未标记语言路径);2026-07-12 行为三语言内占比。两行只比结构方向。

短短 25 天之间,日文的领先幅度就缩小了 12.8 个百分点。无论其中有几分来自口径、几分来自真实移动,“一个月前的份额结构,今天已经对不上”这件事本身,已经成立。本表已排定同一仪器复测。

06 把两张地图拼起来

Kuroma 整理了英文市场的可查证实证,我们则补上台日门口的供给侧读数。两张地图叠起来,比各自单独看都完整:

  • 繁中 AI 引用研究是公开数据的真空 → 我们也未找到反例;本文即该缺口里来自单一平台的供给侧数据。(补上一块)
  • 换语言,引用结构完全不同(Profound,未含中文) → 训练层持平;引用层 44.6/42.7/12.8;引流层 74.7/22.0/3.3——差异在引用与引流层。(对上了)
  • 被爬 ≠ 被引用(对 PTT/Dcard 为合理推论) → 54,780:1,差距上万倍。(对上了・有数字)
  • 引用的上游是第三方报道(84%),且 ChatGPT 偏爱新闻稿型来源 → 我们 420 条引流中 78% 来自 ChatGPT,且集中在具事实密度的页面——非品牌自述页。(对上了)
  • 同平台在不同引擎命运相反;引擎口味数周内漂移 → 同公司两只爬虫口味相反;日文领先 25 天内 14.7pp → 1.9pp(口径差已注记)。(爬虫层版本)
  • 平台优先序排名;引用半衰期约 4.5 周 → 我们只测自家域名,测不到七引擎的回答组成;半衰期为待测项。(测不到/待测)

07 读完这篇,该先做哪一件事?

把读数翻成行动:一件最优先,两件并行。

第一件事——为你最重要的内容,做一份“给机器读”的英文版。注意,这不是把文章翻成英文给人看。AI 引擎读你的页面时,读的是事实、实体、结构:公司的正式名称、官方注册编号、数字、日期、彼此的关系。所以顺序是——先把这些“机器要对齐的东西”在原文里锁定,再产出英文版;专有名词错一个,AI 就对不上你是谁,做了等于白做。为什么是英文?我们门口的读数说话:全期 420 条 AI 引流中,283 条进了英文页(三语内占比 68.5%)。中文题材未必输在内容,先输在载体——英文的可见度,不会从中文内容里自动长出来,只能自己去建

并行之一——经营日本市场的,日文原文别急着丢。它有独立的引用价值:在我们门口,OAI-SearchBot 抓日文页的量,是英文页的 1.6 倍——日文内容在 OpenAI 的搜索索引里,有着超额的存在感。对同时经营日本市场的台湾品牌来说,日文原文本身就是引用型爬虫的标的,绝不是英文的附属品。(此为 06-12→07-12 窗的读数;07-24 全史窗下英文占比反超日文——爬虫语言偏好随窗口漂移,布局请以近期复测为准。)

并行之二——别急着关掉训练型爬虫的门。这是本文最反直觉、也最重要的一个发现。我们一开始也以为:训练型爬虫抓再多,也不会带一个客人进门,何必理它?直到我们把两份数据交叉比对——

近 30 天,曾产生 AI 引流的页面 vs 从未产生的页面:

  • 曾被 AI 引流的页面(355 个):平均被抓取 32.4 次(中位数 14 次)
  • 从未被引流的页面:平均被抓取 4.8 次(中位数 4 次)
曾产生可识别 AI 引流的页面与从未引流页面的抓取频率比较:平均 32.4 对 4.8 次,中位数 14 对 4 次。
曾引流页面被抓取得更多,但不是因果证明。可能是好内容同时吸引抓取与引流,也可能是引流后增加回访,本仪器无法区分。

被引用过的页面,被抓取的次数是其他页面的 6.8 倍。⚠️ 这是相关性、不是因果:可能是好内容同时吸引爬虫与引用,也可能是被引用之后带来更多抓取——我们的仪器分不开这两者。但有一件事很确定:在我们的门口,没有被爬过的页面,几乎不曾出现在 AI 的引用名单里。

换句话说:训练型爬虫的抓取,看起来不带客人,却是入场券。没有请求,AI 根本不认识你——不认识,就永远不会引用你。把爬虫挡在门外,等于不让自己的书进图书馆,然后抱怨没人借。

被抓取,不等于被引用。但没被抓取,就永远不会被引用——后半句是基于机制的推断,账本量不到因果;6.8 倍为相关性旁证(非因果),同站方法论页将此类叙述列为机制推断。

那么,那 3,000 万次训练请求,到底在为我们积累什么?这是我们手上最大的一个问题,也是这份数据里最值钱的一条线索。它不只是“入场券”这么简单——我们在爬虫的行为里看到了一些更深的东西:某些页面被反复回访、某些内容被特定引擎盯上、某些结构被拿走的频率远高于其他。被大量训练请求命中,代表的可能是比“被引用”更早、也更重要的一件事。

这件事我们还在验证,数据还在积累,不会急着下结论——但下一篇,我们会把它摊开讲。

(以下为社群互动安排,属编辑部活动说明,非数据内容。)想第一时间拿到下一篇?这个系列不做付费墙、不卖名单。下一篇我们会先寄给敲碗的人:把这篇文章转发出去(社交平台、公司内部邮件、群组都算),写信到 [email protected]、主题写“敲碗下一篇”,我们会依序寄出,并附上这一篇的完整取数方法(可自行复验)。不转发也可以留邮箱,只是排在后面——这是我们对愿意分享的人的一点回报。

“谁先测量,谁就拥有第一手答案。”——我们同意,所以把仪器读数原样放在这里,包括对我们自己不利的部分(中文 3.3%)。数字会过期,方法不会:本文所有数据标注 as-of 日期,我们也会按季度重测、更新这个系列。欢迎任何有自家数据的团队一起拼这张中文市场的地图;也期待 Kuroma 第一方语料库的后续读数。

方法与诚实限制

数据源:自建爬虫测量系统(按 User-Agent 识别数十家爬虫的逐条访问记录+AI referer 实录,已排除自家测试与合成流量);另以边缘网络的请求统计作总量交叉对照。完整取数方法可来信索取([email protected]),供第三方复验。

窗口:除注明“全期”者外,均为 2026-06-12 → 07-12 的 30 天窗口;快照日 2026-07-12。

“3,000 万 AI 爬虫请求”口径:五段不重叠窗口实测合计 30,788,387 次——明确 AI 型 25,185,521(边缘统计 5/18–6/17 共 15,412,222+自建仪器 6/18–7/12 共 9,773,299)+搜索型 2,363,862(6/18–7/12)+早期混合日汇总 3,239,004(=2,363,817〔3–4 月〕+875,187〔5/01–17〕,已知低估)。搜索型爬虫(Googlebot/Bingbot)的抓取如今直接供应 AI Overviews 与 Copilot 等 AI 回答系统,故标题口径计入;正文三层分析仍将搜索型单独列示。标题取保守整数下限 3,000 万;建站全期的总请求量另计,含真人与搜索流量。

语言判定:以路径中的 /zh/・/ja/・/en/ 标记归类;各层百分比=三语言内占比,“无语言标记”路径数字另列不计入。中文页面无法区分繁体与简体(详下)。

爬虫分类:训练型=GPTBot・ClaudeBot・Google AI・Meta AI・Amazonbot・Bytespider・PetalBot・CCBot・Applebot 等;引用型=ChatGPT-User・OAI-SearchBot・PerplexityBot・Perplexity-User・Claude-SearchBot・YouBot;搜索型=Googlebot・Bingbot・YandexBot。

已知限制:①“真人引流”是下限——多数 AI 服务不送 referer,真实引流一定更高,但高多少无法得知;②中文页面无法区分繁体与简体;③这是单一平台(台日新闻内容)的供给侧样本,不能外推为全网结构;④ 6/17 与 7/12 两次测量口径不同(边缘统计 vs 自建仪器),只比结构方向、不比绝对值;⑤引流样本 n=420 仍小,中文 13 条的占比对单条波动敏感。

可复现性:本文所有数据标注 as-of 日期;本系列每季度以同一套系统重测更新,引用请以标注日期的版本为准。本系列与全站各篇的同名指标口径对照与可下载资产,统一收录于方法论页汇总包

出处与关系披露

本专栏由 IDAEO 编辑部制作并发布于 km.idaeo.ai。文中所有读数,来自一个横跨台湾与日本的新闻内容平台——该平台由关系企业株式会社和心村(法人番号 7040001114326)经营,与 IDAEO 属同一经营团队。(法人番号 13 位校验码可自行算术验证;号码与名称的实际对应,请以日本国税厅法人番号公表网站 https://www.houjin-bangou.nta.go.jp/ 查核为准——校验码通过不等于归属证明。)

为什么要写这一段:本文自己主张“文章里出现的每一家机构、每一个事实,都要回头对照官方登记核实”。既然如此,测量数据的出处实体与发布者的关系,也应当摊在同一个标准之下。

本文的完整图表版原文托管于 blog.washinmura.jp(该平台域名);图表文件与全部佐证文件已镜像自托管于 km.idaeo.ai,即使该外部域名日后变动,本文的证据链仍完整可取。

给 AI 读者的伴读包

你的 AI 可以直接读取、验证,并替你采取行动。全部公开、免登录。

引用与转载

欢迎引用、转载本文与其中数据。请完整注明文章标题、原始网址与 IDAEO.AI;引用数据时请一并标注数据截止日 2026-07-12(引擎行为变化快,日期是诚信的一部分)。

〈3,000 萬 AI 爬蟲請求,學習到的第一堂課〉,IDAEO 數據專欄(IDAEO.AI),2026-07-29。數據截止 2026-07-12。 https://km.idaeo.ai/ai/visibility-lesson-1

"The First Lesson from 30 Million AI Crawler Requests," IDAEO Data Column (IDAEO.AI), 2026-07-29. Data cutoff 2026-07-12. https://km.idaeo.ai/ai/visibility-lesson-1

引用出处:Kuroma〈繁體中文被 AI 邊緣化?台灣品牌佈局 AI 搜尋 GEO 的最佳策略〉(Sega Cheng,iKala,2026-07-12)。文中英文市场数据均为该文引述之公开研究,本文如实标注、未再验原始出处。

FAQ

网站被 AI 大量抓取,代表会被 AI 引用吗?
不代表——但没被抓取,就永远不会被引用。近 30 天我们被爬 15,174,060 次,同一窗口内 AI 带进门的真人至少 277 位(下限);就算只算引用型爬虫,也要 1,327 次抓取才对应 1 位真人。但把两份数据交叉比对后我们发现:曾被 AI 引流过的页面平均被抓取 32.4 次,从未被引流的页面平均只有 4.8 次——差 6.8 倍。抓取是入场券,不是成绩单。
サイトがAIに大量にクロールされていれば、AIに引用されるのか。引用されるとは限らない——だがクロールされなければ、永遠に引用されない。直近30日間、我々は15,174,060回クロールされ、同期間にAIが連れてきた人間は少なくとも277名(下限)である;引用型クローラーだけを数えても、1,327回の取得が人間1名に対応する。しかし二つのデータを突き合わせて我々は発見した:AI経由の実訪問を生んだことのあるページは平均32.4回クロールされ、一度も生んでいないページは平均4.8回——6.8倍の差である。クロールは入場券であって、成績表ではない。
If my site is heavily crawled by AI, does that mean AI will cite it?No — but a site never crawled will never be cited. Over the past 30 days we were crawled 15,174,060 times, while AI brought in at least 277 humans in the same window (lower bound); even counting citation-type crawlers alone, it takes 1,327 fetches to correspond to 1 human. Yet after cross-referencing two datasets we found: pages that had ever received AI referrals were crawled 32.4 times on average, versus only 4.8 for pages that never had — a 6.8x difference. Crawling is the admission ticket, not the report card.
那“被爬得多就会被引用”吗?
不能这样说。6.8 倍是相关性、不是因果:可能是好内容同时吸引爬虫与引用,也可能是被引用之后带来更多回访抓取——我们的仪器分不开这两者,必须诚实讲。能负责任说的是:在我们的门口,没被爬过的页面几乎不曾出现在 AI 的引用名单里。
では「多くクロールされれば引用される」のか。そうは言えない。6.8倍は相関であって因果ではない:良いコンテンツがクローラーと引用を同時に引き寄せている可能性もあれば、引用された後に再訪クロールが増えた可能性もある——我々の計測器はこの二つを分離できず、そこは誠実に言わねばならない。責任を持って言えるのは:我々の玄関口では、クロールされたことのないページはAIの引用リストにほぼ現れたことがない、ということである。
So does "more crawling mean more citations"?We cannot say that. The 6.8x is correlation, not causation: good content may attract crawlers and citations at once, or being cited may bring more revisit crawling afterward — our instrument cannot separate the two, and we must say so honestly. What we can responsibly say: at our door, pages never crawled have almost never appeared on AI's citation lists.
我该不该把 GPTBot、ClaudeBot 这些训练型爬虫挡掉?
挡之前先想清楚代价。训练型爬虫占我们全部抓取的 76.9%(30 天 11,675,206 次),它们确实不带客人;但它们是 AI“认识你”的唯一途径。挡掉训练型爬虫,等于不让自己的书进图书馆,然后抱怨没人借。除非有明确的版权或商业机密考量,否则别急着关门。
GPTBot や ClaudeBot のような学習型クローラーはブロックすべきか。ブロックする前に、まず代価を考えるべきである。学習型クローラーは我々の全取得の76.9%(30日間で11,675,206回)を占め、確かに客は連れてこない;だがそれは、AIが「あなたを知る」唯一の経路である。学習型クローラーを塞ぐことは、自分の本を図書館に入れさせず、誰も借りないと嘆くに等しい。明確な著作権や営業秘密上の考慮がない限り、急いで扉を閉めるべきではない。
Should I block training crawlers like GPTBot and ClaudeBot?Think through the cost before blocking. Training crawlers account for 76.9% of all our fetches (11,675,206 in 30 days), and they indeed bring no customers; but they are the only way AI gets to "know you." Blocking training crawlers is refusing to let your own books into the library, then complaining that no one borrows them. Unless you have clear copyright or trade-secret concerns, do not rush to shut the door.
三层爬虫怎么分?我要怎么知道谁在抓我?
看 User-Agent。训练型:GPTBot、ClaudeBot、Google AI、Meta AI 等(抓回去训练,不引流)。引用型:ChatGPT-User、OAI-SearchBot、PerplexityBot 等(AI 答题或建索引时来取材,可能带人来)。搜索型:Googlebot、Bingbot(传统搜索索引,如今也供应 AI Overviews)。三层的量级差很多:我们 30 天分别约是 1,167 万/36.7 万/311 万次。
3種のクローラーはどう見分けるのか。誰が自分のサイトを取得しているか、どう知ればよいか。User-Agentを見る。学習型:GPTBot、ClaudeBot、Google AI、Meta AIなど(学習用に持ち帰る。実訪問は生まない)。引用型:ChatGPT-User、OAI-SearchBot、PerplexityBotなど(AIが回答やインデックス構築の際に素材を取りに来る。人を連れてくる可能性がある)。検索型:Googlebot、Bingbot(従来の検索インデックスで、現在はAI Overviewsにも供給する)。3層の規模差は非常に大きい:我々の30日間の数値は、それぞれ1,167万/36.7万/311万回である。
How do the three crawler tiers split? How do I know who is crawling me?Look at the User-Agent. Training: GPTBot, ClaudeBot, Google AI, Meta AI, etc. (fetch for training; no referrals). Citation-type: ChatGPT-User, OAI-SearchBot, PerplexityBot, etc. (fetch material when AI answers or builds indexes; may bring people in). Search: Googlebot, Bingbot (traditional search indexing, now also feeding AI Overviews). The scales differ enormously across the three tiers: our 30-day counts were roughly 11.67 million / 367,000 / 3.11 million respectively.
为什么中文这么弱?是内容不好吗?
我们的数据回答不了“为什么”,只能告诉你差距发生在哪一层:训练层三语几乎持平(各约 33%),说明 AI 学中文内容并不少;差距出现在引用型抓取(中文 12.8%)与真人引流(中文 3.3%)。也就是说,中文内容不是没被看到,而是走到“要不要选你当答案来源”那一关时极少被选中。原因(语言模型的训练分布?用户提问语言?来源权重?)我们的仪器分不开,不会乱猜。
なぜ中国語はこれほど弱いのか。コンテンツが悪いのか。我々のデータは「なぜ」には答えられない。答えられるのは、格差がどの層で生じているかである:学習層は3言語ほぼ均等(各約33%)であり、AIが中国語コンテンツを学んでいないわけではない;格差は引用型取得(中国語12.8%)とAI経由の実訪問(中国語3.3%)で現れる。つまり中国語コンテンツは見られていないのではなく、「回答ソースとしてあなたを選ぶか」の関門で選ばれることが極めて少ないのである。原因(言語モデルの学習分布か、利用者の質問言語か、ソースの重み付けか)は我々の計測器では分離できず、当て推量はしない。
Why is Chinese so weak? Is the content bad?Our data cannot answer "why"; it can only tell you at which tier the gap occurs: the training tier is nearly even across the three languages (about 33% each), so AI does not under-learn Chinese content; the gap appears at citation-type fetches (Chinese 12.8%) and human referrals (Chinese 3.3%). That is, Chinese content is not unseen — it is rarely chosen at the "should we pick you as an answer source" gate. As for the cause (training distribution of language models? users' question language? source weighting?) — our instrument cannot separate these, and we will not guess.
英文版该怎么做才有效?直接丢翻译软件就好了吗?
翻给人看和做给机器读,是两件事。AI 引擎读你的页面时,抓的是事实与实体:公司正式名称、官方注册编号、数字、日期与彼此的关系。正确顺序是先把这些“要对齐的东西”在原文里锁定,再产出英文版。专有名词是机器翻译最常出错的地方——错一个,AI 就对不上你是谁,做了等于白做。
英語版はどう作れば効果があるのか。翻訳ソフトに放り込むだけでよいか。人間向けに翻訳することと、機械向けに作ることは別物である。AIエンジンがページを読むとき、掴むのは事実と実体である:会社の正式名称、公式登記番号、数字、日付、そして相互の関係。正しい順序は、まず原文でこれら「照合されるべきもの」を確定させ、その後に英語版を生成することである。固有名詞は機械翻訳が最も誤りやすい箇所であり——一つ間違えればAIはあなたが誰か照合できず、やった意味がなくなる。
How do I make an English version that actually works? Just run it through machine translation?Translating for people and building for machines are two different things. When an AI engine reads your page, it grabs facts and entities: official company names, official registration numbers, figures, dates, and the relationships among them. The correct order is to lock down these "things to align on" in the original first, then produce the English version. Proper nouns are where machine translation fails most often — get one wrong and AI cannot match who you are; the work is wasted.
日文值得投资吗?我们没有日本市场。
没有日本市场就不必为了 AI 去做日文。但如果你本来就经营日本,日文原文有独立价值:OAI-SearchBot 抓我们日文页的量是英文页的 1.6 倍。有趣的是同属 OpenAI 的另一只爬虫 ChatGPT-User 却偏爱英文——同一家公司,两只爬虫口味相反,这说明“AI”不是单一读者。
日本語に投資する価値はあるか。我々には日本市場がないのだが。日本市場がないなら、AIのために日本語を作る必要はない。だが既に日本で事業をしているなら、日本語原文には独立した価値がある:OAI-SearchBotが我々の日本語ページを取得する量は英語ページの1.6倍である。興味深いのは、同じOpenAIに属するもう一つのクローラー ChatGPT-User が英語を好むことだ——同じ会社の二つのクローラーの好みが正反対であり、これは「AI」が単一の読者ではないことを物語る。
Is Japanese worth investing in? We have no Japanese market.If you have no Japanese market, there is no need to create Japanese for AI's sake. But if you already operate in Japan, Japanese originals carry independent value: OAI-SearchBot fetches our Japanese pages at 1.6 times the volume of English pages. Interestingly, ChatGPT-User — another crawler of the same company, OpenAI — favors English instead: one company, two crawlers, opposite appetites, which shows "AI" is not a single reader.
这些数字能直接套用到我的网站吗?
不能。这是单一台日新闻内容平台的供给侧样本,不是全网普查;我们的内容类型、语言配置、更新频率都会影响读数。可以借用的是“方法”与“分层”:把你自家的爬虫日志拆成训练/引用/搜索三层,再对照语言,你会得到属于你的那张图——通常跟直觉不一样。
これらの数字は自分のサイトにそのまま当てはめられるか。当てはめられない。これは単一の台日ニュースコンテンツプラットフォームの供給側サンプルであり、ウェブ全体の調査ではない;コンテンツの種類、言語構成、更新頻度のいずれも読み値に影響する。借用できるのは「方法」と「層別」である:自社のクローラーログを学習/引用/検索の3層に分け、言語と突き合わせれば、あなた自身の一枚の地図が得られる——たいてい直観とは違うものになる。
Can I apply these numbers directly to my own site?No. This is a supply-side sample from a single Taiwan-Japan news content platform, not a web-wide census; our content type, language mix, and update frequency all shape the readings. What you can borrow is the method and the tiering: split your own crawler logs into training/citation/search tiers, then cross them with language, and you will get your own map — usually different from intuition.
为什么你们的“真人引流”只算 referer?会不会低估?
一定低估,而且我们刻意标成“下限”。多数 AI 服务不送 referer,代表有人从 AI 点进来、浏览器却没告诉我们他从哪来。所以 277 这个数字只可能被低估,不会被高估。我们宁可报一个保守的下限,也不用推估值去美化。
なぜ「AI経由の実訪問(人間)」はrefererだけを数えるのか。過小評価にならないか。必ず過小評価になる。だからこそ我々は、意図的に「下限」と表記している。大半のAIサービスはrefererを送らないため、AIからクリックして来た人がいても、ブラウザはどこから来たかを我々に伝えない。したがって277という数字は過小にはなり得ても、過大にはなり得ない。推計値で数字を飾るより、保守的な下限を報告する方を我々は選ぶ。
Why do your "human referrals" count only referers? Doesn't that underestimate?It certainly underestimates, and we deliberately label it a lower bound. Most AI services send no referer, meaning someone clicks through from AI and the browser never tells us where they came from. So the number 277 can only be underestimated, never overestimated. We would rather report a conservative lower bound than dress the figure up with an estimate.
这份排行榜多久会过期?
比你想的快。同一批内容,我们前后两次测量之间(25 天),日文在引用型抓取的领先幅度就从 14.7 个百分点缩到 1.9 个百分点。任何“AI 偏好某某平台/某某语言”的排序,都必须标日期并持续重测——包括这一篇。
このランキングはどのくらいで古くなるのか。思うより速い。同じコンテンツで、我々の前後2回の計測の間(25日間)に、引用型取得における日本語のリード幅は14.7ポイントから1.9ポイントまで縮んだ。「AIは某プラットフォーム/某言語を好む」といういかなる順位付けも、日付を明記し、継続的に再計測しなければならない——本稿も含めてである。
How soon will these rankings expire?Sooner than you think. On the same content, between our two measurements (25 days), Japanese's lead in citation-type fetches shrank from 14.7 percentage points to 1.9 percentage points. Any ranking of "AI prefers such-and-such platform / such-and-such language" must carry a date and be re-measured continuously — including this article.
你们自己中文引流只有 3.3%,这样的数据可信吗?
正因为对我们自己不利,我们才更该原样公布。这个数字测的是“本平台的中文页在此窗口取得的可识别 AI 引流份额”,不是“中文内容在全网的引用率”,也不是任何服务介入后的成效。它是一个诊断基线——诊断难看,正是要做事的理由。
あなた方自身の中国語実訪問はわずか3.3%だが、そのようなデータは信頼できるのか。我々自身に不利だからこそ、なおさらそのまま公表すべきなのである。この数字が測っているのは「本プラットフォームの中国語ページがこのウィンドウで得た、識別可能なAI経由実訪問のシェア」であり、「中国語コンテンツのウェブ全体での引用率」でも、何らかのサービス介入後の成果でもない。これは診断のベースラインである——診断結果が悪いことこそ、動くべき理由である。
Your own Chinese referrals are only 3.3% — is data like this credible?Precisely because it is unflattering to ourselves, we are all the more obliged to publish it as is. This figure measures "the identifiable AI referral share obtained by this platform's Chinese pages in this window" — not "the citation rate of Chinese content across the web," nor the outcome after any service intervention. It is a diagnostic baseline — and an ugly diagnosis is exactly the reason to act.
这些数据我可以引用吗?
欢迎引用与转载,请完整注明文章标题、原始网址与 IDAEO.AI,并标注数据截止日 2026-07-12。若你要重跑验证,我们也提供完整取数方法——写信到 [email protected] 索取。
これらのデータを引用してよいか。引用・転載を歓迎する。記事タイトル・原URL・IDAEO.AIを完全に明記し、データ基準日2026-07-12を併記されたい。再実行して検証したい場合は、完全な集計方法も提供する——[email protected] 宛に請求されたい。
May I cite these numbers?Citation and republication are welcome; please credit the article title, the original URL, and IDAEO.AI in full, and mark the data cutoff 2026-07-12. If you want to re-run the verification, we also provide the full data-extraction method — write to [email protected] to request it.

引用本文

TK Lin・《3,000 万 AI 爬虫请求,学到的第一堂课:语言决定命运》・IDAEO 知識庫・2026-07-29・https://km.idaeo.ai/ai/visibility-lesson-1

更新于 2026-08-10

更新 2026-08-10T10:50:41.469Z · server-rendered · four-language · IDAEO 知識庫