km.idaeo.ai · IDAEO 知識庫

🏛 本文属于主题馆「ai」

看不见的读者:12 只 AI 爬虫现形

越来越多客人不再搜索,而是直接问 AI。AI 会不会提到你,取决于它有没有“读过”你的网站。我们摊开自家服务器五个月的真实记录——三十几只 AI 爬虫、约 3,000 万次内容搬运——发现爬虫分成训练型、索引型、真人代抓三类,只有后两类会带客人回来;把内容做好,感动的是人,不是机器;最能带客的爬虫反应最慢,但加速的抓手就在站长自己手上。全文附诚实账:这是 n=1 的单站观测,被读取到被引用的转化率大约 10–12%,所有边界一并交代。

看不见的读者:12 只 AI 爬虫现形

总览图以“没有爬虫的请求,就没有引用;没有引用,就没有真人流量”串起三类爬虫:训练型 GPTBot、ClaudeBot、Meta AI,索引型 OAI-SearchBot、Bingbot、Applebot,以及真人代抓 ChatGPT-User。声量由约 3,000 万次请求,经转化约一成,收敛到可观测导流 476 次下界。主角卡标出 OAI-SearchBot 的 85.6% 引用覆盖、ClaudeBot 的 644 万次、Bingbot 的 32,993 次,以及 Applebot 30 天 484.7 万次;Applebot 另标“🔭 值得盯住”,并以编辑观察指出量大得不寻常,背后必有正在准备的东西。
AI 能见度的全文地图:先分清爬虫角色,再看请求如何走向引用与真人导流;Applebot 的异常高声量是值得盯住的编辑观察。

先问一个问题:今天有人想找你卖的东西——一家餐厅、一间民宿、一个顾问服务——他会打开搜索引擎慢慢比,还是直接问 AI“帮我推荐”?越来越多人选了后者。AI 直接给答案,顺便报几个名字、附几条链接;被报到名字的,客人就上门;没被报到的,连被比较的资格都没有。这就是为什么我们说:AI 时代的能见度,是一条新的营销通路。

这篇文章不谈理论。我们把自己网站五个月的服务器记录摊开——三十几只 AI 爬虫、约 3,000 万次内容搬运——一只一只拆开看:谁来了、来拿什么、多久来一次、会不会带客人回来(五个月共见三十几只,本文细讲其中 12 只)。所有数字都出自我们自己服务器的记录(服务器记录实测),不是估计值;完整观测报告的正本发布于 km.idaeo.ai

先定义一个贯穿全文的关键词。本文说的“AI 声量”,就是 AI 爬虫对你网站发出的请求:谁来、来几次、拿什么——每一次请求都被服务器记下来,可以数、可以验。下面整篇文章,就是把这 3,000 万次请求拆开来读。

横条图按全史请求量排列十二个 AI 爬虫,并以颜色区分训练型、索引型、真人代抓与 Google 系。
声量大不等于带客多:请求量最大的几家不带客,会带客的 OAI-SearchBot 反而声量小。

先认识一位新访客:AI 爬虫

“爬虫”听起来很技术,其实角色很好懂:它是 AI 公司派出来的机器访客,工作就是上门把你网站的内容抄回去。想象外卖平台派业务员到你的餐厅抄菜单——他不点餐、不消费,只抄资料,让平台之后有办法介绍你。AI 爬虫做的就是这件事,只是抄回去的用途不同:有的拿去教 AI、有的收进推荐名单、有的是替某位正在提问的真人跑腿。

第一课:AI 没读过你,就永远不会推荐你

没有爬虫的请求,就没有引用;没有引用,就没有真人流量。

翻成白话:AI 开口推荐你之前,一定先“读过你”——对你的网页发出过至少一次请求(可以想成敲一次门、翻一次你的资料)。可能是它自己来抄的,也可能是别人(像 Common Crawl 这种公共数据库)抄走之后它拿去用的。没有那一次请求,你在 AI 的世界里不是排名低,是根本不存在——像一家没被任何指南、任何平台收录的店,菜再好也没人报。

但这只是入场券,不是保证,三件事必须诚实讲:

  • 被读取 ≠ 被引用。业务员抄了菜单,平台不一定马上推荐你。我们实测的转化率大约 10–12%(来源:历史引用对账;此为约数、无精确分母,是可观测范围的对账值,AI 不附链接的零点击引用不在内;口径见方法论页)。
  • 被引用 ≠ 有人点进来。AI 常把答案直接讲完、不附链接——这叫“零点击”,发生时我们什么都收不到。
  • 有人来 ≠ 我们看得见。手机 App 内的点击常不带来源标记,我们量到的 476 次(实测)是可观测的下界,真实数字一定更高。

所以顺序只有一种:先确保被读到,再提高每次被读的转化。

三层示意漏斗呈现 AI 爬虫请求、被抓内容转成引用,以及可观测 AI 导流。
声量是入场券,转化才是成绩单;三层口径不同,不可直接相乘。

三种访客,三种未来

从记录里,爬虫清楚分成三类,而且只有后两类会带人回来:

  • 训练型(GPTBot、ClaudeBot、Meta AI 等):像百科全书的编辑,把你的内容收回去写进 AI 的“脑子”。几个月后才见效、不注明出处、不带客人——但 AI 记不记得你,靠的是它。先正名:它不是来“拿走”什么——它在替 AI 的知识库选材,被选进去,你的内容就成为 AI 常识的一部分。在整个 AI 爬虫技术里,这是最基础、也最重要的一层。
  • 索引型(OAI-SearchBot、Bingbot、Applebot 等):像旅游指南的调查员,把你的页面收进答案引擎随时翻查的数据库(这个数据库就叫“索引”)。数小时到数周见效、会附引用链接——客人就是从这里来的。
  • 真人代抓(ChatGPT-User 等):真人此刻正在 AI 里读你的页面,AI 代他去取,几秒钟见效。像客人已经坐在店里,请服务员把菜单念给他听。它出现,代表前面两步都做对了。

一句话记住:想要客人,喂索引型;想被长期记得,喂训练型;看到真人代抓,代表前两步都做对了。

三栏概念卡比较训练型、索引型与真人代抓爬虫的用途、见效速度与流量意义。
同样是爬虫访问,训练、索引与真人代抓代表的未来完全不同。

发现一:把内容做好,感动的是人,不是机器

我们原本以为“内容做好,爬虫会更爱爬”。实测结果是:机器来者不拒,人才挑。抄菜单的业务员不管你的菜好不好吃,照单全抄;真正坐下来吃的客人才会挑。两条完全独立的量法,指向同一个方向(皆实测):

  • ChatGPT 真人代抓读人工深卡 4.7 次/页、自动页 2.5 次/页,差 1.9 倍。
  • 质量分级 green 对 red,真人代抓 3.14 对 1.39,差 2.26 倍。
  • 同一组测试换成机器爬虫 ClaudeBot:green 2.56、red 2.62,持平,red 还略高。

意思是:做好内容不会让机器多爬你,但会让真人到了之后更常读你、更常被 AI 挑出来给人看。所以内容投资的回报,要在“被引用、带人来”那一端验收,不要用爬虫量验收。

分组条图比较 OAI-SearchBot、GPTBot 与 ClaudeBot 在 green、yellow、red 质量页面的每页平均抓取。
ClaudeBot 对质量近乎不挑,OAI-SearchBot 与 ChatGPT 真人代抓对高质量内容更敏感。

发现二:最能带客的访客,来得最慢

发布一篇新内容之后,各家多久第一次来看(中位数,实测):

  • ClaudeBot(训练型):4.2 小时
  • GPTBot(训练型):21.8 小时
  • OAI-SearchBot(索引型):332.8 小时(13.9 天)
  • Bingbot(索引型):374.6 小时(15.6 天)
横条图比较各 AI 爬虫发布后首次访问的中位延迟,训练型最快,索引型与真人代抓较慢。
训练爬虫先到,但真正可能带来引用与读者的索引或真人代抓往往晚得多。

新菜上市,抄菜单的当天就到,指南调查员却要两个星期后才来——中间这两周,你辛苦做的新内容先被拿去训练,还不在任何能带客的名单上。这就是损失。而且统计窗口只有 30 天,太晚发布的内容根本来不及等到慢的爬虫,慢的被系统性低估——真实差距只会比数字更大。

好消息是,这条有解,而且抓手就在你自己手上:

  • sitemap:贴在店门口的“完整菜单目录”,让访客一眼知道店里有哪些页。Bingbot 是重度依赖者,30 天抓了 32,993 次(服务器记录实测;姊妹篇统计窗为 33,155,差异来自统计时点)。
  • llms.txt:专门写给 AI 看的店家导览手册。Amazonbot 和 GPTBot 重度消费它。
  • IndexNow:上了新菜就主动按铃通知,不干等人上门。

推这三样,是对“最慢、却最能带客”的索引型爬虫最直接的加速杠杆。诚实说:这是从“它们吃什么”推出来的合理下一步;部署前后的对照实验我们还没做,做完会再报。

分组横条图比较 Bingbot、Applebot、GPTBot 与 Amazonbot 对 sitemap 和 llms.txt 的抓取。
Bingbot 看 sitemap 吃饭,GPTBot 与 Amazonbot 吃 llms.txt;想加速谁,就喂它爱吃的。

一次查证:“我一做大改版,它们就来了”是真的吗?

站方长期有个感觉:每次做大整合,爬虫就蜂拥而至。我们翻出数据库记录查证,答案比是非题有意思。

时间顺序是真的。2026-05-23,我们一天之内建了 550,807 笔 llms 摘要(实测;5/23=550,807、5/24=11,678,其余日子都只有几千)。九天后的 6/01,三家爬虫同时开机——ClaudeBot 五月整月只来 669 次,6/01 跳到 53,468、6/02 再跳到 354,414;GPTBot、Meta 同一天一起动(实测)。“月初排程”这个替代解释也被排除:4/01 只有 92 次、5/01 只有 464 次,只有 6/01 爆掉,不是月历效应(实测)。

对数尺度条图与事件时间线呈现 ClaudeBot 日量在建立大量 llms 摘要后急升。
大整合九天后三家同时开机,但时序成立不等于因果成立。

但“为什么来”,数据分不出来。因为那次动作同时做了两件事:让内容变好,以及一口气开出 55 万个新网址(robots.txt 查证过没动——我们不是把门打开,而是把看得见的表面积一次放大好几倍)。就像同一天你重新装修、又把一间店扩成一整条街,隔周人潮爆满——你说不出客人是为装修来的,还是为新店面来的。要分辨,得做一次干净实验:只改好既有页面的质量、完全不新增任何网址,再看爬虫反应。这种事件我们的记录里一次都没有——这是下一次该刻意做的事。

主角登场:五只值得认识的爬虫

OAI-SearchBot——挑剔的指南调查员,全案最重要

量小(全史 28.9 万次)但含金量最高:ChatGPT 引用过的网址,85.6% 在它的爬取集里(实测)——它挑什么,ChatGPT 就引什么(这是共现统计;也可能两者刚好偏好同一类页面,因果未证)。它也是全场对质量最敏感的机器爬虫(green 5.94 对 red 3.54,实测)。致命弱点是慢:新内容要 332.8 小时(13.9 天)才来。它慢,就是我们的损失——加速它是第一优先。

双卡对比 OAI-SearchBot 与 GPTBot 对 ChatGPT 引用网址的覆盖率,85.6% 对 34.9%。
爬得多不如挑得准:量小的挑剔调查员决定了谁被引用;共现统计,因果未证。

ClaudeBot——大胃王,来得快、吃得多、不带客

总量冠军(全史 644 万次),吃相是阵发式:平常日量中位数只有 97 次,单日最高 354,414 次(实测)——平时不见人影,一来就把整桌扫光。新内容反应最快(中位数 4.2 小时),但对质量完全无感,而且全史只带回 8 次真人(实测)。把它当长期存在感的投资,别当业绩。

ClaudeBot 全史抓 644 万次,带回真人 8 次,为实测结果。建议把它当长期存在感的投资,别当业绩。
644 万次抓取对上 8 次真人回流:ClaudeBot 更像长期存在感投资,不是短期业绩引擎。

Bingbot——每天巡店的老派调查员

最稳定的心跳,天天来、量稳定(实测)。看 sitemap 吃饭:30 天抓了 32,993 次,全场第一。反应最慢:374.6 小时(15.6 天)才到。但它喂的 Copilot 是我们第二大回流来源(66 次,13.9%,实测)。推 sitemap、IndexNow 对它最有效。

对数尺度横条比较四只爬虫日量 max 与中位数的倍率,从 Amazonbot 4.74 倍到 Meta AI 名目 5,886 倍。
有的天天来查户口,有的几个月来一次搬空整桌;Meta AI 分母太小不可直接比。

Applebot——神秘大户:这种爬法,背后一定有事

7 月最大户(30 天 484.7 万次,实测),但目前零次可辨识的引用点击(Siri 端多为零点击)。它的行为模式很特别:几乎不用 AI 训练旗标(Applebot-Extended 五个月只出现 2 次,实测)、几乎不看 sitemap 与 llms.txt——就是安静、大量、持续地把内容读走。

编辑观察(非实测,是判断):一种可能的解读是它在为一个还没亮相的产品做准备——新版 Siri?新的搜索?另一种是我们品牌迁移触发的重爬(见诚实账)——两种都成立前,我们只观察不下注。所以对它的策略是:不特别投资、保持全开放让它读,然后每周盯着它。另注:此量含对旧网址的 301 转址请求(方法论页第二笔更正),应读作请求量、非内容抓取量。

ChatGPT-User——已经坐在店里的客人

真人代抓的代表:高峰落在日本时间上午 10 点,有明显的人类作息(实测)。它出现=有人此刻正在读你,不是未来的流量,是现在进行式。它是成功的信号灯,不是要优化的对象。

离散度光谱从 0.05 到 0.42,越高越像人。GPTBot 0.05,纯机器排程,峰值时段只占 4.52%;Applebot 0.06;OAI-SearchBot 0.22,峰值 23 时 UTC;ChatGPT-User 0.39,峰值 1 时 UTC,等于日本时间上午 10 点,呈现人类作息;PerplexityBot 0.42,全场最像人,峰值 13 时占 10.18%。数据为实测。
作息离散度把机器排程与人类节奏拉成一条光谱:GPTBot 最规律,PerplexityBot 最像人。

其他角色——每一只都有来意

派爬虫是要成本的,每一只上门都有目的。逐一讲清楚:

  • GPTBot(OpenAI・训练型主力):目的是把内容收进 GPT 系列模型的知识底料。靠 llms.txt 吃饭(30 天抓 7,873 次,实测;8,618 为全部爬虫对 llms.txt 的合计,口径不同),喂饱 llms.txt 就是喂饱它。它不带客,但 ChatGPT 记不记得你,大半靠它。
  • PerplexityBot(Perplexity・索引型):目的是建 Perplexity 答案引擎的索引。小而精(全史 5.9 万次),却给了我们深卡史上第一次真引用(7/08,实测)——按“每次读取换到多少引用”算,它排最前面。
  • Amazonbot(Amazon・索引型):目的是喂 Alexa 与 Rufus 购物助理的检索生态。安静稳定、天天来,llms.txt 消费比例全场最高——对它,llms.txt 特别有效。
  • Google 系(混并标签):“Google AI”217 万次其实是 GoogleOther 与 Google-Extended 两种标签的合并计数——两种标签各自对应不同用途,但在我们的账上混在一起。拆开之前,任何关于 Google 的结论都先搁置。
  • CCBot(Common Crawl・公共语料):目的最特别——它替全世界建公共语料库,是全球开源模型共用的水源。washinmura.jp 已被收进 2026 年 6 月版公共语料(1,515 笔,实测);进了它,等于同时进了所有喝这口水的模型。
  • Bytespider(字节跳动・训练型):目的是字节系 AI 产品的训练语料。全史 7.8 万次、明显偏中文——主战场在中文生态,我们的台日内容是顺手带走。

诚实账:这份记录的边界

营销文更要把界线讲清楚,因为诚实正是我们想给你的东西:

  • n=1:这是一个站的样本、五个月的快照,不保证是这些爬虫的普遍行为,更不是定律。
  • 有些“个性”是我们自己造成的:Applebot 的爆量起点恰好是品牌迁移隔天;Amazonbot 的高量含有掉进垃圾路径黑洞的放大成分。那是我们的架构在说话,不是它的性格。
  • Google 系无法归因:“Google AI”是两种标签的合并计数,任何基于它的结论都建立在混并数字上。
  • 六月的页面级证据已灭失:URL 明细只保留 30 天,那一波只剩每日总数,“六月它们究竟爬了哪些页”的说法都不该下。
  • 质量分级(green/yellow/red)是站内自定的三级标签,分级标准未在本文公开。
  • 质量检定有曝光偏误:“内容好”和“页数多”在数据里高度相关(相关系数 0.86,实测),无法完全分离。
  • 转化率约一成出自历史引用对账,是可观测口径的约数,非精确逐笔追踪;首访时间只给中位数,未附样本数与分布。
  • 零点击与转载看不见:AI 把内容讲完不给链接、或他站转贴,都不会在服务器留下痕迹。这是结构性盲区,不是我们没查。

带得走的三件事

  1. AI 能见度是一条真实存在的新通路,起点是“先被读到”:把 sitemap、llms.txt、IndexNow 做起来,让最能带客的爬虫更快找到你。
  2. 好内容的回报在“人”那一层验收:看引用与导流,不看爬虫量——机器来者不拒,人才挑。
  3. 别被大数字骗:量最大的不一定带客,会带客的往往又小又慢。把力气花在对的那几只身上。

最后说句实话:没有人能保证你的内容一定被 AI 引用——我们自己实测的转化率也只有约一成。但反面是确定的:没被读过的内容,永远不会出现在 AI 的答案里。AI 时代的营销,就从让 AI 看得见你开始。

引用本文:IDAEO(2026)。《看不见的读者:12 只 AI 爬虫现形》。km.idaeo.ai/ai/ai-crawler-marketing。数据截止 2026-07-24(全史窗自 2026-03-03 起),来源:本站服务器记录实测;完整正本:km.idaeo.ai/reports/ai-crawler-profiles-20260724

FAQ

我不是科技行业,AI 爬虫跟我的网站有什么关系?
只要你希望有人通过 AI 找到你,就有关系。AI 推荐任何网站之前,一定先派爬虫来读过它——没被读过,你的网站在 AI 的答案里根本不存在。这不是排名高低的问题,是有没有入场券的问题。
私はテクノロジー業界ではありません。AIクローラーは私のWebサイトとどんな関係があるのですか?AIを通じて誰かに見つけてもらいたいなら、関係があります。AIがWebサイトをおすすめする前には、必ずクローラーを送り、事前にそのサイトを読んでいます。読まれていなければ、あなたのWebサイトはAIの回答の中にそもそも存在しません。順位の高低ではなく、入場券を持っているかどうかの問題です。
I am not in the tech industry. What do AI crawlers have to do with my website?If you want people to find you through AI, they have everything to do with it. Before AI recommends any website, a crawler must first read it. If your site has never been read, it simply does not exist in AI’s answers. This is not a question of ranking high or low; it is a question of whether you have the price of admission.
内容写得好,AI 爬虫就会更常来吗?
实测不会。机器来者不拒——ClaudeBot 对质量分级几乎无感(green 2.56、red 2.62,red 还略高);但真人通过 AI 读好内容的次数明显更多(1.9 倍到 2.26 倍,实测)。好内容的回报要看引用与导流,不要用爬虫量验收。
良いコンテンツを書けば、AIクローラーはもっと頻繁に来るようになりますか?実測では、そうなりません。機械は選り好みしません。ClaudeBotは品質区分にほぼ反応せず(green 2.56、red 2.62で、redがわずかに上回りました)、一方で実ユーザーがAIを通じて良いコンテンツを読む回数は明らかに増えました(1.9倍から2.26倍、実測)。良いコンテンツの成果は引用と流入で評価し、クローラーの件数で評価しないでください。
If I write better content, will AI crawlers visit more often?Our measurements say no. Machines take everything—ClaudeBot was almost entirely indifferent to the quality grades (green 2.56, red 2.62, with red slightly higher). But real people read good content through AI between 1.9 and 2.26 times as often (measured). Judge the return on good content by citations and referral traffic, not crawler volume.
想让 AI 更快发现我的新内容,具体该做什么?
把 sitemap(网站的完整页面目录)、llms.txt(写给 AI 看的网站导览)准备好,并用 IndexNow 主动通知。实测 Bingbot 30 天抓了 32,993 次 sitemap,Amazonbot 和 GPTBot 重度消费 llms.txt——这是对反应最慢、却最能带客的索引型爬虫,最直接的加速方法。
AIに新しいコンテンツをもっと早く見つけてもらうには、具体的に何をすべきですか?sitemap(Webサイト内の全ページ一覧)とllms.txt(AI向けのWebサイト案内)を用意し、IndexNowで能動的に通知してください。実測では、Bingbotは30日間でsitemapを32,993回クロールし、AmazonbotとGPTBotはllms.txtを重点的に利用していました。これは、反応が最も遅い一方で最も顧客を連れてくるインデックス型クローラーを加速させる、最も直接的な方法です。
What exactly should I do to help AI discover my new content faster?Prepare sitemap (a complete directory of your website’s pages) and llms.txt (a site guide written for AI), then use IndexNow to send proactive notifications. Bingbot fetched sitemap 32,993 times over 30 days (measured), while Amazonbot and GPTBot consume llms.txt heavily. For the search-indexing crawlers that respond the slowest yet bring the most customers, these are the most direct ways to accelerate discovery.
什么是“AI 声量”?
本文的定义很具体:**AI 爬虫对你网站的请求,就是你的 AI 声量**(口径:本站服务器记录,可数、可验)。三类请求对应三种声量:训练型请求决定 AI 记不记得你,索引型请求决定 AI 引不引得到你,真人代抓请求代表 AI 正在把你讲给某个人听。请求是零,声量就是零——AI 的答案里不会有你。
「AIでの声量」とは何ですか?本記事の定義は具体的です。**AIクローラーがあなたのWebサイトに送るリクエストこそが、あなたのAIでの声量です**(当サイトの伺服器紀錄サーバーログに基づき、数えられ、検証できます)。3種類のリクエストは3種類の声量に対応します。学習型リクエストはAIがあなたを覚えているかどうかを決め、インデックス型リクエストはAIがあなたを引用できるかどうかを決め、実ユーザー代理取得のリクエストはAIがいままさに誰かにあなたを語っていることを意味します。リクエストがゼロなら、声量もゼロ——AIの答えにあなたは登場しません。
What is "AI share of voice"?This article uses a concrete definition: **your AI share of voice is the requests AI crawlers make to your website** (as recorded in our 伺服器紀錄 server logs—countable and verifiable). The three kinds of requests map to three kinds of voice: training requests determine whether AI remembers you, indexing requests determine whether AI can cite you, and user-triggered requests mean AI is telling someone about you right now. Zero requests means zero share of voice—you will not appear in AI's answers.
照着做,就保证会被 AI 引用吗?
不保证。被读取只是必要条件,我们实测被读取到被引用的转化率大约一成,而且这是 n=1 的单站观测,结论不保证能直接套用到其他网站。能确定的是反面:没被读过的内容,一定不会出现在 AI 的答案里。
そのとおりにすれば、AIに引用されることが保証されますか?保証されません。読まれることは必要条件にすぎません。私たちが実測した、読まれてから引用に至る転換率は約約一成です。しかも、これはn=1の単一サイト観測であり、結論をほかのWebサイトへそのまま適用できる保証はありません。確実なのは、その逆です。読まれていないコンテンツが、AIの回答に現れることはありません。
If I follow these steps, am I guaranteed to be cited by AI?No. Being read is only a necessary condition. Our measured read-to-citation conversion rate is roughly 約一成, and this is an n=1 observation of a single site; the findings cannot be assumed to apply directly to other websites. What we do know for certain is the reverse: content that has never been read cannot appear in an AI answer.
怎么知道哪些 AI 爬虫来过我的网站?
看服务器记录(access log)里的 User-Agent——GPTBot、ClaudeBot、OAI-SearchBot 这些名字会直接出现。要验真身份,再用 IP 反查与官方公布的网段比对(爬虫身份会被冒充,本文的数据全部过了这道验证)。本文所有数字,就是这样一笔一笔数出来的。
どのAIクローラーが自分のサイトに来たか、どうすれば分かりますか?サーバーのアクセスログにあるUser-Agent欄を確認してください。GPTBot、ClaudeBot、OAI-SearchBotといった名前がそのまま現れます。なりすましがあるため、身元の確認はIPの逆引きと各社が公開している公式IPレンジとの照合で行います(本記事のデータはすべてこの検証を通過しています)。本記事の数字は、すべてこの方法で1件ずつ数えたものです。
How do I find out which AI crawlers have visited my website?Check the User-Agent field in your server access logs—names like GPTBot, ClaudeBot, and OAI-SearchBot appear there directly. To verify identities, cross-check IPs against each company's officially published ranges (crawler identities can be spoofed; every figure in this article passed that verification). All the numbers in this article were counted exactly this way.
挡掉不带客的训练型爬虫,会有影响吗?
会有取舍。训练型爬虫(GPTBot、ClaudeBot 等)确实不带客,但它决定 AI 记不记得你——挡掉它,等于放弃在 AI 长期记忆里的位置。本站的选择是全开放、然后观测;要不要挡是每个站自己的策略,但至少要知道你放弃的是哪一层声量。
顧客を連れてこない学習型クローラーをブロックしても大丈夫ですか?トレードオフがあります。学習型クローラー(GPTBot、ClaudeBotなど)は確かに顧客を連れてきませんが、AIがあなたを覚えているかどうかを決めるのはこのタイプです。ブロックすることは、AIの長期記憶の中の居場所を手放すことを意味します。当サイトの選択は「全面開放して観測する」です。ブロックするかどうかは各サイトの戦略ですが、どの層の声量を手放すのかは知っておくべきです。
Would blocking the training crawlers that bring no customers hurt me?It is a trade-off. Training crawlers (GPTBot, ClaudeBot, and others) indeed bring no customers, but they determine whether AI remembers you—blocking them means giving up your place in AI's long-term memory. Our choice is to stay fully open and observe. Whether to block is each site's own strategy, but you should at least know which layer of your share of voice you are giving up.
新内容发布后,多久才会被 AI 引用?
以本站实测,最能带来引用的两只索引型爬虫最慢:OAI-SearchBot 中位数 332.8 小时(13.9 天)、Bingbot 374.6 小时(15.6 天)才第一次来看新内容——先被看到,之后才可能被引用。所以新内容至少要预留两周以上的等待期,并用 sitemap、llms.txt、IndexNow 加速(对照实验未做,属合理建议)。
新しいコンテンツは、公開からどれくらいでAIに引用されますか?当サイトの実測では、引用につながりやすい2つのインデックス型クローラーが最も遅く、OAI-SearchBotは中央値332.8時間(13.9日)、Bingbotは374.6時間(15.6日)かかって初めて新コンテンツを見に来ます。見られて初めて、引用の可能性が生まれます。新コンテンツには最低2週間以上の待機期間を見込み、sitemap、llms.txt、IndexNowで加速してください(導入前後の比較実験は未実施のため、合理的な推奨として扱ってください)。
After publishing new content, how long until AI can cite it?In our measurements, the two indexing crawlers most likely to produce citations are also the slowest: OAI-SearchBot takes a median of 332.8 hours (13.9 days) and Bingbot 374.6 hours (15.6 days) to first visit new content—you must be seen before you can be cited. Plan for at least a two-week lead time, and use sitemap, llms.txt, and IndexNow to speed things up (a before-and-after control experiment is still pending; treat this as a reasoned recommendation).

引用本文

TK Lin・《看不见的读者:12 只 AI 爬虫现形》・IDAEO 知識庫・2026-08-09・https://km.idaeo.ai/ai/ai-crawler-marketing

更新于 2026-08-10

更新 2026-08-10T10:29:32.169Z · server-rendered · four-language · IDAEO 知識庫