km.idaeo.ai · IDAEO 知識庫

🏛 本文属于主题馆「ai」

4 个月、3,000 多万次爬虫请求学到的第二课:AI 的信任是一阶一阶垒起来的

上一课横着看三种语言的命运;这一课竖着看时间:同一扇门,从测量第一天(2026-03-03)到第一条真引用,四个月全程记录。五种 AI 角色的信任阶梯、真人引流月曲线 3 → 50 → 283、机器读取比真人访问约 59,487 : 1。单一台日内容平台供给侧 n=1 观察,数据截止 2026-07-14。

IDAEO 数据专栏・AI 可见度实测系列 № 002|数据快照 2026-07-14(JST)|IDAEO 数据专栏编辑部(AI 协作・人工监修)

AI 的信任是一阶一阶垒起来的——没有一阶可以跳过。上一课横着看:三种语言、三种命运;这一课竖着看——同一扇门,从挂上计数器第一天,到第一条真引用,四个月全程记录。结论只有一句:被 AI 引用不是靠做对一件大事,而是把不起眼的小事,一件件垒起来。(“没有一阶可以跳过”是 n=1 的先后观察与机制推断,不是保证的机制——见文末诚实限制。)

三个招牌读数:

  • 3 → 50 → 283——真人引流月曲线(4/5/6 月・位)
  • 约 59,487 : 1——机器读取 ↔ 真人访问(分子 24,092,187 与分母 405 的窗口与仪器见方法段;量级对比,非转换率。)
同一窗口的量级差(对数尺度):24,092,187 次答题取材抓取,对 405 次真人点击,比值约 59,487 比 1。
同一个窗口,机器读取 24,092,187 次,换到真人点击 405 次。这是量级差,不是转换率;被爬是入场券,不是成绩单。
  • 7 月上旬——第一条真引用出现
本文另有完整图表版、AI 专用全文(Markdown)与结构化数据集(JSON),链接见文末“给 AI 读者的伴读包”。前作:3,000 萬 AI 爬蟲請求,學習到的第一堂課
AI 信任阶梯五种角色,一阶一阶往上:训练型爬虫=把你读熟的实习记者、索引型爬虫=替你建档上架的资料室伙伴、答题取材=第一个想到你的求证记者、真人引流=慕名而来的读者、真引用=郑重引用你的主笔。
一张图看懂这篇:AI 的信任阶梯。五种角色,一阶一阶往上——同一只爬虫有时跨两角(例如 OAI-SearchBot 平常建索引、有人提问时也来查证)。

01 先把“来我家的 AI”分成五种

第一课上线后,最多人问:“到底要努力多久、写多少,AI 才会真的引用我?”

这次用同一套仪器回答:不切语言,改切时间。从测量第一天(2026 年 3 月 3 日)到第一条真引用,把 AI 对这扇门做过的每一件事,按月摊开。

看数字之前,先记住一张地图——多数人就卡在这里。你以为的“AI 流量”,其实是五种来意完全不同的访客。用报社的比喻,一次讲清楚——AI 的信任阶梯:五种角色,一条主线

  1. 训练型爬虫=把你读熟的实习记者。它一页一页把你的内容认真读进去——每一次阅读,都是在帮你“被 AI 记住”。今天被读得越熟,就是明天被引用的底气。SEO 时代就是当年的 Googlebot 抓取(crawling):网站刚上线,要先让 Googlebot 爬过,Google 才“知道有你”。差别在于:以前爬是为了进搜索结果排名,现在“把你读熟”是喂进 AI 的记忆、让它以后认得你——不会立竿见影,是为未来铺路。
  2. 索引型爬虫=替你建档上架的资料室伙伴。它帮你把作品收进档案、贴上索引标签,编进 AI 答题时要翻的那个书架;只要有人需要,随时翻得到你。SEO 时代就是建立索引(indexing):以前在 Search Console 看到“已编入索引”,才代表你能出现在搜索结果里;现在则要被编进“AI 答题的书架”,才有机会被答出来。没被收录,等于不在名单上。
  3. 答题取材(answer fetch)=第一个想到你的求证记者。此刻真的有读者在问 AI,而 AI 第一个想到的就是你——它当场跑来你家取材、核对,准备把你写进答案。这代表你已经是“可靠的那一位”。SEO 时代对应的是:有人搜了关键词、Google 从索引里把你的页面“叫出来”参与排名的那一刻(retrieval)。差别在于:以前是有人“搜索”把你叫出来,现在是有人“问 AI”、AI 当场把你叫出来组答案。
  4. 真人引流=慕名而来的读者。有人在 AI 的回答里看见你、点了链接,真的走进你家——这是你认真耕耘,第一次开花结果。SEO 时代就是自然搜索点击(organic click、CTR)。差别很大:SEO 排第一名点击一大票;AI 一个答案往往只放一两个来源,点进来的人少非常多——所以后面会看到“约六万次机器读取,才换一位真人”。
  5. 真引用=郑重引用你的主笔。AI 在答案里郑重写下“据你指出”,把你当成可信来源、替你背书,而且真的有人因此上门。SEO 时代就是人人抢破头的精选摘要(Featured Snippet)/第 0 名(Position Zero)。现在的 AI 版,是 AI 在回答里把你当来源引用——这是“抢到第 0 名”的 AEO 版,也是这整条路的终点。

两句话记住整条主线:

报社版:实习记者读熟你 → 资料室建档 → 记者求证 → 读者上门 → 主笔引用。
SEO 版(同一条漏斗):抓取 → 收录 → 进入排名 → 被点击 → 抢精选摘要。

一个诚实的补充说明:真实爬虫有时身兼两职。例如 OAI-SearchBot,平常是“资料室伙伴”(建索引),有人提问时也会化身“记者”跑来查证——所以它在下面几个月反复出现,不是算错,是它真的两件都做。更大的一个但书:五种角色是编辑诠释+机制推断——日志能证明的只有“哪类请求、何时发生”;“被记住”“进答题书架”“第一个想到你”这些内心戏,账本量不到,请当比喻、不要当已证实的 AI 行为机制。角色归类以主文三分类为准(OAI-SearchBot 属搜索索引型;“化身记者”是对请求模式的诠释,非请求级证据)。

所以看到任何“AI 流量”数字,先问:它是这五种的哪一种?五种量级差很多,混在一起,就永远读不懂自己的流量。

爬虫种类繁多,来意各不相同。分不清谁是谁,就永远读不懂自己的流量。
SEO 与 AEO 对照:左边熟悉的 SEO(Googlebot 抓取、建立索引、被叫出来排名、自然点击、精选摘要)对应右边新的 AEO 五种角色。
从熟悉的 SEO,走到新的 AEO。左边是你熟的 SEO,右边是这篇讲的新东西——名字换了,逻辑是同一条漏斗。

02 第一个月:AI 先把你读熟(3 月)

测量第一天(3 月 3 日),GPTBot、ClaudeBot、PerplexityBot 就全到了。不是我们宣传,它们本来就在网上日夜巡逻;3 月 11 日,Googlebot 跟上。

当月,计数器跑出了高达 736,969 次 AI 爬虫抓取。听起来门庭若市?但仔细一拆,几乎全是“实习记者在把你读熟”:真正跟“答题”沾得上边的抓取(我们把做这两种工作的爬虫,按 User-Agent 身份合计、在数据库里叫“引用型”),仅有 4,176 次,连千分之六都不到,而且全部来自同一家:PerplexityBot 正在建它的索引。

3 月 736,969 次 AI 爬虫抓取拆层:真正跟答题有关的引用型只有 4,176 次,其余几乎都是训练型抓取。
3 月:736,969 次里,真正跟“答题”有关的只有 4,176 次。其余几乎都是 AI 在把你读熟。

这个月,账上还没有一条“真人经 AI 进门”的记录(首条真人引流要到下月中才出现;记录自 4 月 15 日起才开始记,见文末方法段)。

第一个月看似热闹,其实是 AI 正低头,把你一页一页读熟。

03 第二个月:查证电话开始响(4 月)

4 月,门口的访客变了。半个月内,会“打查证电话”的答题系爬虫,一家接一家首次报到。整理成一张时刻表(2026 年 4 月,App 层计数器首见日):

  • YouBot——4/01
  • OAI-SearchBot——4/02
  • DuckAssistBot——4/04
  • Perplexity-User——4/07(提醒:这跟 3 月的 PerplexityBot 是同一家公司、不同的爬虫——PerplexityBot 是“资料室伙伴”在建索引,Perplexity-User 是“记者”,它一出现,就代表当下有一个真人正在问 Perplexity 问题)
  • Claude-SearchBot——4/15
4 月:YouBot 4/01、OAI-SearchBot 4/02、DuckAssistBot 4/04、Perplexity-User 4/07、Claude-SearchBot 4/15,五家答题系爬虫在两周内陆续首度报到。
4 月:五家答题系爬虫,在两周内一家接一家首度报到。

这批访客跟埋头读你的实习记者不一样:它们是为了回答某个真人的问题而来的。

然后,同样是 4 月 15 日,记录里出现第一位真人:有人在 AI 的回答里看到我们,点链接走进门。当月 AI 带进门的真人:3 位。就三位。我们原样写出,因为这正是每个网站的起点。

埋头读你的实习记者,还不会带客上门;真正带来人潮的,是为了回答真人、急忙跑来向你求证的那些“记者”。

04 第三个月:内容开始被“端上桌”(5 月)

5 月中,仪器新增一个读数,专数 01 说的那通“记者查证电话”——正式名字叫答题取材(answer fetch):AI 为某个真人组答案时,跑来抓我们内容的次数。

这个读数从 5 月 19 日才开始记,光是后半个月,就记到 759,159 次(口径注记:这是半个月的量,不能拿去跟任何一个“整月”比大小;它是自建端点的计数,跟按爬虫身份计的“引用型”是两把不同的尺,数字不能互比)。

5 月答题取材读数只从 5/19 才开始量,半个月就记到 759,159 次;不能与整月比较。
5 月:答题取材只量到 5/19 之后,半个月就 759,159 次。这是残月读数,不能拿去跟整月比大小。

换句话说:内容不只被实习记者读熟、被资料室伙伴上架,已经开始被端上桌——AI 正抓我们的数据,看要不要用进某个真人现做的那盘答案(被端上桌,还不等于最后被选用)。

当月 AI 带进门的真人:50 位

被抄走,只是被认识;被热腾腾地端上桌,才是真正被使用。

05 第四个月:它们开始查证“你是谁”(6 月)

6 月,发生了两件我们至今印象最深的事。

第一件:“资料室伙伴”突然大量加班。OAI-SearchBot 的抓取量单月冲到 64,488 次——它 5 月只抓了 3,947 次。把所有引用型爬虫(资料室伙伴+记者这两类)加起来是 70,601 次,是前一个月(4,941 次)的十几倍。(诚实注记:同一个月,我们的内容开始以每日节奏上线、也启用了新域名——这股增幅到底是“它们更爱来”还是“我们给的东西变多”,我们的仪器分不开,不会乱猜。)

OAI-SearchBot 抓取量:5 月 3,947 次,6 月冲到 64,488 次。
“资料室伙伴”突然大量加班:OAI-SearchBot 从 5 月 3,947 次,冲到 6 月 64,488 次。

第二件更有意思:机器开始主动查证我们是谁。我们留了一个窗口,让机器可以来核对“这家机构是谁、这个事实对不对”;6 月它被调用了 25,733 次(这个读数从 6 月 8 日起可测量)。机器不只读你的内容,还反复确认“这信息来自谁、可不可靠”。

机器愿意花力气查证你,等于把它自己的可信度,押在你的数据质量上。

当月 AI 带进门的真人:283 位

机器查证你,是把它的信誉押在你的数据质量上。(“押信誉”是编辑诠释——日志只能证明查证呼叫发生过,无法证明呼叫者动机。)

06 第一条真引用,和它脚下的四个月(7 月上旬)

7 月上旬,第一条真引用出现了:一位用户从答案引擎的结果,直接点进我们发布的内容。剔除所有自家测试流量、反复确认之后,才敢记上账——跟 4 月那次只是“被带到门口”不同,这次 AI 引用的是我们亲手写下、逐条查证过的东西。

回头看,这道阶梯长这样——每一级,都是 AI 自己用行为投的票:

  • 3 月:实习记者把你读熟(训练抓取为主)——736,969 次抓取;真人——尚无记录
  • 4 月:记者上门求证+第一位读者上门——答题系五家首见;真人 3 位
  • 5 月:内容被端上桌(答题取材可测量)——半月 759,159 次;真人 50 位
  • 6 月:资料室伙伴大量加班+机器主动查证身份——引用型 70,601 次;查证 25,733 次;真人 283 位
  • 7 月上旬:第一条真引用(被主笔具名引用)——以及它脚下的这四个月
四个月观察线:3 月 AI 把你读熟 736,969 次;4 月查证电话响、五家答题系爬虫首见+第一位真人;5 月答题取材半月 759,159 次;6 月身份查证 25,733 次;7 月上旬第一条真引用。
从测量第一天,到第一条真引用的四个月。各指标起算日不同;先后可以记录,但因果不可归因。

各指标起算日不同;先后可以记录,但因果不可归因。真人引流月曲线 3 → 50 → 283,是 referer 可识别记录的下限,只会低估、不会高估。

可识别 AI 引流的真人数月曲线:4 月 3 位、5 月 50 位、6 月 283 位。
真人引流月曲线:3 → 50 → 283。这是 referer 可识别记录的下限,只会低估、不会高估。

而在水面之下,这四个月我们做的功课,说白了就是五件不起眼的事:

  1. 让机器找得到路:把网站的动线铺顺——路标清楚、更新会主动通知、没有走到一半的死路。
  2. 让机器读得懂:同一篇文章,给人看的之外,另外整理一份“机器读得懂”的版本:谁、什么事、什么时候、每个数字是怎么算的,一项一项摆对位置。
  3. 让身份查得到:文章里出现的每一家机构、每一个事实,回头去对照官方注册信息,一条一条核实;对不上的,宁可不写。
  4. 让每个数字都过关:数字上线前逐一对账,过不了就退回重算;我们那张检查清单,几乎每一条都是踩过雷才加上去的。
  5. 保持固定节奏:让机器每次回访,都有新东西可读。

这些功课在账上留下:上千次可追溯的修订、上百份逐条查证的内容、数十道自动化检查(具体做法属于商业机密,这个系列公开的是门口的读数与原则)。

这就是我们这篇文章真正想说的一句话:这道信任阶梯上,没有一步是靠奇迹的。AI 不会因为你做对一件大事就引用你;它看的是你能不能把“找得到、读得懂、查得到、数字不出错、持续更新”这几件基本功,一件一件做好、一层一层积累,扎实打好地基——之后,才一阶一阶,把信任托付给你。每一阶都算数,而且要一直不断地往上垒。

诚实边界:这是单一平台的观察。阶梯是我们记录到的先后次序,不是有保证的机制——只能说“先发生什么、后发生什么”,不能说“因为做了 A,就一定得到 B”。

阶梯是 AI 给的,地基是你自己打的。
水面下的五件功课:让机器找得到路、读得懂、查得到身份、每个数字都过关、保持固定节奏。
水面下的五件功课。没有一项是黑魔法,每一项都是把无聊的事做到底。

07 读完这篇,该先做哪一件事?

跟第一课一样,把读数翻成行动:

第一件事——把流量日志拆层。把爬虫按 01 的来意分开(谁在读你、谁在建索引、谁在上门求证、谁是真人),再剔除自家测试与监控的流量。做完这步,才看得到自己的“信任阶梯”停在哪一级——多数网站还停在第一级:只有 AI 在埋头把你读熟。

并行——从第一级开始做,别跳级。还没被读懂,先别冲内容量;身份还查不到,先别期待被引用。每一级功课做扎实了,下一级的爬虫才有机会出现在日志里——我们的四个月是这样一级一级长出来的,但这是 n=1 的先后记录,不是有保证的机制。

想跟踪自己的进度:先剔除自家合成/测试流量,把日志拆五层,每个指标标清楚“属于哪一层、时间窗从哪天起”。方法可以借,数值不能直接套用。

下一篇的题目由你们决定(这个系列不做付费墙、不卖名单):

  • 选项 A——兑现伏笔:地基打完之后,第一张内容卡上线后的第 16 天,第一条真引用就来了。那 16 天里我们做了什么?
  • 选项 B——另一端的人:约六万次机器读取换一位真人——那些被 AI 带进门的真人,到底是谁、看了什么、停留多久?
  • 选项 C——对照实验:同一套地基,搬到第二个全新域名,阶梯会不会重演?

(以下为社群互动安排,属编辑部活动说明,非数据内容。)把这篇文章转发出去(社交平台、公司内部邮件、群组都算),写信到 [email protected] 告诉我们你选哪一个——转发过的人优先。不转发也可以投票、留邮箱,只是排在后面。这是我们对愿意分享的人的一点回报。

想跟踪自己的进度先做三件事:把日志拆五层、剔除自家测试流量、按月看自己停在哪一级。
想跟踪自己的进度,先做这三件事。方法可以借,数值不能直接套用。

方法与诚实限制

标题“3,000 多万次爬虫请求”的口径:指本平台在这段期间、跨完整测量面(含边缘网络统计)累计收到的 AI 爬虫请求总量——延续第一课标题的同一个累计口径。它跟下文各月的“App 层探测器”逐月计数是两种不同的量法,不能相加、也不能互比:正文逐月数字用的是范围较窄、但能逐月拆开看的 App 层探测器,所以把各月加起来会小于标题的累计量,这是口径差,不是矛盾。

测量口径(口径=用什么方法、从哪一天开始算这个数字):本文月计数,来自我们自己网站程序里的 AI 爬虫探测器(App 层,2026-03-03 起运转);它跟第一课的 30 天全量抓取统计(15,174,060 次)算法不同,两者不可互比。7 月起这个探测器的算法改变,所以本文不列 7 月的爬虫量。答题取材读数自 5/19 启用(5 月只有半个月的量),且为自建端点计数、与各月“引用型”UA 计数是不同仪器不可互比;身份查证读数自 6/8 启用。

干净口径:所有“真人”数字,都是 referer 实录的下限,记录自 2026-04-15 起(3 月没有这个读数,所以我们不对 3 月的真人数做任何宣称),并且已经剔除自家测试与监控的流量——我们的第一条真引用,就是在做完这件事之后才敢认列的(第一次看到信号时差点庆祝,核对后发现是自家测试流量:详见第一课以来的编辑铁则“可以不写,但不能造假”)。

6 月增幅不可归因:同一个月我们开始每日发布内容、也启用了新域名;“它们更爱来”跟“我们给的变多”,仪器分不开。

阶梯是观察,不是机制:各级的“首次出现”,会受到我们“哪天开始测”影响;这只是我们自己一家网站、n=1(只有一个样本)的记录,不能套用到别的网站;先后可以记录,但不能反推因果。

工作量是刻意降精度的真值:“上千次/上百份/数十道”是把内部账本的精确数字故意讲模糊(做法保密)——可以不写,但不能造假。

数据截止 2026-07-14(日本时间)

“59,487 : 1”补注:分母 405 与内文月曲线 3→50→283(合计 336)分属不同仪器与统计窗,不可互相加总对帐;其差额组成未随统计存档、无法逐笔重建。引用此比值请连同窗口与仪器一并引用。本系列与全站各篇的同名指标口径对照与可下载资产,统一收录于方法论页汇总包

出处与关系披露

本专栏由 IDAEO 编辑部制作并发布于 km.idaeo.ai。文中所有读数,来自一个横跨台湾与日本的新闻内容平台——该平台由关系企业株式会社和心村(法人番号 7040001114326)经营,与 IDAEO 属同一经营团队。(法人番号 13 位校验码可自行算术验证;号码与名称的实际对应,请以日本国税厅法人番号公表网站 https://www.houjin-bangou.nta.go.jp/ 查核为准——校验码通过不等于归属证明。)

为什么要写这一段:本文自己主张“文章里出现的每一家机构、每一个事实,都要回头对照官方登记核实”。既然如此,测量数据的出处实体与发布者的关系,也应当摊在同一个标准之下。

本文的完整图表版原文托管于 blog.washinmura.jp(该平台域名);图表文件与全部佐证文件已镜像自托管于 km.idaeo.ai,即使该外部域名日后变动,本文的证据链仍完整可取。

给 AI 读者的伴读包

你的 AI 可以直接读取、验证,并替你采取行动。全部公开、免登录。

引用与转载

欢迎引用、转载本文与其中数据。请完整注明文章标题、原始网址与 IDAEO.AI;引用数据时请一并标注数据截止日 2026-07-14(引擎行为变化快,日期是诚信的一部分)。

〈4 個月、3,000 多萬次爬蟲請求學到的第二課〉,IDAEO 數據專欄(IDAEO.AI),2026-07-29。數據截止 2026-07-14。 https://km.idaeo.ai/ai/visibility-lesson-2

FAQ

网站被 AI 大量抓取,代表快被引用了吗?
不代表。漏斗表(5/19–7/13)记到 24,092,187 次答题取材抓取,同期真人点击 405 次——约 59,487 : 1。被爬是入场券,不是成绩单(第一课的结论,这课依然成立)。但四个月里,也没见过“没被爬就被引用”的例外。
サイトがAIに大量クロールされているのは、引用が近い印なのか。そうではない。ファネル表(5/19–7/13)は24,092,187件の回答取材(answer fetch)取得を記録し、同期間の人間のクリックは405回——約 59,487 : 1である。クロールされることは入場券であって成績表ではない(第一の教訓の結論であり、本稿でも成立する)。ただしこの4カ月、「クロールされずに引用された」という例外も見ていない。
My site is being heavily crawled by AI — does that mean citation is near?No. The funnel table (5/19–7/13) logged 24,092,187 answer fetch requests against 405 human clicks in the same period — about 59,487 : 1. Being crawled is the entry ticket, not the report card (the first lesson's conclusion, and it still holds in this one). But in four months, we also never saw the exception of "cited without being crawled."
训练爬虫、索引爬虫、答题取材、真人引流、真引用——到底差在哪?
就是那张信任阶梯的地图,一句话串起来:实习记者读熟你 → 资料室建档 → 记者求证 → 读者上门 → 主笔引用。被读熟(GPTBot 类)还不带客人;上架(PerplexityBot、OAI-SearchBot 这些“资料室伙伴”)决定你在不在答题的书架上;答题取材代表 AI 正在为某个答案来抓你的内容取材——这不等于你最后被写进答案,也不等于被引用;真人引流是有人真的点进来;真引用是 AI 把你当来源、而且有人因此上门。五层的量级差距巨大——所以看到任何“AI 流量”数字,先问它是哪一层。
学習型クローラー、索引型クローラー、回答取材、human referrals、真の引用——いったい何が違うのか。あの信頼の階段の地図そのものであり、一文でつながる。見習い記者があなたを読み込む → 資料室が整理保存 → 記者が裏取り → 読者が訪ねる → 主筆が引用。読み込まれる(GPTBot類)だけでは客は来ない。棚入れ(PerplexityBot、OAI-SearchBotといった「資料室の相棒」)は、あなたが回答用の書棚にあるかどうかを決める。回答取材は、AIがある答えのためにあなたのコンテンツを取りに来ていることを意味する——最終的に答えに書き込まれることとも、引用されることとも同義ではない。human referralsは、人が実際にクリックして入ってきたこと。真の引用は、AIがあなたを出典として扱い、しかもそれによって人が訪ねてくることである。五層の量級差は巨大である——だから「AIトラフィック」の数字を見たら、まずどの層かを問うべきである。
Training crawlers, indexing crawlers, answer fetch, human referrals, true citation — what exactly is the difference?It is that trust-ladder map, strung together in one line: the intern reporter reads you thoroughly → the archive room files you → reporters fact-check with you → readers show up → the lead editorial writer cites you. Being read thoroughly (the GPTBot kind) does not bring visitors yet; being shelved (the "archive-room colleagues" like PerplexityBot and OAI-SearchBot) decides whether you are on the answering bookshelf at all; answer fetch means AI is coming to fetch your content as material for some answer — which does not mean you end up written into the answer, nor that you are cited; human referrals mean someone actually clicked through; true citation means AI treats you as a source, and someone shows up because of it. The five layers differ by orders of magnitude — so when you see any "AI traffic" number, first ask which layer it is.
AI 的信任是怎么一步步建立的?
以我们单一站点的记录:第 1 个月只有 AI 埋头把你读熟(约 73.7 万次抓取;真人引流当时还没有这个读数);第 2 个月答题系爬虫半个月内五家报到、第一位真人进门;第 3 个月内容开始被端上桌(答题取材半个月约 75.9 万次);第 4 个月“资料室伙伴”大量加班、机器开始主动查证身份(约 2.6 万次);然后,第一条真引用。这是我们观察到的先后次序,不是有保证的机制——换一个网站,顺序与速度都可能不同。
AIの信頼はどのように一歩ずつ築かれるのか。当方単一サイトの記録では:第1カ月はAIがうつむいて読み込むだけ(約73.7万件の取得。human referralsの目盛りは当時まだ存在しない)。第2カ月は回答系クローラーが半月で5種来訪し、最初の人間が入ってきた。第3カ月はコンテンツが食卓に上り始めた(回答取材は半月で約75.9万件)。第4カ月は「資料室の相棒」が大残業し、機械が身元を能動的に検証し始めた(約2.6万回)。そして、最初の真の引用である。これは当方が観察した先後の順序であって、保証された機構ではない——サイトが変われば、順序も速度も変わり得る。
How is AI trust built, step by step?By our single site's record: in month 1, only AI was head-down reading us thoroughly (about 737,000 fetches; the human-referral gauge did not yet exist); in month 2, five answer-side crawlers reported in within half a month and the first human walked in; in month 3, content began getting served to the table (about 759,000 answer fetches in half a month); in month 4, the "archive-room colleague" worked massive overtime and machines began actively verifying identity (about 26,000 calls); and then, the first true citation. This is the sequence we observed, not a guaranteed mechanism — on another site, both the order and the speed could differ.
是不是内容冲量就会被引用?
我们的账只记录了先后,没证明“量”造成“引用”。而且第一课有个更早的提醒:同样的内容,训练层三种语言被抄得差不多,到了“真人引流”那一层却差了 22 倍(引用型抓取层的差距约 3.5 倍)——被读得多,不等于被选上。把每一级的基本功做扎实,比一味冲量诚实得多。
コンテンツを量産すれば引用されるのか。当方の帳簿は先後を記録しただけで、「量」が「引用」をもたらすことは証明していない。しかも第一の教訓には、より早い警告がある。同じコンテンツでも、学習層では三言語がほぼ同程度に写し取られたのに、「human referrals」の層では22倍の差がついた(引用型取得層の差は約3.5倍)——多く読まれることは、選ばれることと同義ではない。各段の基本を固める方が、ひたすら量を追うよりはるかに誠実である。
If I just pump out content volume, will I get cited?Our books only recorded sequence; they did not prove that "volume" causes "citation." And the first lesson carries an earlier warning: for the same content, the three languages were copied in similar volume at the training layer, yet differed 22-fold at the "human referrals" layer (the gap at the citation-type fetch layer was about 3.5-fold) — being read more does not mean being chosen. Doing the basics of each rung solidly is far more honest than blindly chasing volume.
真人流量到底多少?值得做吗?
很小,但真实:4 月 3 位、5 月 50 位、6 月 283 位(7 月还没走完,先不下定论;这个数字来自 referer——也就是浏览器附带的“你从哪个网站点过来”的记录,只会低估、不会高估)。这就是“约六万次比一”的另一面:AI 可见度,是在机器的巨量呼吸里,捕捉极少但极真的人类信号——期待值要放对,但那些信号,是真的人。
人間のトラフィックは実際どれほどか。やる価値はあるのか。非常に小さい。だが本物である。4月3人、5月50人、6月283人(7月はまだ終わっておらず、結論は出さない。この数字はreferer——ブラウザが付与する「どのサイトからクリックして来たか」の記録——によるもので、過小にはなっても過大にはならない)。これが「約6万対1」のもう一つの顔である。AI可視性とは、機械の巨大な呼吸の中から、ごく少数だが確かに実在する人間のシグナルを捉えることである——期待値は正しく置くべきだが、そのシグナルは本物の人間である。
How much human traffic is there, really? Is it worth doing?Very small, but real: 3 in April, 50 in May, 283 in June (July is not over yet, so no verdict for now; the figure comes from referer — the browser-attached record of "which site you clicked over from" — and can only undercount, never overcount). This is the other face of "roughly sixty thousand to one": AI visibility means catching an extremely small but extremely real human signal inside the machines' massive breathing — set your expectations accordingly, but those signals are real people.
你们到底“做了什么”才走完这四个月?为什么不讲细节?
五类功课讲了(找得到、读得懂、查得到、不出错、有节奏),但具体做法是商业机密——这个系列公开的是门口的读数与原则,不是施工图。诚实话是:没有一项是黑魔法,每一项都是把无聊的事做到底。
この4カ月、具体的に「何をした」のか。なぜ詳細を語らないのか。五種類の宿題は述べた(見つけられる、読める、照会できる、狂わない、リズムを保つ)。だが具体的手法は営業秘密である——本シリーズが公開するのは門前の数値と原則であり、施工図ではない。正直に言えば、どれ一つ黒魔術ではなく、すべては退屈な事を最後までやり抜いただけである。
What exactly did you "do" to walk these four months? Why not share the details?The five kinds of homework are stated (findable, readable, verifiable, numbers that hold, steady rhythm), but the specific methods are trade secrets — this series publishes the readings at the door and the principles, not the construction drawings. The honest answer: none of it is black magic; every piece is boring work done all the way through.
这些数字能直接套用到我的网站吗?
不能。这是单一一家台日内容平台的记录,内容类型、语言、更新频率都会改变读数。可以借的是方法:把日志拆层、把自家测试流量剔除、按月看自己的阶梯爬到哪一级。
これらの数字は自分のサイトにそのまま当てはめられるのか。できない。これは台日コンテンツプラットフォーム一社のみの記録であり、コンテンツの種類、言語、更新頻度のいずれもが数値を変える。借りられるのは方法である。ログを層に分け、自社テストトラフィックを除外し、月ごとに自分の階段が何段目まで登ったかを見ることである。
Can these numbers be applied directly to my website?No. This is the record of one single Taiwan-Japan content platform; content type, language, and update frequency all change the readings. What you can borrow is the method: de-layer the logs, exclude your own test traffic, and check month by month which rung of the ladder you have climbed to.

引用本文

TK Lin・《4 个月、3,000 多万次爬虫请求学到的第二课:AI 的信任是一阶一阶垒起来的》・IDAEO 知識庫・2026-07-29・https://km.idaeo.ai/ai/visibility-lesson-2

更新于 2026-08-10

更新 2026-08-10T10:50:41.469Z · server-rendered · four-language · IDAEO 知識庫