km.idaeo.ai · IDAEO 知識庫

🏛 本文属于主题馆「reports」

我们怎么记这本账:AI 爬虫系列的方法论与限制

本站四篇 AI 爬虫数据文章(3,000 万次搬货系列)共用同一本伺服器账。这一页把账本摊开:数字怎么算、爬虫身分怎么验、哪些数字有已知限制、哪些统计已无法回溯——包含我们自己查出来的三笔账务更正。查证用的指令一并公开,欢迎重跑。

这一页是本站 AI 爬虫系列文章的方法附录。我们把「账本怎么记的」完整摊开,包括查证后发现的三笔账务更正。原则只有一条:量得到的给指令、量不到的直说。

从伺服器账、口径、验证、更正到限制标注,形成可重跑、可对账的证据链。
可验证账本的方法:量得到的给指令,量不到的直说。

资料从哪里来

所有请求数出自我们两个网站(washinmura.jp 与 idaeo.ai)自己的伺服器资料库,统计期间 2026-03-03 到 2026-07-24。账分两段拼接:2026-06-22 以前来自永久保存的每日汇总表;2026-06-23 到 07-24 来自请求明细表。两段在 06-22/06-23 切开,无重叠、无漏接。

一个要诚实交代的细节:明细段 06-23 到 07-24 含首尾是 32 个日历日;文中「30 天」指标沿用系统「30 天滚动视窗」的习称,不是精确的 30.0 天。

明细表依政策只保留 30 天,之后删除、只留每日汇总。这带来一个代价:发布后回头追查明细的问题,有些已经无法回答——下面第三节就有两题。

资料由永久保存的每日汇总与只保留 30 天的请求明细无缝拼接;2026-06-22 与 06-23 之间无重叠、无漏接,逾期明细不可回溯。
资料沿革与保留边界:汇总永久保存,请求明细只保留 30 天。

爬虫身分怎么验

爬虫自报的名字(User-Agent)可以伪造,所以我们把来源 IP 逐一反查 DNS 登记、比对各公司官方公布的网段、查网段的登记归属。Apple 的 565 个 IP 全部反查回 applebot.apple.com;OpenAI 三只爬虫全部命中官方公布网段;Amazon、Microsoft、Meta 同样通过。抽样中发现 1 个从云端机房冒充 Bytespider 的假来源。

爬虫身分验证链:User-Agent 自报只是起点,来源 IP、DNS 反查、官方网段与登记归属必须交叉一致;不一致者判为冒牌来源。
AI 爬虫身分不能只信自报名称,必须沿证据链交叉验证。

「476 次真人点击」的判定:只计网页版浏览器带来路资讯(referrer)的点击,已剔除我们自家的测试流量。手机 App 内点击不带来路、AI 讲完答案的零点击回答不会上门,所以 476 是看得到的下界。

自查更正(诚实账,持续更新)

第一笔:Common Crawl 收录数。 原报告写「1,515 笔收录、其中 1,089 笔完整页面正本」,但分项只加得出 1,087。我们重跑公开索引查询后解账:正确账是 1,515 笔收录、1,100 笔状态 200 的正本(ainews 734/aeo 333/www 29/另两个子域各 2),加总与总数零差。旧账差额的成因:当时查询遭遇服务中断掉了部分行、分类时漏了两个小子域。查证指令:`curl 'https://index.commoncrawl.org/CC-MAIN-2026-25-index?url=*.washinmura.jp&output=json'`。

第二笔:Applebot 的量含重定向。 我们品牌从 washinmura.jp 迁移到 idaeo.ai 后,Applebot 至今仍持续爬旧网址——当前纪录里它对旧域的请求 100% 收到 301 转址回应(1,173 笔全数),再到新域抓实际内容。这代表「Applebot 500 万次」里含有对旧域的重定向请求,同一内容可能被计为旧域一笔加新域一笔。爆量期间(6/28 起)的转址比例已随日志轮替无法回溯,我们如实标注这个限制。

第三笔:4.7 次/页 vs 2.5 次/页 的样本数。 这组「人工深度文章 vs 自动生成页」的对比出自 07-24 当时的 30 天明细,统计当下没有把样本数(页数分母)一起存档,明细其后已依保留政策删除——样本数无法重建,我们不再为它补一个数字。当前窗口的同型统计(真人代抓整体 2.3 次/页,86,950 次请求、38,530 个网址)因网址结构已改版,与原统计不可直接比较。这组数字在文章中维持「在我们的账上」的限定表述。

三笔自查更正:Common Crawl 正本数由 1,089 更正为 1,100;Applebot 量含 1,173 笔旧域 301;4.7 与 2.5 次每页的样本数不可重建。
可信度来自公开更正,也来自清楚区分可量测与不可回溯。

第四笔(2026-08-11):“28 万句真人问句”更正为“约 2.8 万句”。〈GSC 没坏,是客人搬家了〉原写题库源自“28 万句真人问句”;对帐资料库实表为 28,363 句(2026 年 4 月起搜集),原数字为十倍误植,已于全部语言版本更正。发现途径:全站逐篇评审循环的真值对帐。

已知限制清单

  • 单一营运者、两个网站、五个月:是诚实的个案观察,不是全行业定律
  • 「Google AI」计数是两种标签的合并,无法归因到单一 Google 产品;Google 系点击混在一般搜寻来路里,被系统性低估
  • 品质与被读次数是「同时出现」,混杂因素(页数、页龄)未完全拆开,不做因果宣称
  • 转载与零点击复现在伺服器端不可观测;可行侦测法是特征句探针与 Common Crawl 反查
  • 「被爬内容约 10–12% 最终被引用」是历史引用对账的约数:可观测范围内的方向性估计,无精确分母(分母定义随统计窗变动),不可当转化率使用。系列文章首次引用处挂本条
  • 「内容品质三级」(green/yellow/red)为内部编辑分级:判定维度包含证据挂源密度、口径完整度、可对账资产覆盖度;分级规则属编辑内规不全文公开,引用该分级的数字时应视为站内相对比较,非外部可重算指标
  • 同站姊妹篇之间的同名指标可能来自不同统计窗(例:sitemap 30 天抓取数 32,993 与 33,155 分属两篇的统计时点)——遇数字不一致,以各篇标注的统计窗为准,差异不代表账错
  • 「训练爬虫是 AI 流量的地基」是机制推断,不是量测结论:训练到日后引用的因果段在伺服器端不可观测。文中以三项实测旁证支撑方向(训练爬虫最早抵达、抓取广度优先且三语均衡、内容流入公共训练语料),不宣称已证明因果

资料下载(可对账汇总包)

与其只给指令,不如把账本给你。我们公开了两份去识别化的聚合资料:逐日×爬虫的请求数(crawler-daily.csv,2026-03-03 起全量)与逐日×AI 来源的真人点击(referrals-daily.csv)。栏位定义、SHA-256 杂凑、产出查询与「与冻结数字的已知差异」都写在 README——包括聚合口径与文章冻结值差约 354 万的成因交代。核心数字从此不只「相信我们」,还能「自己对账」。另有引用等级实验包:三轮评审实验的完整题目与匿名化裁决全文,附校验码。

现实检验制度(2026-08-10 起)

模拟评审讲得再好,都不算数——真实世界的引用才算。从本日起,本站把“现实检验”定为站规:每篇文章发布后 30 天与 90 天,回页公布它的真实观测数字(AI 爬虫触达与 AI 平台导流点击,来自本站伺服器观测,2026-08-10 起记录)。首批到期表:〈引用来源的五个等级〉2026-09-09(30 天)与 2026-11-08(90 天)。诚实边界先讲:观测自 2026-08-10 启用,早于此日的行为不在帐内;导流点击仅计网页版可辨识来路,为下界。回填数字会直接写进对应文章,错了就照“自查更正”规矩公开修。

利益揭露

本系列全部数据出自 IDAEO 营运者自有站点的伺服器纪录;IDAEO 提供「让内容被 AI 正确引用」的相关服务。读者评估本系列结论时,应知悉此利益关系。数据查证指令已随文公开,欢迎重跑打脸——我们自己就是这样找到上面三笔更正的。

FAQ

为什么有些数字说「无法重建」,不补算一个新的?
因为明细已依保留政策删除,补算只能用不同窗口、不同口径,数字看起来像但不可比。与其给一个似是而非的数,不如标明不可考。
「再構築できない」と言う数字を、なぜ計算し直さないのですか?明細は保持ポリシーで削除済みです。計算し直すと別のウィンドウ・別の口径になり、似て見えて比較できない数字になります。もっともらしい数を出すより、調べようがないと明記するほうが誠実です。
Why do some numbers say "cannot be reconstructed" instead of being recalculated?The details were deleted under the retention policy. A recalculation would use a different window and different definitions — a number that looks similar but is not comparable. Better to mark it unknowable than to publish a plausible fake.
1,089 改成 1,100,原文章要改吗?
文章正文当时已回避引用这两个数字,不受影响。本页是把更正的账完整公开。
1,089 が 1,100 に変わりました。元の記事は直すべきですか?記事本文は当時からこの2つの数字の引用を避けており、影響はありません。このページは訂正後の帳簿を完全公開するものです。
1,089 became 1,100 — do the articles need fixing?The article text already avoided citing those two figures, so it is unaffected. This page publishes the corrected account in full.
Applebot 的量含重定向,「500 万次」还可信吗?
请求发生是真的,但其中含对旧网址的 301 转址请求,不全是内容抓取。我们无法回溯拆分比例,所以如实标注,读者应把它读成「请求量」而非「内容抓取量」。
Applebot の量がリダイレクトを含むなら、「500万回」はまだ信用できますか?リクエストの発生は事実ですが、旧URLへの 301 転送要求を含み、すべてが内容取得ではありません。比率は遡って分解できないため、そのまま注記します。「リクエスト量」であって「内容取得量」ではない、と読んでください。
Applebot's volume includes redirects — is "5 million" still credible?The requests are real, but they include 301 redirect requests to old URLs, so not all of them are content fetches. We cannot retroactively split the share, so we state it as is: read it as "request volume," not "content-fetch volume."
怎么验证你们说的话?
Common Crawl 反查指令已附在文中,任何人可重跑;伺服器内部数据无法公开原始档,但口径与表结构已在本页交代。
あなたたちの言うことは、どう検証できますか?Common Crawl の照会コマンドは本文に付してあり、誰でも再実行できます。サーバー内部データの生ファイルは公開できませんが、口径とテーブル構造はこのページで説明しています。
How can I verify what you claim?The Common Crawl lookup command is in the text, and anyone can rerun it. The internal server data cannot be released raw, but the definitions and table structure are described on this page.
什么是「优先引用源」?跟「部分引用」差在哪?
这是本站评审框架的分级,模拟 AI 答案引擎挑来源的行为,不是行业标准术语。部分引用=AI 愿意引你,但只挑安全的句子、还要加「据该站自称」的防卫限定;优先引用源=同一题目多个来源可选时,AI 排你在前面——因为口径清楚、限制自己标了、数据可对账,引用你不用替你打折。分级结果仍属模拟评审,真实引用以引用点击账验证。
「優先引用ソース」とは何ですか?「部分引用」とどう違いますか?これは本サイトの評価フレームワークの等級で、AI答案エンジンがソースを選ぶ振る舞いを模擬したものです——業界標準の用語ではありません。部分引用=AIはあなたを引用するが、安全な文だけを選び、「同サイトの自称によれば」という防衛的な限定を付ける。優先引用ソース=同じテーマで複数のソースから選べるとき、AIがあなたを前に並べる——口径が明確で、限界を自ら記し、データが照合可能だから、引用時に割り引く必要がないのです。等級の結果はあくまで模擬評価であり、実際の引用は引用クリックの帳簿で検証します。
What is a "preferred citation source," and how does it differ from "partial citation"?These are tiers from our own review framework, which simulates how AI answer engines pick sources — they are not industry-standard terms. Partial citation = the AI is willing to cite you, but picks only the safest sentences and adds defensive qualifiers like "according to the site's own account." Preferred citation source = when multiple sources compete on the same topic, the AI ranks you first — because your definitions are clear, your limits are self-declared and your data can be audited, citing you requires no discount. Tier results are still a simulated review; real citation is verified against the referral-click ledger.
这一页会更新吗?
会。发现新的账务问题就补进「自查更正」,每次更新标日期。
このページは更新されますか?はい。新しい帳簿の問題が見つかるたびに「自己監査訂正」に追記し、更新ごとに日付を記します。
Will this page be updated?Yes. New bookkeeping issues will be added to "self-audit corrections," and each update will be dated.

引用本文

TK Lin・《我们怎么记这本账:AI 爬虫系列的方法论与限制》・IDAEO 知識庫・2026-08-10・https://km.idaeo.ai/reports/crawler-methodology

更新 2026-08-10T15:26:19.302Z · server-rendered · four-language · IDAEO 知識庫