km.idaeo.ai · IDAEO 知識庫

🏛 本文属于主题馆「ai」

网站没被 ChatGPT 引用?我们自己差点误判的七步排查实录

我们的仪器显示 OAI-SearchBot 造访 0 次,差点误判成“OpenAI 没来过”。到边缘对账才发现是时间窗假象。本文是第一人称排查实录,附七步清单与全部原始数字。

限制先讲

  • 我们的自建仪器 2026-08-10 07:52 UTC 才开机,样本非常年轻。仪器内的数字,只代表开机之后的世界。
  • 边缘对账用的是 Cloudflare GraphQL 的 72 小时窗。窗外的事,这次没看。
  • 这是单一网站的实录,不是产业统计。清单可以套用,数字不能外推。
  • sitemap 返回 204 是“受理”,不是“已收录”。IndexNow 的 200/202 同样只是收件回执。

一个 0,差点写进报告

事情从一个 0 开始。

我们给自家网站建了一套 origin 仪器,记录每一笔爬虫到访。打开一看:OAI-SearchBot——OpenAI 给 ChatGPT 搜索做索引的爬虫——0 次。

第一反应很自然:“OpenAI 根本没来过,难怪 ChatGPT 不引用我们。”这句话差一点写进正式报告。

还好我们多做了一步:去 Cloudflare 边缘拉 GraphQL 的 72 小时真值对账。结果完全翻案——

  • OAI-SearchBot:5 次,全部 200(成功取走内容)
  • GPTBot:10 次
  • Claude 系:6 次(ClaudeBot 1+Claude-User 2+anthropic 3)
  • Amazonbot:151 次
  • meta-external:423 次

人家不但来过,还每次都拿到了东西。那个 0 是怎么回事?答案很不体面:仪器 08-10 才开机,OAI-SearchBot 的到访发生在开机之前。

打个比方:你半夜才装好门口的摄像头,第二天早上看回放,然后宣布“邮递员从来没来过我们家”。摄像头没坏,是你的观测窗太短。

事后回想,这种错特别容易犯,原因很讽刺:仪器是我们自己建的,所以我们最信任它。越是自己亲手做的工具,越容易忘记先问一句:“它是从什么时候开始看的?”

误判的代价也不便宜。如果那句“OpenAI 没来过”真的写进报告,接下来的药方全会开错:去改内容、去调标题、去怪算法——而真正的问题,其实出在我们自己读错了仪表盘。

这次差点误判,逼我们把整套流程写成清单。以下七步,是我们自己走过、每步都有实跑证据的版本。顺序有讲究:由外而内、由便宜到昂贵,前面的步骤不过关,后面的结论都不成立。

七步排查清单

第一步:robots.txt 有没有把人挡在门外。 最便宜的检查最先做。打开 robots.txt,逐行看有没有 Disallow 到 AI 爬虫。要逐字读,不要瞄过去:挡的是谁、挡到哪个路径、有没有整站全挡。这一步我们过了。但很多网站在这里就出局——多年前请人建站时留下的一行设置,等于自己贴了“谢绝推销”,再抱怨没人上门。

第二步:CDN/边缘有没有替你挡。实查设置,不要用猜的。 就算 robots.txt 开门,CDN 可能在你不知道的地方关门。近年各家 CDN 陆续推出“AI 爬虫防护”类功能,有的默认值会随版本改变,有的是托管商好意帮你打开的——你自己完全不知情。我们实查 Cloudflare 设置:ai_bots_protection=disabled、crawler_protection=disabled、没有 WAF 拦截规则——门全开。重点不是我们的结果,是方法:这一步必须打开设置页或打 API 实查。“我记得没开”不算证据。

第三步:边缘 vs 自家仪器对账。时间窗陷阱就在这。 这是我们摔跤的那一步。同一个网站,origin 仪器说 0,边缘说 5 次全 200。没有谁说谎——它们量的是不同时间、不同位置。实务做法:对账之前,先把“我的仪器几点开机”“边缘的查询窗多长”白纸黑字写下来,再去拉数字。这些“窗”没先写下来,任何比较都是错的;写下来之后,多半连对账都不用做,你就先看见自己的洞。

第四步:索引层查证。爬过,不等于认识你。 爬虫来过,只代表内容被搬走;搜索引擎的索引认不认识你,是另一本账。这就像书店:有人进店翻过书,和这本书有没有登进图书馆的总目录,是不相干的事。我们拿三页去 Google Search Console 做 URL inspection,三页全部回“URL is unknown to Google”。也就是说,在 Google 的索引层,我们等于不存在——和爬虫有没有来,得分开查。

第五步:sitemap 是不是“真的”提交过。 再往下挖,更不体面的真相:整个域名在 GSC 的 sitemap 清单=0 张,从来没提交过。对应的结果是 28 天曝光 0 次。我们一直以为“上线了就会被看见”,事实是我们从来没去柜台报到。这里的关键词是“真的”:不要问记忆,去后台把提交清单打开看。修复当天做完:六张 sitemap 提交,全部回 204 受理;IndexNow 也发了,回 200/202。再提醒:受理是收件,不是收录。

第六步:外部提及量。别人有没有谈论你。 AI 引用不只看你家门口的路通不通,也看外面有没有人提到你。别人的文章有没有链接过来、行业名录有没有收录你、社群里有没有人谈起你——这些都是 AI 判断“这个来源值不值得引”的旁证。这一步在本次窗内我们没有新数字,只有前作账本的定性提醒:五个月 roughly 30 million 次爬取,只对应 476 次真人点击(可见下限)(https://km.idaeo.ai/ai/ai-crawler-shop-ledger)。被搬走很多,不代表被谈论、被引用。

第七步:定期探测复测。一次排查只是一张快照。 排查不是做完就结案。索引型爬虫的节奏以周计:前作实测,训练型的 ClaudeBot 首爬中位数 4.2 小时,索引型的 OAI-SearchBot 却要 332.8 小时(13.9 天)(https://km.idaeo.ai/ai/ai-crawler-marketing)。你今天修好门,最慢的访客要以“周”为单位才会再路过。复测排程要配合这种节奏:定好固定的复查日,到点就重跑同一套检查,把结果留档,让下次的自己有得比对——而不是第二天没动静就掀桌。

核心教训

量测工具的窗,决定你看见的世界。

仪器上的 0,只证明“仪器开机以后、它的窗内没看到”,不证明“世界上没发生”。边缘看到的、仪器看到的、索引认得的,各是各的账,要分开对。

我们差点用一个 0 说服自己“OpenAI 没来过”。真正该说的是:“在我们的窗内没看到;窗外的事,去边缘查。”这句话比较长,但它才是真的。

所以,下次你想抱怨“AI 都不引用我”之前,先照这份清单走一遍:门有没有自己关上、量测的窗开了多久、柜台报到了没。多数时候,答案不在算法的黑箱里,而在自己家的仪表盘上。

FAQ

仪器显示某只 AI 爬虫 0 造访,可以下“它没来过”的结论吗?
不行。0 只代表“仪器开机后的窗内没看到”。我们实测:origin 仪器显示 OAI-SearchBot=0,Cloudflare 边缘 72 小时真值却是 5 次全 200。先确认仪器开机时间,再到更外层(CDN 边缘)对账。
計測器に AI クローラーの来訪 0 回と表示されています。「来ていない」と結論してよいですか?いけません。0 が意味するのは「計測器の稼働開始後、そのウィンドウ内では見えなかった」ことだけです。私たちの実測では、origin の計測器は OAI-SearchBot=0 でしたが、Cloudflare エッジの 72 時間の真値は 5 回・すべて 200 でした。まず計測器の稼働開始時刻を確認し、その上でより外側の層(CDN エッジ)と突き合わせてください。
The instrument shows 0 visits from an AI crawler. Can I conclude it never came?No. A 0 only means "nothing was seen inside the window after the instrument came online". In our own test, the origin instrument showed OAI-SearchBot = 0, while the Cloudflare edge's 72-hour ground truth was 5 visits, all 200. First confirm when your instrument came online, then reconcile at an outer layer (the CDN edge).
怎么确认 CDN 没有挡 AI 爬虫?
打开设置实查,不要猜。以 Cloudflare 为例,我们逐项检查:ai_bots_protection=disabled、crawler_protection=disabled、无 WAF 拦截规则,才敢说“门全开”。
CDN が AI クローラーを塞いでいないことは、どう確認しますか?設定を開いて実際に確認します。推測は禁物です。Cloudflare の例では、ai_bots_protection=disabled、crawler_protection=disabled、WAF の遮断ルールなし、と一つずつ確認して初めて「門は全開」と言えました。
How do I confirm the CDN is not blocking AI crawlers?Open the settings and check them — do not guess. Taking Cloudflare as an example, we verified item by item: ai_bots_protection=disabled, crawler_protection=disabled, no WAF rules intercepting. Only then did we dare say "the door is fully open".
爬虫都来搬内容了,为什么 Google 还说不认识我的网页?
爬取和索引是分开的账。我们的网站爬虫有到访,但 GSC URL inspection 三页全部回“URL is unknown to Google”。索引状态要用索引层工具查证,不能用爬虫记录推论。
クローラーはコンテンツを持ち出しているのに、なぜ Google は私のページを知らないと言うのですか?クロールとインデックスは別の帳簿です。私たちのサイトにもクローラーは来ていましたが、GSC の URL inspection では 3 ページとも「URL is unknown to Google」が返りました。インデックス状態はインデックス層のツールで検証すべきで、クローラーの記録から推論してはいけません。
Crawlers are hauling my content away — why does Google still say it does not know my pages?Crawling and indexing are separate ledgers. Crawlers did visit our site, yet GSC URL inspection returned "URL is unknown to Google" for all 3 pages. Index status must be verified with index-layer tools, not inferred from crawler logs.
sitemap 提交后回 204,代表成功了吗?
204 只是“受理”,等同收件回执,不是“已收录”。IndexNow 的 200/202 也一样。提交后要回到索引层复查,才能确认收录。
sitemap 送信後に 204 が返りました。成功ということですか?204 は「受理」にすぎず、受領書と同じで、「収録済み」ではありません。IndexNow の 200/202 も同様です。送信後にインデックス層へ戻って再確認して、はじめて収録を確かめられます。
My sitemap submission returned 204 — does that mean it succeeded?A 204 is only "accepted" — the equivalent of a delivery receipt, not "indexed". IndexNow's 200/202 are the same. After submitting, go back and re-check at the index layer to confirm actual indexing.
没提交 sitemap,影响有多大?
以我们自己为例:整个域名 GSC sitemap 清单=0 张(从未提交),对应 28 天曝光 0 次。因果无法证明,但“从未报到”与“零曝光”同时成立,值得最优先修。
sitemap を送信していない影響は、どれくらい大きいですか?私たち自身の例では、ドメイン全体で GSC の sitemap リストは 0 件(未送信)で、対応して 28 日間の表示は 0 回でした。因果は証明できませんが、「一度も受付に行っていない」と「表示ゼロ」が同時に成立しており、最優先で直す価値があります。
How much does never submitting a sitemap matter?In our own case: the entire domain had 0 sitemaps in GSC's list (never submitted), alongside 0 impressions over 28 days. Causation cannot be proven, but "never checked in" and "zero impressions" held at the same time — worth fixing first.
修完多久该复测?
以周为单位。前作实测:索引型的 OAI-SearchBot 首爬中位数 332.8 小时(13.9 天),训练型的 ClaudeBot 是 4.2 小时(https://km.idaeo.ai/ai/ai-crawler-marketing)。第二天没动静是常态,不是失败。
修復後、どれくらいで再テストすべきですか?週単位で考えます。前作の実測では、インデックス型 OAI-SearchBot の初回クロール中央値は 332.8 時間(13.9 日)、学習型 ClaudeBot は 4.2 時間でした(https://km.idaeo.ai/ai/ai-crawler-marketing)。翌日に動きがないのは通常のことで、失敗ではありません。
How soon after fixing things should I re-test?Think in weeks. Our previous article measured a median first crawl of 332.8 hours (13.9 days) for the index-type OAI-SearchBot, versus 4.2 hours for the training-type ClaudeBot (https://km.idaeo.ai/ai/ai-crawler-marketing). No movement the next day is normal, not failure.
这份七步清单适用所有网站吗?
步骤可以套用,数字不能外推。本文全部数字来自单一网站、年轻观测窗(仪器 2026-08-10 07:52 UTC 开机)的实测,属个案实录,不是产业统计。
この 7 ステップの点検リストは、すべてのサイトに当てはまりますか?ステップは流用できますが、数字の外挿はできません。本文の数字はすべて、単一サイト・若い観測ウィンドウ(計測器は 2026-08-10 07:52 UTC 稼働開始)での実測です。個別事例の実録であり、業界統計ではありません。
Does this seven-step checklist apply to every website?The steps can be reused; the numbers cannot be extrapolated. Every number in this article comes from a single website measured through a young observation window (instrument online since 2026-08-10 07:52 UTC). It is a case log, not industry statistics.

引用本文

TK Lin・《网站没被 ChatGPT 引用?我们自己差点误判的七步排查实录》・IDAEO 知識庫・2026-08-11・https://km.idaeo.ai/ai/ai-citation-troubleshooting

更新 2026-08-11T12:20:10.717Z · server-rendered · four-language · IDAEO 知識庫