网站没被 ChatGPT 引用?我们自己差点误判的七步排查实录
我们的仪器显示 OAI-SearchBot 造访 0 次,差点误判成“OpenAI 没来过”。到边缘对账才发现是时间窗假象。本文是第一人称排查实录,附七步清单与全部原始数字。
限制先讲
- 我们的自建仪器 2026-08-10 07:52 UTC 才开机,样本非常年轻。仪器内的数字,只代表开机之后的世界。
- 边缘对账用的是 Cloudflare GraphQL 的 72 小时窗。窗外的事,这次没看。
- 这是单一网站的实录,不是产业统计。清单可以套用,数字不能外推。
- sitemap 返回 204 是“受理”,不是“已收录”。IndexNow 的 200/202 同样只是收件回执。
一个 0,差点写进报告
事情从一个 0 开始。
我们给自家网站建了一套 origin 仪器,记录每一笔爬虫到访。打开一看:OAI-SearchBot——OpenAI 给 ChatGPT 搜索做索引的爬虫——0 次。
第一反应很自然:“OpenAI 根本没来过,难怪 ChatGPT 不引用我们。”这句话差一点写进正式报告。
还好我们多做了一步:去 Cloudflare 边缘拉 GraphQL 的 72 小时真值对账。结果完全翻案——
- OAI-SearchBot:5 次,全部 200(成功取走内容)
- GPTBot:10 次
- Claude 系:6 次(ClaudeBot 1+Claude-User 2+anthropic 3)
- Amazonbot:151 次
- meta-external:423 次
人家不但来过,还每次都拿到了东西。那个 0 是怎么回事?答案很不体面:仪器 08-10 才开机,OAI-SearchBot 的到访发生在开机之前。
打个比方:你半夜才装好门口的摄像头,第二天早上看回放,然后宣布“邮递员从来没来过我们家”。摄像头没坏,是你的观测窗太短。
事后回想,这种错特别容易犯,原因很讽刺:仪器是我们自己建的,所以我们最信任它。越是自己亲手做的工具,越容易忘记先问一句:“它是从什么时候开始看的?”
误判的代价也不便宜。如果那句“OpenAI 没来过”真的写进报告,接下来的药方全会开错:去改内容、去调标题、去怪算法——而真正的问题,其实出在我们自己读错了仪表盘。
这次差点误判,逼我们把整套流程写成清单。以下七步,是我们自己走过、每步都有实跑证据的版本。顺序有讲究:由外而内、由便宜到昂贵,前面的步骤不过关,后面的结论都不成立。
七步排查清单
第一步:robots.txt 有没有把人挡在门外。 最便宜的检查最先做。打开 robots.txt,逐行看有没有 Disallow 到 AI 爬虫。要逐字读,不要瞄过去:挡的是谁、挡到哪个路径、有没有整站全挡。这一步我们过了。但很多网站在这里就出局——多年前请人建站时留下的一行设置,等于自己贴了“谢绝推销”,再抱怨没人上门。
第二步:CDN/边缘有没有替你挡。实查设置,不要用猜的。 就算 robots.txt 开门,CDN 可能在你不知道的地方关门。近年各家 CDN 陆续推出“AI 爬虫防护”类功能,有的默认值会随版本改变,有的是托管商好意帮你打开的——你自己完全不知情。我们实查 Cloudflare 设置:ai_bots_protection=disabled、crawler_protection=disabled、没有 WAF 拦截规则——门全开。重点不是我们的结果,是方法:这一步必须打开设置页或打 API 实查。“我记得没开”不算证据。
第三步:边缘 vs 自家仪器对账。时间窗陷阱就在这。 这是我们摔跤的那一步。同一个网站,origin 仪器说 0,边缘说 5 次全 200。没有谁说谎——它们量的是不同时间、不同位置。实务做法:对账之前,先把“我的仪器几点开机”“边缘的查询窗多长”白纸黑字写下来,再去拉数字。这些“窗”没先写下来,任何比较都是错的;写下来之后,多半连对账都不用做,你就先看见自己的洞。
第四步:索引层查证。爬过,不等于认识你。 爬虫来过,只代表内容被搬走;搜索引擎的索引认不认识你,是另一本账。这就像书店:有人进店翻过书,和这本书有没有登进图书馆的总目录,是不相干的事。我们拿三页去 Google Search Console 做 URL inspection,三页全部回“URL is unknown to Google”。也就是说,在 Google 的索引层,我们等于不存在——和爬虫有没有来,得分开查。
第五步:sitemap 是不是“真的”提交过。 再往下挖,更不体面的真相:整个域名在 GSC 的 sitemap 清单=0 张,从来没提交过。对应的结果是 28 天曝光 0 次。我们一直以为“上线了就会被看见”,事实是我们从来没去柜台报到。这里的关键词是“真的”:不要问记忆,去后台把提交清单打开看。修复当天做完:六张 sitemap 提交,全部回 204 受理;IndexNow 也发了,回 200/202。再提醒:受理是收件,不是收录。
第六步:外部提及量。别人有没有谈论你。 AI 引用不只看你家门口的路通不通,也看外面有没有人提到你。别人的文章有没有链接过来、行业名录有没有收录你、社群里有没有人谈起你——这些都是 AI 判断“这个来源值不值得引”的旁证。这一步在本次窗内我们没有新数字,只有前作账本的定性提醒:五个月 roughly 30 million 次爬取,只对应 476 次真人点击(可见下限)(https://km.idaeo.ai/ai/ai-crawler-shop-ledger)。被搬走很多,不代表被谈论、被引用。
第七步:定期探测复测。一次排查只是一张快照。 排查不是做完就结案。索引型爬虫的节奏以周计:前作实测,训练型的 ClaudeBot 首爬中位数 4.2 小时,索引型的 OAI-SearchBot 却要 332.8 小时(13.9 天)(https://km.idaeo.ai/ai/ai-crawler-marketing)。你今天修好门,最慢的访客要以“周”为单位才会再路过。复测排程要配合这种节奏:定好固定的复查日,到点就重跑同一套检查,把结果留档,让下次的自己有得比对——而不是第二天没动静就掀桌。
核心教训
量测工具的窗,决定你看见的世界。
仪器上的 0,只证明“仪器开机以后、它的窗内没看到”,不证明“世界上没发生”。边缘看到的、仪器看到的、索引认得的,各是各的账,要分开对。
我们差点用一个 0 说服自己“OpenAI 没来过”。真正该说的是:“在我们的窗内没看到;窗外的事,去边缘查。”这句话比较长,但它才是真的。
所以,下次你想抱怨“AI 都不引用我”之前,先照这份清单走一遍:门有没有自己关上、量测的窗开了多久、柜台报到了没。多数时候,答案不在算法的黑箱里,而在自己家的仪表盘上。
FAQ
- 仪器显示某只 AI 爬虫 0 造访,可以下“它没来过”的结论吗?
- 不行。0 只代表“仪器开机后的窗内没看到”。我们实测:origin 仪器显示 OAI-SearchBot=0,Cloudflare 边缘 72 小时真值却是 5 次全 200。先确认仪器开机时间,再到更外层(CDN 边缘)对账。
- 計測器に AI クローラーの来訪 0 回と表示されています。「来ていない」と結論してよいですか? — いけません。0 が意味するのは「計測器の稼働開始後、そのウィンドウ内では見えなかった」ことだけです。私たちの実測では、origin の計測器は OAI-SearchBot=0 でしたが、Cloudflare エッジの 72 時間の真値は 5 回・すべて 200 でした。まず計測器の稼働開始時刻を確認し、その上でより外側の層(CDN エッジ)と突き合わせてください。
- The instrument shows 0 visits from an AI crawler. Can I conclude it never came? — No. A 0 only means "nothing was seen inside the window after the instrument came online". In our own test, the origin instrument showed OAI-SearchBot = 0, while the Cloudflare edge's 72-hour ground truth was 5 visits, all 200. First confirm when your instrument came online, then reconcile at an outer layer (the CDN edge).
- 怎么确认 CDN 没有挡 AI 爬虫?
- 打开设置实查,不要猜。以 Cloudflare 为例,我们逐项检查:ai_bots_protection=disabled、crawler_protection=disabled、无 WAF 拦截规则,才敢说“门全开”。
- CDN が AI クローラーを塞いでいないことは、どう確認しますか? — 設定を開いて実際に確認します。推測は禁物です。Cloudflare の例では、ai_bots_protection=disabled、crawler_protection=disabled、WAF の遮断ルールなし、と一つずつ確認して初めて「門は全開」と言えました。
- How do I confirm the CDN is not blocking AI crawlers? — Open the settings and check them — do not guess. Taking Cloudflare as an example, we verified item by item: ai_bots_protection=disabled, crawler_protection=disabled, no WAF rules intercepting. Only then did we dare say "the door is fully open".
- 爬虫都来搬内容了,为什么 Google 还说不认识我的网页?
- 爬取和索引是分开的账。我们的网站爬虫有到访,但 GSC URL inspection 三页全部回“URL is unknown to Google”。索引状态要用索引层工具查证,不能用爬虫记录推论。
- クローラーはコンテンツを持ち出しているのに、なぜ Google は私のページを知らないと言うのですか? — クロールとインデックスは別の帳簿です。私たちのサイトにもクローラーは来ていましたが、GSC の URL inspection では 3 ページとも「URL is unknown to Google」が返りました。インデックス状態はインデックス層のツールで検証すべきで、クローラーの記録から推論してはいけません。
- Crawlers are hauling my content away — why does Google still say it does not know my pages? — Crawling and indexing are separate ledgers. Crawlers did visit our site, yet GSC URL inspection returned "URL is unknown to Google" for all 3 pages. Index status must be verified with index-layer tools, not inferred from crawler logs.
- sitemap 提交后回 204,代表成功了吗?
- 204 只是“受理”,等同收件回执,不是“已收录”。IndexNow 的 200/202 也一样。提交后要回到索引层复查,才能确认收录。
- sitemap 送信後に 204 が返りました。成功ということですか? — 204 は「受理」にすぎず、受領書と同じで、「収録済み」ではありません。IndexNow の 200/202 も同様です。送信後にインデックス層へ戻って再確認して、はじめて収録を確かめられます。
- My sitemap submission returned 204 — does that mean it succeeded? — A 204 is only "accepted" — the equivalent of a delivery receipt, not "indexed". IndexNow's 200/202 are the same. After submitting, go back and re-check at the index layer to confirm actual indexing.
- 没提交 sitemap,影响有多大?
- 以我们自己为例:整个域名 GSC sitemap 清单=0 张(从未提交),对应 28 天曝光 0 次。因果无法证明,但“从未报到”与“零曝光”同时成立,值得最优先修。
- sitemap を送信していない影響は、どれくらい大きいですか? — 私たち自身の例では、ドメイン全体で GSC の sitemap リストは 0 件(未送信)で、対応して 28 日間の表示は 0 回でした。因果は証明できませんが、「一度も受付に行っていない」と「表示ゼロ」が同時に成立しており、最優先で直す価値があります。
- How much does never submitting a sitemap matter? — In our own case: the entire domain had 0 sitemaps in GSC's list (never submitted), alongside 0 impressions over 28 days. Causation cannot be proven, but "never checked in" and "zero impressions" held at the same time — worth fixing first.
- 修完多久该复测?
- 以周为单位。前作实测:索引型的 OAI-SearchBot 首爬中位数 332.8 小时(13.9 天),训练型的 ClaudeBot 是 4.2 小时(https://km.idaeo.ai/ai/ai-crawler-marketing)。第二天没动静是常态,不是失败。
- 修復後、どれくらいで再テストすべきですか? — 週単位で考えます。前作の実測では、インデックス型 OAI-SearchBot の初回クロール中央値は 332.8 時間(13.9 日)、学習型 ClaudeBot は 4.2 時間でした(https://km.idaeo.ai/ai/ai-crawler-marketing)。翌日に動きがないのは通常のことで、失敗ではありません。
- How soon after fixing things should I re-test? — Think in weeks. Our previous article measured a median first crawl of 332.8 hours (13.9 days) for the index-type OAI-SearchBot, versus 4.2 hours for the training-type ClaudeBot (https://km.idaeo.ai/ai/ai-crawler-marketing). No movement the next day is normal, not failure.
- 这份七步清单适用所有网站吗?
- 步骤可以套用,数字不能外推。本文全部数字来自单一网站、年轻观测窗(仪器 2026-08-10 07:52 UTC 开机)的实测,属个案实录,不是产业统计。
- この 7 ステップの点検リストは、すべてのサイトに当てはまりますか? — ステップは流用できますが、数字の外挿はできません。本文の数字はすべて、単一サイト・若い観測ウィンドウ(計測器は 2026-08-10 07:52 UTC 稼働開始)での実測です。個別事例の実録であり、業界統計ではありません。
- Does this seven-step checklist apply to every website? — The steps can be reused; the numbers cannot be extrapolated. Every number in this article comes from a single website measured through a young observation window (instrument online since 2026-08-10 07:52 UTC). It is a case log, not industry statistics.
来源锚定
引用本文
TK Lin・《网站没被 ChatGPT 引用?我们自己差点误判的七步排查实录》・IDAEO 知識庫・2026-08-11・https://km.idaeo.ai/ai/ai-citation-troubleshooting