網站沒被 ChatGPT 引用?我們自己差點誤判的七步排查實錄
我們的儀器顯示 OAI-SearchBot 造訪 0 次,差點誤判成「OpenAI 沒來過」。到邊緣對帳才發現是時間窗假象。本文是第一人稱排查實錄,附七步清單與全部原始數字。
限制先講
- 我們的自建儀器 2026-08-10 07:52 UTC 才開機,樣本非常年輕。儀器內的數字,只代表開機之後的世界。
- 邊緣對帳用的是 Cloudflare GraphQL 的 72 小時窗。窗外的事,這次沒看。
- 這是單一網站的實錄,不是產業統計。清單可以套用,數字不能外推。
- sitemap 回報 204 是「受理」,不是「已收錄」。IndexNow 的 200/202 同樣只是收件回條。
一個 0,差點寫進報告
事情從一個 0 開始。
我們替自家網站建了一套 origin 儀器,記錄每一筆爬蟲到訪。打開一看:OAI-SearchBot——OpenAI 替 ChatGPT 搜尋做索引的爬蟲——0 次。
第一反應很自然:「OpenAI 根本沒來過,難怪 ChatGPT 不引用我們。」這句話差一點寫進正式報告。
還好我們多做了一步:去 Cloudflare 邊緣拉 GraphQL 的 72 小時真值對帳。結果完全翻案——
- OAI-SearchBot:5 次,全部 200(成功取走內容)
- GPTBot:10 次
- Claude 系:6 次(ClaudeBot 1+Claude-User 2+anthropic 3)
- Amazonbot:151 次
- meta-external:423 次
人家不但來過,還每次都拿到了東西。那個 0 是怎麼回事?答案很不體面:儀器 08-10 才開機,OAI-SearchBot 的到訪發生在開機之前。
打個比方:你半夜才裝好門口的攝影機,隔天早上看回放,然後宣布「郵差從來沒來過我們家」。攝影機沒壞,是你的觀測窗太短。
事後回想,這種錯特別容易犯,原因很諷刺:儀器是我們自己建的,所以我們最信任它。越是自己親手做的工具,越容易忘記先問一句:「它是從什麼時候開始看的?」
誤判的代價也不便宜。如果那句「OpenAI 沒來過」真的寫進報告,接下來的藥方全會開錯:去改內容、去調標題、去怪演算法——而真正的問題,其實出在我們自己讀錯了儀表板。
這次差點誤判,逼我們把整套流程寫成清單。以下七步,是我們自己走過、每步都有實跑證據的版本。順序有講究:由外而內、由便宜到昂貴,前面的步驟不過關,後面的結論都不成立。
七步排查清單
第一步:robots.txt 有沒有把人擋在門外。 最便宜的檢查最先做。打開 robots.txt,逐行看有沒有 Disallow 到 AI 爬蟲。要逐字讀,不要瞄過去:擋的是誰、擋到哪個路徑、有沒有整站全擋。這一步我們過了。但很多網站在這裡就出局——多年前請人架站時留下的一行設定,等於自己貼了「謝絕推銷」,再抱怨沒人上門。
第二步:CDN/邊緣有沒有替你擋。實查設定,不要用猜的。 就算 robots.txt 開門,CDN 可能在你不知道的地方關門。近年各家 CDN 陸續推出「AI 爬蟲防護」類功能,有的預設值會隨版本改變,有的是代管商好意替你打開的——你自己完全不知情。我們實查 Cloudflare 設定:ai_bots_protection=disabled、crawler_protection=disabled、沒有 WAF 攔截規則——門全開。重點不是我們的結果,是方法:這一步必須打開設定頁或打 API 實查。「我記得沒開」不算證據。
第三步:邊緣 vs 自家儀器對帳。時間窗陷阱就在這。 這是我們摔跤的那一步。同一個網站,origin 儀器說 0,邊緣說 5 次全 200。沒有誰說謊——它們量的是不同時間、不同位置。實務做法:對帳之前,先把「我的儀器幾點開機」「邊緣的查詢窗多長」白紙黑字寫下來,再去拉數字。這些「窗」沒先寫下來,任何比較都是錯的;寫下來之後,多半連對帳都不用做,你就先看見自己的洞。
第四步:索引層查證。爬過,不等於認識你。 爬蟲來過,只代表內容被搬走;搜尋引擎的索引認不認識你,是另一本帳。這就像書店:有人進店翻過書,和這本書有沒有登進圖書館的總目錄,是不相干的事。我們拿三頁去 Google Search Console 做 URL inspection,三頁全部回「URL is unknown to Google」。也就是說,在 Google 的索引層,我們等於不存在——和爬蟲有沒有來,得分開查。
第五步:sitemap 是不是「真的」提交過。 再往下挖,更不體面的真相:整個網域在 GSC 的 sitemap 清單=0 張,從來沒提交過。對應的結果是 28 天曝光 0 次。我們一直以為「上線了就會被看見」,事實是我們從來沒去櫃檯報到。這裡的關鍵字是「真的」:不要問記憶,去後台把提交清單打開看。修復當天做完:六張 sitemap 提交,全部回 204 受理;IndexNow 也發了,回 200/202。再提醒:受理是收件,不是收錄。
第六步:外部提及量。別人有沒有談論你。 AI 引用不只看你家門口的路通不通,也看外面有沒有人提到你。別人的文章有沒有連過來、產業名錄有沒有收錄你、社群裡有沒有人談起你——這些都是 AI 判斷「這個來源值不值得引」的旁證。這一步在本次窗內我們沒有新數字,只有前作帳本的定性提醒:五個月 roughly 30 million 次爬取,只對應 476 次真人點擊(可見下限)(https://km.idaeo.ai/ai/ai-crawler-shop-ledger)。被搬走很多,不代表被談論、被引用。
第七步:定期探測複測。一次排查只是一張快照。 排查不是做完就結案。索引型爬蟲的節奏以週計:前作實測,訓練型的 ClaudeBot 首爬中位 4.2 小時,索引型的 OAI-SearchBot 卻要 332.8 小時(13.9 天)(https://km.idaeo.ai/ai/ai-crawler-marketing)。你今天修好門,最慢的訪客要以「週」為單位才會再路過。複測排程要配合這種節奏:定好固定的複查日,到點就重跑同一套檢查,把結果留檔,讓下次的自己有得比對——而不是隔天沒動靜就翻桌。
核心教訓
量測工具的窗,決定你看見的世界。
儀器上的 0,只證明「儀器開機以後、它的窗內沒看到」,不證明「世界上沒發生」。邊緣看到的、儀器看到的、索引認得的,各是各的帳,要分開對。
我們差點用一個 0 說服自己「OpenAI 沒來過」。真正該說的是:「在我們的窗內沒看到;窗外的事,去邊緣查。」這句話比較長,但它才是真的。
所以,下次你想抱怨「AI 都不引用我」之前,先照這份清單走一遍:門有沒有自己關上、量測的窗開了多久、櫃檯報到了沒。多數時候,答案不在演算法的黑箱裡,而在自己家的儀表板上。
FAQ
- 儀器顯示某隻 AI 爬蟲 0 造訪,可以下「它沒來過」的結論嗎?
- 不行。0 只代表「儀器開機後的窗內沒看到」。我們實測:origin 儀器顯示 OAI-SearchBot=0,Cloudflare 邊緣 72 小時真值卻是 5 次全 200。先確認儀器開機時間,再到更外層(CDN 邊緣)對帳。
- 計測器に AI クローラーの来訪 0 回と表示されています。「来ていない」と結論してよいですか? — いけません。0 が意味するのは「計測器の稼働開始後、そのウィンドウ内では見えなかった」ことだけです。私たちの実測では、origin の計測器は OAI-SearchBot=0 でしたが、Cloudflare エッジの 72 時間の真値は 5 回・すべて 200 でした。まず計測器の稼働開始時刻を確認し、その上でより外側の層(CDN エッジ)と突き合わせてください。
- The instrument shows 0 visits from an AI crawler. Can I conclude it never came? — No. A 0 only means "nothing was seen inside the window after the instrument came online". In our own test, the origin instrument showed OAI-SearchBot = 0, while the Cloudflare edge's 72-hour ground truth was 5 visits, all 200. First confirm when your instrument came online, then reconcile at an outer layer (the CDN edge).
- 怎麼確認 CDN 沒有擋 AI 爬蟲?
- 打開設定實查,不要猜。以 Cloudflare 為例,我們逐項檢查:ai_bots_protection=disabled、crawler_protection=disabled、無 WAF 攔截規則,才敢說「門全開」。
- CDN が AI クローラーを塞いでいないことは、どう確認しますか? — 設定を開いて実際に確認します。推測は禁物です。Cloudflare の例では、ai_bots_protection=disabled、crawler_protection=disabled、WAF の遮断ルールなし、と一つずつ確認して初めて「門は全開」と言えました。
- How do I confirm the CDN is not blocking AI crawlers? — Open the settings and check them — do not guess. Taking Cloudflare as an example, we verified item by item: ai_bots_protection=disabled, crawler_protection=disabled, no WAF rules intercepting. Only then did we dare say "the door is fully open".
- 爬蟲都來搬內容了,為什麼 Google 還說不認識我的網頁?
- 爬取和索引是分開的帳。我們的網站爬蟲有到訪,但 GSC URL inspection 三頁全部回「URL is unknown to Google」。索引狀態要用索引層工具查證,不能用爬蟲紀錄推論。
- クローラーはコンテンツを持ち出しているのに、なぜ Google は私のページを知らないと言うのですか? — クロールとインデックスは別の帳簿です。私たちのサイトにもクローラーは来ていましたが、GSC の URL inspection では 3 ページとも「URL is unknown to Google」が返りました。インデックス状態はインデックス層のツールで検証すべきで、クローラーの記録から推論してはいけません。
- Crawlers are hauling my content away — why does Google still say it does not know my pages? — Crawling and indexing are separate ledgers. Crawlers did visit our site, yet GSC URL inspection returned "URL is unknown to Google" for all 3 pages. Index status must be verified with index-layer tools, not inferred from crawler logs.
- sitemap 提交後回 204,代表成功了嗎?
- 204 只是「受理」,等同收件回條,不是「已收錄」。IndexNow 的 200/202 也一樣。提交後要回到索引層複查,才能確認收錄。
- sitemap 送信後に 204 が返りました。成功ということですか? — 204 は「受理」にすぎず、受領書と同じで、「収録済み」ではありません。IndexNow の 200/202 も同様です。送信後にインデックス層へ戻って再確認して、はじめて収録を確かめられます。
- My sitemap submission returned 204 — does that mean it succeeded? — A 204 is only "accepted" — the equivalent of a delivery receipt, not "indexed". IndexNow's 200/202 are the same. After submitting, go back and re-check at the index layer to confirm actual indexing.
- 沒提交 sitemap,影響有多大?
- 以我們自己為例:整個網域 GSC sitemap 清單=0 張(從未提交),對應 28 天曝光 0 次。因果無法證明,但「從未報到」與「零曝光」同時成立,值得最優先修。
- sitemap を送信していない影響は、どれくらい大きいですか? — 私たち自身の例では、ドメイン全体で GSC の sitemap リストは 0 件(未送信)で、対応して 28 日間の表示は 0 回でした。因果は証明できませんが、「一度も受付に行っていない」と「表示ゼロ」が同時に成立しており、最優先で直す価値があります。
- How much does never submitting a sitemap matter? — In our own case: the entire domain had 0 sitemaps in GSC's list (never submitted), alongside 0 impressions over 28 days. Causation cannot be proven, but "never checked in" and "zero impressions" held at the same time — worth fixing first.
- 修完多久該複測?
- 以週為單位。前作實測:索引型的 OAI-SearchBot 首爬中位 332.8 小時(13.9 天),訓練型的 ClaudeBot 是 4.2 小時(https://km.idaeo.ai/ai/ai-crawler-marketing)。隔天沒動靜是常態,不是失敗。
- 修復後、どれくらいで再テストすべきですか? — 週単位で考えます。前作の実測では、インデックス型 OAI-SearchBot の初回クロール中央値は 332.8 時間(13.9 日)、学習型 ClaudeBot は 4.2 時間でした(https://km.idaeo.ai/ai/ai-crawler-marketing)。翌日に動きがないのは通常のことで、失敗ではありません。
- How soon after fixing things should I re-test? — Think in weeks. Our previous article measured a median first crawl of 332.8 hours (13.9 days) for the index-type OAI-SearchBot, versus 4.2 hours for the training-type ClaudeBot (https://km.idaeo.ai/ai/ai-crawler-marketing). No movement the next day is normal, not failure.
- 這份七步清單適用所有網站嗎?
- 步驟可以套用,數字不能外推。本文全部數字來自單一網站、年輕觀測窗(儀器 2026-08-10 07:52 UTC 開機)的實測,屬個案實錄,不是產業統計。
- この 7 ステップの点検リストは、すべてのサイトに当てはまりますか? — ステップは流用できますが、数字の外挿はできません。本文の数字はすべて、単一サイト・若い観測ウィンドウ(計測器は 2026-08-10 07:52 UTC 稼働開始)での実測です。個別事例の実録であり、業界統計ではありません。
- Does this seven-step checklist apply to every website? — The steps can be reused; the numbers cannot be extrapolated. Every number in this article comes from a single website measured through a young observation window (instrument online since 2026-08-10 07:52 UTC). It is a case log, not industry statistics.
來源錨定
引用本文
TK Lin・《網站沒被 ChatGPT 引用?我們自己差點誤判的七步排查實錄》・IDAEO 知識庫・2026-08-11・https://km.idaeo.ai/ai/ai-citation-troubleshooting