km.idaeo.ai · IDAEO 知識庫

🏛 本文屬於主題館「ai」

網站沒被 ChatGPT 引用?我們自己差點誤判的七步排查實錄

我們的儀器顯示 OAI-SearchBot 造訪 0 次,差點誤判成「OpenAI 沒來過」。到邊緣對帳才發現是時間窗假象。本文是第一人稱排查實錄,附七步清單與全部原始數字。

限制先講

  • 我們的自建儀器 2026-08-10 07:52 UTC 才開機,樣本非常年輕。儀器內的數字,只代表開機之後的世界。
  • 邊緣對帳用的是 Cloudflare GraphQL 的 72 小時窗。窗外的事,這次沒看。
  • 這是單一網站的實錄,不是產業統計。清單可以套用,數字不能外推。
  • sitemap 回報 204 是「受理」,不是「已收錄」。IndexNow 的 200/202 同樣只是收件回條。

一個 0,差點寫進報告

事情從一個 0 開始。

我們替自家網站建了一套 origin 儀器,記錄每一筆爬蟲到訪。打開一看:OAI-SearchBot——OpenAI 替 ChatGPT 搜尋做索引的爬蟲——0 次。

第一反應很自然:「OpenAI 根本沒來過,難怪 ChatGPT 不引用我們。」這句話差一點寫進正式報告。

還好我們多做了一步:去 Cloudflare 邊緣拉 GraphQL 的 72 小時真值對帳。結果完全翻案——

  • OAI-SearchBot:5 次,全部 200(成功取走內容)
  • GPTBot:10 次
  • Claude 系:6 次(ClaudeBot 1+Claude-User 2+anthropic 3)
  • Amazonbot:151 次
  • meta-external:423 次

人家不但來過,還每次都拿到了東西。那個 0 是怎麼回事?答案很不體面:儀器 08-10 才開機,OAI-SearchBot 的到訪發生在開機之前。

打個比方:你半夜才裝好門口的攝影機,隔天早上看回放,然後宣布「郵差從來沒來過我們家」。攝影機沒壞,是你的觀測窗太短。

事後回想,這種錯特別容易犯,原因很諷刺:儀器是我們自己建的,所以我們最信任它。越是自己親手做的工具,越容易忘記先問一句:「它是從什麼時候開始看的?」

誤判的代價也不便宜。如果那句「OpenAI 沒來過」真的寫進報告,接下來的藥方全會開錯:去改內容、去調標題、去怪演算法——而真正的問題,其實出在我們自己讀錯了儀表板。

這次差點誤判,逼我們把整套流程寫成清單。以下七步,是我們自己走過、每步都有實跑證據的版本。順序有講究:由外而內、由便宜到昂貴,前面的步驟不過關,後面的結論都不成立。

七步排查清單

第一步:robots.txt 有沒有把人擋在門外。 最便宜的檢查最先做。打開 robots.txt,逐行看有沒有 Disallow 到 AI 爬蟲。要逐字讀,不要瞄過去:擋的是誰、擋到哪個路徑、有沒有整站全擋。這一步我們過了。但很多網站在這裡就出局——多年前請人架站時留下的一行設定,等於自己貼了「謝絕推銷」,再抱怨沒人上門。

第二步:CDN/邊緣有沒有替你擋。實查設定,不要用猜的。 就算 robots.txt 開門,CDN 可能在你不知道的地方關門。近年各家 CDN 陸續推出「AI 爬蟲防護」類功能,有的預設值會隨版本改變,有的是代管商好意替你打開的——你自己完全不知情。我們實查 Cloudflare 設定:ai_bots_protection=disabled、crawler_protection=disabled、沒有 WAF 攔截規則——門全開。重點不是我們的結果,是方法:這一步必須打開設定頁或打 API 實查。「我記得沒開」不算證據。

第三步:邊緣 vs 自家儀器對帳。時間窗陷阱就在這。 這是我們摔跤的那一步。同一個網站,origin 儀器說 0,邊緣說 5 次全 200。沒有誰說謊——它們量的是不同時間、不同位置。實務做法:對帳之前,先把「我的儀器幾點開機」「邊緣的查詢窗多長」白紙黑字寫下來,再去拉數字。這些「窗」沒先寫下來,任何比較都是錯的;寫下來之後,多半連對帳都不用做,你就先看見自己的洞。

第四步:索引層查證。爬過,不等於認識你。 爬蟲來過,只代表內容被搬走;搜尋引擎的索引認不認識你,是另一本帳。這就像書店:有人進店翻過書,和這本書有沒有登進圖書館的總目錄,是不相干的事。我們拿三頁去 Google Search Console 做 URL inspection,三頁全部回「URL is unknown to Google」。也就是說,在 Google 的索引層,我們等於不存在——和爬蟲有沒有來,得分開查。

第五步:sitemap 是不是「真的」提交過。 再往下挖,更不體面的真相:整個網域在 GSC 的 sitemap 清單=0 張,從來沒提交過。對應的結果是 28 天曝光 0 次。我們一直以為「上線了就會被看見」,事實是我們從來沒去櫃檯報到。這裡的關鍵字是「真的」:不要問記憶,去後台把提交清單打開看。修復當天做完:六張 sitemap 提交,全部回 204 受理;IndexNow 也發了,回 200/202。再提醒:受理是收件,不是收錄。

第六步:外部提及量。別人有沒有談論你。 AI 引用不只看你家門口的路通不通,也看外面有沒有人提到你。別人的文章有沒有連過來、產業名錄有沒有收錄你、社群裡有沒有人談起你——這些都是 AI 判斷「這個來源值不值得引」的旁證。這一步在本次窗內我們沒有新數字,只有前作帳本的定性提醒:五個月 roughly 30 million 次爬取,只對應 476 次真人點擊(可見下限)(https://km.idaeo.ai/ai/ai-crawler-shop-ledger)。被搬走很多,不代表被談論、被引用。

第七步:定期探測複測。一次排查只是一張快照。 排查不是做完就結案。索引型爬蟲的節奏以週計:前作實測,訓練型的 ClaudeBot 首爬中位 4.2 小時,索引型的 OAI-SearchBot 卻要 332.8 小時(13.9 天)(https://km.idaeo.ai/ai/ai-crawler-marketing)。你今天修好門,最慢的訪客要以「週」為單位才會再路過。複測排程要配合這種節奏:定好固定的複查日,到點就重跑同一套檢查,把結果留檔,讓下次的自己有得比對——而不是隔天沒動靜就翻桌。

核心教訓

量測工具的窗,決定你看見的世界。

儀器上的 0,只證明「儀器開機以後、它的窗內沒看到」,不證明「世界上沒發生」。邊緣看到的、儀器看到的、索引認得的,各是各的帳,要分開對。

我們差點用一個 0 說服自己「OpenAI 沒來過」。真正該說的是:「在我們的窗內沒看到;窗外的事,去邊緣查。」這句話比較長,但它才是真的。

所以,下次你想抱怨「AI 都不引用我」之前,先照這份清單走一遍:門有沒有自己關上、量測的窗開了多久、櫃檯報到了沒。多數時候,答案不在演算法的黑箱裡,而在自己家的儀表板上。

FAQ

儀器顯示某隻 AI 爬蟲 0 造訪,可以下「它沒來過」的結論嗎?
不行。0 只代表「儀器開機後的窗內沒看到」。我們實測:origin 儀器顯示 OAI-SearchBot=0,Cloudflare 邊緣 72 小時真值卻是 5 次全 200。先確認儀器開機時間,再到更外層(CDN 邊緣)對帳。
計測器に AI クローラーの来訪 0 回と表示されています。「来ていない」と結論してよいですか?いけません。0 が意味するのは「計測器の稼働開始後、そのウィンドウ内では見えなかった」ことだけです。私たちの実測では、origin の計測器は OAI-SearchBot=0 でしたが、Cloudflare エッジの 72 時間の真値は 5 回・すべて 200 でした。まず計測器の稼働開始時刻を確認し、その上でより外側の層(CDN エッジ)と突き合わせてください。
The instrument shows 0 visits from an AI crawler. Can I conclude it never came?No. A 0 only means "nothing was seen inside the window after the instrument came online". In our own test, the origin instrument showed OAI-SearchBot = 0, while the Cloudflare edge's 72-hour ground truth was 5 visits, all 200. First confirm when your instrument came online, then reconcile at an outer layer (the CDN edge).
怎麼確認 CDN 沒有擋 AI 爬蟲?
打開設定實查,不要猜。以 Cloudflare 為例,我們逐項檢查:ai_bots_protection=disabled、crawler_protection=disabled、無 WAF 攔截規則,才敢說「門全開」。
CDN が AI クローラーを塞いでいないことは、どう確認しますか?設定を開いて実際に確認します。推測は禁物です。Cloudflare の例では、ai_bots_protection=disabled、crawler_protection=disabled、WAF の遮断ルールなし、と一つずつ確認して初めて「門は全開」と言えました。
How do I confirm the CDN is not blocking AI crawlers?Open the settings and check them — do not guess. Taking Cloudflare as an example, we verified item by item: ai_bots_protection=disabled, crawler_protection=disabled, no WAF rules intercepting. Only then did we dare say "the door is fully open".
爬蟲都來搬內容了,為什麼 Google 還說不認識我的網頁?
爬取和索引是分開的帳。我們的網站爬蟲有到訪,但 GSC URL inspection 三頁全部回「URL is unknown to Google」。索引狀態要用索引層工具查證,不能用爬蟲紀錄推論。
クローラーはコンテンツを持ち出しているのに、なぜ Google は私のページを知らないと言うのですか?クロールとインデックスは別の帳簿です。私たちのサイトにもクローラーは来ていましたが、GSC の URL inspection では 3 ページとも「URL is unknown to Google」が返りました。インデックス状態はインデックス層のツールで検証すべきで、クローラーの記録から推論してはいけません。
Crawlers are hauling my content away — why does Google still say it does not know my pages?Crawling and indexing are separate ledgers. Crawlers did visit our site, yet GSC URL inspection returned "URL is unknown to Google" for all 3 pages. Index status must be verified with index-layer tools, not inferred from crawler logs.
sitemap 提交後回 204,代表成功了嗎?
204 只是「受理」,等同收件回條,不是「已收錄」。IndexNow 的 200/202 也一樣。提交後要回到索引層複查,才能確認收錄。
sitemap 送信後に 204 が返りました。成功ということですか?204 は「受理」にすぎず、受領書と同じで、「収録済み」ではありません。IndexNow の 200/202 も同様です。送信後にインデックス層へ戻って再確認して、はじめて収録を確かめられます。
My sitemap submission returned 204 — does that mean it succeeded?A 204 is only "accepted" — the equivalent of a delivery receipt, not "indexed". IndexNow's 200/202 are the same. After submitting, go back and re-check at the index layer to confirm actual indexing.
沒提交 sitemap,影響有多大?
以我們自己為例:整個網域 GSC sitemap 清單=0 張(從未提交),對應 28 天曝光 0 次。因果無法證明,但「從未報到」與「零曝光」同時成立,值得最優先修。
sitemap を送信していない影響は、どれくらい大きいですか?私たち自身の例では、ドメイン全体で GSC の sitemap リストは 0 件(未送信)で、対応して 28 日間の表示は 0 回でした。因果は証明できませんが、「一度も受付に行っていない」と「表示ゼロ」が同時に成立しており、最優先で直す価値があります。
How much does never submitting a sitemap matter?In our own case: the entire domain had 0 sitemaps in GSC's list (never submitted), alongside 0 impressions over 28 days. Causation cannot be proven, but "never checked in" and "zero impressions" held at the same time — worth fixing first.
修完多久該複測?
以週為單位。前作實測:索引型的 OAI-SearchBot 首爬中位 332.8 小時(13.9 天),訓練型的 ClaudeBot 是 4.2 小時(https://km.idaeo.ai/ai/ai-crawler-marketing)。隔天沒動靜是常態,不是失敗。
修復後、どれくらいで再テストすべきですか?週単位で考えます。前作の実測では、インデックス型 OAI-SearchBot の初回クロール中央値は 332.8 時間(13.9 日)、学習型 ClaudeBot は 4.2 時間でした(https://km.idaeo.ai/ai/ai-crawler-marketing)。翌日に動きがないのは通常のことで、失敗ではありません。
How soon after fixing things should I re-test?Think in weeks. Our previous article measured a median first crawl of 332.8 hours (13.9 days) for the index-type OAI-SearchBot, versus 4.2 hours for the training-type ClaudeBot (https://km.idaeo.ai/ai/ai-crawler-marketing). No movement the next day is normal, not failure.
這份七步清單適用所有網站嗎?
步驟可以套用,數字不能外推。本文全部數字來自單一網站、年輕觀測窗(儀器 2026-08-10 07:52 UTC 開機)的實測,屬個案實錄,不是產業統計。
この 7 ステップの点検リストは、すべてのサイトに当てはまりますか?ステップは流用できますが、数字の外挿はできません。本文の数字はすべて、単一サイト・若い観測ウィンドウ(計測器は 2026-08-10 07:52 UTC 稼働開始)での実測です。個別事例の実録であり、業界統計ではありません。
Does this seven-step checklist apply to every website?The steps can be reused; the numbers cannot be extrapolated. Every number in this article comes from a single website measured through a young observation window (instrument online since 2026-08-10 07:52 UTC). It is a case log, not industry statistics.

引用本文

TK Lin・《網站沒被 ChatGPT 引用?我們自己差點誤判的七步排查實錄》・IDAEO 知識庫・2026-08-11・https://km.idaeo.ai/ai/ai-citation-troubleshooting

更新 2026-08-11T12:20:10.717Z · server-rendered · four-language · IDAEO 知識庫