我們怎麼記這本帳:AI 爬蟲系列的方法論與限制
本站四篇 AI 爬蟲數據文章(3,000 萬次搬貨系列)共用同一本伺服器帳。這一頁把帳本攤開:數字怎麼算、爬蟲身分怎麼驗、哪些數字有已知限制、哪些統計已無法回溯——包含我們自己查出來的三筆帳務更正。查證用的指令一併公開,歡迎重跑。
這一頁是本站 AI 爬蟲系列文章的方法附錄。我們把「帳本怎麼記的」完整攤開,包括查證後發現的三筆帳務更正。原則只有一條:量得到的給指令、量不到的直說。

資料從哪裡來
所有請求數出自我們兩個網站(washinmura.jp 與 idaeo.ai)自己的伺服器資料庫,統計期間 2026-03-03 到 2026-07-24。帳分兩段拼接:2026-06-22 以前來自永久保存的每日彙總表;2026-06-23 到 07-24 來自請求明細表。兩段在 06-22/06-23 切開,無重疊、無漏接。
一個要誠實交代的細節:明細段 06-23 到 07-24 含首尾是 32 個日曆日;文中「30 天」指標沿用系統「30 天滾動視窗」的習稱,不是精確的 30.0 天。
明細表依政策只保留 30 天,之後刪除、只留每日彙總。這帶來一個代價:發布後回頭追查明細的問題,有些已經無法回答——下面第三節就有兩題。

爬蟲身分怎麼驗
爬蟲自報的名字(User-Agent)可以偽造,所以我們把來源 IP 逐一反查 DNS 登記、比對各公司官方公布的網段、查網段的登記歸屬。Apple 的 565 個 IP 全部反查回 applebot.apple.com;OpenAI 三隻爬蟲全部命中官方公布網段;Amazon、Microsoft、Meta 同樣通過。抽樣中發現 1 個從雲端機房冒充 Bytespider 的假來源。

「476 次真人點擊」的判定:只計網頁版瀏覽器帶來路資訊(referrer)的點擊,已剔除我們自家的測試流量。手機 App 內點擊不帶來路、AI 講完答案的零點擊回答不會上門,所以 476 是看得到的下界。
自查更正(誠實帳,持續更新)
第一筆:Common Crawl 收錄數。 原報告寫「1,515 筆收錄、其中 1,089 筆完整頁面正本」,但分項只加得出 1,087。我們重跑公開索引查詢後解帳:正確帳是 1,515 筆收錄、1,100 筆狀態 200 的正本(ainews 734/aeo 333/www 29/另兩個子域各 2),加總與總數零差。舊帳差額的成因:當時查詢遭遇服務中斷掉了部分行、分類時漏了兩個小子域。查證指令:`curl 'https://index.commoncrawl.org/CC-MAIN-2026-25-index?url=*.washinmura.jp&output=json'`。
第二筆:Applebot 的量含重定向。 我們品牌從 washinmura.jp 遷移到 idaeo.ai 後,Applebot 至今仍持續爬舊網址——當前紀錄裡它對舊域的請求 100% 收到 301 轉址回應(1,173 筆全數),再到新域抓實際內容。這代表「Applebot 500 萬次」裡含有對舊域的重定向請求,同一內容可能被計為舊域一筆加新域一筆。爆量期間(6/28 起)的轉址比例已隨日誌輪替無法回溯,我們如實標注這個限制。
第三筆:4.7 次/頁 vs 2.5 次/頁 的樣本數。 這組「人工深度文章 vs 自動生成頁」的對比出自 07-24 當時的 30 天明細,統計當下沒有把樣本數(頁數分母)一起存檔,明細其後已依保留政策刪除——樣本數無法重建,我們不再為它補一個數字。當前窗口的同型統計(真人代抓整體 2.3 次/頁,86,950 次請求、38,530 個網址)因網址結構已改版,與原統計不可直接比較。這組數字在文章中維持「在我們的帳上」的限定表述。

第四筆(2026-08-11):「28 萬句真人問句」更正為「約 2.8 萬句」。〈GSC 沒壞,是客人搬家了〉原寫題庫源自「28 萬句真人問句」;對帳資料庫實表為 28,363 句(2026 年 4 月起蒐集),原數字為十倍誤植,已於全部語言版本更正。發現途徑:全站逐篇評審循環的真值對帳。
已知限制清單
- 單一營運者、兩個網站、五個月:是誠實的個案觀察,不是全行業定律
- 「Google AI」計數是兩種標籤的合併,無法歸因到單一 Google 產品;Google 系點擊混在一般搜尋來路裡,被系統性低估
- 品質與被讀次數是「同時出現」,混雜因素(頁數、頁齡)未完全拆開,不做因果宣稱
- 轉載與零點擊復現在伺服器端不可觀測;可行偵測法是特徵句探針與 Common Crawl 反查
- 「被爬內容約 10–12% 最終被引用」是歷史引用對帳的約數:可觀測範圍內的方向性估計,無精確分母(分母定義隨統計窗變動),不可當轉化率使用。系列文章首次引用處掛本條
- 「內容品質三級」(green/yellow/red)為內部編輯分級:判定維度包含證據掛源密度、口徑完整度、可對帳資產覆蓋度;分級規則屬編輯內規不全文公開,引用該分級的數字時應視為站內相對比較,非外部可重算指標
- 同站姊妹篇之間的同名指標可能來自不同統計窗(例:sitemap 30 天抓取數 32,993 與 33,155 分屬兩篇的統計時點)——遇數字不一致,以各篇標注的統計窗為準,差異不代表帳錯
- 「訓練爬蟲是 AI 流量的地基」是機制推斷,不是量測結論:訓練到日後引用的因果段在伺服器端不可觀測。文中以三項實測旁證支撐方向(訓練爬蟲最早抵達、抓取廣度優先且三語均衡、內容流入公共訓練語料),不宣稱已證明因果
資料下載(可對帳彙總包)
與其只給指令,不如把帳本給你。我們公開了兩份去識別化的聚合資料:逐日×爬蟲的請求數(crawler-daily.csv,2026-03-03 起全量)與逐日×AI 來源的真人點擊(referrals-daily.csv)。欄位定義、SHA-256 雜湊、產出查詢與「與凍結數字的已知差異」都寫在 README——包括聚合口徑與文章凍結值差約 354 萬的成因交代。核心數字從此不只「相信我們」,還能「自己對帳」。另有引用等級實驗包:三輪評審實驗的完整題目與匿名化裁決全文,附校驗碼。
現實檢驗制度(2026-08-10 起)
模擬評審講得再好,都不算數——真實世界的引用才算。從本日起,本站把「現實檢驗」定為站規:每篇文章發布後 30 天與 90 天,回頁公佈它的真實觀測數字(AI 爬蟲觸達與 AI 平台導流點擊,來自本站伺服器觀測,2026-08-10 起記錄)。首批到期表:〈引用來源的五個等級〉2026-09-09(30 天)與 2026-11-08(90 天)。誠實邊界先講:觀測自 2026-08-10 啟用,早於此日的行為不在帳內;導流點擊僅計網頁版可辨識來路,為下界。回填數字會直接寫進對應文章,錯了就照「自查更正」規矩公開修。
利益揭露
本系列全部數據出自 IDAEO 營運者自有站點的伺服器紀錄;IDAEO 提供「讓內容被 AI 正確引用」的相關服務。讀者評估本系列結論時,應知悉此利益關係。數據查證指令已隨文公開,歡迎重跑打臉——我們自己就是這樣找到上面三筆更正的。
FAQ
- 為什麼有些數字說「無法重建」,不補算一個新的?
- 因為明細已依保留政策刪除,補算只能用不同窗口、不同口徑,數字看起來像但不可比。與其給一個似是而非的數,不如標明不可考。
- 「再構築できない」と言う数字を、なぜ計算し直さないのですか? — 明細は保持ポリシーで削除済みです。計算し直すと別のウィンドウ・別の口径になり、似て見えて比較できない数字になります。もっともらしい数を出すより、調べようがないと明記するほうが誠実です。
- Why do some numbers say "cannot be reconstructed" instead of being recalculated? — The details were deleted under the retention policy. A recalculation would use a different window and different definitions — a number that looks similar but is not comparable. Better to mark it unknowable than to publish a plausible fake.
- 1,089 改成 1,100,原文章要改嗎?
- 文章正文當時已迴避引用這兩個數字,不受影響。本頁是把更正的帳完整公開。
- 1,089 が 1,100 に変わりました。元の記事は直すべきですか? — 記事本文は当時からこの2つの数字の引用を避けており、影響はありません。このページは訂正後の帳簿を完全公開するものです。
- 1,089 became 1,100 — do the articles need fixing? — The article text already avoided citing those two figures, so it is unaffected. This page publishes the corrected account in full.
- Applebot 的量含重定向,「500 萬次」還可信嗎?
- 請求發生是真的,但其中含對舊網址的 301 轉址請求,不全是內容抓取。我們無法回溯拆分比例,所以如實標注,讀者應把它讀成「請求量」而非「內容抓取量」。
- Applebot の量がリダイレクトを含むなら、「500万回」はまだ信用できますか? — リクエストの発生は事実ですが、旧URLへの 301 転送要求を含み、すべてが内容取得ではありません。比率は遡って分解できないため、そのまま注記します。「リクエスト量」であって「内容取得量」ではない、と読んでください。
- Applebot's volume includes redirects — is "5 million" still credible? — The requests are real, but they include 301 redirect requests to old URLs, so not all of them are content fetches. We cannot retroactively split the share, so we state it as is: read it as "request volume," not "content-fetch volume."
- 怎麼驗證你們說的話?
- Common Crawl 反查指令已附在文中,任何人可重跑;伺服器內部數據無法公開原始檔,但口徑與表結構已在本頁交代。
- あなたたちの言うことは、どう検証できますか? — Common Crawl の照会コマンドは本文に付してあり、誰でも再実行できます。サーバー内部データの生ファイルは公開できませんが、口径とテーブル構造はこのページで説明しています。
- How can I verify what you claim? — The Common Crawl lookup command is in the text, and anyone can rerun it. The internal server data cannot be released raw, but the definitions and table structure are described on this page.
- 什麼是「優先引用源」?跟「部分引用」差在哪?
- 這是本站評審框架的分級,模擬 AI 答案引擎挑來源的行為,不是行業標準術語。部分引用=AI 願意引你,但只挑安全的句子、還要加「據該站自稱」的防衛限定;優先引用源=同一題目多個來源可選時,AI 排你在前面——因為口徑清楚、限制自己標了、數據可對帳,引用你不用替你打折。分級結果仍屬模擬評審,真實引用以引用點擊帳驗證。
- 「優先引用ソース」とは何ですか?「部分引用」とどう違いますか? — これは本サイトの評価フレームワークの等級で、AI答案エンジンがソースを選ぶ振る舞いを模擬したものです——業界標準の用語ではありません。部分引用=AIはあなたを引用するが、安全な文だけを選び、「同サイトの自称によれば」という防衛的な限定を付ける。優先引用ソース=同じテーマで複数のソースから選べるとき、AIがあなたを前に並べる——口径が明確で、限界を自ら記し、データが照合可能だから、引用時に割り引く必要がないのです。等級の結果はあくまで模擬評価であり、実際の引用は引用クリックの帳簿で検証します。
- What is a "preferred citation source," and how does it differ from "partial citation"? — These are tiers from our own review framework, which simulates how AI answer engines pick sources — they are not industry-standard terms. Partial citation = the AI is willing to cite you, but picks only the safest sentences and adds defensive qualifiers like "according to the site's own account." Preferred citation source = when multiple sources compete on the same topic, the AI ranks you first — because your definitions are clear, your limits are self-declared and your data can be audited, citing you requires no discount. Tier results are still a simulated review; real citation is verified against the referral-click ledger.
- 這一頁會更新嗎?
- 會。發現新的帳務問題就補進「自查更正」,每次更新標日期。
- このページは更新されますか? — はい。新しい帳簿の問題が見つかるたびに「自己監査訂正」に追記し、更新ごとに日付を記します。
- Will this page be updated? — Yes. New bookkeeping issues will be added to "self-audit corrections," and each update will be dated.
來源錨定
- AI 爬蟲流量是聲量:3,000 萬次,帶來 476 次真人點擊 · https://km.idaeo.ai/ai/ai-crawler-shop-ledger
- IDAEO 數據專欄第一課:語言決定命運 · https://km.idaeo.ai/ai/visibility-lesson-1
- IDAEO 數據專欄第二課:AI 的信任是一階一階堆出來的 · https://km.idaeo.ai/ai/visibility-lesson-2
- 沒有 AI 聲量,AI 就永遠不會推薦你 · https://km.idaeo.ai/ai/ai-crawler-marketing
- Common Crawl 公開索引 · https://index.commoncrawl.org/
引用本文
TK Lin・《我們怎麼記這本帳:AI 爬蟲系列的方法論與限制》・IDAEO 知識庫・2026-08-10・https://km.idaeo.ai/reports/crawler-methodology