# AI 爬蟲系列 · 可對帳彙總包（crawler-shop-ledger evidence pack）

發布：2026-08-10｜來源：IDAEO 營運者自有站點（washinmura.jp／idaeo.ai）伺服器資料庫｜授權：CC BY 4.0（引用請註明出處）

## 檔案與雜湊（SHA-256）

| 檔案 | 內容 | 雜湊 |
|---|---|---|
| crawler-daily.csv | 逐日 × 爬蟲的請求聚合（2026-03-03 → 2026-08-09，34 個爬蟲標籤，2,282 列） | `161c8c14cc58d8e8208245a691bfc19c30e0fbe4d4032903be2a238a7c5fde43` |
| referrals-daily.csv | 逐日 × AI 來源的真人引用點擊（2026-04-15 →，已排除合成測試流量，199 列） | `b06d16027afae81b3345f9b0df92eaed23a350e35ef05060e389f52e658bf002` |

## 欄位定義

**crawler-daily.csv**
- `day`：日期（伺服器時區聚合日）
- `bot`：爬蟲標籤（由 User-Agent 分類器映射；同公司可能有多個標籤，如 GPTBot／OAI-SearchBot／ChatGPT 分列）
- `visit_count`：該日該爬蟲的請求數（HTTP 請求次數，非去重頁面數；含重定向請求）
- `unique_urls`：該日該爬蟲觸及的不重複網址數

**referrals-daily.csv**
- `day`：日期
- `ai_source`：帶來點擊的 AI 平台（chatgpt／copilot／gemini／perplexity／claude 等，依 referrer 判定）
- `clicks`：該日該來源的真人點擊數（僅網頁版 referrer 可辨識者；App 內點擊與零點擊回答不可觀測）

## 口徑說明與已知差異（誠實帳，發布數字以文章凍結值為準）

1. **與文章「約 3,000 萬次」的差異**：文章全歷史＝當時「日聚合表（≤06-22）＋30 天明細表（06-23→07-24）」兩段拼接（≈2,985 萬）；明細段已依 30 天保留政策刪除。本包 crawler-daily.csv 為系統日聚合表全量，至 07-24 加總為 26,309,961——與凍結值差約 354 萬，成因是聚合口徑與明細口徑的爬蟲覆蓋面不同。本表適合檢驗趨勢與相對量，不能逐字重現凍結總數。
2. **與文章「476 次」的差異**：本包 referrals-daily.csv 至 07-24 加總為 481；文章凍結值 476 為當時查詢時點的計數。差 5 筆屬事後補錄。
3. 爬蟲身分驗真方法、三筆自查更正、其餘限制見方法論頁：https://km.idaeo.ai/reports/crawler-methodology

## 產出查詢（可對照重跑）

```sql
-- crawler-daily.csv
SELECT day::date AS day, bot, visit_count, unique_urls FROM bot_visits_daily ORDER BY 1,2;
-- referrals-daily.csv
SELECT visited_at::date AS day, ai_source, count(*) AS clicks
FROM ai_referrer_visits WHERE NOT is_synthetic GROUP BY 1,2 ORDER BY 1,2;
```

## 補充口徑（2026-08-10 增補：姊妹篇〈沒有 AI 聲量〉引用的數字）

該篇引用的行為誌數字，口徑一併登記於此：`21.8`／`374.6`＝新頁面發布後首次被爬的中位小時數（分別為 GPTBot、Bingbot；以首爬時間計，未被爬到的頁面不在分母）；`97`＝ClaudeBot 陣發期外的日請求中位數；`32,993`＝該篇統計窗的 Bingbot sitemap 30 天抓取數（主文統計窗為 33,155，差異來自統計時點，非帳錯）；`7,873`＝GPTBot 單家對 llms.txt 的 30 天讀取（8,618 為全部爬蟲合計）。品質分級（green/yellow/red）為站內編輯分級，屬相對比較非外部可重算指標。
