# 神秘客第一輪實測（B01 引用稽核・試點）— 2026-08-10
IDAEO 數據專欄《GSC 沒壞，是客人搬家了》證據附件・第三本帳「答案有採用嗎」的第一次真實量測

## 協定（固定、可重跑）
- **題庫**：20 題，全部取自真人問句庫（4,408 條實際查詢），規則寫死＝「specialty=牙醫 且 query 含『推薦』，去重按字典序取前 20」——題目全文見 `mystery-panel-r1.json`
- **模型面 ×2**（版本記錄）：
  1. OpenAI `gpt-5.6-sol`＋實時網路搜尋（Codex CLI 0.147、web_search=live、effort medium）
  2. Anthropic Claude（sonnet）＋WebSearch（Claude Code 環境）
- **提問法**：原句照問＋「請附上你實際參考的來源網址」；每題獨立作答
- **判定**：答案或來源含 `idaeo.ai` 家族網域（site/rank/km/主域）＝引用命中；判定器先過 should-FAIL 探針自驗
- **原始資料**：`mystery-diner-r1-results.json`（40 筆完整答案＋來源網域）

## 結果
| 模型面 | IDAEO 大使館頁被引用 |
|---|---|
| OpenAI gpt-5.6-sol＋live search | **0/20** |
| Claude sonnet＋WebSearch | **0/20** |

**第一輪＝零基線。**這不是失敗，是量測儀器上線的起點讀數（本專欄的鐵則本來就寫著：真引用個位數正常、cited=0 誠實標記）。從今天起，「答案有採用嗎」不再是 NA 的空格，而是一條有起點、可每週重跑的曲線。

## 副產物：這 20 題目前誰在被引用（競爭地景）
best-doctor.com.tw（8 題）、blog.dentco.tw（6 題）、ptt.cc／invisalign.com.tw／成大醫院／unicorndent（各 3 題）、兒牙學會 tapd.org.tw／台大醫院／長庚（各 2 題）——**目錄站、學會與醫院官網是目前的引用霸主**。這就是第三本帳要追趕的對象名單。

## 誠實限制（引用必帶）
1. 兩個模型面是 **CLI／API 環境的代理量測**，非 ChatGPT App／claude.ai 消費者產品本身；產品端有不同的檢索與個人化，結果可能不同。
2. 單一輪、20 題、牙醫「推薦」意圖一類——不可外推到其他題型或科別。
3. 「請附來源」的提問法會提高來源揭露率，此為協定的一部分（量的是「來源清單裡有沒有你」）。
4. 週測固定化之前，月報第三本帳照規則仍標 NA；本輪為 pilot r1。

---
*English summary*: First live round of the citation audit (Ledger 3). Fixed 20-question panel (real dental "recommendation" queries, rule published), two model surfaces (OpenAI gpt-5.6-sol with live web search; Claude sonnet with WebSearch), verbatim asks with "list your sources". Result: IDAEO embassy pages cited 0/20 on both surfaces — an honest zero baseline; the instrument now exists and is rerunnable weekly. Byproduct: the current citation landscape is dominated by directories, dental societies and hospital sites. Surfaces are CLI/API proxies, not the consumer apps; single round; not generalizable beyond this intent class.
