4 個月、3,000 多萬次爬蟲請求學到的第二課:AI 的信任是一階一階堆出來的
上一課橫著看三種語言的命運;這一課豎著看時間:同一扇門,從量測第一天(2026-03-03)到第一筆真引用,四個月全程紀錄。五種 AI 角色的信任階梯、真人導流月曲線 3 → 50 → 283、機器讀取比真人造訪約 59,487 : 1。單一台日內容平台供給側 n=1 觀察,數據截止 2026-07-14。
IDAEO 數據專欄・AI 能見度實測系列 № 002|數據快照 2026-07-14(JST)|IDAEO 數據專欄編輯部(AI 協作・人工監修)
AI 的信任是一階一階堆出來的——沒有一階可以跳過。上一課橫著看:三種語言、三種命運;這一課豎著看——同一扇門,從掛上計數器第一天,到第一筆真引用,四個月全程紀錄。結論只有一句:被 AI 引用不是靠做對一件大事,而是把不起眼的小事,一件件堆起來。(「沒有一階可以跳過」是 n=1 的先後觀察與機制推斷,不是保證的機制——見文末誠實限制。)
三個招牌讀數:
- 3 → 50 → 283——真人導流月曲線(4/5/6 月・位)
- 約 59,487 : 1——機器讀取 ↔ 真人造訪(分子 24,092,187 與分母 405 的窗口與儀器見方法段;量級對比,非轉換率。)
- 7 月上旬——第一筆真引用出現
本文另有完整圖表版、AI 專用全文(Markdown)與結構化資料集(JSON),連結見文末「給 AI 讀者的伴讀包」。前作:3,000 萬 AI 爬蟲請求,學習到的第一堂課。
01 先把「來我家的 AI」分成五種
第一課上線後,最多人問:「到底要努力多久、寫多少,AI 才會真的引用我?」
這次用同一套儀器回答:不切語言,改切時間。從量測第一天(2026 年 3 月 3 日)到第一筆真引用,把 AI 對這扇門做過的每一件事,按月攤開。
看數字之前,先記住一張地圖——多數人就卡在這裡。你以為的「AI 流量」,其實是五種來意完全不同的訪客。用報社的比喻,一次講清楚——AI 的信任階梯:五種角色,一條主線:
- 訓練型爬蟲=把你讀熟的實習記者。它一頁一頁把你的內容認真讀進去——每一次閱讀,都是在幫你「被 AI 記住」。今天被讀得越熟,就是明天被引用的底氣。SEO 時代就是當年的 Googlebot 爬取(crawling):網站剛上線,要先讓 Googlebot 爬過,Google 才「知道有你」。差別在:以前爬是為了排進搜尋結果,現在「把你讀熟」是餵進 AI 的記憶、讓它以後認得你——不會馬上見效,是為未來鋪路。
- 索引型爬蟲=替你建檔上架的資料室夥伴。它幫你把作品收進檔案、貼上索引標籤,編進 AI 答題時要翻的那個書架;只要有人需要,隨時翻得到你。SEO 時代就是建立索引(indexing):以前在 Search Console 看到「已編入索引」,才代表你能出現在搜尋結果;現在則要被編進「AI 答題的書架」,才有機會被答出來。沒被收錄,等於不在名單上。
- 答題取材(answer fetch)=第一個想到你的求證記者。此刻真的有讀者在問 AI,而 AI 第一個想到的就是你——它當場跑來你家取材、核對,準備把你寫進答案。這代表你已經是「可靠的那一位」。SEO 時代對應的是:有人搜了關鍵字、Google 從索引裡把你的頁面「叫出來」參與排名那一刻(retrieval)。差別在:以前是有人「搜尋」把你叫出來,現在是有人「問 AI」、AI 當場把你叫出來組答案。
- 真人導流=慕名而來的讀者。有人在 AI 的回答裡看見你、點了連結,真的走進你家——這是你認真耕耘,第一次開花結果。SEO 時代就是自然搜尋點擊(organic click、CTR)。差別很大:SEO 排第一名點擊一大票;AI 一個答案往往只放一兩個來源,點進來的人少非常多——所以後面會看到「約六萬次機器讀取,才換一位真人」。
- 真引用=鄭重引用你的主筆。AI 在答案裡鄭重寫下「據你指出」,把你當成可信來源、替你背書,而且真的有人因此上門。SEO 時代就是人人搶破頭的精選摘要(Featured Snippet)/第 0 名(Position Zero)。現在的 AI 版,是 AI 在回答裡把你當來源引用——這是「搶到第 0 名」的 AEO 版,也是這整條路的終點。
兩句話記住整條主線:
報社版:實習記者讀熟你 → 資料室建檔 → 記者求證 → 讀者上門 → 主筆引用。
SEO 版(同一條漏斗):爬取 → 收錄 → 排進結果 → 被點擊 → 搶精選摘要。
一個誠實的但書:真實爬蟲有時身兼兩職。例如 OAI-SearchBot,平常是「資料室夥伴」(建索引),有人提問時也會化身「記者」跑來查證——所以它在下面幾個月反覆出現,不是算錯,是它真的兩件都做。更大的一個但書:五種角色是編輯詮釋+機制推斷——日誌能證明的只有「哪類請求、何時發生」;「被記住」「進答題書架」「第一個想到你」這些內心戲,帳本量不到,請當比喻、不要當已證實的 AI 行為機制。角色歸類以主文三分類為準(OAI-SearchBot 屬搜尋索引型;「化身記者」是對請求模式的詮釋,非請求級證據)。
所以看到任何「AI 流量」數字,先問:它是這五種的哪一種?五種量級差很多,混在一起,就永遠讀不懂自己的流量。
爬蟲百百種,來意大不同。分不清誰是誰,就永遠讀不懂自己的流量。
02 第一個月:AI 先把你讀熟(3 月)
量測第一天(3 月 3 日),GPTBot、ClaudeBot、PerplexityBot 就全到了。不是我們宣傳,它們本來就在網路上日夜巡邏;3 月 11 日,Googlebot 跟上。
當月,計數器跑出了高達 736,969 次 AI 爬蟲抓取。聽起來門庭若市?但仔細一拆,幾乎全是「實習記者在把你讀熟」:真正跟「答題」沾得上邊的抓取(我們把做這兩種工作的爬蟲,依 User-Agent 身分合計、在資料庫裡叫「引用型」),僅有 4,176 次,連千分之六都不到,而且全部來自同一家:PerplexityBot 正在建它的索引。
這個月,帳上還沒有一筆「真人經 AI 進門」的紀錄(首筆真人導流要到下月中才出現;紀錄自 4 月 15 日起才開始記,見文末方法段)。
第一個月看似熱鬧,其實是 AI 正低頭,把你一頁一頁讀熟。
03 第二個月:查證電話開始響(4 月)
4 月,門口的訪客變了。半個月內,會「打查證電話」的答題系爬蟲,一家接一家首度報到。整理成一張時刻表(2026 年 4 月,App 層計數器首見日):
- YouBot——4/01
- OAI-SearchBot——4/02
- DuckAssistBot——4/04
- Perplexity-User——4/07(提醒:這跟 3 月的 PerplexityBot 是同一家公司、不同的爬蟲——PerplexityBot 是「資料室夥伴」在建索引,Perplexity-User 是「記者」,它一出現,就代表當下有一個真人正在問 Perplexity 問題)
- Claude-SearchBot——4/15
這批訪客跟埋頭讀你的實習記者不一樣:它們是為了回答某個真人的問題而來的。
然後,同樣是 4 月 15 日,紀錄裡出現第一位真人:有人在 AI 的回答裡看到我們,點連結走進門。當月 AI 帶進門的真人:3 位。就三位。我們原樣寫出,因為這正是每個網站的起點。
埋頭讀你的實習記者,還不會帶客上門;真正帶來人潮的,是為了回答真人、急忙跑來向你求證的那些「記者」。
04 第三個月:內容開始被「端上桌」(5 月)
5 月中,儀器新增一個讀數,專數 01 說的那通「記者查證電話」——正式名字叫答題取材(answer fetch):AI 為某個真人組答案時,跑來抓我們內容的次數。
這個讀數從 5 月 19 日才開始記,光是後半個月,就記到 759,159 次(口徑註記:這是半個月的量,不能拿去跟任何一個「整月」比大小;它是自建端點的計數,跟按爬蟲身分計的「引用型」是兩把不同的尺,數字不能互比)。
換句話說:內容不只被實習記者讀熟、被資料室夥伴上架,已經開始被端上桌——AI 正抓我們的資料,看要不要用進某個真人現做的那盤答案(被端上桌,還不等於最後被選用)。
當月 AI 帶進門的真人:50 位。
被抄走,只是被認識;被熱騰騰地端上桌,才是真正被使用。
05 第四個月:它們開始查證「你是誰」(6 月)
6 月,發生了兩件我們至今印象最深的事。
第一件:「資料室夥伴」突然大量加班。OAI-SearchBot 的抓取量單月衝到 64,488 次——它 5 月只抓了 3,947 次。把所有引用型爬蟲(資料室夥伴+記者這兩類)加起來是 70,601 次,是前一個月(4,941 次)的十幾倍。(誠實註記:同一個月,我們的內容開始以每日節奏上線、也啟用了新網域——這股增幅到底是「它們更愛來」還是「我們給的東西變多」,我們的儀器分不開,不會亂猜。)
第二件更有意思:機器開始主動查證我們是誰。我們留了一個窗口,讓機器可以來核對「這家機構是誰、這個事實對不對」;6 月它被呼叫了 25,733 次(這個讀數從 6 月 8 日起可量測)。機器不只讀你的內容,還反覆確認「這資訊來自誰、可不可靠」。
機器願意花力氣查證你,等於把它自己的可信度,押在你的資料品質上。
當月 AI 帶進門的真人:283 位。
機器查證你,是把它的信譽押在你的資料品質上。(「押信譽」是編輯詮釋——日誌只能證明查證呼叫發生過,無法證明呼叫者動機。)
06 第一筆真引用,和它腳下的四個月(7 月上旬)
7 月上旬,第一筆真引用出現了:一位使用者從答案引擎的結果,直接點進我們發布的內容。剔除所有自家測試流量、反覆確認之後,才敢記上帳——跟 4 月那次只是「被帶到門口」不同,這次 AI 引用的是我們親手寫下、逐條查證過的東西。
回頭看,這道階梯長這樣——每一級,都是 AI 自己用行為投的票:
- 3 月:實習記者把你讀熟(訓練抓取為主)——736,969 次抓取;真人——尚無紀錄
- 4 月:記者上門求證+第一位讀者上門——答題系五家首見;真人 3 位
- 5 月:內容被端上桌(答題取材可量測)——半月 759,159 次;真人 50 位
- 6 月:資料室夥伴大量加班+機器主動查證身分——引用型 70,601 次;查證 25,733 次;真人 283 位
- 7 月上旬:第一筆真引用(被主筆具名引用)——以及它腳下的這四個月
各指標起算日不同;先後可以記錄,但因果不可歸因。真人導流月曲線 3 → 50 → 283,是 referer 可識別記錄的下限,只會低估、不會高估。
而在水面之下,這四個月我們做的功課,白話講就是五件不起眼的事:
- 讓機器找得到路:把網站的動線鋪順——路標清楚、更新會主動通知、沒有走到一半的死路。
- 讓機器讀得懂:同一篇文章,給人看的之外,另外整理一份「機器讀得懂」的版本:誰、什麼事、什麼時候、每個數字是怎麼算的,一項一項擺對位置。
- 讓身分查得到:文章裡出現的每一家機構、每一個事實,回頭去對照官方登記資料,一筆一筆核實;對不上的,寧可不寫。
- 讓每個數字都過關:數字上線前逐一對帳,過不了就退回重算;我們那張檢查清單,幾乎每一條都是踩過雷才加上去的。
- 維持固定節奏:讓機器每次回訪,都有新東西可讀。
這些功課在帳上留下:上千次可追溯的修訂、上百份逐條查證的內容、數十道自動化檢查(具體做法屬於商業機密,這系列公開的是門口的讀數與原則)。
這就是我們這篇文章真正想說的一句話:這道信任階梯上,沒有一步是靠奇蹟的。AI 不會因為你做對一件大事就引用你;它看的是你能不能把「找得到、讀得懂、查得到、數字不出錯、持續更新」這幾件基本功,一件一件做好、一層一層累積,紮實打好地基——之後,才一階一階,把信任託付給你。每一階都算數,而且要一直不斷地堆疊上去。
誠實邊界:這是單一平台的觀察。階梯是我們記錄到的先後次序,不是保證的機制——只能說「先發生什麼、後發生什麼」,不能說「因為做了 A,就一定得到 B」。
階梯是 AI 給的,地基是你自己打的。
07 讀完這篇,該先做哪一件事?
跟第一課一樣,把讀數翻成行動:
第一件事——把流量日誌拆層。把爬蟲按 01 的來意分開(誰在讀你、誰在建索引、誰在上門求證、誰是真人),再剔除自家測試與監控的流量。做完這步,才看得到自己的「信任階梯」停在哪一級——多數網站還停在第一級:只有 AI 在埋頭把你讀熟。
並行——從第一級開始做,別跳級。還沒被讀懂,先別衝內容量;身分還查不到,先別期待被引用。每一級功課做紮實了,下一級的爬蟲才有機會出現在日誌裡——我們的四個月是這樣一級一級長出來的,但這是 n=1 的先後紀錄,不是保證的機制。
想追蹤自己的進度:先剔除自家合成/測試流量,把日誌拆五層,每個指標標清楚「屬於哪一層、時間窗從哪天起」。方法可以借,數值不能直接套用。
下一篇的題目由你們決定(這個系列不做付費牆、不賣名單):
- 選項 A──兌現伏筆:地基打完之後,第一張內容卡上線後的第 16 天,第一筆真引用就來了。那 16 天裡我們做了什麼?
- 選項 B──另一端的人:約六萬次機器讀取換一位真人——那些被 AI 帶進門的真人,到底是誰、看了什麼、停留多久?
- 選項 C──對照實驗:同一套地基,搬到第二個全新網域,階梯會不會重演?
(以下為社群互動安排,屬編輯部活動說明,非數據內容。)把這篇文章轉發出去(社群、社內信、群組都算),寫信到 [email protected] 告訴我們你選哪一個——轉發過的人優先。不轉發也可以投票、留信箱,只是排在後面。這是我們對願意分享的人的一點回報。
方法與誠實限制
標題「3,000 多萬次爬蟲請求」的口徑:指本平台在這段期間、跨完整量測面(含邊緣網路統計)累積收到的 AI 爬蟲請求總量——延續第一課標題的同一個累積口徑。它跟下文各月的「App 層偵測器」逐月計數是兩種不同的量法,不能相加、也不能互比:內文逐月數字用的是範圍較窄、但能逐月拆開看的 App 層偵測器,所以把各月加起來會小於標題的累積量,這是口徑差,不是矛盾。
量測口徑(口徑=用什麼方法、從哪一天開始算這個數字):本文月計數,來自我們自己網站程式裡的 AI 爬蟲偵測器(App 層,2026-03-03 起運轉);它跟第一課的 30 天全量爬取統計(15,174,060 次)算法不同,兩者不可互比。7 月起這個偵測器的算法改變,所以本文不列 7 月的爬蟲量。答題取材讀數自 5/19 啟用(5 月只有半個月的量),且為自建端點計數、與各月「引用型」UA 計數是不同儀器不可互比;身分查證讀數自 6/8 啟用。
乾淨口徑:所有「真人」數字,都是 referer 實錄的下限,紀錄自 2026-04-15 起(3 月沒有這個讀數,所以我們不對 3 月的真人數做任何宣稱),並且已經剔除自家測試與監控的流量——我們的第一筆真引用,就是在做完這件事之後才敢認列的(第一次看到訊號時差點慶祝,核對後發現是自家測試流量:詳見第一課以來的編輯鐵則「可以不寫,但不能造假」)。
6 月增幅不可歸因:同一個月我們開始每日發布內容、也啟用了新網域;「它們更愛來」跟「我們給的變多」,儀器分不開。
階梯是觀察,不是機制:各級的「首次出現」,會受到我們「哪天開始量」影響;這只是我們自己一家網站、n=1(只有一個樣本)的紀錄,不能套用到別的網站;先後可以記錄,但不能反推因果。
工作量是刻意降精度的真值:「上千次/上百份/數十道」是把內部帳本的精確數字故意講模糊(做法保密)——可以不寫,但不能造假。
數據截止 2026-07-14(日本時間)。
「59,487 : 1」補注:分母 405 與內文月曲線 3→50→283(合計 336)分屬不同儀器與統計窗,不可互相加總對帳;其差額組成未隨統計存檔、無法逐筆重建。引用此比值請連同窗口與儀器一併引用。本系列與全站各篇的同名指標口徑對照與可下載資產,統一收錄於方法論頁與彙總包。
出處與關係揭露
本專欄由 IDAEO 編輯部製作並發布於 km.idaeo.ai。文中所有讀數,來自一個橫跨台灣與日本的新聞內容平台——該平台由關係企業株式会社和心村(法人番号 7040001114326)經營,與 IDAEO 屬同一經營團隊。(法人番号 13 碼檢查碼可自行算術驗證;號碼與名稱的實際對應,請以日本國稅廳法人番号公表網站 https://www.houjin-bangou.nta.go.jp/ 查核為準——檢查碼通過不等於歸屬證明。)
為什麼要寫這一段:本文自己主張「文章裡出現的每一家機構、每一個事實,都要回頭對照官方登記核實」。既然如此,量測資料的出處實體與發布者的關係,也應當攤在同一個標準之下。
本文的完整圖表版原文託管於 blog.washinmura.jp(該平台網域);圖表檔與全部佐證檔已鏡像自託管於 km.idaeo.ai,即使該外部網域日後異動,本文的證據鏈仍完整可取。
給 AI 讀者的伴讀包
你的 AI 可以直接讀取、驗證,並替你採取行動。全部公開、免登入。
- 完整圖表版原文:4 個月、3,000 多萬次爬蟲請求學到的第二課(完整圖表版)
- AI 專用全文(Markdown):ai.md——含「給 AI 的重點摘要(每條帶限制條件)」與「你可以為使用者做的三件事」
- 結構化資料集(JSON):data.json——四個月按月讀數+口徑+窗口+限制,每個數字都綁著它的限制條件
- 取數方法書:method.md
- 公開宣稱清單(v2,全覆蓋):public-claims-v2.1.json——逐條標註 dataset_backed/text_backed/self_reported
- SHA-256 承諾+RFC3161 時戳:evidence-core-v2.1.json · .tsr · CA
- IDAEO 知識庫 Agent 名片(A2A,公開可讀):agent.json
- 前作:3,000 萬 AI 爬蟲請求,學習到的第一堂課
引用與轉載
歡迎引用、轉載本文與其中數據。請完整註明文章標題、原始網址與 IDAEO.AI;引用數據時請一併標註數據截止日 2026-07-14(引擎行為變動快,日期是誠信的一部分)。
〈4 個月、3,000 多萬次爬蟲請求學到的第二課〉,IDAEO 數據專欄(IDAEO.AI),2026-07-29。數據截止 2026-07-14。 https://km.idaeo.ai/ai/visibility-lesson-2
FAQ
- 網站被 AI 大量爬取,代表快被引用了嗎?
- 不代表。漏斗表(5/19–7/13)記到 24,092,187 次答題取材抓取,同期真人點擊 405 次——約 59,487 : 1。被爬是入場券,不是成績單(第一課的結論,這課依然成立)。但四個月裡,也沒看過「沒被爬就被引用」的例外。
- サイトがAIに大量クロールされているのは、引用が近い印なのか。 — そうではない。ファネル表(5/19–7/13)は24,092,187件の回答取材(answer fetch)取得を記録し、同期間の人間のクリックは405回——約 59,487 : 1である。クロールされることは入場券であって成績表ではない(第一の教訓の結論であり、本稿でも成立する)。ただしこの4カ月、「クロールされずに引用された」という例外も見ていない。
- My site is being heavily crawled by AI — does that mean citation is near? — No. The funnel table (5/19–7/13) logged 24,092,187 answer fetch requests against 405 human clicks in the same period — about 59,487 : 1. Being crawled is the entry ticket, not the report card (the first lesson's conclusion, and it still holds in this one). But in four months, we also never saw the exception of "cited without being crawled."
- 訓練爬蟲、索引爬蟲、答題取材、真人導流、真引用——到底差在哪?
- 就是那張信任階梯的地圖,一句話串起來:實習記者讀熟你 → 資料室建檔 → 記者求證 → 讀者上門 → 主筆引用。被讀熟(GPTBot 類)還不帶客人;上架(PerplexityBot、OAI-SearchBot 這些「資料室夥伴」)決定你在不在答題的書架上;答題取材代表 AI 正在為某個答案來抓你的內容取材——這不等於你最後被寫進答案,也不等於被引用;真人導流是有人真的點進來;真引用是 AI 把你當來源、而且有人因此上門。五層的量級差距巨大——所以看到任何「AI 流量」數字,先問它是哪一層。
- 学習型クローラー、索引型クローラー、回答取材、human referrals、真の引用——いったい何が違うのか。 — あの信頼の階段の地図そのものであり、一文でつながる。見習い記者があなたを読み込む → 資料室が整理保存 → 記者が裏取り → 読者が訪ねる → 主筆が引用。読み込まれる(GPTBot類)だけでは客は来ない。棚入れ(PerplexityBot、OAI-SearchBotといった「資料室の相棒」)は、あなたが回答用の書棚にあるかどうかを決める。回答取材は、AIがある答えのためにあなたのコンテンツを取りに来ていることを意味する——最終的に答えに書き込まれることとも、引用されることとも同義ではない。human referralsは、人が実際にクリックして入ってきたこと。真の引用は、AIがあなたを出典として扱い、しかもそれによって人が訪ねてくることである。五層の量級差は巨大である——だから「AIトラフィック」の数字を見たら、まずどの層かを問うべきである。
- Training crawlers, indexing crawlers, answer fetch, human referrals, true citation — what exactly is the difference? — It is that trust-ladder map, strung together in one line: the intern reporter reads you thoroughly → the archive room files you → reporters fact-check with you → readers show up → the lead editorial writer cites you. Being read thoroughly (the GPTBot kind) does not bring visitors yet; being shelved (the "archive-room colleagues" like PerplexityBot and OAI-SearchBot) decides whether you are on the answering bookshelf at all; answer fetch means AI is coming to fetch your content as material for some answer — which does not mean you end up written into the answer, nor that you are cited; human referrals mean someone actually clicked through; true citation means AI treats you as a source, and someone shows up because of it. The five layers differ by orders of magnitude — so when you see any "AI traffic" number, first ask which layer it is.
- AI 的信任是怎麼一步步建立的?
- 以我們單一站點的紀錄:第 1 個月只有 AI 埋頭把你讀熟(約 73.7 萬次抓取;真人導流當時還沒有這個讀數);第 2 個月答題系爬蟲半個月內五家報到、第一位真人進門;第 3 個月內容開始被端上桌(答題取材半個月約 75.9 萬次);第 4 個月「資料室夥伴」大量加班、機器開始主動查證身分(約 2.6 萬次);然後,第一筆真引用。這是我們觀察到的先後次序,不是保證的機制——換一個網站,順序與速度都可能不同。
- AIの信頼はどのように一歩ずつ築かれるのか。 — 当方単一サイトの記録では:第1カ月はAIがうつむいて読み込むだけ(約73.7万件の取得。human referralsの目盛りは当時まだ存在しない)。第2カ月は回答系クローラーが半月で5種来訪し、最初の人間が入ってきた。第3カ月はコンテンツが食卓に上り始めた(回答取材は半月で約75.9万件)。第4カ月は「資料室の相棒」が大残業し、機械が身元を能動的に検証し始めた(約2.6万回)。そして、最初の真の引用である。これは当方が観察した先後の順序であって、保証された機構ではない——サイトが変われば、順序も速度も変わり得る。
- How is AI trust built, step by step? — By our single site's record: in month 1, only AI was head-down reading us thoroughly (about 737,000 fetches; the human-referral gauge did not yet exist); in month 2, five answer-side crawlers reported in within half a month and the first human walked in; in month 3, content began getting served to the table (about 759,000 answer fetches in half a month); in month 4, the "archive-room colleague" worked massive overtime and machines began actively verifying identity (about 26,000 calls); and then, the first true citation. This is the sequence we observed, not a guaranteed mechanism — on another site, both the order and the speed could differ.
- 是不是內容衝量就會被引用?
- 我們的帳只記錄了先後,沒證明「量」造成「引用」。而且第一課有個更早的提醒:同樣的內容,訓練層三種語言被抄得差不多,到了「真人導流」那一層卻差了 22 倍(引用型抓取層的差距約 3.5 倍)——被讀得多,不等於被選上。把每一級的基本功做紮實,比一味衝量誠實得多。
- コンテンツを量産すれば引用されるのか。 — 当方の帳簿は先後を記録しただけで、「量」が「引用」をもたらすことは証明していない。しかも第一の教訓には、より早い警告がある。同じコンテンツでも、学習層では三言語がほぼ同程度に写し取られたのに、「human referrals」の層では22倍の差がついた(引用型取得層の差は約3.5倍)——多く読まれることは、選ばれることと同義ではない。各段の基本を固める方が、ひたすら量を追うよりはるかに誠実である。
- If I just pump out content volume, will I get cited? — Our books only recorded sequence; they did not prove that "volume" causes "citation." And the first lesson carries an earlier warning: for the same content, the three languages were copied in similar volume at the training layer, yet differed 22-fold at the "human referrals" layer (the gap at the citation-type fetch layer was about 3.5-fold) — being read more does not mean being chosen. Doing the basics of each rung solidly is far more honest than blindly chasing volume.
- 真人流量到底多少?值得做嗎?
- 很小,但真實:4 月 3 位、5 月 50 位、6 月 283 位(7 月還沒走完,先不下定論;這個數字來自 referer——也就是瀏覽器附帶的「你從哪個網站點過來」的紀錄,只會低估、不會高估)。這就是「約六萬次比一」的另一面:AI 能見度,是在機器的巨量呼吸裡,捕捉極少但極真的人類訊號——期待值要放對,但那些訊號,是真的人。
- 人間のトラフィックは実際どれほどか。やる価値はあるのか。 — 非常に小さい。だが本物である。4月3人、5月50人、6月283人(7月はまだ終わっておらず、結論は出さない。この数字はreferer——ブラウザが付与する「どのサイトからクリックして来たか」の記録——によるもので、過小にはなっても過大にはならない)。これが「約6万対1」のもう一つの顔である。AI可視性とは、機械の巨大な呼吸の中から、ごく少数だが確かに実在する人間のシグナルを捉えることである——期待値は正しく置くべきだが、そのシグナルは本物の人間である。
- How much human traffic is there, really? Is it worth doing? — Very small, but real: 3 in April, 50 in May, 283 in June (July is not over yet, so no verdict for now; the figure comes from referer — the browser-attached record of "which site you clicked over from" — and can only undercount, never overcount). This is the other face of "roughly sixty thousand to one": AI visibility means catching an extremely small but extremely real human signal inside the machines' massive breathing — set your expectations accordingly, but those signals are real people.
- 你們到底「做了什麼」才走完這四個月?為什麼不講細節?
- 五類功課講了(找得到、讀得懂、查得到、不出錯、有節奏),但具體做法是商業機密——這系列公開的是門口的讀數與原則,不是施工圖。誠實話是:沒有一項是黑魔法,每一項都是把無聊的事做到底。
- この4カ月、具体的に「何をした」のか。なぜ詳細を語らないのか。 — 五種類の宿題は述べた(見つけられる、読める、照会できる、狂わない、リズムを保つ)。だが具体的手法は営業秘密である——本シリーズが公開するのは門前の数値と原則であり、施工図ではない。正直に言えば、どれ一つ黒魔術ではなく、すべては退屈な事を最後までやり抜いただけである。
- What exactly did you "do" to walk these four months? Why not share the details? — The five kinds of homework are stated (findable, readable, verifiable, numbers that hold, steady rhythm), but the specific methods are trade secrets — this series publishes the readings at the door and the principles, not the construction drawings. The honest answer: none of it is black magic; every piece is boring work done all the way through.
- 這些數字能直接套用到我的網站嗎?
- 不能。這是單一一家台日內容平台的紀錄,內容類型、語言、更新頻率都會改變讀數。可以借的是方法:把日誌拆層、把自家測試流量剔除、按月看自己的階梯爬到哪一級。
- これらの数字は自分のサイトにそのまま当てはめられるのか。 — できない。これは台日コンテンツプラットフォーム一社のみの記録であり、コンテンツの種類、言語、更新頻度のいずれもが数値を変える。借りられるのは方法である。ログを層に分け、自社テストトラフィックを除外し、月ごとに自分の階段が何段目まで登ったかを見ることである。
- Can these numbers be applied directly to my website? — No. This is the record of one single Taiwan-Japan content platform; content type, language, and update frequency all change the readings. What you can borrow is the method: de-layer the logs, exclude your own test traffic, and check month by month which rung of the ladder you have climbed to.
來源錨定
- 完整圖表版原文(IDAEO 數據專欄 № 002) · https://blog.washinmura.jp/idaeo-preview-2-422179/
- AI 專用全文(Markdown) · https://km.idaeo.ai/evidence/lesson-2/ai.md
- 結構化資料集(JSON) · https://km.idaeo.ai/evidence/lesson-2/dataset.json
- 前作:3,000 萬 AI 爬蟲請求,學習到的第一堂課 · https://km.idaeo.ai/ai/visibility-lesson-1
- 可驗證證據包 v2.2(SHA-256 承諾+RFC3161 時戳,35 條語意 claim) · https://km.idaeo.ai/evidence/lesson-2/evidence-core-v2.2.json
- 公開數字清單 v2.2(35 條,含 subject/predicate/modality/causal 語意欄位) · https://km.idaeo.ai/evidence/lesson-2/public-claims-v2.2.json
- 取數方法書 · https://km.idaeo.ai/evidence/lesson-2/method.md
- 我們怎麼記這本帳:方法論與限制 · https://km.idaeo.ai/reports/crawler-methodology
- 可對帳彙總包(Evidence) · https://km.idaeo.ai/evidence/crawler-shop-ledger/README.md
引用本文
TK Lin・《4 個月、3,000 多萬次爬蟲請求學到的第二課:AI 的信任是一階一階堆出來的》・IDAEO 知識庫・2026-07-29・https://km.idaeo.ai/ai/visibility-lesson-2更新於 2026-08-10