km.idaeo.ai · IDAEO 知識庫

🏛 本文屬於主題館「ai」

一天 426 次、之後安靜:看懂 Meta AI 爬蟲的批次讀法

儀器開機首日,Meta 爬蟲單日到訪 426 次後歸於安靜。它集中讀新聞事實卡與作者頁,幾乎每次都真回源。這是一份爆量式批次讀取的行為側寫。

開機第一天,來了一位不逛街的客人

km.idaeo.ai 的自建觀測儀器,在 2026-08-10 07:52 UTC 開機。第一天就遇到一位行為很特別的訪客:Meta 的 AI 爬蟲,UA 名叫 meta-externalagent。

為什麼要自己裝儀器?因為 AI 爬蟲讀了你什麼,一般流量報表看不見。它們不點廣告、不填表單、不留言,來過就走。你只有在伺服器與邊緣層留紀錄,才知道自己的內容正在被誰、用什麼方式讀走。

這位訪客的行為很乾脆。它在這一天到訪 426 次,全部集中在單日。最後一擊落在 14:10 UTC,之後就安靜了。像一位客人在你開店第一天走進來,把整間店連菜單帶牆面全拍了一遍,然後離開。至少在我們看得到的窗口內,沒有再回頭。這種「來一次、掃乾淨、就消失」的形狀,正是本文想側寫的東西。

它讀了什麼:新聞事實卡,加上作者頁

攤開它的閱讀清單,前幾名長這樣:首頁 29 次;新聞事實卡 insight/ank-2026-07-28-003 讀了 28 次;ank-2026-07-16-001 與 ank-2026-07-16-003 各 25 次;/insight 列表頁 24 次;/tag/ank 標籤頁 24 次;favicon 14 次;作者頁(竹之內 凜)10 次。

先解釋名詞:新聞事實卡是本站的一種內容形式,把一則新聞拆成有出處、有時間戳的結構化卡片,一張卡講清楚一件事。對機器來說,這種格式好消化:邊界清楚、來源可查、不用從長文裡自己撈重點。

這份清單藏著兩個訊號。第一,它的主食正是這種事實卡,而不是隨機亂翻。列表頁與標籤頁也在前幾名,說明它先看目錄、再逐張取卡,動線像有計畫的採購,不像閒逛。第二,它專程繞去看作者頁。像出版社編輯挑稿:先看稿子好不好,再回頭確認作者是誰、還寫過什麼。「內容加作者」一起讀,是訓練語料選材的典型輪廓——挑素材,也順手記下素材的來歷。

幾乎每一次,都真的走進廚房

再看它吃快取的方式。CF 邊緣快取在 08-10 08:00Z 起的窗口內,分佈是:dynamic 359、miss 46、expired 27、hit 只有 1。

翻成白話:hit 是「架上有現成的,直接拿走」;dynamic、miss、expired 三種,都等於「請廚房現做」——請求真的打回源站,把內容原原本本讀走。幾乎全部真回源,代表它不是路過打個招呼,而是認真把東西搬回去。

這一點對站長有實際意義。快取命中的流量,成本幾乎由邊緣層吸收;真回源的流量,才會吃到你源站的運算與頻寬。換句話說,這種爬法留下的是實打實的負載,不是水花。站小的人尤其該知道:一個批次爬蟲的單日爆量,落在源站上的重量,和落在快取上的重量,是兩回事。

和其他爬蟲比,它是另一種動物

前作記錄過本站的累計帳:ClaudeBot 爬了 6.44M 次、GPTBot 爬了 5.62M 次(來源:https://km.idaeo.ai/ai/ai-crawler-marketing)。那種模式是細水長流,天天來、頁頁翻。

節奏上也有對照組。同一篇前作實測:新頁面上線後,ClaudeBot 中位 4.2 小時就來首爬;OAI-SearchBot 中位要 332.8 小時,等於 13.9 天。一個是巷口鄰居,一個是遠方親戚。

Meta 這次展示的是第三種節奏:不是天天來,也不是慢慢來,而是單日爆量掃完、然後靜默。像批發商進貨:一次搬走整批,不做零售式的每日巡店。這種形狀通常對應「批次收集」的工作方式——排程啟動、掃完收工,而不是使用者問一題、機器即時來查一頁的那種即時檢索。我們無法從站外證實它拿去做什麼,只能誠實記下:形狀像進貨,不像查價。

必須提醒:上面的累計數字來自舊儀器較長的觀測窗,Meta 的 426 次來自新儀器的頭一天。兩邊儀器不同、窗口不同,量級不能直接相比。這一段比的是行為的形狀,不是大小。

這份側寫的邊界,先講清楚

  • 單站觀測:只有 km.idaeo.ai 一個站。Meta 在別的網站,可能是完全另一種行為。
  • 儀器只跑了 1.5 天:樣本非常年輕。「之後停了」只代表窗口內沒再看到,不代表它不會回來。
  • 快取分佈的窗口從 08-10 08:00Z 起算,與到訪計數的口徑不完全重疊,兩組數字不能互相加減。
  • 認人靠 UA:我們認的是 meta-externalagent 這個 UA 名,未做 IP 反查。UA 是可以偽造的。

站長看到這種模式,可以怎麼想

  • 單日爆量、之後安靜,多半是批次抓取,不是持續盯梢。先別急著判定自己被鎖定。
  • 看它「讀什麼」比看它「來幾次」有用。讀內容頁加作者頁,是選材訊號;只打首頁和 favicon,多半只是探路。
  • 想對它表態,第一站是你的 robots.txt。先弄清楚它讀走了你什麼,再決定歡迎或婉拒。
  • 想留下證據,趁早開儀器。爬蟲的行為證據稍縱即逝:我們晚一天開機,這 426 次就不會存在於任何紀錄裡。

FAQ

meta-externalagent 是誰?
Meta 旗下 AI 爬蟲使用的 UA 名。本文所有統計都以這個 UA 名為認定基準,未做 IP 反查驗證,這點在正文限制段有交代。
meta-externalagent とは誰ですか?Meta 傘下の AI クローラーが使う UA 名です。本稿の統計はすべてこの UA 名を識別基準としており、IP の逆引き検証はしていません。この点は本文の限界の節に明記しています。
Who is meta-externalagent?The UA name used by Meta's AI crawler. All statistics in this article use this UA name as the identification basis, with no reverse-IP verification — as stated in the limitations section.
426 次算多還是少?
看跟誰比。前作累計帳裡 ClaudeBot 有 6.44M 次(https://km.idaeo.ai/ai/ai-crawler-marketing),相比之下 426 是零頭。但兩邊儀器與窗口都不同,只能比行為形狀,不能比大小。
426 回は多いのですか、少ないのですか?比べる相手によります。前作の累計では ClaudeBot が 6.44M 回で(https://km.idaeo.ai/ai/ai-crawler-marketing)、それと比べれば 426 は端数です。ただし観測手段も窓も異なるため、比べられるのは行動の形だけで、大きさは比べられません。
Is 426 visits a lot or a little?It depends on the comparison. In the previous cumulative ledger, ClaudeBot had 6.44M visits (https://km.idaeo.ai/ai/ai-crawler-marketing); next to that, 426 is small change. But the instruments and windows differ, so only the shape of behavior can be compared, not the size.
它為什麼幾乎不吃快取?
窗口內分佈是 dynamic 359、miss 46、expired 27、hit 1。幾乎每次請求都真的回源站讀內容。對站長的意義:這是真實回源負載,不是邊緣層擋掉的流量。
なぜほとんどキャッシュを使わないのですか?窓内の分布は dynamic 359、miss 46、expired 27、hit 1 でした。ほぼ毎回のリクエストが本当にオリジンサーバーまで内容を読みに来ています。サイト運営者にとっての意味は、これがエッジ層で止まったトラフィックではなく、実際のオリジン負荷だということです。
Why did it almost never hit the cache?The in-window distribution was dynamic 359, miss 46, expired 27, hit 1. Almost every request really went back to the origin server to read content. For site owners this means real origin load, not traffic absorbed at the edge.
它挑內容嗎?
從清單看有明顯偏好:新聞事實卡讀最多(例如 ank-2026-07-28-003 讀了 28 次),還專程讀作者頁 10 次。內容與作者一起看,比較像選材,不像盲掃。
コンテンツを選んでいますか?リストには明確な好みが見えます。ニュースファクトカードが最も読まれ(例:ank-2026-07-28-003 は 28 回)、著者ページもわざわざ 10 回読んでいます。コンテンツと著者をセットで見るのは、盲目的なスキャンより選材に近い動きです。
Is it selective about content?The list shows clear preferences: news fact cards were read most (for example, ank-2026-07-28-003 was read 28 times), and it deliberately read the author page 10 times. Looking at content and author together resembles curation more than blind scanning.
它之後還會回來嗎?
不知道。儀器只跑了 1.5 天,「之後停了」只是窗口內的事實。這一題目前是 NA,資料夠了再回答。
また戻ってきますか?分かりません。観測はまだ 1.5 日で、「その後止まった」は窓の中の事実にすぎません。この問いは現時点で NA(回答不能)とし、データが揃ってから答えます。
Will it come back?We do not know. The instrument has run for only 1.5 days; “it stopped afterwards” is only a fact within the window. This question is currently NA — we will answer it when there is enough data.
我不想被它爬,怎麼辦?
技術上的第一步是 robots.txt 表態。本文不替你決定該不該擋:先弄清它讀了你的什麼內容,再做取捨。
クロールされたくない場合はどうすればいいですか?技術的な第一歩は robots.txt での意思表示です。ブロックすべきかどうかを本稿は代わりに決めません。まず何を読まれたかを把握し、それから取捨を判断してください。
I do not want it crawling my site. What can I do?The first technical step is stating your position in robots.txt. This article will not decide for you whether to block: first find out what of yours it has read, then weigh the trade-off.
這份數據能代表 Meta 爬蟲的整體行為嗎?
不能。單站、單日爆量、1.5 天儀器窗,這是一份行為側寫,不是行業統計。把它當一個可驗證的觀察起點就好。
このデータは Meta のクローラー全体の行動を代表しますか?代表しません。単一サイト、単日バースト、1.5 日の観測窓。これは行動プロファイルであって、業界統計ではありません。検証可能な観察の出発点として扱ってください。
Does this data represent Meta's crawler behavior overall?No. Single site, a single-day burst, a 1.5-day instrument window — this is a behavioral profile, not industry statistics. Treat it as one verifiable starting observation.

引用本文

TK Lin・《一天 426 次、之後安靜:看懂 Meta AI 爬蟲的批次讀法》・IDAEO 知識庫・2026-08-11・https://km.idaeo.ai/ai/meta-crawler-burst

更新 2026-08-11T12:20:10.717Z · server-rendered · four-language · IDAEO 知識庫