一天 426 次、之后安静:看懂 Meta AI 爬虫的批量读取方式
仪器开机首日,Meta 爬虫单日到访 426 次后归于安静。它集中读新闻事实卡与作者页,几乎每次都真回源。这是一份爆量式批量读取的行为侧写。
开机第一天,来了一位不逛街的客人
km.idaeo.ai 的自建观测仪器,在 2026-08-10 07:52 UTC 开机。第一天就遇到一位行为很特别的访客:Meta 的 AI 爬虫,UA 名叫 meta-externalagent。
为什么要自己装仪器?因为 AI 爬虫读了你什么,一般流量报表看不见。它们不点广告、不填表单、不留言,来过就走。你只有在服务器与边缘层留记录,才知道自己的内容正在被谁、用什么方式读走。
这位访客的行为很干脆。它在这一天到访 426 次,全部集中在单日。最后一击落在 14:10 UTC,之后就安静了。像一位客人在你开店第一天走进来,把整间店连菜单带墙面全拍了一遍,然后离开。至少在我们看得到的窗口内,没有再回头。这种“来一次、扫干净、就消失”的形状,正是本文想侧写的东西。
它读了什么:新闻事实卡,加上作者页
摊开它的阅读清单,前几名长这样:首页 29 次;新闻事实卡 insight/ank-2026-07-28-003 读了 28 次;ank-2026-07-16-001 与 ank-2026-07-16-003 各 25 次;/insight 列表页 24 次;/tag/ank 标签页 24 次;favicon 14 次;作者页(竹之内 凛)10 次。
先解释名词:新闻事实卡是本站的一种内容形式,把一则新闻拆成有出处、有时间戳的结构化卡片,一张卡讲清楚一件事。对机器来说,这种格式好消化:边界清楚、来源可查、不用从长文里自己捞重点。
这份清单藏着两个信号。第一,它的主食正是这种事实卡,而不是随机乱翻。列表页与标签页也在前几名,说明它先看目录、再逐张取卡,动线像有计划的采购,不像闲逛。第二,它专程绕去看作者页。像出版社编辑挑稿:先看稿子好不好,再回头确认作者是谁、还写过什么。“内容加作者”一起读,是训练语料选材的典型轮廓——挑素材,也顺手记下素材的来历。
几乎每一次,都真的走进厨房
再看它吃缓存的方式。CF 边缘缓存在 08-10 08:00Z 起的窗口内,分布是:dynamic 359、miss 46、expired 27、hit 只有 1。
翻成白话:hit 是“架上有现成的,直接拿走”;dynamic、miss、expired 三种,都等于“请厨房现做”——请求真的打回源站,把内容原原本本读走。几乎全部真回源,代表它不是路过打个招呼,而是认真把东西搬回去。
这一点对站长有实际意义。缓存命中的流量,成本几乎由边缘层吸收;真回源的流量,才会吃到你源站的运算与带宽。换句话说,这种爬法留下的是实打实的负载,不是水花。站小的人尤其该知道:一个批量爬虫的单日爆量,落在源站上的重量,和落在缓存上的重量,是两回事。
和其他爬虫比,它是另一种动物
前作记录过本站的累计账:ClaudeBot 爬了 6.44M 次、GPTBot 爬了 5.62M 次(来源:https://km.idaeo.ai/ai/ai-crawler-marketing)。那种模式是细水长流,天天来、页页翻。
节奏上也有对照组。同一篇前作实测:新页面上线后,ClaudeBot 中位 4.2 小时就来首爬;OAI-SearchBot 中位要 332.8 小时,等于 13.9 天。一个是巷口邻居,一个是远方亲戚。
Meta 这次展示的是第三种节奏:不是天天来,也不是慢慢来,而是单日爆量扫完、然后静默。像批发商进货:一次搬走整批,不做零售式的每日巡店。这种形状通常对应“批量收集”的工作方式——排程启动、扫完收工,而不是用户问一题、机器即时来查一页的那种即时检索。我们无法从站外证实它拿去做什么,只能诚实记下:形状像进货,不像查价。
必须提醒:上面的累计数字来自旧仪器较长的观测窗,Meta 的 426 次来自新仪器的头一天。两边仪器不同、窗口不同,量级不能直接相比。这一段比的是行为的形状,不是大小。
这份侧写的边界,先讲清楚
- 单站观测:只有 km.idaeo.ai 一个站。Meta 在别的网站,可能是完全另一种行为。
- 仪器只跑了 1.5 天:样本非常年轻。“之后停了”只代表窗口内没再看到,不代表它不会回来。
- 缓存分布的窗口从 08-10 08:00Z 起算,与到访计数的口径不完全重叠,两组数字不能互相加减。
- 认人靠 UA:我们认的是 meta-externalagent 这个 UA 名,未做 IP 反查。UA 是可以伪造的。
站长看到这种模式,可以怎么想
- 单日爆量、之后安静,多半是批量抓取,不是持续盯梢。先别急着判定自己被锁定。
- 看它“读什么”比看它“来几次”有用。读内容页加作者页,是选材信号;只打首页和 favicon,多半只是探路。
- 想对它表态,第一站是你的 robots.txt。先弄清楚它读走了你什么,再决定欢迎或婉拒。
- 想留下证据,趁早开仪器。爬虫的行为证据稍纵即逝:我们晚一天开机,这 426 次就不会存在于任何记录里。
FAQ
- meta-externalagent 是谁?
- Meta 旗下 AI 爬虫使用的 UA 名。本文所有统计都以这个 UA 名为认定基准,未做 IP 反查验证,这点在正文限制段有交代。
- meta-externalagent とは誰ですか? — Meta 傘下の AI クローラーが使う UA 名です。本稿の統計はすべてこの UA 名を識別基準としており、IP の逆引き検証はしていません。この点は本文の限界の節に明記しています。
- Who is meta-externalagent? — The UA name used by Meta's AI crawler. All statistics in this article use this UA name as the identification basis, with no reverse-IP verification — as stated in the limitations section.
- 426 次算多还是少?
- 看跟谁比。前作累计账里 ClaudeBot 有 6.44M 次(https://km.idaeo.ai/ai/ai-crawler-marketing),相比之下 426 是零头。但两边仪器与窗口都不同,只能比行为形状,不能比大小。
- 426 回は多いのですか、少ないのですか? — 比べる相手によります。前作の累計では ClaudeBot が 6.44M 回で(https://km.idaeo.ai/ai/ai-crawler-marketing)、それと比べれば 426 は端数です。ただし観測手段も窓も異なるため、比べられるのは行動の形だけで、大きさは比べられません。
- Is 426 visits a lot or a little? — It depends on the comparison. In the previous cumulative ledger, ClaudeBot had 6.44M visits (https://km.idaeo.ai/ai/ai-crawler-marketing); next to that, 426 is small change. But the instruments and windows differ, so only the shape of behavior can be compared, not the size.
- 它为什么几乎不吃缓存?
- 窗口内分布是 dynamic 359、miss 46、expired 27、hit 1。几乎每次请求都真的回源站读内容。对站长的意义:这是真实回源负载,不是边缘层挡掉的流量。
- なぜほとんどキャッシュを使わないのですか? — 窓内の分布は dynamic 359、miss 46、expired 27、hit 1 でした。ほぼ毎回のリクエストが本当にオリジンサーバーまで内容を読みに来ています。サイト運営者にとっての意味は、これがエッジ層で止まったトラフィックではなく、実際のオリジン負荷だということです。
- Why did it almost never hit the cache? — The in-window distribution was dynamic 359, miss 46, expired 27, hit 1. Almost every request really went back to the origin server to read content. For site owners this means real origin load, not traffic absorbed at the edge.
- 它挑内容吗?
- 从清单看有明显偏好:新闻事实卡读最多(例如 ank-2026-07-28-003 读了 28 次),还专程读作者页 10 次。内容与作者一起看,比较像选材,不像盲扫。
- コンテンツを選んでいますか? — リストには明確な好みが見えます。ニュースファクトカードが最も読まれ(例:ank-2026-07-28-003 は 28 回)、著者ページもわざわざ 10 回読んでいます。コンテンツと著者をセットで見るのは、盲目的なスキャンより選材に近い動きです。
- Is it selective about content? — The list shows clear preferences: news fact cards were read most (for example, ank-2026-07-28-003 was read 28 times), and it deliberately read the author page 10 times. Looking at content and author together resembles curation more than blind scanning.
- 它之后还会回来吗?
- 不知道。仪器只跑了 1.5 天,“之后停了”只是窗口内的事实。这一题目前是 NA,数据够了再回答。
- また戻ってきますか? — 分かりません。観測はまだ 1.5 日で、「その後止まった」は窓の中の事実にすぎません。この問いは現時点で NA(回答不能)とし、データが揃ってから答えます。
- Will it come back? — We do not know. The instrument has run for only 1.5 days; “it stopped afterwards” is only a fact within the window. This question is currently NA — we will answer it when there is enough data.
- 我不想被它爬,怎么办?
- 技术上的第一步是 robots.txt 表态。本文不替你决定该不该挡:先弄清它读了你的什么内容,再做取舍。
- クロールされたくない場合はどうすればいいですか? — 技術的な第一歩は robots.txt での意思表示です。ブロックすべきかどうかを本稿は代わりに決めません。まず何を読まれたかを把握し、それから取捨を判断してください。
- I do not want it crawling my site. What can I do? — The first technical step is stating your position in robots.txt. This article will not decide for you whether to block: first find out what of yours it has read, then weigh the trade-off.
- 这份数据能代表 Meta 爬虫的整体行为吗?
- 不能。单站、单日爆量、1.5 天仪器窗,这是一份行为侧写,不是行业统计。把它当一个可验证的观察起点就好。
- このデータは Meta のクローラー全体の行動を代表しますか? — 代表しません。単一サイト、単日バースト、1.5 日の観測窓。これは行動プロファイルであって、業界統計ではありません。検証可能な観察の出発点として扱ってください。
- Does this data represent Meta's crawler behavior overall? — No. Single site, a single-day burst, a 1.5-day instrument window — this is a behavioral profile, not industry statistics. Treat it as one verifiable starting observation.
来源锚定
- km.idaeo.ai 自建邊緣觀測儀器(2026-08-10 07:52 UTC 開機;本文到訪數、閱讀清單、快取分佈的唯一來源) · https://km.idaeo.ai
- 前作〈AI 爬蟲行銷帳〉(ClaudeBot 6.44M/GPTBot 5.62M 累計;首爬 ClaudeBot 4.2 小時/OAI-SearchBot 332.8 小時=13.9 天) · https://km.idaeo.ai/ai/ai-crawler-marketing
- 前作〈五個月帳本〉(系列脈絡,本文正文未引用其數字) · https://km.idaeo.ai/ai/ai-crawler-shop-ledger
- 前作〈語言結構〉(系列脈絡,本文正文未引用其數字) · https://km.idaeo.ai/ai/visibility-lesson-1
引用本文
TK Lin・《一天 426 次、之后安静:看懂 Meta AI 爬虫的批量读取方式》・IDAEO 知識庫・2026-08-11・https://km.idaeo.ai/ai/meta-crawler-burst