km.idaeo.ai · IDAEO 知識庫

🏛 本文属于主题馆「ai」 →

为什么一个新站,两周就被 AI 搜索大量引用——一次真实的 crawl→index→cite 拆解

一个 2026-09-20 上线的新站,两周内 Google 曝光上升,并在一次 Perplexity 引用探针里被大量取源、排第一。但没有对照组,拆不开原因;只能提出与数据一致的假设:挂对母域+把事实做成机器可验的来源。

Infographic: crawl to index to cite — 457 crawler visits, Google impressions 4 to 265, #1 source in one test
图:一个刚上线两周的新网站,在一次 AI 搜索测试里成了最常被选用的来源。上线头几天 6 种 AI/搜索工具共来读 457 次;Google 曝光 14 天从 4 冲到 265(约 66 倍);这次测试 AI 回答最常拿它当来源(第一名、约 91% 被选)。单一网站、一次测试、无对照组。

一个 2026-09-20 才上线的站,Google 曝光在两周内往上走;另一次 Perplexity 引用探针,则把它大量抓为来源、排在第一。为什么这么快?我没有对照组,也没有做逐项移除测试,还拆不开原因。

目前能提出的是一个与数据一致的假设:网站挂在 AI 爬虫早已常态访问的母域下,事实又整理成机器容易取用、可以回溯核对的来源。母域可能让它较快被看见,证据结构可能让它较容易被选中。两者各出了多少力,这次测量回答不了。

这篇交代数字,以及数字容许我们推到哪里。AEO 的概念与 SEO 差异,见《AEO 不是 SEO》;搭建做法,见《个人 IDA 方法论》。

三个节点的真实痕迹

Bar chart: AI and search crawler visits in the first days (ClaudeBot 183 down to PerplexityBot 2)
图:新网站上线头几天,6 种主流 AI/搜索爬虫都来读了,访问量差别很大——Claude 的机器人最勤(183 次),Perplexity 只来 2 次。数字是 Cloudflare 记录到的“验证过的机器人身份”,不是看它自称。

这是我自己的事实页 tklin.washinmura.jp,挂在已有数年历史的母域 washinmura.jp 下,2026-09-20 上线。母域原本就有 AI 爬虫流量。网站在 crawl(被抓)、index(被收录)、cite(被引用)三段,留下的是三种不同信号。

Crawl。 上线数天内,Cloudflare“认证爬虫身份”记到的次数是:ClaudeBot 183、bingbot 161、Googlebot 67、GPTBot 36、OAI-SearchBot 8、PerplexityBot 2。这些是经验证的机器人身份,不是 User-Agent 自称。六种爬虫都来过,访问量却差得很远。

Index。 Google Search Console 的曝光在两周内依次走到 4 → 32 → 89 → 171 → 265。GSC 曝光上升,证明搜索可见度在涨;它不等于已收录页数。

Cite。 我用 Perplexity 的 Agent API 跑了一次 100 题 × 5 个模型后端的引用探针。5 个后端全部走 Perplexity 自己的网页搜索。这次量的是 Perplexity 搜索会不会抓这个站当来源,不是五家独立 AI 各自判断。

结果是检索成功率 retrieved 91%(身份/公司题)。取源次数:tklin.washinmura.jp 439(第一)、tklin.me 246、washinmura.jp 145。5 个受测后端都取用了新站;不点名描述题 19/20 指向他。这是 Perplexity 搜索大量取用它的强信号,不能改写成“一般对话里每家 AI 都稳定首引它”。

时间也要说准。“两周”是上线后观察 GSC 曝光的窗口。引用探针另跑一次;DATA 来源没有记下确切执行日期,因此不能说引用正好发生在那两周内。能确定的是:两周内搜索可见度上升,而探针那一次,Perplexity 搜索已大量抓它作来源。

为什么抓得快,为什么被选为来源

Bar chart: most-picked source in one AI-search test, 439 vs 246 vs 145, 91% retrieved
图:同一次 AI 搜索测试里,AI 回答最常拿这个新网站当来源(439 次、第一名),超过作者旧网站(246)和母网站(145);身份类问题约 91% 被取用。这是一次测试的结果,不代表每个 AI、每次都这样。

先看爬取。母域既有流量,是一个可能原因。 washinmura.jp 有多年历史,AI 爬虫原本就常来;子域名搭上这条流量渠道,可能少了全新域名的冷启动等待。但这只支持“搭上既有爬虫流量”的说法,不能宣称母域把“权重”继承给子站。数据没有证明继承。

技术配置可能也帮了忙。 robots.txt 全放行,HTTP 标头设 X-Robots-Tag: all,sitemap.xml 列出站内页面,IndexNow 主动推送更新。爬虫来时进得去,也有机会收到新页面的通知。母域与技术各贡献多少,没有对照实验可拆。

接着是一个看似矛盾的数字:PerplexityBot 只来 2 次,这个站却在探针里被取源 439 次。合理推论是,Perplexity 这一次的实时检索搭了通用搜索索引的便车,并非只靠自家爬虫建库。Perplexity 作为 meta-search,会调用 Bing/Google 等搜索结果,再交给模型整合;通用索引先收进页面,它就可能找得到。

这个推论只适用于 Perplexity 的这一次探针。Cloudflare 记到的爬虫请求,与 Agent API 检索时的取源,也不是同一个指标,不能拿 2 次直接推算 439 次。更不能把这个观察扩大成“专用爬虫不重要”:同一份记录里,ClaudeBot 来了 183 次、GPTBot 36 次;有些 AI 检索系统,例如 OpenAI 原生的检索环境,相当依赖自家专用爬虫抓取建库。通用搜索引擎与专用爬虫,两边都别挡。

至于收录之后为何被选中,我认为证据结构可能有作用。这是机制假设;我没有做逐项移除(ablation)测试,不能把它写成已证因果。

schema.org 的 JSON-LD 用单一 @id 把 Person 与 Organization 绑到同一个规范身份,理论上能减少同名混淆。anchors.json 44 条第三方来源,每条附 Wayback 快照与 sha256,方便逐条回溯、核对。sha256 只能验内容是否一致、是否被篡改,不能验内容本身为真。llms.txt、llms-full.txt、brief.txt 与四语版本,则提供机器容易解析的纯文本事实,也增加不同语言问句的匹配机会。

这些安排可能共同影响了身份题的 91% 检索率,以及不点名题 19/20 的结果。哪一项有效、各占多少,目前没有证据能拆开。

哪些是方法,哪些是运气

Two columns: four repeatable moves versus two case-specific advantages
图:这个案例里,能照做的有四项(技术全开、统一身份、第三方证据链、纯文本事实页),任何人都做得到;学不来的两项(挂在有多年流量的母网站、人名竞争低)是这个案例特有的运气。先把能照做的四项做扎实。

有些起跑条件,别人带不走。

其一是母域。washinmura.jp 的历史与既有 AI 爬虫流量,给了子站一条现成的访问渠道。这不等于母域权重已继承给子站;数据没有证明那件事。

其二是人名竞争低、事迹独特。网络上没有大量同名权威页面与他竞争,事实页被收录后,可能比较容易被锁定为来源。这也可能与不点名题 19/20 指向他的结果有关,但我没有同名竞争度的测量,仍是推测。

能照着做的有四项:技术全开(robots、X-Robots-Tag、sitemap、IndexNow)、以单一 @id 做实体消歧、用 anchors.json 串起可由 Wayback 与 sha256 核对的第三方证据链,以及提供 llms.txt 与多语纯文本事实页。方法可以复制;这个案例的速度与取源量,不能照单保证。

想复制,三步

一、找已有爬虫访问的节点。 优先在爬虫常来的域名下建子站,或至少与已被索引的站点建立反向关联。上线时打 IndexNow。

二、把身份与证据整理清楚。 用带单一 @id 的 Person/Organization JSON-LD 固定身份;发布 anchors.json,让第三方出处能由 Web Archive 与 sha256 逐条核对。

三、给机器容易取用的文本。 根目录提供 llms.txt 与多语纯文本事实摘要,减少冗余排版,方便检索器读取与引用。

这三步是骨架。完整的四条件、五步做法,以及“只喂可查证”的纪律,见《个人 IDA 方法论》。

诚实的局限

第一,原因还拆不开。 没有新裸域对照组,也没有逐项移除(ablation)测试,无法分出母域既有流量、内容质量、技术配置各自的贡献。同一规格若放在毫无历史的全新裸域,收录很可能明显变慢;这是合理预期,不是验证过的必然。本文记录一个站的轨迹,并非对照实验。

第二,439 是特定探针值。 它来自刻意开启 web_search 的 Perplexity Agent API,规模是 100 题 × 5 个模型后端。5 个后端全部使用 Perplexity 自己的网页搜索。439 表示 tklin.washinmura.jp 在这次 Perplexity 搜索的取源次数排第一;它不代表五家独立 AI 各自选它当首选,更不代表一般对话中每家 AI 都稳定首引。GSC 曝光上升同样只能证明搜索可见度增加,不能当成已收录页数,也不能证明每个引擎都完整收录。

第三,爬虫与取源走的是两本账。 PerplexityBot 只来 2 次,探针却取源 439 次。搭通用搜索索引便车,是对这次 Perplexity 观察的合理推论;Cloudflare 的爬虫次数不能直接换算 Agent API 的取源次数,也不能推出所有 AI 搜索都采同一路径。专用爬虫对某些引擎仍很重要。

第四,冷需求(L3)尚未证实。 这次题目多围绕特定人物身份。不涉及这个人、纯靠主题竞争的冷需求(L3)查询,这批数据还没有证据。

新站上线两周内,搜索可见度明显上升;另一次探针也确实显示,Perplexity 搜索大量取用了它。“挂对母域,加上可供机器核对的事实来源”能解释眼前数据,但仍是假设。能先学的,是把可复制的四项做扎实;母域究竟替它赢了多少时间,我还算不出来。

FAQ

真的两周就被引用吗?
“两周”是上线后 GSC 曝光的观察窗;引用探针是另外跑的一次截面,DATA 没记确切执行日期,不能宣称引用正好发生在两周内。能确定的是:两周内收录信号明显在涨,探针则显示它已被 Perplexity 的搜索大量抓为来源。
本当に二週間で引用されたのですか? — 「二週間」は、公開後に GSC の表示回数を観察した期間です。引用プローブは別に実行した一回の断面で、DATA には正確な実行日が記録されておらず、引用がちょうど二週間のうちに起きたとは主張できません。確実に言えるのは、二週間のうちにインデックスのシグナルが明らかに伸びていたこと、そしてプローブが、このサイトがすでに Perplexity の検索で大量にソースとして取得されていたことを示していることです。
Was it really cited within two weeks? — "Two weeks" is the observation window for GSC impressions after launch. The citation probe was a separately run single cross-section, and DATA didn't record the exact execution date, so I can't claim the citations happened precisely within the two weeks. What is certain: indexing signals were clearly rising within two weeks, and the probe shows the site was already being pulled heavily as a source by Perplexity's search.
哪些爬虫来了、各几次?
上线数天内 Cloudflare 认证爬虫身份记到:ClaudeBot 183、bingbot 161、Googlebot 67、GPTBot 36、OAI-SearchBot 8、PerplexityBot 2。是验证过的机器人,不是 User-Agent 自称。
どのクローラーが、それぞれ何回来ましたか? — 公開から数日のうちに、Cloudflare の認証済みクローラー ID で記録されたのは、ClaudeBot 183、bingbot 161、Googlebot 67、GPTBot 36、OAI-SearchBot 8、PerplexityBot 2 です。検証済みのボットであり、User-Agent の自称ではありません。
Which crawlers came, and how many times each? — Within days of launch, Cloudflare verified bot identity recorded: ClaudeBot 183, bingbot 161, Googlebot 67, GPTBot 36, OAI-SearchBot 8, PerplexityBot 2. These are verified bots, not self-declared User-Agents.
439 是什么意思?
一次探针(100 题 × 5 个后端、开 web_search 的 Perplexity Agent API)里,tklin.washinmura.jp 被取源 439 次、排第一。它代表在 Perplexity 的搜索里排第一,不等于一般对话中每家 AI 都稳定把它当首选来源。
439 とは何を意味しますか? — 一回のプローブ(100 問 × 5 つのバックエンド、web_search を有効にした Perplexity Agent API)で、tklin.washinmura.jp が 439 回ソースとして取得され、第一位だったという意味です。Perplexity の検索で第一位だったことを表すもので、一般的な対話でどの AI も安定してこのサイトを第一のソースにすることと同じではありません。
What does 439 mean? — In one probe (100 questions × 5 backends, Perplexity Agent API with web_search on), tklin.washinmura.jp was sourced 439 times and ranked first. It means first place within Perplexity's search; it doesn't mean every AI consistently treats it as the top source in ordinary conversation.
为什么 PerplexityBot 只来 2 次却取源 439 次?
合理推论是 Perplexity 这类 meta-search 搭了通用搜索索引的便车,不是只靠自家爬虫建库。但这只对 Perplexity 这一次成立,不能推成所有 AI 搜索都这样;有些引擎很依赖自家专用爬虫,两边都别挡。
なぜ PerplexityBot は 2 回しか来ていないのに、439 回もソースとして取得されたのですか? — 合理的な推論は、Perplexity のような meta-search が汎用検索インデックスに相乗りしており、自社クローラーだけでインデックスを構築しているわけではない、というものです。ただし、これは Perplexity の今回の一回についてのみ成り立つことで、すべての AI 検索がそうだと一般化することはできません。自社の専用クローラーに大きく依存するエンジンもあるので、どちらもブロックしないでください。
Why did PerplexityBot visit only 2 times when the site was sourced 439 times? — A reasonable inference is that a meta-search like Perplexity piggybacked on general search indexes instead of relying only on its own crawler to build a corpus. But this holds only for this one Perplexity run and can't be generalized to all AI search; some engines depend heavily on their own dedicated crawlers, so block neither side.
哪些能复制、哪些是运气?
难照搬的两项:母域既有流量、人名竞争低。可复制的四项:技术全开、单一 @id 实体消歧、anchors.json 第三方证据链、llms.txt 与多语纯文本事实页。
どこが複製でき、どこが運ですか? — そのまま真似しにくいのは二項目:親ドメインの既存トラフィック、人名の競合の少なさ。複製できるのは四項目:技術面の全開放、単一の @id によるエンティティの曖昧性解消、anchors.json による第三者の証拠の連鎖、llms.txt と多言語のプレーンテキスト事実ページです。
What can be replicated, and what was luck? — Two things are hard to carry over: the parent domain's existing traffic, and low competition for the name. Four things can be replicated: opening everything technically, single-@id entity disambiguation, the anchors.json third-party evidence chain, and llms.txt with multilingual plain-text fact pages.
这代表所有 AI 都会引用你吗?
不代表。没有新裸域对照组、没做逐项移除测试,拆不开贡献;439 是特定探针值;冷需求查询未证。这是与数据一致的假设,不是拆解证实的结论。
これは、すべての AI があなたを引用するということですか? — そうではありません。新規のネイキッドドメインによる対照群はなく、項目を一つずつ外すテストも行っておらず、寄与を切り分けられません。439 は特定のプローブでの値です。コールド需要のクエリは実証されていません。これはデータと整合する仮説であり、分解して実証された結論ではありません。
Does this mean every AI will cite you? — No. There is no fresh bare-domain control group and no item-by-item ablation testing, so the contributions can't be separated; 439 is a probe-specific value; cold-demand queries are unproven. This is a hypothesis consistent with the data, not a conclusion confirmed by taking the factors apart.

引用本文

TK Lin・《为什么一个新站,两周就被 AI 搜索大量引用——一次真实的 crawl→index→cite 拆解》・IDAEO 知識庫・2026-10-04・https://km.idaeo.ai/post/ai/why-new-site-cited

更新 2026-10-04T10:13:00.123Z · server-rendered · four-language · IDAEO 知識庫