个人 IDA 方法论:如何为一个人建立 AI 会引用的官方事实来源
个人 IDA 是为一个人建立的官方事实库,要同时做到可查证、机器可读、诚实分区、可重算。做法五步,守则只有一条——只喂可查证的。
AI 被问起你时,手上最好有一份你敢署名、别人也查得回去的事实底稿。个人 IDA 做的就是这件事。它背后的 crawl→index→cite 概念及与 SEO 的差异,见《AEO 不是 SEO》;我的实测数字与机制推论,见《为什么一个新站,两周就被 AI 搜索大量引用》。这篇说搭建方法。
定义
个人 IDA(Identity Data Aggregation)是一个人的官方事实库:内容可查证、格式让机器读得懂,并尽量成为 AI 愿意引用的权威来源。当 AI 被问到“这个人是谁”,目标是让它找到本人愿意负责的版本,减少依赖第三方转述或错误资料。
为什么要做
我观察到,越来越多人认识一个人的第一步,是直接问 AI;对这部分人,AI 的回答就是第一印象。这是趋势观察,不是这次案例量到的数字。
如果本人没有提供能核对的版本,AI 只能从第三方资料拼凑。那些资料可能过时、片面,甚至有错;回答却可能说得很肯定。你无法等它说错了,才期待每个提问的人都来看澄清。先把可负责的事实备好,才有机会让它拿对来源。
四个条件

有个人网站,只是有了位置。个人 IDA 还得具备四个条件。
- 可查证:每条事实都有锚点,能回到原始来源或公开记录。“卓越”“资深”这类形容词不能充当事实。
- 机器可读:使用 schema.org 的 Person/Organization 结构化数据;全站用单一 `@id` 作为这个人的规范标识符,让分散的 Person 与相关 Organization 数据都锚定到同一个人,同时保留人与公司的区别。再提供多语版本,减少机器猜测。
- 诚实边界:已查证的事实,与自述、他人形容,分开标示。
- 可重算:第三方能对回原始来源、核对网页存档并重算哈希,才谈得上 citation-grade。sha256 能验内容是否一致、是否被篡改;它不能验内容本身为真。
五步做法


这五步沿着“爬取 → 收录 → 引用”往前走。每一步都要留下看得见的产出。
第一步:建事实库。 只把可查证的内容放进事实区,每条标出锚点;自述与待查说法另放。替来源保留网页存档、记下哈希,日后才有办法重算。这一步决定事实库能不能让人信任,别赶。
第二步:机器可读化。 制作 JSON-LD(Person 与 Organization,共用单一 `@id`)、多语版本及 `llms.txt`。把第三方出处整理成机器可读的 `anchors.json`,逐条附网页存档与哈希。
第三步:打开爬虫。 `robots.txt` 全开,提交 sitemap,启用 IndexNow,HTTP 标头设 `X-Robots-Tag: all`。页面写好了,也要让爬虫进得来。
第四步:进索引,并分三层追踪。 各看各的信号:
- 爬取:看 Cloudflare 的认证爬虫身份,确认哪些机器人真的来了。
- 收录/曝光:看 Google Search Console 的曝光,追踪搜索可见度;曝光上升不等于已收录页数。
- 引用:用固定题组或引用探针,看页面有没有被取回、被写进答案。
《为什么一个新站,两周就被 AI 搜索大量引用》的数字显示,三层可能各走各的。拿其中一层替另一层下结论,容易失准。
第五步:量引用率。 固定题组、定期追踪,分别记录页面有没有被取回作为来源(retrieved),以及有没有写进答案(cited)。两个指标分开,才知道事实库究竟在哪一段发挥作用。
真实案例:一句话
我替自己建的个人 IDA 位于 tklin.washinmura.jp,2026-09-20 上线。其后两周,Google 曝光持续上升;另一次 Perplexity 引用探针,则大量取回这个站作为来源。完整数字、三层各自量到什么,以及爬虫来得少却被大量取源的推论与局限,见《为什么一个新站,两周就被 AI 搜索大量引用》。
诚实原则:只喂可查证的

AI 可能连错误也照着复述。事实库里每一句话,因此都要经得起回头核对。
网络上流传的媒体封号、专访说法,即使好听,本人若无法用原始来源证实,就不能写进事实区。放进去,AI 可能把它当成本人认证的事实继续传。
处理方式很简单:
- 已查证的事实,附锚点,放事实区。
- 自述、他人形容、尚待查证的说法,另放一区,清楚标明性质。
个人 IDA 的信用,就押在这条界线上。你给 AI 的每句“事实”,都得愿意让别人查。
一句诚实提醒
目前只有我自己的单一案例支持这套方法,限制不能省略:
- 没有新裸域对照组,也没有做逐项移除测试。 tklin.washinmura.jp 挂在已有 AI 爬虫流量渠道的母域下。我拆不开母域、内容质量、技术配置三者的贡献;数据也没证明母域把权重继承给子站。换成毫无历史的全新裸域,收录很可能明显变慢。这是合理预期,并非验证过的必然。
- “被大量引用”有特定测量条件。 439 次取源来自刻意开启 web_search 的 Perplexity Agent API 探针。受测的 5 个后端都走 Perplexity 自己的网页搜索;量的是 Perplexity 搜索会不会抓它当来源,并非五家独立 AI 各自判断。这个值也不等于一般对话中,每家 AI 都稳定把它当首选来源。
- 冷需求(L3)尚未证实。 这次题目多围绕特定人物的身份。对于不涉及这个人、纯靠主题竞争的冷需求(L3)查询,目前没有证据。
更完整的对照与保留,见《为什么一个新站,两周就被 AI 搜索大量引用》的诚实局限段。
结语
个人 IDA 要治理的是一个人的身份与事实来源。五步能把来源建起来;能让它站得住的,始终是同一条守则:只喂可查证的。
可查证锚点:个人 IDA(tklin.washinmura.jp)。测量分三层、三个来源:爬取看 Cloudflare 认证爬虫身份、收录看 Google Search Console 曝光、引用看 Perplexity 引用探针;本文数字皆以此为准。
FAQ
- 个人 IDA 是什么?
- Identity Data Aggregation,一个人的官方事实库:内容可查证、格式让机器读得懂,并尽量成为 AI 愿意引用的权威来源。
- 個人 IDA とは何ですか? — Identity Data Aggregation、つまり一人の人物の公式の事実データベースです。内容は検証可能で、形式は機械が読み取れ、できるかぎり AI が引用したくなる権威あるソースとなることを目指します。
- What is a personal IDA? — Identity Data Aggregation: a person's official fact base, with verifiable content, a machine-readable format, and the aim of becoming, as far as possible, an authoritative source AI is willing to cite.
- 为什么要做?
- 越来越多人认识一个人的第一步是直接问 AI;本人没提供官方版本,AI 只能从第三方拼凑,可能过时、片面甚至有错,却讲得很肯定。(这是趋势观察,不是这次案例量到的数字。)
- なぜ取り組むのですか? — 人を知る最初の一歩として AI に直接尋ねる人が増えています。本人が公式版を提供していなければ、AI は第三者の情報をつなぎ合わせるしかなく、それは古かったり、一面的だったり、誤っていることさえあるのに、断定的に語られます。(これは傾向の観察であり、今回の事例で計測した数字ではありません。)
- Why do it? — For more and more people, the first step in getting to know someone is asking AI directly. If the person hasn't provided an official version, AI can only piece one together from third parties, which may be outdated, partial, or wrong, yet stated with confidence. (This is a trend observation, not a number measured in this case.)
- 四个条件是哪四个?
- 可查证(每条有锚点)、机器可读(schema.org+单一 @id+多语)、诚实边界(事实与自述分区)、可重算(第三方能对回原始来源、重算哈希)。
- 四つの条件とは何ですか? — 検証可能(一件ごとにアンカーがある)、機械可読(schema.org+単一の @id+多言語)、正直な境界(事実と自己申告を区分する)、再計算可能(第三者が原典と突き合わせ、ハッシュを再計算できる)です。
- What are the four conditions? — Verifiable (every item has an anchor), machine-readable (schema.org + single @id + multilingual), honest boundaries (facts and self-descriptions in separate sections), and recomputable (a third party can trace back to the original source and recompute the hash).
- 五步做法?
- 建事实库→机器可读化(JSON-LD/llms.txt/anchors.json)→打开爬虫(robots/sitemap/IndexNow/X-Robots-Tag)→进索引并分三层追踪(爬取/收录/引用)→量引用率(retrieved 与 cited 分开记)。
- 五つのステップとは? — 事実データベースを作る→機械可読にする(JSON-LD/llms.txt/anchors.json)→クローラーに開放する(robots/sitemap/IndexNow/X-Robots-Tag)→インデックスに入り、三層に分けて追跡する(クロール/インデックス/引用)→引用率を測る(retrieved と cited を分けて記録)。
- What are the five steps? — Build the fact base → make it machine-readable (JSON-LD / llms.txt / anchors.json) → open up to crawlers (robots / sitemap / IndexNow / X-Robots-Tag) → get indexed and track three layers (crawl / index / cite) → measure the citation rate (record retrieved and cited separately).
- “只喂可查证的”是什么意思?
- AI 可能把你给的内容原封复述,包括错的。无法用原始来源证实的媒体封号、说法,不能进事实区;要分区标明性质。这条线把个人 IDA 和公关稿分开。
- 「検証可能なものだけを与える」とはどういう意味ですか? — AI は、あなたが与えた内容を、誤りも含めてそのまま復唱するかもしれません。原典で裏づけられないメディアの称号や表現は、事実セクションに入れてはいけません。セクションを分け、性質を明示します。この一線が、個人 IDA と PR 原稿を分けます。
- What does "feed only the verifiable" mean? — AI may repeat what you give it verbatim, including what's wrong. Media titles and claims that can't be confirmed with an original source can't go in the fact section; separate them and label what they are. That line is what separates a personal IDA from a PR piece.
- 这套方法有效吗?
- 目前只有作者自己一个案例的实测支持,且挂在已有 AI 爬虫流量的母域下,拆不开母域、内容、技术的贡献;换全新裸域收录很可能明显变慢(合理预期,非验证过的必然)。冷需求查询尚未证实。
- この方法は効果がありますか? — 現時点では著者自身の一事例の実測による支持しかなく、しかもすでに AI クローラーのトラフィックがある親ドメインの下に置かれているため、親ドメイン・コンテンツ・技術の寄与を切り分けられません。まったく新規のネイキッドドメインに替えれば、インデックスは明らかに遅くなる可能性が高いでしょう(合理的な予想であり、検証済みの必然ではありません)。コールド需要のクエリはまだ実証されていません。
- Does this method work? — So far it is supported only by measurements from the author's own single case, on a site under a parent domain that already had AI-crawler traffic, so the contributions of parent domain, content, and technical setup can't be separated. On a brand-new bare domain, indexing would very likely be noticeably slower (a reasonable expectation, not a verified certainty). Cold-demand queries are not yet proven.
来源锚定
引用本文
TK Lin・《个人 IDA 方法论:如何为一个人建立 AI 会引用的官方事实来源》・IDAEO 知識庫・2026-10-04・https://km.idaeo.ai/post/ai/personal-ida-methodology