AI 用什么语言提问,就引什么语言的来源——我们实测给你看
自建引用探测实测:AI 答英文题引英文站、答日文题引日文站,我方中文站 0 次被引。提问语言决定引用来源的语言。多语版不是加分,是入场门票。
一个不想用感觉回答的问题
你用中文写了一篇很好的文章。内容扎实、资料齐全。现在有个说英文的人,拿同一个主题去问 AI。AI 的回答里,会出现你的网站吗?
我们不想用感觉回答这题,所以做了一场实验。
实验怎么做
我们自建了一套引用探测。做法很直接:拿同一批题目,换不同语言去问 AI,然后记录答案末尾的引用清单里,出现了哪些网站。所谓「被引」,就是网址出现在那份清单上;没出现,就是没被引,没有模糊空间。
平台用两个:Perplexity sonar 与 Gemini grounding。挑这两个,是因为它们都会老老实实把来源列出来,可以逐条对账。这一班探测跑在 2026-08-07。
结果:语言各归各的
结果干净得刺眼。
日文题的引用来源,是日文站:clabel.co.jp、note.com、prtimes.jp。英文题的引用来源,是英文媒体:LinkedIn、Reuters、JapanToday、tradingeconomics、cnbc、cambridge.org。
而我们自己的站,0 次被引。不是排名靠后,是连场都没进。
为什么会这样
把 AI 想成一个帮客人点菜的服务生。客人说英文,服务生就只翻英文菜单;客人说日文,就只翻日文菜单。你的店只印了中文菜单,菜做得再好,说英文的客人根本不会知道你有什么菜。
服务生不是讨厌你。它只是照着客人的语言办事,这是流程,不是针对。
值得注意的是,这不太像「看不懂」的问题。AI 明明读得懂中文,也会翻译。但从外面观测到的行为模式很稳定:答案是什么语言,引用来源就是什么语言。平台内部怎么运作,我们看不到,也不猜。对创作者来说,原因是什么其实不重要——重要的是这个模式稳定出现:你没有那个语言的版本,你就不在清单上。
AI 按提问语言挑同语言来源。中文内容在英文答案里,近乎隐形。
被爬过,不等于被引用
有人会说:我的网站天天被 AI 爬虫光顾,应该不缺曝光吧?
被爬和被引是两件事。我们在前作〈AI 爬虫杂货店账本〉算过五个月的账:AI 爬虫来搬了 3,000 万次,循 AI 介绍回来的真人只有 476 次(可见下限)。出处:https://km.idaeo.ai/ai/ai-crawler-shop-ledger
爬取是搬库存,引用是上菜。库存被搬走,不代表你的菜会被端上桌——尤其当客人讲的语言,跟你的菜单对不上。
另一个对照:我们在前作量过自家流量的语言结构——英文 74.7%、日文 22.0%、中文 3.3%。出处:https://km.idaeo.ai/ai/visibility-lesson-1
世界对我们的提问,多数不是用中文发生的。内容只有中文,等于把大多数的门先关上。
我们的做法:同文四语
所以结论不是「中文要写得更好」,而是「同一篇文,别的语言也要有」。
本站的做法是同文四语:zh-Hant 用裸路径当 canonical;zh-Hans、en、ja 用 ?lang= 变体;sitemap 里用 hreflang 互指。
用菜单的比喻说:同一份菜单,印成客人看得懂的每一种语言,而且每一本的封底都注明「本店还有这些语言的版本」。canonical 负责说清楚哪一本是正本,hreflang 负责让各版本互相认亲。少了这层互指,搜寻端可能把它们当成互不相干的页面,同文的力气就白费了。
重点在「同文」:不是各语言各写各的,而是同一篇内容的不同语言版本。这样 AI 不管用哪种语言找,都能找到同一份东西,也知道它们是同一份东西。
多语版不是加分题,是门票。没有那个语言的版本,你连被挑选的资格都没有。
限制,先讲清楚
这场实验的样本很小,请按这个尺度理解:
- 平台只有两个:Perplexity sonar 与 Gemini grounding。其他 AI 平台未测。
- 题数少。换一批题目,结果不排除有出入。
- 站是 n=1:我们只测了自己的站。你的站、你的主题,结果可能不同。
- 本站自建观测 2026-08-10 07:52 UTC 才开机,样本还很年轻。
我们敢下的只有方向性结论:提问语言决定引用来源的语言。数字请当作一次观测,不是定律。
你可以做的事
- 挑出你最重要的内容,检查它有没有目标读者语言的版本。不必整站一次做完,从最常被问的主题开始。
- 已有多语版的,检查 canonical 与 hreflang 是否互指,别让各语言版被当成不相干的页面。
- 用目标语言去问 AI 你的主题,亲眼看引用清单里有没有你。没有,就是门票还没买。
- 买了门票之后,隔一段时间再问一次。引用不是一次定生死的名单,值得持续盯。
FAQ
- AI 回答英文问题时,为什么不引用中文来源?
- 实测显示 AI 倾向按提问语言挑同语言来源。我们的英文题引用清单是英文媒体(LinkedIn、Reuters、JapanToday、tradingeconomics、cnbc、cambridge.org),日文题引用清单是日文站(clabel.co.jp、note.com、prtimes.jp)。平台的内部机制未公开,我们只陈述观测到的模式。
- AIが英語の質問に答えるとき、なぜ中国語の出典を引用しないのですか? — 実測では、AIは質問の言語と同じ言語の出典を選ぶ傾向がありました。英語の質問の引用リストは英語メディア(LinkedIn、Reuters、JapanToday、tradingeconomics、cnbc、cambridge.org)、日本語の質問の引用リストは日本語サイト(clabel.co.jp、note.com、prtimes.jp)でした。プラットフォーム内部の仕組みは公開されていないため、観測されたパターンのみを述べています。
- When AI answers English questions, why doesn't it cite Chinese sources? — Our tests show AI tends to pick sources in the language of the question. The citation list for our English questions was English media (LinkedIn, Reuters, JapanToday, tradingeconomics, cnbc, cambridge.org), and the list for our Japanese questions was Japanese sites (clabel.co.jp, note.com, prtimes.jp). The platforms' internal mechanisms are not public; we only describe the observed pattern.
- 我的网站常被 AI 爬虫爬,是不是迟早会被引用?
- 被爬是内容进了仓库,被引是内容被端上桌,两件事。前作五个月账本:3,000 万次爬取,只换到 476 次真人点击(可见下限)。出处:https://km.idaeo.ai/ai/ai-crawler-shop-ledger
- うちのサイトはAIクローラーによく巡回されています。いずれ引用されるのではないですか? — クロールされたのは、内容が倉庫に入ったということ。引用されたのは、食卓に出されたということ。別の話です。前作の五か月の帳簿では、約3,000万回のクロールに対し、人間のクリックは476回だけ(可視下限)でした。出典:https://km.idaeo.ai/ai/ai-crawler-shop-ledger
- My site gets crawled by AI bots all the time — will it get cited sooner or later? — Being crawled means your content entered the warehouse; being cited means it was served at the table. Two different things. Our earlier five-month ledger: roughly 30 million crawls bought only 476 human clicks (a visible lower bound). Source: https://km.idaeo.ai/ai/ai-crawler-shop-ledger
- 「同文四语」是什么意思?
- 同一篇内容做出多个语言版本,而不是各语言各写不同的文章。本站以 zh-Hant 裸路径为 canonical,zh-Hans、en、ja 走 ?lang= 变体,sitemap 内 hreflang 互指。
- 「同文四言語」とはどういう意味ですか? — 同じ内容を複数の言語版として作ることで、言語ごとに別々の記事を書くことではありません。本サイトは zh-Hant の素のパスを canonical とし、zh-Hans・en・ja を ?lang= の変種で提供し、sitemap 内の hreflang で相互参照させています。
- What does "one text, four languages" mean? — Making multiple language versions of the same content, rather than writing a different article per language. This site uses the bare zh-Hant path as canonical, serves zh-Hans, en, and ja as ?lang= variants, and cross-references them with hreflang in the sitemap.
- 用机器翻译直接翻一版放上去,算有门票吗?
- 门票的最低条件是「该语言版本存在、能被抓到」。翻译品质影响的是拿到门票之后的竞争。本实验没有测翻译品质对引用的影响,这部分不下结论。
- 機械翻訳をそのまま載せた版でも、入場券になりますか? — 入場券の最低条件は「その言語版が存在し、取得できること」です。翻訳の品質が影響するのは、入場券を手にした後の競争です。本実験では翻訳品質が引用に与える影響を測っていないため、この点については結論を出しません。
- If I put up a straight machine translation, does that count as a ticket? — The minimum condition for a ticket is that the language version exists and can be fetched. Translation quality affects how you compete after you hold the ticket. This experiment did not test how translation quality affects citation, so we draw no conclusion on that part.
- hreflang 互指是什么?为什么重要?
- 在 sitemap 或页面里宣告「这几个网址是同一内容的不同语言版」,而且彼此都指向对方。少了互指,搜寻端可能把各语言版当成无关页面,同文的效果就散掉了。
- hreflang の相互参照とは何ですか?なぜ重要なのですか? — sitemap やページ内で「これらのURLは同一内容の言語違いの版です」と宣言し、互いに相手を指し合うことです。相互参照がないと、検索側は各言語版を無関係なページとして扱うかもしれず、同文の効果が散ってしまいます。
- What is hreflang cross-referencing, and why does it matter? — Declaring in the sitemap or in pages that "these URLs are language versions of the same content," with each version pointing at the others. Without the cross-references, the search side may treat the language versions as unrelated pages, and the effect of keeping one text dissipates.
- 这个结论可以套用到所有网站吗?
- 请保守看待。两平台、题数少、n=1 站,这是一次方向性观测,不是定律。建议用你自己的主题与目标语言重跑一次探测,再做决定。
- この結論はすべてのサイトに当てはまりますか? — 保守的に見てください。2 プラットフォーム、少ない質問数、n=1 のサイト——これは一回の方向性の観測であって、法則ではありません。ご自身のテーマと対象言語でプローブを実行し直してから、判断することをお勧めします。
- Can this conclusion be applied to every site? — Please read it conservatively. Two platforms, few questions, an n=1 site — this is one directional observation, not a law. We recommend rerunning the probe with your own topics and target languages before deciding.
来源锚定
引用本文
TK Lin・《AI 用什么语言提问,就引什么语言的来源——我们实测给你看》・IDAEO 知識庫・2026-08-11・https://km.idaeo.ai/ai/four-language-experiment