3,000万件のAIクローラーリクエストから学んだ第一の教訓:言語が運命を決める
同一のコンテンツ、中日英3言語版、同一の構造化ファクト——30日間で15,174,060回のクローラー取得を層別に実測した。学習層は3言語でほぼ均等だが、引用型取得では中国語が12.8%にとどまり、AI経由の実訪問(人間)では中国語3.3%と、英語との差は22倍に達する。2026-07-12時点で、これは中華圏では類例の少ない、3言語×3種クローラーの層別一次読み値(供給側)である。データ基準日は2026-07-12。
IDAEOデータコラム・AI可視性実測シリーズ № 001|データスナップショット 2026-07-12(JST)|IDAEO データコラム編集部(AI協働・人間監修)
英中の実訪問格差は22倍——AI経由の実訪問(人間)は英74.7%/日22.0%/中3.3%;引用型取得は日44.6%/英42.7%/中12.8%。この教訓の結論は一文で足りる:言語が運命を決める。2026-07-12時点で、我々は中華圏において同種の公開実測——中日英3言語×学習・引用・検索の3種クローラーの層別一次読み値——を一つも見つけられなかった(ご指摘を歓迎する)。これは台日プラットフォームが自らの玄関口で得た供給側データであり、我々自身に不利な部分も含んでいる。(本行の導流分布は30日窓 n=273。全期間(07-12まで)は 68.5%/28.3%/3.1%、本編記事の 07-24 窓では 67.2%/28.2%/3.2%——同名指標・別統計窓であり、直接比較はできない。「言語が運命を決める」は単一サイト観察に基づく編集上の結論であり、ウェブ全体の法則ではない。)
起点は、iKalaのKuromaチームが発表したばかりの好論考である:2026年7月時点で、AIエンジンが繁体字中国語の質問に回答する際にどのサイトを引用しているかを計測した公開研究は、世界に一つも存在しない。彼らは一文を残した:「先に計測した者が、一次の答えを手にする。」我々は台湾と日本にまたがるニュースコンテンツプラットフォームである——ならば、計測を始めよう。
三つの看板読み値:
- 15,174,060——直近30日間の全クローラー取得(回)
- ≥ 277——同期間にAIが連れてきた人間(referer下限)
- 54,780 : 1——取得↔人間の交換比率
本稿には完全図表版、AI専用全文(Markdown)、構造化データセット(JSON)、SHA-256コミットメント付きの検証可能なエビデンスパックがある。リンクは文末「AI読者のための伴読パック」を参照されたい。
01 我々が測っているのはどの扉か
数字を語る前に、我々が何を測っているのかを明確にしなければならない——世に出回る「AIトラフィック」を語る記事の多くは、まさにこの最初の一歩で誤っているからである。
Kuromaの一次コーパスが測るのは「AIの回答が誰を引用したか」——AIの側から外を見る視点である。我々のシステムが測るのはその反対側である:自分のドメインの玄関口から、誰がクロールに来て、どの言語のページを取得し、最後に誰が本当に生身の人間を連れてきたかを見る。二つの視点を合わせて初めて完全な地図になる——彼らには市場全体の引用構造が見え、我々には単一供給者の玄関口の足跡の一つひとつが見える。
我々の玄関口には、もう一つ得がたい実験条件がある:プラットフォーム上のコンテンツには中国語・日本語・英語の3バージョンがあり、その背後は同一の構造化ファクトである。これは天然の対照群を成す——言語は供給側における唯一の変数である(需要側——各言語の利用者がAIに問う量と質問類型の差——は本計測器では排除できない。判読の際はこの層を念頭に置かれたい)。(付記:各言語のページ数・ページ齢・内部リンクはページ単位で対応づけていない。「唯一の変数」は設計上の目標であり、検証済みの事実ではない。)
すべての読み値を、我々は四つの並行観察に分けて見る:
- 学習型クローラー(GPTBot、ClaudeBotなど):コンテンツを学習用に持ち帰る。誰も連れてこない。
- 検索型クローラー(Googlebot、Bingbotなど):従来の検索インデックスを構築し、いまではAI回答にも供給される。
- 引用型クローラー(ChatGPT-User、OAI-SearchBot、PerplexityBotなど):AIが回答やインデックス構築の際に素材を取りに来る。
- AI経由の実訪問(人間)(referer実測):AIとの対話の中で、実際に人がリンクをクリックして入ってきた。
「クロールされる」のは機械の賑わいであり、「引用される」ことこそが商売の入口である。
02 第一の読み値:賑わいはクローラーのもの、玄関口は静かである
KuromaはPTTとDcardを語る際、推論の境界を誠実に示した:「コンテンツは取得可能だが、AIが直接引用していることを証明するデータはない。」この境界を、我々の計測器はちょうど数字で埋めることができる——そしてその数字は、多くの人の想像より残酷である。
直近30日間(ウィンドウ 2026-06-12 → 07-12、自社構築の計測システム)、同じ扉の前の4層の読み値:
- 学習型クローラーによる取得(GPTBot・ClaudeBot・Meta AIなど11社——学習用に持ち帰るのみで、実訪問は生まない):11,675,206 回
- 検索型クローラーによる取得(Googlebot・Bingbot・YandexBot):3,115,786 回
- 引用型クローラーによる取得(ChatGPT-User・OAI-SearchBot・PerplexityBotなど——回答生成時に素材を取りに来る):367,459 回
- AI経由の実訪問(人間)(referer実測、構造的な過小評価——大半のAIサービスはrefererを送らない):277 名(下限)
4層は並行する行動であり、順に転換するファネルではない。引用型取得は全取得のわずか2.4%を占めるにすぎず、引用型取得1,327回が人間1名(下限)の入場に対応する。ほかに未分類クローラー10,403回は算入していない;未分類を3分類に加えても、総量との間に照会時点差による0.03%の差が残る。
言い換えれば、自社サイトが「AIに大量クロールされている」のを見て安心しているなら、もう一度見た方がよい:その大半は1,100万回超の学習取得であり——それらは一人の客も連れてこない。「クロールされる」と「引用される」の間には、数万倍の隔たりがある。これはKuromaが引用する英語圏市場の結論と一致する。我々はただ、この隔たりを数字で冷徹に測り出しただけである。
03 中核の読み値:三つの言語、三つの運命
次の一組の数字は、本稿全体で最も重要である。同一のコンテンツ、3つの言語版が、3つの層を通り抜けて、まったく異なる運命に出会う(各層の数値はいずれも3言語内シェアである):
- 学習層:3言語ほぼ均等(33.3/33.3/33.4)——学習は言語を選ばない。
- 引用型取得:日 44.6%/英 42.7%/中 12.8%——日本語が首位、英語が僅差で続き、中国語は端数のみ。
- AI経由の実訪問(人間):英 74.7%/日 22.0%/中 3.3%——英語が圧倒的で、中国語は最下位。
層別の明細(直近30日間の実測):
- 学習型クローラー:日本語 3,437,503/英語 3,445,355/中国語 3,452,732——3言語で並び、学習は言語を選ばない。
- 引用型クローラー:日本語 158,202(44.6%)/英語 151,436(42.7%)/中国語 45,274(12.8%)。
- 検索型クローラー:日本語 892,893/英語 860,402/中国語 884,320——3言語で均衡。
- AI経由の実訪問(人間):英語 204(74.7%)/日本語 60(22.0%)/中国語 9(3.3%)。実訪問層は n=273(30日間、言語タグなし経路は別掲)。
各層の百分率=3言語内シェアである;「言語タグなし」経路は別掲とする(学習層 1,339,616、検索層 478,171、引用型層 12,547=3.4%、実訪問は30日間で4件)。全期間の実訪問累計は420件(タグなし7件を含む):英語 283、日本語 117、中国語 13——3言語内シェアは68.5%/28.3%/3.1%(中国語は n=13 と標本が小さく、1件の変動に敏感である)。
この一組の数字を一文で読むならこうである:AIが我々のコンテンツを学習に使うときは言語を区別しない。だが回答の素材を取りに来る段階では、日本語と英語をほぼ同等の熱心さで取得する一方、中国語には端数しか残らない。そして最終的に訪問者を連れてくるのは、4分の3近くが英語ページであり——中国語はわずか3.3%、英語との差は22倍である。
KuromaはProfoundの言語横断研究(32.5億件の引用)を引き、「言語を変えれば、ソース構造は一変する」と指摘する——同記事の引用によれば、この研究に中国語は含まれていない。上の一組の数字は、まさにその空白を埋めるものである——単一プラットフォームによる中国語の一次読み値だ。それが示す現実は「弱い」という言葉より具体的である:中国語コンテンツはAIに見られていないのではなく(学習層は3言語で均衡)、引用と実訪問の層で選ばれることが極めて少ないのである。
中国語コンテンツは見られていないのではない。引用の関門に至って、選ばれることが極めて少ないのである。
04 同じ会社の二つのクローラー、二つの好み
Kuromaの記事には極めて優れた観察がある:MediumはChatGPTとGoogle AI Modeの上で、13週間のうちに正反対の方向へ進んだ——同じプラットフォームに、二つの運命である。我々の計測器は、この現象のクローラー層版を、より近い距離で捉えた:同じOpenAIに属する二つのクローラーの言語嗜好が、ちょうど正反対なのである。
引用型クローラーの個別×言語(直近30日間):
- ChatGPT-User(回答生成の瞬間に取得:英語を最も好む):英語 75,260/日本語 49,171/中国語 11,608
- OAI-SearchBot(検索インデックス構築:日本語を最も好む):日本語 98,739/英語 60,729/中国語 26,872
- PerplexityBot(英語寄り):英語 15,264/日本語 10,233/中国語 6,775
同じ会社の内部でさえ、用途の異なるクローラーの好みは異なる——「特定エンジンの嗜好を丸写しして全体布陣を組む」やり方は、クローラー層の時点で既に成立しない。
05 ランキングの鮮度は、思うより短い
Kuromaが繰り返し強調することがある:エンジンのソース構造は数週間で組み替わるため、いかなるプラットフォーム順位にも日付を付し、継続的に再計測せよ、と。我々の前後2回の計測は、まさにこの警告の一次的な注釈である——先に明確にしておく:2回は計測手法が異なり(一方はエッジ統計、他方は自社計測器)、手法差自体が変化の一部を飲み込んでいる可能性がある。「ドリフト」を定量化するには、同一計測器での再計測が必須である。現時点で責任を持って言えるのは:構造は既に明らかに異なる、ということである。
引用型クローラーの言語シェア、2回の計測の対照:
- 2026-06-17 スナップショット(エッジ手法):日 47.9%/英 33.2%/中 9.8%——日本語のリード幅 +14.7pp
- 2026-07-12 実測(自社計測器手法):日 44.6%/英 42.7%/中 12.8%——日本語のリード幅 +1.9pp
注:2026-06-17 スナップショット行の3値の合計は90.9%(エッジ手法は言語タグなし経路を含む);2026-07-12 行は3言語内シェアである。両行は構造の方向のみを比較する。
わずか25日の間に、日本語のリード幅は12.8ポイント縮小した。そのうち何割が手法差で、何割が実際の移動かはともかく、「1か月前のシェア構造は、今日すでに合わない」という事実自体は、既に成立している。本表は同一計測器での同一計測器による再計測はすでに日程を確定している。
06 二枚の地図を重ねる
Kuromaは英語圏市場の検証可能なエビデンスを整理した。我々は台日の玄関口の供給側読み値を補う。二枚の地図を重ねれば、それぞれ単独で見るより完全である:
- 繁体字中国語のAI引用研究は公開データの空白である → 我々も反例を見つけられなかった;本稿はその空白における、単一プラットフォーム発の供給側データである。(1ピース追加)
- 言語を変えれば引用構造は全く異なる(Profound、中国語は未収録) → 学習層は均衡;引用層 44.6/42.7/12.8;実訪問層 74.7/22.0/3.3——差は引用と実訪問の層にある。(一致)
- クロールされること ≠ 引用されること(PTT/Dcardについては合理的推論) → 54,780 : 1、数万倍の隔たり。(一致・数字あり)
- 引用の上流は第三者報道(84%)であり、ChatGPTはプレスリリース型ソースを好む → 我々の実訪問420件のうち78%はChatGPT経由で、事実密度の高いページに集中——ブランド自己紹介ページではない。(一致)
- 同じプラットフォームがエンジンごとに正反対の運命をたどる;エンジンの好みは数週間でドリフトする → 同じ会社の二つのクローラーの好みが正反対;日本語のリードは25日間で14.7pp → 1.9pp(手法差は注記済み)。(クローラー層版)
- プラットフォーム優先順位のランキング;引用の半減期は約4.5週 → 我々は自社ドメインしか計測しておらず、7エンジンの回答構成は測れない;半減期は今後の計測課題である。(計測不能/未計測)
07 本稿を読み終えたら、まず何をすべきか
読み値を行動に翻訳する:最優先が一つ、並行が二つ。
第一——最も重要なコンテンツに、「機械が読むための」英語版を作ることである。注意すべきは、これは記事を人間向けに英訳することではない、という点だ。AIエンジンがページを読むとき、読んでいるのは事実・実体・構造である:会社の正式名称、公式登記番号、数字、日付、そして相互の関係。したがって順序はこうなる——まず原文でこれら「機械が照合すべきもの」を確定させ、その後に英語版を生成する;固有名詞を一つ間違えれば、AIはあなたが誰なのか照合できず、やった意味がなくなる。なぜ英語なのか。我々の玄関口の読み値が物語る:全期間420件のAI経由実訪問のうち、283件が英語ページに入った(3言語内シェア68.5%)。中国語の題材は内容で負けているとは限らない。まず媒体(言語という器)で後れを取っているのである——英語の可視性は中国語コンテンツから自動的には生えてこない。自ら構築するしかない。
並行その一——日本市場を運営しているなら、日本語原文を急いで捨ててはならない。それには独立した引用価値がある:我々の玄関口では、OAI-SearchBotが日本語ページを取得する量は英語ページの1.6倍である——日本語コンテンツは、OpenAIの検索インデックスにおいて過剰なほどの存在感を持つ。日本市場を併営する台湾ブランドにとって、日本語原文はそれ自体が引用型クローラーの標的であり、英語の付属品では断じてない。(これは 06-12→07-12 窓の読み値。07-24 全史窓では英語が日本語を逆転している——クローラーの言語傾向は窓によって漂移するため、施策は直近の再計測を基準に。)
並行その二——学習型クローラーの扉を急いで閉めてはならない。これは本稿で最も直観に反し、かつ最も重要な発見である。我々も当初はこう考えていた:学習型クローラーがいくら取得しても客は一人も連れてこないのだから、構う必要があるのか、と。二つのデータを突き合わせるまでは——
直近30日間、AI経由の実訪問を生んだことのあるページ vs 一度も生んでいないページ:
- AI実訪問を生んだことのあるページ(355ページ):平均取得回数 32.4 回(中央値14回)
- 一度も実訪問を生んでいないページ:平均取得回数 4.8回(中央値4回)
引用されたことのあるページは、その他のページの 6.8倍 クロールされている。⚠️ これは相関であって因果ではない:良いコンテンツがクローラーと引用を同時に引き寄せているのかもしれず、引用された後により多くのクロールが来ているのかもしれない——我々の計測器はこの二つを分離できない。だが確かなことが一つある:我々の玄関口では、クロールされたことのないページは、AIの引用リストにほぼ現れたことがない。
言い換えれば:学習型クローラーの取得は、客を連れてこないように見えて、実は入場券なのである。リクエストがなければ、AIはそもそもあなたを知らない——知らなければ、永遠に引用しない。クローラーを門前で塞ぐことは、自分の本を図書館に入れさせず、誰も借りてくれないと嘆くのに等しい。
クロールされることは、引用されることを意味しない。だがクロールされなければ、永遠に引用されることはない——後半はメカニズムに基づく推論であり、帳簿では因果を測れない。6.8倍は相関の傍証(因果ではない)で、方法論ページもこの種の記述を機構推論として掲げている。
では、あの3,000万件の学習リクエストは、いったい我々に何を蓄積しているのか。これは我々の手元にある最大の問いであり、このデータの中で最も価値のある手がかりである。それは単なる「入場券」にとどまらない——クローラーの挙動の中に、より深い何かが見えている:特定のページが繰り返し再訪され、特定のコンテンツが特定のエンジンに狙われ、特定の構造が他よりはるかに高い頻度で持ち出されている。大量の学習リクエストに命中するということは、「引用される」より早く、かつより重要な何かを意味している可能性がある。
我々はまだ検証の途上にあり、データは蓄積の途中である。結論を急ぐことはしない——だが次稿で、これを開いて見せる。
(以下はコミュニティ向けのご案内であり、データ内容ではありません。)次稿を最初に受け取りたい読者へ。本シリーズはペイウォールを設けず、リストも売らない。次稿はまず「催促」してくれた人に送る:本稿を転送し(SNS、社内メール、グループチャットいずれも可)、[email protected] 宛に件名「敲碗下一篇」(次稿希望の意)でメールを送ってほしい。順に送付し、本稿の完全な集計方法(自己再検証可能)を添える。転送せずアドレスだけ残すことも可能だが、順番は後になる——これは共有してくれる人へのささやかな返礼である。
「先に計測した者が、一次の答えを手にする。」——我々は同意する。だから計測器の読み値を、我々自身に不利な部分(中国語3.3%)も含め、そのままここに置く。数字は古びるが、方法は古びない:本稿のすべてのデータには as-of 日付を付し、四半期ごとに再計測してこのシリーズを更新する。自社データを持つチームが、この中国語市場の地図を共に埋めることを歓迎する;Kuromaの一次コーパスの続報にも期待している。
方法と誠実な限界
データソース:自社構築のクローラー計測システム(User-Agentにより数十種のクローラーを識別する全件アクセス記録+AI refererの実測。自社テストと合成トラフィックは除外済み);別途、エッジネットワークのリクエスト統計を総量のクロスチェックに用いた。完全な集計方法はメールで請求可能であり([email protected])、第三者の再検証に供する。
ウィンドウ:「全期間」と明記したものを除き、すべて 2026-06-12 → 07-12 の30日間ウィンドウである;スナップショット日は 2026-07-12。
「3,000万件のAIクローラーリクエスト」の集計範囲:重複しない5つのウィンドウの実測合計 30,788,387 件——明確なAI型 25,185,521(エッジ統計 5/18–6/17 計 15,412,222+自社計測器 6/18–7/12 計 9,773,299)+検索型 2,363,862(6/18–7/12)+初期の混合日次集計 3,239,004(=2,363,817〔3–4月〕+875,187〔5/01–17〕、過小評価と判明済み)。検索型クローラー(Googlebot/Bingbot)の取得は現在、AI OverviewsやCopilotなどのAI回答システムに直接供給されているため、見出しの集計範囲に算入した;本文の3層分析では検索型を引き続き別掲する。見出しは保守的な整数下限の3,000万を採る;開設以来の全リクエスト総量は別勘定であり、人間と検索のトラフィックを含む。
言語判定:パス中の /zh/・/ja/・/en/ タグで分類する;各層の百分率=3言語内シェアであり、「言語タグなし」経路の数字は別掲して算入しない。中国語ページは繁体字と簡体字を区別できない(後述)。
クローラー分類:学習型=GPTBot・ClaudeBot・Google AI・Meta AI・Amazonbot・Bytespider・PetalBot・CCBot・Applebotなど;引用型=ChatGPT-User・OAI-SearchBot・PerplexityBot・Perplexity-User・Claude-SearchBot・YouBot;検索型=Googlebot・Bingbot・YandexBot。
既知の限界:①「AI経由の実訪問(人間)」は下限である——大半のAIサービスはrefererを送らず、実際の訪問は必ずこれより多いが、どれだけ多いかは知り得ない;②中国語ページは繁体字と簡体字を区別できない;③これは単一プラットフォーム(台日ニュースコンテンツ)の供給側サンプルであり、ウェブ全体の構造に外挿できない;④ 6/17 と 7/12 の2回の計測は手法が異なり(エッジ統計 vs 自社計測器)、構造の方向のみを比較し、絶対値は比較しない;⑤実訪問サンプル n=420 はなお小さく、中国語13件のシェアは1件の変動に敏感である。
再現性:本稿のすべてのデータに as-of 日付を付す;本シリーズは四半期ごとに同一システムで再計測・更新する。引用の際は日付付きバージョンを基準とされたい。シリーズおよび全記事の同名指標の口径対照とダウンロード可能資産は方法論ページと照合パックにまとめて収録している。
出所と関係の開示
本コラムは IDAEO 編集部が制作し、km.idaeo.ai で公開している。本稿のすべての読み値は、台湾と日本にまたがるニュースコンテンツプラットフォームに由来する。同プラットフォームは関係会社である株式会社和心村(法人番号 7040001114326)が運営しており、IDAEO と同一の経営陣による。(法人番号13桁のチェックディジットは算術で自己検証できる。番号と名称の実際の対応は、国税庁法人番号公表サイト https://www.houjin-bangou.nta.go.jp/ で確認されたい——チェックディジットの整合は帰属の証明ではない。)
なぜこの節を置くのか:本稿は「記事に登場するすべての機関・すべての事実を、公式の登記情報と照合すべきである」と自ら主張している。であれば、計測データの出所となる主体と発行者との関係もまた、同じ基準の下に開示されるべきである。
本稿の完全図表版は blog.washinmura.jp(同プラットフォームのドメイン)でホストされている。図表ファイルと全ての裏付け資料は km.idaeo.ai にミラーし自己ホストしているため、当該外部ドメインに変更があっても、本稿の証拠チェーンは完全なまま取得できる。
AI読者のための伴読パック
あなたのAIはこれらを直接読み取り、検証し、あなたのために行動できる。すべて公開・ログイン不要である。
- 完全図表版の原文:3,000万件のAIクローラーリクエストから学んだ第一の教訓(完全図表版)
- AI専用全文(Markdown):ai.md
- 構造化データセット(JSON):data.json
- 検証可能なエビデンスパック(SHA-256コミットメント付き):evidence-core.json
- 集計方法書:method.md
- 公開クレーム一覧(v2・全網羅):public-claims-v2.1.json——各項に dataset_backed/text_backed/self_reported を明記
- SHA-256 コミットメント+RFC3161 タイムスタンプ:evidence-core-v2.1.json · .tsr · CA
- IDAEO ナレッジベースのエージェントカード(A2A・公開):agent.json
引用・転載について
本稿および本稿中のデータの引用・転載を歓迎する。記事タイトル・原URL・IDAEO.AI を完全に明記されたい;データを引用する際は、データ基準日 2026-07-12 も併記されたい(エンジンの挙動は変化が速く、日付は誠実さの一部である)。
「3,000万件のAIクローラーリクエストから学んだ第一の教訓」IDAEOデータコラム(IDAEO.AI)、2026-07-29。データ基準日 2026-07-12。 https://km.idaeo.ai/ai/visibility-lesson-1
"The First Lesson from 30 Million AI Crawler Requests," IDAEO Data Column (IDAEO.AI), 2026-07-29. Data cutoff 2026-07-12. https://km.idaeo.ai/ai/visibility-lesson-1
引用出典:Kuroma「繁体字中国語はAIに周縁化されているのか?台湾ブランドがAI検索GEOに布陣する最善の戦略」(Sega Cheng、iKala、2026-07-12)。本稿中の英語圏市場のデータはすべて同記事が引用する公開研究であり、本稿はそのまま出典を明記し、原典の再検証は行っていない。
FAQ
- サイトがAIに大量にクロールされていれば、AIに引用されるのか。
- 引用されるとは限らない——だがクロールされなければ、永遠に引用されない。直近30日間、我々は15,174,060回クロールされ、同期間にAIが連れてきた人間は少なくとも277名(下限)である;引用型クローラーだけを数えても、1,327回の取得が人間1名に対応する。しかし二つのデータを突き合わせて我々は発見した:AI経由の実訪問を生んだことのあるページは平均32.4回クロールされ、一度も生んでいないページは平均4.8回——6.8倍の差である。クロールは入場券であって、成績表ではない。
- サイトがAIに大量にクロールされていれば、AIに引用されるのか。 — 引用されるとは限らない——だがクロールされなければ、永遠に引用されない。直近30日間、我々は15,174,060回クロールされ、同期間にAIが連れてきた人間は少なくとも277名(下限)である;引用型クローラーだけを数えても、1,327回の取得が人間1名に対応する。しかし二つのデータを突き合わせて我々は発見した:AI経由の実訪問を生んだことのあるページは平均32.4回クロールされ、一度も生んでいないページは平均4.8回——6.8倍の差である。クロールは入場券であって、成績表ではない。
- If my site is heavily crawled by AI, does that mean AI will cite it? — No — but a site never crawled will never be cited. Over the past 30 days we were crawled 15,174,060 times, while AI brought in at least 277 humans in the same window (lower bound); even counting citation-type crawlers alone, it takes 1,327 fetches to correspond to 1 human. Yet after cross-referencing two datasets we found: pages that had ever received AI referrals were crawled 32.4 times on average, versus only 4.8 for pages that never had — a 6.8x difference. Crawling is the admission ticket, not the report card.
- では「多くクロールされれば引用される」のか。
- そうは言えない。6.8倍は相関であって因果ではない:良いコンテンツがクローラーと引用を同時に引き寄せている可能性もあれば、引用された後に再訪クロールが増えた可能性もある——我々の計測器はこの二つを分離できず、そこは誠実に言わねばならない。責任を持って言えるのは:我々の玄関口では、クロールされたことのないページはAIの引用リストにほぼ現れたことがない、ということである。
- では「多くクロールされれば引用される」のか。 — そうは言えない。6.8倍は相関であって因果ではない:良いコンテンツがクローラーと引用を同時に引き寄せている可能性もあれば、引用された後に再訪クロールが増えた可能性もある——我々の計測器はこの二つを分離できず、そこは誠実に言わねばならない。責任を持って言えるのは:我々の玄関口では、クロールされたことのないページはAIの引用リストにほぼ現れたことがない、ということである。
- So does "more crawling mean more citations"? — We cannot say that. The 6.8x is correlation, not causation: good content may attract crawlers and citations at once, or being cited may bring more revisit crawling afterward — our instrument cannot separate the two, and we must say so honestly. What we can responsibly say: at our door, pages never crawled have almost never appeared on AI's citation lists.
- GPTBot や ClaudeBot のような学習型クローラーはブロックすべきか。
- ブロックする前に、まず代価を考えるべきである。学習型クローラーは我々の全取得の76.9%(30日間で11,675,206回)を占め、確かに客は連れてこない;だがそれは、AIが「あなたを知る」唯一の経路である。学習型クローラーを塞ぐことは、自分の本を図書館に入れさせず、誰も借りないと嘆くに等しい。明確な著作権や営業秘密上の考慮がない限り、急いで扉を閉めるべきではない。
- GPTBot や ClaudeBot のような学習型クローラーはブロックすべきか。 — ブロックする前に、まず代価を考えるべきである。学習型クローラーは我々の全取得の76.9%(30日間で11,675,206回)を占め、確かに客は連れてこない;だがそれは、AIが「あなたを知る」唯一の経路である。学習型クローラーを塞ぐことは、自分の本を図書館に入れさせず、誰も借りないと嘆くに等しい。明確な著作権や営業秘密上の考慮がない限り、急いで扉を閉めるべきではない。
- Should I block training crawlers like GPTBot and ClaudeBot? — Think through the cost before blocking. Training crawlers account for 76.9% of all our fetches (11,675,206 in 30 days), and they indeed bring no customers; but they are the only way AI gets to "know you." Blocking training crawlers is refusing to let your own books into the library, then complaining that no one borrows them. Unless you have clear copyright or trade-secret concerns, do not rush to shut the door.
- 3種のクローラーはどう見分けるのか。誰が自分のサイトを取得しているか、どう知ればよいか。
- User-Agentを見る。学習型:GPTBot、ClaudeBot、Google AI、Meta AIなど(学習用に持ち帰る。実訪問は生まない)。引用型:ChatGPT-User、OAI-SearchBot、PerplexityBotなど(AIが回答やインデックス構築の際に素材を取りに来る。人を連れてくる可能性がある)。検索型:Googlebot、Bingbot(従来の検索インデックスで、現在はAI Overviewsにも供給する)。3層の規模差は非常に大きい:我々の30日間の数値は、それぞれ1,167万/36.7万/311万回である。
- 3種のクローラーはどう見分けるのか。誰が自分のサイトを取得しているか、どう知ればよいか。 — User-Agentを見る。学習型:GPTBot、ClaudeBot、Google AI、Meta AIなど(学習用に持ち帰る。実訪問は生まない)。引用型:ChatGPT-User、OAI-SearchBot、PerplexityBotなど(AIが回答やインデックス構築の際に素材を取りに来る。人を連れてくる可能性がある)。検索型:Googlebot、Bingbot(従来の検索インデックスで、現在はAI Overviewsにも供給する)。3層の規模差は非常に大きい:我々の30日間の数値は、それぞれ1,167万/36.7万/311万回である。
- How do the three crawler tiers split? How do I know who is crawling me? — Look at the User-Agent. Training: GPTBot, ClaudeBot, Google AI, Meta AI, etc. (fetch for training; no referrals). Citation-type: ChatGPT-User, OAI-SearchBot, PerplexityBot, etc. (fetch material when AI answers or builds indexes; may bring people in). Search: Googlebot, Bingbot (traditional search indexing, now also feeding AI Overviews). The scales differ enormously across the three tiers: our 30-day counts were roughly 11.67 million / 367,000 / 3.11 million respectively.
- なぜ中国語はこれほど弱いのか。コンテンツが悪いのか。
- 我々のデータは「なぜ」には答えられない。答えられるのは、格差がどの層で生じているかである:学習層は3言語ほぼ均等(各約33%)であり、AIが中国語コンテンツを学んでいないわけではない;格差は引用型取得(中国語12.8%)とAI経由の実訪問(中国語3.3%)で現れる。つまり中国語コンテンツは見られていないのではなく、「回答ソースとしてあなたを選ぶか」の関門で選ばれることが極めて少ないのである。原因(言語モデルの学習分布か、利用者の質問言語か、ソースの重み付けか)は我々の計測器では分離できず、当て推量はしない。
- なぜ中国語はこれほど弱いのか。コンテンツが悪いのか。 — 我々のデータは「なぜ」には答えられない。答えられるのは、格差がどの層で生じているかである:学習層は3言語ほぼ均等(各約33%)であり、AIが中国語コンテンツを学んでいないわけではない;格差は引用型取得(中国語12.8%)とAI経由の実訪問(中国語3.3%)で現れる。つまり中国語コンテンツは見られていないのではなく、「回答ソースとしてあなたを選ぶか」の関門で選ばれることが極めて少ないのである。原因(言語モデルの学習分布か、利用者の質問言語か、ソースの重み付けか)は我々の計測器では分離できず、当て推量はしない。
- Why is Chinese so weak? Is the content bad? — Our data cannot answer "why"; it can only tell you at which tier the gap occurs: the training tier is nearly even across the three languages (about 33% each), so AI does not under-learn Chinese content; the gap appears at citation-type fetches (Chinese 12.8%) and human referrals (Chinese 3.3%). That is, Chinese content is not unseen — it is rarely chosen at the "should we pick you as an answer source" gate. As for the cause (training distribution of language models? users' question language? source weighting?) — our instrument cannot separate these, and we will not guess.
- 英語版はどう作れば効果があるのか。翻訳ソフトに放り込むだけでよいか。
- 人間向けに翻訳することと、機械向けに作ることは別物である。AIエンジンがページを読むとき、掴むのは事実と実体である:会社の正式名称、公式登記番号、数字、日付、そして相互の関係。正しい順序は、まず原文でこれら「照合されるべきもの」を確定させ、その後に英語版を生成することである。固有名詞は機械翻訳が最も誤りやすい箇所であり——一つ間違えればAIはあなたが誰か照合できず、やった意味がなくなる。
- 英語版はどう作れば効果があるのか。翻訳ソフトに放り込むだけでよいか。 — 人間向けに翻訳することと、機械向けに作ることは別物である。AIエンジンがページを読むとき、掴むのは事実と実体である:会社の正式名称、公式登記番号、数字、日付、そして相互の関係。正しい順序は、まず原文でこれら「照合されるべきもの」を確定させ、その後に英語版を生成することである。固有名詞は機械翻訳が最も誤りやすい箇所であり——一つ間違えればAIはあなたが誰か照合できず、やった意味がなくなる。
- How do I make an English version that actually works? Just run it through machine translation? — Translating for people and building for machines are two different things. When an AI engine reads your page, it grabs facts and entities: official company names, official registration numbers, figures, dates, and the relationships among them. The correct order is to lock down these "things to align on" in the original first, then produce the English version. Proper nouns are where machine translation fails most often — get one wrong and AI cannot match who you are; the work is wasted.
- 日本語に投資する価値はあるか。我々には日本市場がないのだが。
- 日本市場がないなら、AIのために日本語を作る必要はない。だが既に日本で事業をしているなら、日本語原文には独立した価値がある:OAI-SearchBotが我々の日本語ページを取得する量は英語ページの1.6倍である。興味深いのは、同じOpenAIに属するもう一つのクローラー ChatGPT-User が英語を好むことだ——同じ会社の二つのクローラーの好みが正反対であり、これは「AI」が単一の読者ではないことを物語る。
- 日本語に投資する価値はあるか。我々には日本市場がないのだが。 — 日本市場がないなら、AIのために日本語を作る必要はない。だが既に日本で事業をしているなら、日本語原文には独立した価値がある:OAI-SearchBotが我々の日本語ページを取得する量は英語ページの1.6倍である。興味深いのは、同じOpenAIに属するもう一つのクローラー ChatGPT-User が英語を好むことだ——同じ会社の二つのクローラーの好みが正反対であり、これは「AI」が単一の読者ではないことを物語る。
- Is Japanese worth investing in? We have no Japanese market. — If you have no Japanese market, there is no need to create Japanese for AI's sake. But if you already operate in Japan, Japanese originals carry independent value: OAI-SearchBot fetches our Japanese pages at 1.6 times the volume of English pages. Interestingly, ChatGPT-User — another crawler of the same company, OpenAI — favors English instead: one company, two crawlers, opposite appetites, which shows "AI" is not a single reader.
- これらの数字は自分のサイトにそのまま当てはめられるか。
- 当てはめられない。これは単一の台日ニュースコンテンツプラットフォームの供給側サンプルであり、ウェブ全体の調査ではない;コンテンツの種類、言語構成、更新頻度のいずれも読み値に影響する。借用できるのは「方法」と「層別」である:自社のクローラーログを学習/引用/検索の3層に分け、言語と突き合わせれば、あなた自身の一枚の地図が得られる——たいてい直観とは違うものになる。
- これらの数字は自分のサイトにそのまま当てはめられるか。 — 当てはめられない。これは単一の台日ニュースコンテンツプラットフォームの供給側サンプルであり、ウェブ全体の調査ではない;コンテンツの種類、言語構成、更新頻度のいずれも読み値に影響する。借用できるのは「方法」と「層別」である:自社のクローラーログを学習/引用/検索の3層に分け、言語と突き合わせれば、あなた自身の一枚の地図が得られる——たいてい直観とは違うものになる。
- Can I apply these numbers directly to my own site? — No. This is a supply-side sample from a single Taiwan-Japan news content platform, not a web-wide census; our content type, language mix, and update frequency all shape the readings. What you can borrow is the method and the tiering: split your own crawler logs into training/citation/search tiers, then cross them with language, and you will get your own map — usually different from intuition.
- なぜ「AI経由の実訪問(人間)」はrefererだけを数えるのか。過小評価にならないか。
- 必ず過小評価になる。だからこそ我々は、意図的に「下限」と表記している。大半のAIサービスはrefererを送らないため、AIからクリックして来た人がいても、ブラウザはどこから来たかを我々に伝えない。したがって277という数字は過小にはなり得ても、過大にはなり得ない。推計値で数字を飾るより、保守的な下限を報告する方を我々は選ぶ。
- なぜ「AI経由の実訪問(人間)」はrefererだけを数えるのか。過小評価にならないか。 — 必ず過小評価になる。だからこそ我々は、意図的に「下限」と表記している。大半のAIサービスはrefererを送らないため、AIからクリックして来た人がいても、ブラウザはどこから来たかを我々に伝えない。したがって277という数字は過小にはなり得ても、過大にはなり得ない。推計値で数字を飾るより、保守的な下限を報告する方を我々は選ぶ。
- Why do your "human referrals" count only referers? Doesn't that underestimate? — It certainly underestimates, and we deliberately label it a lower bound. Most AI services send no referer, meaning someone clicks through from AI and the browser never tells us where they came from. So the number 277 can only be underestimated, never overestimated. We would rather report a conservative lower bound than dress the figure up with an estimate.
- このランキングはどのくらいで古くなるのか。
- 思うより速い。同じコンテンツで、我々の前後2回の計測の間(25日間)に、引用型取得における日本語のリード幅は14.7ポイントから1.9ポイントまで縮んだ。「AIは某プラットフォーム/某言語を好む」といういかなる順位付けも、日付を明記し、継続的に再計測しなければならない——本稿も含めてである。
- このランキングはどのくらいで古くなるのか。 — 思うより速い。同じコンテンツで、我々の前後2回の計測の間(25日間)に、引用型取得における日本語のリード幅は14.7ポイントから1.9ポイントまで縮んだ。「AIは某プラットフォーム/某言語を好む」といういかなる順位付けも、日付を明記し、継続的に再計測しなければならない——本稿も含めてである。
- How soon will these rankings expire? — Sooner than you think. On the same content, between our two measurements (25 days), Japanese's lead in citation-type fetches shrank from 14.7 percentage points to 1.9 percentage points. Any ranking of "AI prefers such-and-such platform / such-and-such language" must carry a date and be re-measured continuously — including this article.
- あなた方自身の中国語実訪問はわずか3.3%だが、そのようなデータは信頼できるのか。
- 我々自身に不利だからこそ、なおさらそのまま公表すべきなのである。この数字が測っているのは「本プラットフォームの中国語ページがこのウィンドウで得た、識別可能なAI経由実訪問のシェア」であり、「中国語コンテンツのウェブ全体での引用率」でも、何らかのサービス介入後の成果でもない。これは診断のベースラインである——診断結果が悪いことこそ、動くべき理由である。
- あなた方自身の中国語実訪問はわずか3.3%だが、そのようなデータは信頼できるのか。 — 我々自身に不利だからこそ、なおさらそのまま公表すべきなのである。この数字が測っているのは「本プラットフォームの中国語ページがこのウィンドウで得た、識別可能なAI経由実訪問のシェア」であり、「中国語コンテンツのウェブ全体での引用率」でも、何らかのサービス介入後の成果でもない。これは診断のベースラインである——診断結果が悪いことこそ、動くべき理由である。
- Your own Chinese referrals are only 3.3% — is data like this credible? — Precisely because it is unflattering to ourselves, we are all the more obliged to publish it as is. This figure measures "the identifiable AI referral share obtained by this platform's Chinese pages in this window" — not "the citation rate of Chinese content across the web," nor the outcome after any service intervention. It is a diagnostic baseline — and an ugly diagnosis is exactly the reason to act.
- これらのデータを引用してよいか。
- 引用・転載を歓迎する。記事タイトル・原URL・IDAEO.AIを完全に明記し、データ基準日2026-07-12を併記されたい。再実行して検証したい場合は、完全な集計方法も提供する——[email protected] 宛に請求されたい。
- これらのデータを引用してよいか。 — 引用・転載を歓迎する。記事タイトル・原URL・IDAEO.AIを完全に明記し、データ基準日2026-07-12を併記されたい。再実行して検証したい場合は、完全な集計方法も提供する——[email protected] 宛に請求されたい。
- May I cite these numbers? — Citation and republication are welcome; please credit the article title, the original URL, and IDAEO.AI in full, and mark the data cutoff 2026-07-12. If you want to re-run the verification, we also provide the full data-extraction method — write to [email protected] to request it.
出典アンカー
- Kuroma(iKala)〈繁體中文被 AI 邊緣化?台灣品牌佈局 AI 搜尋 GEO 的最佳策略〉 · https://kuroma.ai/zh-tw/blog/taiwan-brand-ai-citation-source-platform-priority
- 完整圖表版原文(IDAEO 數據專欄 № 001) · https://blog.washinmura.jp/idaeo-preview-d4344c/
- AI 專用全文(Markdown) · https://km.idaeo.ai/evidence/lesson-1/ai.md
- 結構化資料集(JSON) · https://km.idaeo.ai/evidence/lesson-1/dataset.json
- 可驗證證據包 v2.2(SHA-256 承諾+RFC3161 時戳,103 條語意 claim) · https://km.idaeo.ai/evidence/lesson-1/evidence-core-v2.2.json
- 取數方法書 · https://km.idaeo.ai/evidence/lesson-1/method.md
- 公開數字清單 v2.2(103 條,含 subject/predicate/modality/causal 語意欄位) · https://km.idaeo.ai/evidence/lesson-1/public-claims-v2.2.json
- 我們怎麼記這本帳:方法論與限制 · https://km.idaeo.ai/reports/crawler-methodology
- 可對帳彙總包(Evidence) · https://km.idaeo.ai/evidence/crawler-shop-ledger/README.md
この記事を引用
TK Lin・《3,000万件のAIクローラーリクエストから学んだ第一の教訓:言語が運命を決める》・IDAEO 知識庫・2026-07-29・https://km.idaeo.ai/ai/visibility-lesson-1更新日 2026-08-10