本文へ移動

AIに選ばれる情報は、どう作られるのか。

検証レポート

AIにすすめられる会社は、何が違うのか 口コミ件数は3〜5倍、評価は10分の1星の差

  • 米国の100大都市圏で、AIが挙げた推薦先を公式の登録簿と1件ずつ照合した監査では、ウェブ検索を切った条件で実在の臨床医と一致したのは4%と11%でした。同じ分野でも検索をつなぐと、64〜71%まで上がります。
  • 実在を確かめられる推薦に絞っても、選ばれ方は評価より露出に寄ります。飲食店では、すすめられた店の口コミ件数が3〜5倍に偏った一方、評価そのものの差は10分の1星までしか開きませんでした。
  • 名前が挙がった影響は、AI経由の流入には出てきません。直前まで接点のなかった人の社名検索が4.3ポイント、自社サイトへの訪問が2.4ポイント増える一方、その動きの大半は検索を経由するためです。
AIにすすめられる会社は、何が違うのか 口コミ件数は3〜5倍、評価は10分の1星の差

答え:評価の高さではなく、名前の出回り方で選ばれている

AIが会社をすすめる基準は、評価の高さよりも名前の出回り方に寄っています。米国の飲食店では、すすめられた店の口コミ件数が3〜5倍に偏った一方、評価そのものの差は10分の1星までしか開きませんでした。

「この辺でいい歯医者はどこ」「中小企業に強い税理士を教えて」といった質問に、AIは固有名詞で答えます。ここに自社が挙がるかどうかで問い合わせの数が変わるので、何を見て選んでいるのかは知っておきたいところです。

米国の100大都市圏を対象に、AIが挙げた推薦先を公式の登録簿と1件ずつ照合した監査が公開されました。医師はMedicareの診療記録、投資助言の会社はSECへの届出と突き合わせているため、答えに出てきた名前が実在するかどうかを機械的に判定できます。

あわせて、AIが答える前にウェブ検索を挟むかどうかを4つのサービスで追った調査と、名前を出された側でその後に何が起きるかを閲覧履歴で測った研究が並びました。選ばれる基準と、選ばれたあとに動くものを、続けて確かめられます。

検索を挟まないAIは、実在しない会社をすすめる

ウェブ検索を挟まずに答えたAIでは、すすめられた医師のうち実在の臨床医と一致したのは4%と11%でした。同じ分野でも検索をつなぐと64〜71%まで上がるため、名前が実在するかどうかは答える側の設定でほとんど決まっています。

監査は3つの条件を比べています。誰でも動かせる公開モデル、ウェブ検索を切った商用モデル、そして同じ商用モデルに検索をつないだ条件です。

ウェブでの情報が薄い分野ほど、検索を切ったAIは名前を作ります。すすめられた医師が、質問した都市の登録簿にいる臨床医と一致した割合は、公開モデルで4%、商用モデルで11%にとどまりました。

公開モデルのほうは、一致した分も実質は偶然です。一致した医師が初期診療を担う医師である割合は登録簿から無作為に名前を引いたときと変わらないため、実在の人物を指して答えていたわけではありません。

ウェブ検索の有無で推薦先の実在率がどう変わるか(米国100大都市圏・公式の登録簿と1件ずつ照合)
答える条件推薦された医師のうち、その都市の登録簿と一致した割合照合に使った名簿
公開モデル・検索なし4%Medicareの臨床医の記録
商用モデル・検索なし11%Medicareの臨床医の記録
商用モデル・検索あり同じ分野の推薦の64〜71%が実在の提供者と一致Medicareの記録とSECの届出

どんな会社が選ばれるかも、検索の有無で入れ替わります。検索を切った条件では、すすめられた投資助言の会社がSECの処分歴を持つ割合が登録簿全体の3.6倍にのぼり、会社の規模で調整しても残りました。検索をつなぐと、この割合は逆に全体の水準を明確に下回ります。

都市の大きさによる差も同じように動きます。検索なしでは実在する推薦が大都市へ偏る一方、検索をつなぐと、都市の規模で3つに分けたどの層でも一致率がほぼそろいました。

検索を挟んでも、選ばれるのは評価の高い店ではない

実在を確かめられる推薦に絞っても、選ばれ方は品質より露出に寄ります。飲食店では、すすめられた店の口コミ件数が3〜5倍に偏った一方、評価そのものの差は10分の1星までしか開きませんでした。

飲食店を切り出しているのは、品質と露出を別々に測れるからです。星の評価が品質、口コミの件数が人目に触れた量にあたるので、どちらが推薦と結びついているかを分けて見られます。

結果は片方に寄りました。すすめられた店とそうでない店を分けているのは評価の高さではなく、名前が書かれた回数のほうです。ただし、これは同時に観測された偏りであって、口コミを増やせば推薦されると確かめた実験ではありません。

読者の側で決められないのが、検索を挟むかどうかです。ChatGPT・Claude・Grok・DeepSeekの4つを、実際の利用と制御した実験の両方で追った調査では、検索を呼び出す判断がサービスごとにもモデルごとにも大きく違いました。よく検索するほど答えがよくなるわけでもありません。

それぞれのサービスの検索エンジンが、自分の好むドメインから結果を返す傾向も出ています。答えの大半は検索結果に基づく一方、引用の付かないまま使われた検索結果も混じるため、引用リンクに自社が出ていないことと、読まれていないことは同じではありません。

すすめられた先で、人は社名で検索する

AIが名前を出すと、直前まで接点のなかった人の社名検索が4.3ポイント、自社サイトへの訪問が2.4ポイント増えます。動いた先の大半は検索を経由するので、AI経由の流入だけを数えているとこの入口は見えません。

測り方は、許諾を得た閲覧履歴と、同じ人のChatGPT・Claude・Geminiの会話を結び合わせたパネルです。直前に接点のなかった人へブランド名が出た場合を、同じ人の過去の期間と比べています。

増えたのは3つで、社名での検索が4.3ポイント、ブランド自身のサイトへの訪問が2.4ポイント、そのブランドの商品ページへの訪問が1.0ポイントでした。すでに使っているサービスの名前が会話の中でただ出ただけの場合は、同じ3つが1.8・1.1・0.3ポイントにとどまります。

AIがブランド名を出したあと、その後の行動がどれだけ増えるか(許諾を得た閲覧履歴と会話ログを結び合わせた利用者が母数/直前に接点のなかった人に限定)
その後の行動すすめとして名前が出た場合会話の中でついでに名前が出た場合
社名での検索+4.3ポイント+1.8ポイント
ブランド自身のサイトへの訪問+2.4ポイント+1.1ポイント
そのブランドの商品ページへの訪問+1.0ポイント+0.3ポイント

すすめとして挙がった名前と、ついでに出ただけの名前とでは、その後の動きの大きさが違います。両者を分けずにまとめて数えると、AIが人を動かした量は実際より大きく見えてしまいます。

厄介なのは、増えたぶんが参照元に残らないことです。人はAIの回答から直接飛ぶより社名で検索し直すため、流入は検索経由として記録されます。最後に触れた経路だけを見る測り方では、この入口はまるごと落ちます。

Webマーケ担当者が、いまやること

最初にやることは、自社と競合の口コミ件数を数えて差を出すことです。星の平均が並んでいても件数が一桁違うなら、AIの推薦で先に負けているのは件数のほうになります。

必要なのはブラウザと表計算ソフトだけで、広告費も開発の手も最初の一巡には要りません。

  • 自社と競合5社について、Googleマップと業界の比較サイトで口コミの件数と平均評価を並べる。件数の桁が違う相手が、AIの推薦で先に出る相手になる
  • 口コミを増やす導線を1つ作る。納品後のメールや請求書に依頼の一文を入れるだけでも、件数は積み上がっていく
  • 業界団体の名簿や公的な事業者一覧に、自社の名称・住所・業種が正しく載っているかを確かめる。照合に使われるのは、この手の名簿になる
  • ChatGPTで自社の業種と地域を指定して聞き、回答に引用リンクが並んだかを見る。リンクが1つも無い回答は、実在を確かめずに書かれている
  • 成果はAI経由の流入ではなく、Search Consoleの社名での検索の表示回数とクリック数で追う。AIに名前が出た影響は、この数字のほうに現れる
  • 引用リンクに自社が出ていないことを理由に、施策を止めない。引用が付かないまま参照されている場合がある

一巡は半日で終わります。口コミの件数は積み上がるまでに数か月かかるため、評価の改善やページの手直しより先に動かしておくと、順番に無駄がありません。

観測手法

公開された資料3件だけを使いました。1件目は、Hazem Ibrahim と Yasir Zaki が2026年9月16日にarXivへ投稿した「Understanding AI Provider Recommendations in Local Service Markets」です。米国の100大都市圏について、公式の登録簿で裏づけが取れる4分野の推薦先を1件ずつ照合した12ページの監査で、医師と施設はMedicareの記録、投資助言の会社はSECへの届出を照合先にしています。比べた条件は、公開モデル、ウェブ検索を切った商用モデル、同じ商用モデルに検索をつないだものの3つです。

2件目は、Mahsa Amani ほか11名が2026年9月16日にarXivへ投稿した「Characterizing Web Search by Conversational LLM Agents」です。ChatGPT・Claude・Grok・DeepSeekの4つについて、実際の利用者とのやり取りと、同じサービスのモデルをAPIで動かした制御実験を組み合わせ、検索を呼び出す判断、検索語の作り方、返ってくる結果の偏り、答えへの反映までを通して調べています。この資料からは数値を本文に入れていません。

3件目は、Michael Iannelli と Alan Ai が2026年6月9日にarXivへ投稿し、2026年8月31日に改訂した「From Prompt to Purchase: How AI Brand Recommendations Move Consumers on the Open Web」です。許諾を得た閲覧履歴と、同じ利用者のChatGPT・Claude・Geminiの会話を結び合わせたパネルを使い、直前に接点のなかった利用者に絞って、同じ人の過去の期間を対照に効果を推定した10ページの研究です。

AIMAによる独自の計測は行っていません。本文中の数値は、取得時に保存した原文から機械的に抽出したものです。

この記事で言えないこと

3件とも米国での観測で、日本語の質問や日本の事業者で同じ比率になるかは確かめられていません。口コミ件数が3〜5倍という偏りは飲食店に絞った比較であり、同時に観測された関連であって、件数を増やせば推薦されると示した実験ではありません。検索をつないだときの64〜71%も、挙がった名前がその都市に実在する提供者と一致したという意味までで、その提供者が質問者にとって適切だったことは示していません。検索を挟むかどうかは利用者の環境とサービス側の設計で決まるため、サイト側の作業では動かせない点にも注意が要ります。行動の数字は取引そのものを観測したものではなく、商品ページへの訪問までの測定です。1.8・1.1・0.3ポイントのほうは、すでに接点のある利用者を含んだ素朴な集計に対応する値で、本筋の推定と同じ条件でそろえた数字ではありません。ここから言えるのは、推薦の実在率が検索の有無で大きく変わること、実在する推薦の中では評価より言及の量が推薦先と結びついていること、そして名前が挙がった影響が社名での検索として現れること、この3点までです。

突き合わせた資料

  1. 推薦先を公式の登録簿と照合した監査Understanding AI Provider Recommendations in Local Service Markets(米国100大都市圏・4分野/Medicareの記録とSECの届出で照合)
    arXiv cs.CY/取得 2026-09-17
  2. 検索を挟むかどうかの実態Characterizing Web Search by Conversational LLM Agents(ChatGPT・Claude・Grok・DeepSeekの4サービス/実利用と制御実験の組み合わせ)
    arXiv cs.IR/取得 2026-09-18
  3. 推薦されたあとの行動の実測From Prompt to Purchase: How AI Brand Recommendations Move Consumers on the Open Web(閲覧履歴とChatGPT・Claude・Geminiの会話を結んだパネル)
    arXiv cs.CY/取得 2026-09-02

出典

  1. Understanding AI Provider Recommendations in Local Service Markets|arXiv:2609.18341(Hazem Ibrahim ほか、2026年9月16日)
  2. Characterizing Web Search by Conversational LLM Agents: From Search Decisions and Strategies to Results and Responses|arXiv:2609.19244(Mahsa Amani ほか、2026年9月16日)
  3. From Prompt to Purchase: How AI Brand Recommendations Move Consumers on the Open Web|arXiv:2606.10907(Michael Iannelli ほか、2026年8月31日改訂)
検証レポート AIの答えは、聞く人によって変わるのか 同じ質問でも重なるブランドは4分の1 同じ質問に年代・性別・収入・職業を一言足すと、挙がるブランドの重なりは約5分の2から約4分の1へ、引用元の重なりは34%から20%へ落ちる(71,147件の回答)。衣料では低収入8〜24ドル、高収入140〜1,650ドルと商圏ごと入れ替わる。買い手の質問の78.3%は調べもの段階。 検証レポート AIに引用されるには、よそのサイトに載るしかないのか 引用の84%は第三者サイト 引用の約84%は第三者サイト(2,500万リンク)。AI Modeの上位10ドメインのうち8つも第三者。一方その枠は上位3サイトで76.75%を占め、新規参入も被リンクも効かない。ChatGPTでのRedditの割合は4日で3.8%→0.5%。 検証レポート 構造化データはAI検索に効くのか 29社10週間の対照実験と、Googleが消した表示枠 29社・10週間の対照実験で、LocalBusinessの記述を足した側は順位も検索可視性も上回らず、最高でもYahooの81.96%。Googleはこの1年でFAQ・How-to・practice problemなどの型を削除。それでも2026年8月の推奨リストには消えた型が並ぶ。 検証レポート AI検索向けにページを盛るのは、ありなのか 実測10,095ページの8.90%が加工済み 実際の検索結果10,095ページのうち8.90%がAI検索向けの加工済み。2026年更新分では16.36%。1枚の書き換えで最大27%、上位3枚で73.8%が偽物を勧め、汎用フィルタは5.7%しか止めない。検出の精度はF1 0.944。 検証レポート AI検索対策では、どんなキーワードを狙えばいいのか AIが自分で投げた検索5,333件は平均6.56語 Geminiが自分で投げた検索5,333件の平均は6.56語。33%に年号が入る。人が打つ2〜3語のキーワードとは形が違い、検索数からは拾えない。上位に出ることは引用とほぼ同義で、留保の言葉は要約で最大60%落ちる。