本文へ移動

AIに選ばれる情報は、どう作られるのか。

検証レポート

AIの答えは、聞く人によって変わるのか 同じ質問でも重なるブランドは4分の1

  • 衣料・家具・クレジットカードの質問で71,147件の回答を集めた実測では、同じ人物像への繰り返しでブランドが重なる割合が約5分の2だったのに対し、人物像を変えると約4分の1まで落ちました。引用元のドメインの重なりも34%から20%へ下がっています。
  • 差が最も大きく出た属性は収入でした。衣料の質問で挙がったブランドの代表的なTシャツの価格帯は、低収入の人物像で8〜24ドル、高収入で140〜1,650ドルと開き、高収入への回答は平均7.5件のブランドと4.8件の引用を含みます。
  • それでも可視性は1つの点数で語られがちです。スコアはどの質問を集めてどう重み付けするかで決まるうえ、買い手の質問を100万人分そろえたデータでは78.3%が調べもの段階で、購入直前は4.3%しかありません。
AIの答えは、聞く人によって変わるのか 同じ質問でも重なるブランドは4分の1

答え:変わる。相手が違えば、挙がるブランドは4分の1しか重ならない

同じ質問でも、聞き手の年代・性別・収入・職業を一言添えるだけで、AIが挙げるブランドの重なりは約4分の1、引用元の重なりは20%まで落ちます。自社の見え方を平均点ひとつで見ていると、狙っている客層に出ていないことが数字の上では見えません。

AI検索での自社の見え方を測るとき、たいていは「自社名が何%の回答に出たか」という1つの数字を見ます。ところが、その数字を作っている質問を誰が投げたことにするかで、返ってくるブランドも引用元も入れ替わります。

年代や収入を一言添えるだけで答えがどう動くかを、7万件規模で測った実測が出ました。あわせて可視性スコアそのものの成り立ちを検証した論文と、買い手の質問を100万人分そろえたデータが並んだので、平均点の読み方まで含めて確かめられます。

年代や収入を一言足すだけで、挙がるブランドが入れ替わる

衣料・家具・クレジットカードの質問で71,147件の回答を集めた実測では、同じ人物像への繰り返しでブランドが重なる割合が約5分の2だったのに対し、人物像を変えると約4分の1まで落ちました。引用元のドメインの重なりも34%から20%へ下がっています。

比べ方は単純で、同じ質問の頭に「私は30代です」のように属性を1つだけ足しています。性別2種・年代4種・収入3種・職業5種を用意し、ChatGPTとClaude、Geminiへ14日間投げ続けた結果を突き合わせました。

AIの回答はもともと同じ質問を繰り返すだけでも揺れるので、その揺れより大きく動いたかどうかが判定の焦点になります。同じ人物像での繰り返しが基準線で、そこから15ポイント下がったぶんが、相手が変わったことによる差です。

人物像を変えたときに重なりがどこまで落ちるか(衣料・家具・クレジットカードの質問/71,147件の回答)
比べたもの同じ人物像の繰り返し別の人物像どうし差
挙がったブランド約5分の2が重なる約4分の1が重なる15ポイント
引用されたドメイン34%が重なる20%が重なる14ポイント

入れ替わり方は分野と属性で違います。衣料の質問では、男性の人物像にPatagoniaやRalph Laurenが上位で並ぶ一方、女性の人物像ではReformationやFree Peopleが並びました。

ブランドの入れ替わりより重いのは、引用元まで入れ替わっていることのほうです。AIは引いてきた資料の中からブランドを拾うので、引用元が2割しか重ならない時点で、その先に並ぶ名前も別のものになります。

収入を変えると、同じ質問が別の市場の話になる

衣料の質問で挙がったブランドの代表的なTシャツの価格帯は、低収入の人物像で8〜24ドル、中間で10〜58ドル、高収入で140〜1,650ドルでした。同じ質問文でも、収入の一語で商圏ごと入れ替わっています。

差が最も大きく出た属性が収入でした。低収入の人物像にはPoshmarkやDepopといった中古の売買の場が上位に来て、高収入の人物像には高級ブランドが並びます。

挙がる数そのものも動きます。3分野をまとめると、高収入の人物像への回答は平均7.5件のブランドと4.8件の引用を含み、低収入では5.8件と4.1件でした。露出の枠自体が相手によって広がったり狭まったりするので、同じ手を打っても入り込める余地が違います。

収入の一語で回答の中身がどう変わるか(言及数と引用数は衣料・家具・クレジットカード3分野の平均/価格帯は衣料の質問)
人物像の収入ブランドの言及数引用数代表的なTシャツの価格帯
低5.8件4.1件8〜24ドル
中間6.8件4.4件10〜58ドル
高7.5件4.8件140〜1,650ドル

引用元の構成も収入で変わります。Geminiの衣料の回答では、高収入の人物像のほうがブランド自身のサイトからの引用が24ポイント多く、他社に取り上げられた記事は17ポイント、公的な資料は8ポイント少なくなりました。狙う価格帯によって、自社サイトを直す価値と、よそに載る価値の比率が変わることになります。

厄介なのは、人物像から勝手に補われる前提のほうです。50代向けの衣料では、AIが自分で投げた検索語に「women」が入る割合が他の年代より約39ポイント高く、50代なら女性だろうという前提が足されていました。50代の男性へ売っている会社は、そもそも想定客として数えられていない可能性があります。

可視性スコアは、測る側が作った市場の点数

可視性スコアは、どの質問を集めるかと、それぞれをどれだけ重く見るかで決まります。この2つが評価の舞台そのものを決めてしまうため、実際の需要とずれていても点数は同じように出てきます。

スコアの作られ方を検証した論文が、この構造を分解しています。質問の集め方、言い回し、実行の条件、重み付け、採点の規則という5つの選択がスコアを決めていて、どれも中立ではありません。

言い回しを変えるだけで、AIが引く資料も、競合として画面に出てくる相手も変わります。さらに採点を別のAIに任せている場合は、回答が1文字も変わっていなくても、採点の指示を書き換えれば点数が動きます。

もうひとつ重いのが、引用されたこと自体は、その資料が答えに効いた証明にならないという点です。効き目を測るには、その資料を入れた場合と外した場合で答えがどう変わるかを、条件をそろえて比べる必要があります。

重みを決められないときは、1つの点数ではなく取りうる点数の幅として出すべきだ、という提案も示されています。この論文は新しい実験を行っておらず既存の研究を突き合わせた検証なので、ここから言えるのは点数の読み方までです。

では、誰の質問で測るのか

買い手の質問を100万人分そろえたデータでは、質問の78.3%が調べもの、17.4%が比較検討、4.3%が購入直前でした。可視性を測る質問を自分で用意するなら、この比率のどこを見ているのかを先に決めておく必要があります。

測る質問を決めるには、買い手が実際に何を聞くのかという分布が要ります。511の業種と4つの市場をまたいで1,031,732人分の人物像を作り、そこへ5,160,046件の質問と、その人が信用する情報源の種類を持たせたデータが公開されました。

この比率が意味するのは、買う直前の質問が全体の2割ほどしかないということです。ブランド名が挙がるかどうかで勝負がつくのは比較検討の段階なので、調べもの段階の質問ばかりで作った平均点は、勝負の場所からずれた点数になります。

人物像ごとに信用する情報源の種類が持たされている点も効きます。引用元の実測と突き合わせれば、狙う客層が信用する種類の媒体へAIが当たっているかを確かめられるためです。ただし、この突き合わせ自体はまだ実験で確かめられていません。

Webマーケ担当者が、いまやること

最初にやることは、自社の主力商品についての質問を、狙っている客層の言い方に直して聞き分けることです。年代・予算・立場の3つを頭に足した質問を並べ、返ってきたブランドと引用元を客層ごとに控えます。

必要なのはブラウザと表計算ソフトだけで、開発の手も広告費も最初の一巡には要りません。

  • 自社の主力商品について、買う直前に出そうな質問を3つ書き出す。「おすすめの〇〇」ではなく、比較や条件が入った言い方にする
  • その3問の頭に「私は40代です」「予算は月3万円までです」のように、狙う客層の条件を1つだけ足した版を作る
  • ChatGPTとGeminiで、条件なしの版と条件付きの版を同じ日に投げ、返ってきたブランド名と引用元のドメインを客層ごとの列へ書き出す
  • 自社名が条件なしの版にしか出ないなら、狙う客層には届いていない。どの条件で消えるかを見れば、足りない情報が分かる
  • 価格帯・対象・使う場面を、仕様欄だけでなく商品ページの本文にも文章で書く。条件付きの質問で拾われるのは文章のほうになる
  • 客層ごとに引用元の顔ぶれを比べる。自社サイトが出る客層と、他社の記事しか出ない客層とでは、次に打つ手が変わる
  • スコアを出す外部の道具を使うなら、どの質問を何件、どんな重みで集計しているかを先に聞く。答えられない道具の点数は比較の材料にできない

この一巡は2〜3時間で終わります。条件を足した質問で自社が消えるかどうかは平均点をいくら眺めても出てこないので、外部の道具を入れるかどうかを決めるより先に済ませておくと、順番に無駄がありません。

観測手法

公開された資料3件だけを使いました。1件目は、Allison Huang が2026年9月9日にProfoundへ公開した「Do Answer Engines customize responses to different personas?」です。Profound Index の3分野(クレジットカード・衣料・家具)の質問の頭に属性を1つだけ足した版を作り、性別2種・年代4種・収入3種・職業5種について、2026年8月11日から24日までの14日間、ChatGPTとClaude、Geminiへ投げた71,147件の回答を集計したものです。挙がったブランド、引用されたドメイン、記録された検索語の3つを比べています。検索語が取れたのはChatGPTとClaudeのみで、Geminiでは取れていません。

2件目は、Olivier Martinez が2026年9月6日にarXivへ投稿した「Measuring GEO Visibility: Prompt Corpora Define the Answer Market」です。44件の先行研究を突き合わせた16ページの検証で、新しい実験は行われていません。質問集合・言い回し・実行条件・重み付け・採点規則という5つの選択がスコアをどう決めるかを整理し、重みが未確定のときに取りうる点数の幅を報告する枠組みを示しています。

3件目は、Dmitrij Żatuchin と Daniil Dzemesjuk が2026年8月30日にarXivへ投稿した「Demand-Side Measurement for Generative Engine Optimization」です。4つの公開データセットの約4,000万件の人物像の記述を重複除去し、1,031,732人分へ整えたPersonaGen-1Mの構築と検証で、511の業種と4つの市場、19,416,821件の属性、5,160,046件の質問を含みます。意図の内訳と情報源の好みの欄は、この論文が報告した値をそのまま拾いました。

AIMAによる独自の計測は行っていません。本文中の数値は、取得時に保存した原文から機械的に抽出したものです。

この記事で言えないこと

3件とも英語での質問が対象で、日本語で同じ比率になるかは確かめられていません。Profoundの実測は衣料・家具・クレジットカードの3分野に限られ、属性も「私は30代です」のように一言を前置きした形なので、実際の利用者が書く長い相談文で同じ差が出るとは示されていません。人物像を変えたときの重なりの落ち方も、繰り返しによる揺れとの差が15ポイントと14ポイントであって、揺れそのものが消えたわけではない点に注意が要ります。収入別の価格帯は、挙がったブランドから代表的なTシャツを1つ選んで並べたもので、各ブランドの品ぞろえ全体の価格ではありません。可視性スコアの検証は新しい実験を伴わない文献の突き合わせで、示された枠組みが実際の計測でどこまで当てはまるかは未確認です。100万人分の人物像も生成されたデータで、実在の買い手の質問ログではないため、意図の内訳をそのまま日本の需要の分布として読むことはできません。ここから言えるのは、相手が変われば答えとその引用元が入れ替わること、収入がその差を最も大きく動かすこと、そして平均点ひとつではこの差が見えないこと、この3点までです。

突き合わせた資料

  1. 人物像を変えたときの差の実測Do Answer Engines customize responses to different personas?(3分野・4属性/ChatGPT・Claude・Geminiの71,147件の回答)
    Profound/取得 2026-09-10
  2. 可視性スコアの成り立ちの検証Measuring GEO Visibility: Prompt Corpora Define the Answer Market(44件の先行研究を突き合わせた16ページの検証)
    arXiv cs.CL/取得 2026-09-09
  3. 買い手の質問の分布Demand-Side Measurement for Generative Engine Optimization(1,031,732人分の人物像・5,160,046件の質問)
    arXiv cs.CL/取得 2026-09-01

出典

  1. Do Answer Engines customize responses to different personas?|Profound(Allison Huang、2026年9月9日)
  2. Measuring GEO Visibility: Prompt Corpora Define the Answer Market|arXiv:2609.06811(Olivier Martinez、2026年9月6日)
  3. Demand-Side Measurement for Generative Engine Optimization: Constructing and Validating a Million-Persona, Intent-Annotated Buyer Corpus|arXiv:2608.30023(Dmitrij Żatuchin ほか、2026年8月30日)
検証レポート AIに引用されるには、よそのサイトに載るしかないのか 引用の84%は第三者サイト 引用の約84%は第三者サイト(2,500万リンク)。AI Modeの上位10ドメインのうち8つも第三者。一方その枠は上位3サイトで76.75%を占め、新規参入も被リンクも効かない。ChatGPTでのRedditの割合は4日で3.8%→0.5%。 検証レポート 構造化データはAI検索に効くのか 29社10週間の対照実験と、Googleが消した表示枠 29社・10週間の対照実験で、LocalBusinessの記述を足した側は順位も検索可視性も上回らず、最高でもYahooの81.96%。Googleはこの1年でFAQ・How-to・practice problemなどの型を削除。それでも2026年8月の推奨リストには消えた型が並ぶ。 検証レポート AI検索向けにページを盛るのは、ありなのか 実測10,095ページの8.90%が加工済み 実際の検索結果10,095ページのうち8.90%がAI検索向けの加工済み。2026年更新分では16.36%。1枚の書き換えで最大27%、上位3枚で73.8%が偽物を勧め、汎用フィルタは5.7%しか止めない。検出の精度はF1 0.944。 検証レポート AI検索対策では、どんなキーワードを狙えばいいのか AIが自分で投げた検索5,333件は平均6.56語 Geminiが自分で投げた検索5,333件の平均は6.56語。33%に年号が入る。人が打つ2〜3語のキーワードとは形が違い、検索数からは拾えない。上位に出ることは引用とほぼ同義で、留保の言葉は要約で最大60%落ちる。 検証レポート AI検索で自社サイトのアクセスは減るのか 実測は5%前後の目減りと、3倍近い別経路 AI要約が出ると検索からの流入は5%前後減る。一方でChatGPTからの流入は週157.7%増え、着地の約60%がトップページ。減る場所と増える場所が違うため、合算すると何も見えなくなる。