AI検索での自社の見え方は1回測れば分かるのか 同じ質問の繰り返しで一致は4割
- 米国50都市圏の1,487件の地域向けの質問をGeminiに投げ、14,472件の引用を集めた実測では、同じ質問を繰り返したときに重なった引用元は約40%でした。同じ店が1位に挙がったのは約7%で、対照に置いたGoogleの地図付きの検索枠は約90%です。
- AIをまたぐと、食い違いはさらに開きます。同じ1,487件をChatGPTでも回すと、両者が同じドメインを引用したのは8%、同じ店を1位に挙げたのは4.2%にとどまりました。片方での見え方は、もう片方の保証になりません。
- では何回測れば足りるのか。30のプラットフォームとテーマの組み合わせで検証した研究の答えは、どの場面にも通じる固定の回数は正当化できない、というものでした。回数は集めた結果の散らばりからしか決まりません。
答え:1回調べただけでは、自社の見え方は分からない
同じAIに同じ質問を繰り返しても、引用される情報源は毎回入れ替わります。地域向けの検索を実測した調査では、2回目に重なった引用元は約40%どまりで、同じ店が1位に挙がったのは約7%でした。1回分の結果は、その瞬間を写した1枚の写真です。
検索エンジンの順位を見るときは、1回調べれば足りました。同じ言葉を入れれば同じ並びが返ってくる前提があり、翌日に順位が動けば、それは自社か競合が何かをした証拠として読めたからです。AI検索にはその前提がなく、同じ質問でも回答は毎回その場で組み直されるため、動いた・動かないの読み方がそのままでは通用しません。
どのくらい違うのかを、対照つきで測った調査があります。米国の50都市圏と10の業種にまたがる1,487件の地域向けの質問をGeminiに投げ、返ってきた14,472件の引用元を集計したうえで、同じ質問をもう一度投げ直したものです。比較のために、同じ質問をGoogleの地図付きの検索枠でも回しています。
| 調べた先 | 2回目に重なったもの | 一致した割合 |
|---|---|---|
| Googleの地図付きの検索枠 | 1位に出た店 | 約90% |
| Gemini | 引用された情報源 | 約40% |
| Gemini | 1位に挙がった店 | 約7% |
従来の検索が9割で同じ答えを返す横で、AIは10回に1回も同じ推薦をしませんでした。担当者の実感に置き換えると、月曜に自社が出て火曜に出なかったとしても、その間に何かが悪化したとは限らないという話になります。逆に、施策を打った翌日に自社が出たことも、効いた証拠にはなりません。
引用元が入れ替わるのは、AIがその場で根拠を集め直しているから
AIは回答を作るたびに検索をやり直し、集まった候補の中から根拠を選び直します。この集め直しの結果が毎回ずれるため、引用元の重なりは4割にとどまり、順位の並びは上位から下位まで揺れ続けます。
調査を行ったSteady Demandは、この揺れをグラウンディング・ドリフトと名付けました。回答の根拠をその都度ウェブから拾ってくる仕組みそのものが原因なので、サイト側で何かを間違えたから起きるわけではありません。競合が抜き去ったわけでもなく、同じ日の同じ質問でも起きます。
揺れの幅を統計として測った研究もあります。Perplexity、OpenAIのSearchGPT、Geminiの3つに、消費者向けの3つの商品テーマで同じ質問を繰り返し投げたもので、9日間かけて1日1回集める方法と、10分おきに集める方法の2通りが使われました。引用の集まり方はごく一部のドメインに極端に偏る形をしており、少数の常連が大半を取り、残りが長い裾を作ります。
この研究の要点は、揺れの大きさが測れるという点にあります。集めた標本から誤差の幅を計算すると、ドメインどうしの見かけの差の多くが、その誤差の中に収まってしまいました。順位の不安定さは上位だけの現象ではなく、よく引用されるドメインの集まり全体で起きています。1回だけ測った数字は、実際より精密に見えるぶん、かえって判断を誤らせるわけです。
そのため、自社と競合の可視性が3ポイント違う、といった報告には意味がない場合があります。差が誤差より小さければ、それは差ではありません。順位が1つ上がった下がったで一喜一憂する運用は、AI検索では成り立たないということになります。
AIが違えば数字も違う。平均してはいけない
同じ1,487件の質問をGeminiとChatGPTの両方に投げると、同じドメインを引用したのは8%、同じ店を1位に挙げたのは4.2%でした。片方で見えていることは、もう片方では何の保証にもなりません。
2つのAIは、そもそも見ている場所が違いました。Geminiの引用はおよそ60%が店や会社の自社サイトへ向かい、次に多いRedditが13.7%を占めます。ChatGPT側はRedditとディレクトリ型のサイトへの依存がはるかに強く、同じ質問に答えていながら参照先の構成が入れ替わります。
もっと意外なのは、同じ会社の同じモデルを使っていても、入口が変われば別物になることです。AnthropicのClaudeと、開発者向けの入口であるClaude Codeに、11分野から集めた1,724件の質問を投げて24,135件の回答を比べた測定では、両者が同じブランドに触れたのは平均で5件に1件でした。同じ知能を土台にしていても、指示も道具も画面も違えば、返ってくる答えは別のエンジンのものになります。
| 見ているもの | Claude | Claude Code |
|---|---|---|
| 回答するときにウェブを検索した割合 | 93%超 | 13% |
| 1回の回答に出るブランドの数 | 5.2件 | 6.6件 |
| 回答の平均の長さ | 459語 | 322語 |
| 箇条書きを含む回答 | 56% | 94% |
| 表を含む回答 | 11% | 54% |
| 同じ入口で2回聞いたときのブランドの重なり | 2件に1件 | 5件に2件 |
表のいちばん下が、繰り返しの揺れそのものです。同じ入口に同じ質問を2回投げても、挙がるブランドの半分は入れ替わりました。それでも、Claude同士やClaude Code同士のほうが、ClaudeとClaude Codeの間よりは一致します。揺れは確かにあるものの、入口をまたいだときの食い違いのほうがなお大きい、という順序になります。
読みに来る先も分かれていて、Claude Codeの巡回はおよそ4分の3が技術文書と価格のページへ向かうのに対し、Claudeの側は6割がrobots.txtやサイトマップ、トップページに集中します。前者は必要な事実を取りに来ており、後者はサイトに何があるかを調べに来ている、という違いです。同じ社名のAIでも、届けるべきページが変わります。
何回調べれば足りるのか、決まった回数はない
必要な回数は、AIごとにもテーマごとにも変わります。Gemini、SearchGPT、Perplexityにまたがる30の組み合わせで検証した研究の結論は、どの場面にも当てはまる固定の回数は正当化できない、というものでした。
それでも、調べ終わっていいかどうかを判断する筋道はあります。回数を増やしながら順位の並びを見ていき、並びの変わり方が横ばいになったところで、まず1つ目の条件を満たします。次に、誤差の幅を超えるだけの差が上位のドメイン同士に開いているかを見て、開いていればその測定は比較に使える段階に届いたことになります。
この2つを分けているところが実務では効いてきます。並びが落ち着いただけの状態と、差を語れる状態は別で、前者で止まると、誤差の中の順位差を根拠に予算を動かすことになるからです。測り足りているかどうかは、集めた結果自体の散らばりから判断するしかありません。
担当者の手元に落とすと、回数を先に決めない、という一点になります。3回で並びが落ち着くテーマもあれば、10回でも落ち着かないテーマもあり、後者は「まだ分からない」が正しい答えです。ツールの契約や社内の報告の都合で回数を決めてしまうと、その数字は最初から比較の役に立ちません。
Webマーケ担当者が、いまやること
やることは、1回の結果を捨てて記録に変えることです。同じ質問を日を変えて何度か自分で入力し、出た回数を試した回数で割った値を残す。AIごとに別々の表を持ち、平均はしません。
特別な道具は要りません。スプレッドシートと、いつも使っているAIの画面だけで足ります。以下は、上の3つの調査から素直に導ける手順を、担当者が自分の手でできることだけに絞ったものです。
- 自社のテーマで、顧客が実際に口に出す質問を5本から10本決める。社名を入れない形にそろえ、そのまま使い続ける
- スプレッドシートに、日付・質問文・使ったAI・自社が出たかどうかの4列を作る。1回の結果はこの表の1行にしかならない
- 同じ質問を、日を変えて何度か入力する。回数を先に決めず、自社と競合の出方の並びが変わらなくなるまで足していく
- 報告に載せる数字は、出た回数を試した回数で割った割合にする。分母の回数も必ず併記し、単発の結果は載せない
- GeminiとChatGPTは別々の表に分け、平均を取らない。同じ質問でも参照先の構成が入れ替わるため、まとめた瞬間に意味が消える
- 顧客が主に使うAIを1つ決め、そこを主戦場にする。全部を同じ密度で追うと、どれも回数が足りず判断できなくなる
- 競合との差が小さいときは、差がないものとして扱う。数ポイントの上下は、施策の成果ではなく測定の揺れであることが多い
- ツールのレポートを受け取ったら、その数字が何回の測定にもとづくかを確認する。1回きりのスナップショットなら、前月比の比較には使わない
- 開発者向けの製品を扱っているなら、技術文書と価格のページを別枠で整える。そこを読みに来る入口が実在する
順番としては、記録を始めるのが先で、サイトを直すのは後です。記録がないうちにページを書き換えると、翌日に自社が出たか出なかったかという、揺れそのものを成果として読むことになります。まず分母を持ち、それから施策の前後を比べる方が、遠回りに見えて早く着きます。
最後に、この3つを重ねても言えないことを書いておきます。何回測れば十分かの具体的な数は、テーマごとに違うため、ここから持ち帰ることはできません。示せるのは、1回では足りないこと、AIをまたいだ数字は足し合わせられないこと、そして必要な回数は集めた結果の散らばりからしか決められないことの3つです。
観測手法
公開された一次資料4件だけを使いました。1件目は、Search Engine Landが2026年8月19日に報じたSteady Demandの調査です。米国の人口上位50都市圏と10の業種にまたがる1,487件の地域向けの質問をGeminiに投げ、返ってきた14,472件の引用を集計しています。再現性の検証は同じ質問を投げ直す形で行われ、対照としてGoogleの地図付きの検索枠が同時に回されました。同じ1,487件はChatGPTでも実行され、両者の引用元と推薦の一致率が比較されています。共同創業者のBen Fisherがこの揺れをGrounding Driftと呼んでいます。
2件目は、Ronald Sielinskiが2026年3月9日にarXivへ投稿し、8月26日に第3版を出した論文「Quantifying Uncertainty in AI Visibility」です。Perplexity Search、OpenAI SearchGPT、Google Geminiの3つを対象に、消費者向けの3つの商品テーマで繰り返し標本を取っています。採取は9日間の毎日と10分間隔の高頻度の2通りで、引用の分布はべき乗則の形を取ります。ドメイン間の差が誤差の範囲に収まるかどうかは、ブートストラップ法による信頼区間で判定されました。
3件目は、同じ著者が2026年7月11日に投稿し8月26日に第2版を出した論文「From Stochastic to Stable」です。順位相関の推移が平らになったかを見る条件と、信頼区間がゼロを含まないドメイン同士の差が推定の不確かさを上回るかを見る条件の2つで、収集を止めてよい時点を判定します。Gemini、SearchGPT、Perplexityにまたがる30のプラットフォームとテーマの組み合わせに適用されました。
4件目は、AI可視性を扱うProfoundが2026年8月24日に公開した調査「Claude and Claude Code are distinct Answer Engines」(著者 Allison Huang)です。11分野から無作為に取った1,724件の質問に対する24,135件の回答を、2026年7月13日から23日にかけて収集しており、web検索は両方の入口で有効にしてあります。巡回の分析は、7月18日から8月18日までに同社が追跡するドメイン群で最も多く訪問された1,000ページを、Firecrawlで取得しLLMで分類したものです。
AIMAによる独自の計測は行っていません。本文中の数値は、取得時に保存した原文から機械的に抽出したものです。
この記事で言えないこと
4件はそれぞれ別のものを測っており、間を直接つなぐ因果は示せません。Steady Demandの調査は米国の地域向けの検索に限られ、10業種と50都市圏という条件の外へそのまま広げることはできず、日本語の検索で同じ一致率になる保証もありません。Sielinskiの2本は3つのプラットフォームと3つの商品テーマという小さな範囲での観測で、対象を変えれば揺れの幅も収束に要する回数も変わります。Profoundの測定は同社が追跡するドメイン群の上での観測であり、Claude Codeが表示する引用は少ないため、巡回の記録と回答の中身は別々に読む必要があります。したがって「何回測れば十分か」の具体的な数は、この材料からは出せません。示せるのは、1回の測定では判断に足りないこと、AIをまたいだ数字を合算できないこと、必要な回数は測定結果の散らばりから決まることの3つの対応関係までです。
突き合わせた資料
- 再現性の実測Business websites dominate Gemini local AI search citations(1,487件の質問と14,472件の引用)
Search Engine Land/取得 2026-08-20 - 揺れの統計的な測定Quantifying Uncertainty in AI Visibility(繰り返し標本と信頼区間)
arXiv cs.IR/取得 2026-08-27 - 収集を止める判定基準From Stochastic to Stable(30の組み合わせでの収束判定)
arXiv cs.IR/取得 2026-08-27 - 入口ごとの差の実測Claude and Claude Code are distinct Answer Engines(24,135件の回答の比較)
Profound/取得 2026-08-25
出典
- Business websites dominate Gemini local AI search citations: Study|Search Engine Land(Danny Goodwin、2026年8月19日)
- Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement|arXiv:2603.08924(Ronald Sielinski、2026年8月26日 v3)
- From Stochastic to Stable: Rank Stability and Structural Sufficiency in AI Visibility Measurement|arXiv:2607.10341(Ronald Sielinski、2026年8月26日 v2)
- Claude and Claude Code are distinct Answer Engines|Profound(Allison Huang、2026年8月24日)