本文へ移動

AIに選ばれる情報は、どう作られるのか。

検証レポート

AI検索向けにページを盛るのは、ありなのか 実測10,095ページの8.90%が加工済み

  • 実際の利用者の質問1,000件から集めた検索結果とGeminiの取得結果、そこに含まれる10,095ページを1枚ずつ判定すると、8.90%がAI検索向けに手を加えられたページでした。2026年に更新されたページに限ると16.36%まで上がります。
  • 加工が通った先で何が起きるかも測られています。取得されたページのうち1枚だけを偽の商品に書き換えると最大27%、上位3枚すべてを書き換えると73.8%の割合で、AIは存在しない商品を勧めました。試した12種類のAIはどれも防げていません。
  • 止まらない理由は、専用の検査がまだ配られていないからです。汎用の安全フィルタ3種では通る割合が相対で最大5.7%しか下がらない一方、GEO専用に作った軽い仕組みでは47.6%下がり、検出の精度もF1で0.944に達しています。
AI検索向けにページを盛るのは、ありなのか 実測10,095ページの8.90%が加工済み

答え:競合の一部はもうやっている。ただし見分けはつき始めた

実際のGoogle検索とGemini経由の取得結果から集めた10,095ページのうち、8.90%がAI検索向けに手を加えられたページでした。加工そのものは今も通用している一方、判別の精度はF1という指標で0.944まで来ています。

AI検索で上位に出すために本文へ手を入れましょう、という提案を受けたことがあるかもしれません。AIが選びやすい言い回しへ寄せる、根拠らしく見える一節を足す、といった書き換えです。これが実際にどれくらい行われていて、どこまで通用するのかを、外から確かめられる材料が出そろいました。

1,000件の実際の利用者の質問について、Google検索の結果とGeminiが回答づくりに使った取得結果を集め、そこに含まれる10,095ページを1枚ずつ判定した調査があります。AI検索向けの加工が入っていたのは8.90%でした。11ページに1枚に近い密度で、加工されたページが答えの材料に混ざっている計算になります。

この判定に使われた検出器は、400の質問と4つの分野、8種類の加工手法から作った3,200件の見本で鍛えられています。既存の手法でも総合のF1は0.880あったものの、誰が書いたかという手がかりに寄りかかる弱点が残っていました。

AI検索向け加工の判定精度(見本3,200件/400の質問・4分野・8種類の加工手法)
判定のしかたF1最も苦手な条件での正解率
既存の手法で最も強いもの0.880―
ModernBERT に素直に学習させた場合0.8620.725
加工とAI推敲を対にして学習させた場合0.9440.883

精度が上がった理由が、書き手にとっては大事なところです。順位のために内容を寄せる書き換えと、AIに文章を整えさせるだけの推敲を、対にして見せながら学習させています。つまりAIで下書きを磨く作業そのものは、加工とは別のものとして扱われています。

新しく作られたページほど、加工の割合が高い

同じ10,095ページを更新の時期で割ると、2026年に更新されたページでは加工の割合が16.36%へ上がりました。全体の8.90%は古いページを含んだ平均なので、いま作られているページに限れば密度はおよそ倍になります。

この差の読み方はひとつしかありません。加工は昔から一定量あったものではなく、直近で増えている書き方だということです。6ページに1枚という水準は、特殊な業者だけの話として片づけられる割合ではありません。

担当者の立場からは、これは二つの意味を持ちます。ひとつは、競合の一部がすでにその手を使っている前提で自社の見え方を眺めるべきだということ。もうひとつは、外注先に本文の書き換えを任せたとき、自社が知らないうちに加工の側へ回る恐れがあるということです。

加工が通ると、答えは1ページで壊れる

取得されたページのうち1枚だけを偽の商品に書き換える実験では、最大27%の割合でAIが偽物を勧めました。上位3枚すべてを書き換えると73.8%まで上がり、試した12種類のAIはどれもこれを防げていません。

実験は、実在する225商品を15の分野と5つの購買場面にまたがって選び、AIが取ってきたページの中の商品名だけを架空のものへ差し替える形で行われました。ページ全体を捏造するのではなく、1枚の中身をすり替えるだけです。それでもAIは、存在しない商品を勧める側に回ります。

取得ページを書き換えたときにAIが偽物を勧めた割合(実在225商品・15分野・5場面/12モデル)
書き換えた枚数偽物を勧めた割合
1枚だけ最大27%
上位3枚すべて73.8%

釣られやすさは分野によって違い、AIがその商品について確かな知識を持っていない分野ほど上がりました。知名度の低い商材を扱っている会社ほど、書き換えられたページの影響を受けやすいわけです。

じっくり考えさせれば直る、という期待も外れています。推論を長く取らせても改善せず、むしろ偽の商品を勧める理由として「多くの人が選んでいる」たぐいの存在しない裏付けを作り出しました。答えの見た目はかえって説得力を増します。

いま止まらないのは、専用の検査がまだ配られていないから

既存の安全フィルタを通しても、加工による誤情報が通る割合は相対で最大5.7%しか下がりませんでした。GEO専用に作った軽い仕組みなら47.6%下がるため、止め方が無いのではなく、まだ現場に配られていないだけです。

247件の質問それぞれに、内容を保つ書き換えと内容を歪める書き換えを対で用意し、3種類のAIを的にして防御の効き目を測った検証があります。Granite Guardian、Llama Guard 3、NeMo Self-Check の3つは、いずれも相対の低減が最大5.7%にとどまりました。Granite Guardian にいたっては、統計的に意味のある差になっていません。

効かない理由ははっきりしています。これらは規約違反にあたる内容を見つけるために作られた仕組みなので、加工された誤情報はごく普通の説明文の顔をしたまま通り抜けてしまうからです。

GEO misinformation passes through them as fluent informational content(加工による誤情報は、流暢な情報の顔で素通りする)

Counter-GEO-Bench|arXiv:2609.02316

同じ検証で示された C-GEO Guard という軽い仕組みは、回答の質をほとんど落とさないまま、通る割合を相対で47.6%まで下げました。汚染側の実験でも、信頼度で並べ替える防御は12モデルすべてで効いたものの、取り除けた偽物は6分の1にとどまっています。

この二つを並べると、加工がいま罰されない理由が見えてきます。汎用の安全フィルタを流用しているから素通りしているのであって、専用に作れば半分近くは止まると分かっているからです。加工に賭けることは、検出の精度が0.944まで来た状態で、配備が遅れている期間だけを当てにする行為になります。

Webマーケ担当者が、いまやること

やることは、自社の商材名でAIに聞き、返ってきた会社名・価格・型番が実在するかを1件ずつ照合することです。名前が広く知られていない商材ほど答えが揺れるため、そこから始めると早く見つかります。

特別なツールは要りません。AIの画面と、自社の価格表と型番の一覧があれば足ります。加工する側に回るかどうかを考える前に、自社がすでに巻き込まれていないかを見るほうが先になります。

  • 主力の商材を3〜5件選び、ChatGPT・Gemini・Perplexityにそれぞれ「おすすめは」と聞く。返ってきた会社名・製品名・価格を、実在するかどうか1件ずつ照合する
  • 知名度の低い商材から先に確認する。AIが確かな知識を持たない分野ほど、書き換えられたページに引っ張られやすい
  • 自社ページの本文に、価格・型番・提供範囲・実績を数字で書く。他所の説明を経由しなくても答えが作れる状態にしておく
  • AIに下書きを整えさせる作業は続けてよい。区別の対象になっているのは推敲ではなく、順位のために内容そのものを寄せる書き換えのほう
  • 本文の書き換えを外注するときは、どこをどう変えるのかを文面で出させる。加工の割合が2026年更新分で16.36%まで来ている以上、知らずに側へ回る余地がある

照合は1商材あたり10分ほどで終わります。誤った価格や存在しない型番が出てきたら、その事実を自社ページの本文へ数字で書き足すのが最初の手当てになります。

観測手法

公開された一次資料3件だけを使いました。1件目は、Junjie Chu らが2026年8月17日にarXivへ投稿し、8月20日に第2版を出した論文「GEO-Flag: Detecting and Measuring GEO-Optimized Web Content」です。400の質問と4分野、8系統の加工手法から3,200件の見本データを組み、検出手法を評価したうえで、公開されたGoogle検索の結果とGeminiの取得結果に対して1,000件の実利用者クエリぶんを判定しています。判定対象として取得できたのは10,095ページでした。

この論文の検出器は、加工への介入と、加工ではないAIによる推敲を対にして学習させる方式を採っています。ModernBERT を土台にした場合で、F1が0.862から0.944、最も成績の悪い群での正解率が0.725から0.883へ動きました。既存手法で最も強いもののF1は0.880です。

2件目は、Minghao Luo と Liang Chen が2026年6月11日に投稿し、8月24日に第2版を出した論文「One Polluted Page Is Enough: Evaluating Web Content Pollution in LLM Recommenders」で、EMNLP 2026 Findings に採択されています。FORGE という仕組みで、固定した取得ページの中の実在商品を架空の商品へ局所的に書き換え、AIがその偽物を勧める割合を測っています。対象は実在225商品、15分野、5つの購買場面、商用と公開重みを合わせた12モデルです。

3件目は、Bing Zheng らが2026年9月2日に投稿した論文「Counter-GEO-Bench: Evaluating Defenses Against Information-Distorting Generative Engine Optimization」で、EMNLP 2026 本会議に採択されています。人手で検証した247件の質問に、内容を保つ書き換えと歪める書き換えを対で用意し、3つの被害側モデルに対して攻撃成功率・誤検知率・回答品質の3点で防御を評価しています。

AIMAによる独自の計測は行っていません。本文中の数値は、取得時に保存した原文から機械的に抽出したものです。

この記事で言えないこと

3件はいずれも英語圏の環境での観測で、日本語のページや日本語の質問で同じ割合になるとは示されていません。GEO-Flag の8.90%と16.36%は、1,000件の実利用者クエリから取得できた10,095ページに対する推定値であり、Web全体の割合でも、日本語圏の割合でもありません。検出器の精度も、その論文が作った見本データ上での数字なので、実運用でどこまで保たれるかは別の問題になります。One Polluted Page の27%と73.8%は、取得ページを実験側が意図して書き換えた条件での上限に近い値で、実際のWebでどれだけの頻度で同じ状況が起きるかは測られていません。Counter-GEO-Bench の5.7%と47.6%はいずれも相対の変化で、元の成功率が何%だったかはこの記事の裏付けに含めていません。ここから言えるのは、加工されたページが答えの材料に一定量混ざっていること、混ざると答えが実際に動くこと、汎用の安全フィルタでは止まらないこと、この3点までです。加工が今後どれくらいの速さで罰されるようになるかは、どの資料も示していません。

突き合わせた資料

  1. 加工されたページの実測GEO-Flag: Detecting and Measuring GEO-Optimized Web Content(実利用者クエリ1,000件/判定10,095ページ)
    arXiv cs.IR/取得 2026-08-24
  2. 加工が通ったときの影響One Polluted Page Is Enough: Evaluating Web Content Pollution in LLM Recommenders(実在225商品・15分野・12モデル)
    arXiv cs.CL/取得 2026-08-25
  3. 防御の効き目の検証Counter-GEO-Bench: Evaluating Defenses Against Information-Distorting Generative Engine Optimization(人手検証247件の質問/3モデル)
    arXiv cs.CL/取得 2026-09-03

出典

  1. GEO-Flag: Detecting and Measuring GEO-Optimized Web Content|arXiv:2608.16824(Junjie Chu ほか、2026年8月20日 v2)
  2. One Polluted Page Is Enough: Evaluating Web Content Pollution in LLM Recommenders|arXiv:2606.13610(Minghao Luo ほか、2026年8月24日 v2、EMNLP 2026 Findings)
  3. Counter-GEO-Bench: Evaluating Defenses Against Information-Distorting Generative Engine Optimization|arXiv:2609.02316(Bing Zheng ほか、2026年9月2日、EMNLP 2026 Main)
検証レポート AI検索対策では、どんなキーワードを狙えばいいのか AIが自分で投げた検索5,333件は平均6.56語 Geminiが自分で投げた検索5,333件の平均は6.56語。33%に年号が入る。人が打つ2〜3語のキーワードとは形が違い、検索数からは拾えない。上位に出ることは引用とほぼ同義で、留保の言葉は要約で最大60%落ちる。 検証レポート AI検索で自社サイトのアクセスは減るのか 実測は5%前後の目減りと、3倍近い別経路 AI要約が出ると検索からの流入は5%前後減る。一方でChatGPTからの流入は週157.7%増え、着地の約60%がトップページ。減る場所と増える場所が違うため、合算すると何も見えなくなる。 検証レポート AI検索での自社の見え方は1回測れば分かるのか 同じ質問の繰り返しで一致は4割 同じ質問を繰り返すと引用元の一致は約40%、1位の一致は約7%。GeminiとChatGPTの間では同じドメインが8%、同じ店が4.2%しか一致しない。必要な測定回数に固定の答えはなく、1回の数字は比較に使えない。 検証レポート AIに引用される文章は何が違うのか 118億件の引用実測と、一節ごとの採点結果 118億件の引用の57%は企業サイト。ただし採点されるのはページではなく一節で、同じ話題でも説明文は0.0019%、直接答える一文は99.9%超に分かれた。相手になる質問は平均8.2語で、社名入りは12.8%だけ。 検証レポート llms.txtは本当に効果があるのか 13.7万サイト調査で97%のファイルがアクセス0件 13万7,210サイトのサーバ記録を調べたAhrefsの実測では、置かれたllms.txtの97%が1か月間アクセス0件。読んでいたのはAI検索ではなく開発現場のAIだった。今の優先度と例外条件を整理する。