本文へ移動

重要なAIニュースを、速く、わかりやすく。

運営:AIMA

誤ったAI助言で「分からない」が消えた、3,132人実験で正答率3分の1

誤ったAI助言で「分からない」が消えた、3,132人実験で正答率3分の1
3行でわかる
  • AIの助言を使えるだけで、人は「分からない」と答えにくくなる結果が5つの実験で示された
  • 金銭的な正解報酬がない条件では、正答率はAIなしの約3分の1、自信は約2.5倍になった
  • ただし誤答しやすい質問とAIを意図的に選んだ査読前研究で、AIを使えば常に判断が悪化する証明ではない

3,132人の実験で何が分かったのか

イタリアとフランスの研究者3人は2026年7月15日、AIの助言が、人の「分からない」と判断を保留する力にどう影響するかを調べた論文をarXivで公開しました。arXivは研究者が査読前の論文も公開できる場所です。今回の論文は公開直後のプレプリントで、学術誌の査読を通過した最終版ではありません。

研究は5つの実験、合計3,132人を対象にしました。参加者は映画の細かな内容について6問を解き、答えが分からない場合は回答を保留できました。AIを使えない人と、AIの助言を求められる人を無作為に分けて比べています。

最初の実験では、回答を保留した割合がAIなしの36%に対し、AIを使える条件では6%でした。別の参加者で行った再現実験でも44%対3%となり、AIの答えを利用できると「分からない」が大きく減りました。

「正答率3分の1、自信2倍」の正確な条件

論文がまとめた「正答率が約3分の1」という数字は、金銭的な報酬や罰則がない条件を合算した比較です。正答率はAIなしの27.5%に対し、AIありでは9.2%でした。自信を0〜100で尋ねた実験では、AIなしの29.6に対し、AIありは75.9でした。正確には約2.5倍ですが、論文の要旨では「ほぼ2倍」と表現されています。

ここで最も重要なのは、研究者がAIの通常性能を測ったのではないことです。映画の細部というネット上の文章に答えが少ない質問を選び、実験に使ったStep 3.5 Flashがほぼ誤答する状況を意図的に作りました。研究の目的は、もっともらしいが誤った答えが出たとき、人がどう反応するかを切り分けることです。

したがって、この結果を「AIを使うと正答率が必ず3分の1になる」と一般化することはできません。AIの助言が普段は正しい分野でも、同じ程度に判断保留が減るかは未検証です。

報酬と罰則を付けると何が変わったか

研究では、正解で0.10ドルを得て、不正解で0.10ドルを失い、回答保留なら増減なしという条件も試しました。実験2では、AIを使える人の正答率が報酬・罰則なしの10%から、ありでは17%へ上がりました。AIへの質問回数も6問中5.44回から4.93回へ減りました。

毎問の前に報酬と罰則を知らせた実験3でも、AIへの質問は5.27回から4.53回へ減り、AIを使える条件の正答率は11%から16%へ改善しました。つまり、正しさに具体的な責任を持たせると、参加者はAIをそのまま受け入れにくくなりました。

一方で、「分からない」と保留する割合はAIなしの水準まで戻りませんでした。AIの答えを自動表示した実験4でも同じ傾向が確認されました。検索結果のAI要約や文章ソフトの提案のように、頼んでいなくても答えが先に見える場面へつながる結果です。

数字を比較して分かったこと

話題になった「3分の1」「自信2倍」だけを見ると、現在の有力AI全体が人の判断を悪くした研究に見えます。しかし原論文を確認すると、研究者は誤答しやすい質問とモデルを選び、AIの精度ではなく人の頼り方を調べています。GPT-5.5、Claude 4.6 Sonnet、Gemini 3.5 Flashも最難問では誤答したものの、ほかの設問ではしばしば正解したと記載されています。

もう一つの重要点は、報酬と罰則で正答率が改善したことです。研究は、AIを禁止することだけが対策だとは示していません。答えの正しさを評価される仕組みがあると、AIへの質問や追従が減り、自分で考え直す行動が増える可能性を示しています。

ただし研究者は、参加者が別のWebサイトや別のAIで確認したかを記録していません。何が正答率改善の直接原因だったかまでは断定できません。

会社や日常で使える対策

会社で問題になるのは、AIが間違うことだけではありません。AIが流ちょうに答えることで、担当者が本来なら「確認が必要」と止める場面でも、答えを確定してしまうことです。採用、契約、医療、経理、顧客対応など、誤りの影響が大きい仕事では特に注意が必要です。

実務では、AIの回答欄とは別に「根拠URL」「確認した原文」「未確認事項」を必須項目にすると、正しさへの責任を具体化できます。重要な判断では、AIを見る前に担当者が自分の暫定判断と不明点を書き、あとからAIの提案と比べる方法も有効です。

AIの答えと自分の考えが違う場合は、AIへ聞き直すだけでなく、一次資料や別の担当者で確認します。「AIがそう言った」を承認理由にせず、誰が何を根拠に確定したかを残すことが、今回の研究から導ける実用的な対策です。

注意点と研究の限界

この研究は映画の細かな内容という1種類の課題だけを使い、誤答が多い1つのAIを中心に調べました。仕事、医療、法律など現実の重要判断で同じ結果になるか、普段は正しいAIを使った場合にどうなるかは確認されていません。

参加者はオンライン調査サービスProlificで集められ、金銭的な損得は1問0.10ドルと小額でした。より大きな金額、会社での評価、社会的な責任がある場合の行動は別に調べる必要があります。

論文は4つの事前登録実験と1つの直接再現実験を含みますが、公開時点では査読前です。AI深報は論文本文と公開された実験資料を確認しましたが、実験データの再解析や独自の参加者実験は行っていません。

※ 本記事は公開時点の一次情報にもとづいています。最新の状況は出典をご確認ください。

AI検索・LLMO対策

月額5万円で、AIに引用される会社へ

AIの進化が速いほど、自社の情報がAIにどう読まれるかも変わります。ChatGPTやGoogleのAI検索で正しく引用される状態を、AIMAが月額5万円でつくります。相談はチャットで回数の制限なし。記事・FAQの制作から公開・保守まで、本数・回数の上限なし。最低契約期間はありません。

SUPERVISOR
監修者 水間 雄紀

監修者:水間 雄紀

株式会社AIMA 代表取締役

1986年和歌山県生まれ、近畿大学卒。金融機関、経営コンサルティング会社を経て、2018年にコンテンツ制作の専門会社である株式会社circlizeを創業。2024年、ラグザス株式会社に事業譲渡。現在は株式会社AIMAにてAI×マーケティング事業に従事し、株式会社ラグザス・クリエイトでコンテンツの品質管理責任者を務める。

監修者・運営会社について
← AI深報トップへ