OpenAI、自動攻撃AI「GPT-Red」発表──GPT-5.6を強化

- OpenAIが、AIの弱点を自動で探す「GPT-Red」を発表した
- 未知の環境では攻撃成功率84%で、人間の13%を上回った
- GPT-5.6 Solは、4カ月前のモデルより失敗が6分の1になった
何が発表されたか
OpenAIは2026年7月15日、自動でAIの弱点を探す安全性テスト用モデル「GPT-Red」を発表しました。一般の利用者へ提供するAIではなく、OpenAIが社内で使う攻撃役のAIです。
AIエージェントは、ウェブページ、メール、接続したアプリ、ローカルファイルなど外部の情報を読みます。その中に悪意のある命令が埋め込まれていると、本来の依頼を無視して情報を送信するなどの誤動作につながる場合があります。これをプロンプトインジェクションと呼びます。
人が攻撃役になって弱点を探すレッドチームは重要ですが、時間がかかり、大量の攻撃例を作りにくいという問題があります。GPT-Redは攻撃を自動で繰り返し、弱点を見つける量と速さを増やすために作られました。
AI同士の自己対戦で攻撃と防御を強くする
GPT-Redは自己対戦型の強化学習で訓練されました。GPT-Redは攻撃が成功すると評価され、防御側の複数のAIは攻撃を防ぎながら元の仕事を終えると評価されます。防御側が強くなるほど、GPT-Redもさらに新しい攻撃を探す仕組みです。
攻撃の舞台には、ローカルファイル、ウェブページの表示、メール本文、ツールの出力などが使われます。OpenAIによると、訓練後のGPT-RedはGPT-5.5までの社内モデルと本番モデルのほぼすべてを破る強さになりました。危険な攻撃能力を外へ出さないため、GPT-Redは一般提供するモデルとは分けて保管されます。
未知の環境でGPT-5.1を攻撃する比較では、GPT-Redは84%の場面で攻撃に成功しました。人間のレッドチームは13%でした。ただし、これはOpenAIが再現した特定の評価環境での結果であり、すべての攻撃や製品で同じ数字になることを意味しません。
実際のAIエージェントでも弱点を発見
OpenAIは、現実に近いAIエージェントでもGPT-Redを試しました。社内の自動販売機を管理するAIでは、高額商品の価格を最低額の0.50ドルへ変更する、新しい100ドル超の商品を0.50ドルで販売する、別の顧客の注文を取り消す、という3つの目的をすべて達成しました。発見した弱点は関係者へ伝えられ、新しい対策が試されています。
また、GPT-5.4 miniを使うCodex CLIエージェントに対し、学習には使っていない10件の情報持ち出し課題で評価しました。公式発表では、GPT-RedはGPT-5.5へ攻撃用の指示を与えた比較対象より、多くの場面で攻撃に成功し、使ったトークンも少なかったとしています。
これらは、AIが文章を答えるだけでなく、ファイルや業務システムを操作する時代には、実際の仕事に近い環境で安全性を調べる必要があることを示しています。
GPT-5.6 Solの失敗は4カ月前の6分の1に
OpenAIは、GPT-Redが作った攻撃をGPT-5.6の訓練へ使いました。その結果、GPT-5.6 Solは最も難しい直接プロンプトインジェクション評価で、4カ月前の本番モデルと比べて失敗が6分の1になったとしています。
別の結果では、GPT-5.1に対して95%を超える成功率だった「Fake Chain-of-Thought」という攻撃が、GPT-5.6 Solでは10%未満になりました。さらに、GPT-Redによる直接攻撃に対するGPT-5.6 Solの失敗率は0.05%でした。
OpenAIは、通常の能力を落としたり、必要以上に拒否したりして安全に見せたのではないと説明しています。一般的な能力と過剰拒否の評価も行い、通常の能力を維持したまま、悪意のある命令への耐性が上がったとしています。
なぜ仕事や会社に重要なのか
会社でAIエージェントを使う場合、モデル名や精度だけでなく、AIが読む情報と実行できる操作を確認する必要があります。メールを読むAI、社内ファイルを検索するAI、注文や支払いを扱うAIでは、外部の文章に隠れた命令が業務操作へつながる危険があります。
GPT-Redの結果は、AIによる自動テストが安全性向上に役立つことを示しています。ただし、OpenAI自身も人間と第三者によるレッドチーム、多層の安全対策、リアルタイム監視を続けるとしています。自動テストだけですべての危険を防げるという発表ではありません。
企業が今できる対策は、AIへ必要以上の権限を与えないこと、外部情報を読んだだけで送信や購入を実行させないこと、重要操作の前に人の確認を入れることです。導入前には、実際のメール、ウェブ、ファイルに近いテスト環境で、悪意のある命令を無視できるか確認することも重要です。
※ 本記事は公開時点の一次情報にもとづいています。最新の状況は出典をご確認ください。
AI検索・LLMO対策
月額5万円で、AIに引用される会社へ
AIの進化が速いほど、自社の情報がAIにどう読まれるかも変わります。ChatGPTやGoogleのAI検索で正しく引用される状態を、AIMAが月額5万円でつくります。相談はチャットで回数の制限なし。記事・FAQの制作から公開・保守まで、本数・回数の上限なし。最低契約期間はありません。
監修者:水間 雄紀
株式会社AIMA 代表取締役
1986年和歌山県生まれ、近畿大学卒。金融機関、経営コンサルティング会社を経て、2018年にコンテンツ制作の専門会社である株式会社circlizeを創業。2024年、ラグザス株式会社に事業譲渡。現在は株式会社AIMAにてAI×マーケティング事業に従事し、株式会社ラグザス・クリエイトでコンテンツの品質管理責任者を務める。
監修者・運営会社について