Anthropic、AI開発減速を提言 外部評価者に「社員同等」アクセス

- Anthropicのダリオ・アモデイCEOは、AIの安全対策が追いつく時間を確保するため、能力向上の速度を落とすべきだと提言した
- 同社は外部評価チームへ恒常的な社員同等アクセスを与え、訓練工程や事故、安全策を継続確認できるようにすると表明した
- 企業はAI調達時に、公開資料の有無だけでなく、第三者が何へアクセスし、不都合な結果を公表できるかまで比べる必要がある
安全策が追いつくまで、能力向上の速度を落とす
Anthropicの共同創業者兼CEO、ダリオ・アモデイ氏は2026年9月、AIモデルの能力向上を今より慎重な速度へ落とすべきだとする提言を公表しました。開発停止ではなく、安全調整、運用管理、解釈可能性、試験を進める時間を確保しながら開発を続ける考えです。同氏は、AIが次世代AIの開発を助ける「再帰的自己改善」によって進歩が速まり、従来の公開前試験だけでは安全対策が追いつかなくなると説明しています。
提言の背景には、AIエージェントが複数で動くほど、完成モデルへの質問だけでは危険を捉えにくくなるという問題があります。アモデイ氏は、現在の進歩が続けば6〜12カ月で多数のエージェントがインターネット規模の攻撃を行えるおそれがあると予測しました。ただし、これは確認済みの能力ではなく、同氏のリスク予測です。時期や被害規模を確定事実として扱ってはいけません。
能力向上の速度を落とし、安全調整や保護策を整え、第三者がそれを確認できる時間を確保する。
出典:Dario Amodei「We Must Pace the Frontier」を要約
「社員同等」の外部評価は、完成品より開発工程を見る
今回の具体策で最も大きいのは、Anthropicが外部評価者の常設受け入れを一方的に約束した点です。想定する評価チームには、社内のリスク評価担当者に近い権限と道具を継続的に与えます。オフィスの机、入館証、社用端末に加え、法令、契約、顧客情報の制約を除いて、作業環境や社員との対話へアクセスできる設計です。
評価対象も、発売前の完成モデルに限りません。安全方針が実際に守られたか、事故がどう報告されたか、訓練中のモデルや訓練工程に危険な兆候がないかを調べます。評価者には、リスク、事故、実際に得られたアクセスと拒まれたアクセスについて、Anthropicの編集承認なしで主要所見を公表できる契約を用意するとしています。安全保障、法的秘匿、営業秘密、第三者の機密は編集されますが、会社に不利という理由だけでは削除できないという線引きです。
外部評価チームは、安全策の順守、事故、完成モデルだけでなく訓練工程の整合性まで確認し、主要所見を独立して公表できる。
出典:Dario Amodeiの提言を要約
従来のAnthropicのResponsible Scaling Policyにも外部審査はあります。最新版では、取締役会へ出すリスク報告書を外部審査者へ原則1週間以内に共有し、30日以内の公開コメントを求める仕組みです。今回の常設評価者は、報告書を後から読む方式から、日常の工程へ継続的に入る方式へ踏み込みます。編集部は、AI安全の競争軸が「何ページ公開したか」から「第三者がどこまで現場を見られるか」へ移る動きだとみます。
業界共通ルールと国際合意は、まだ提案段階
アモデイ氏は常設評価者に続き、民主主義国の先端AI企業による共通安全基準、さらに権威主義国を含む国際協調を提案しました。能力と安全性の到達点を組にしたチェックポイントを置き、一定の危険能力へ達したモデルには評価、解釈可能性分析、訓練環境監査を求める構想です。企業間の調整には独占禁止法上の課題があるため、政府の仲介や限定的な適用除外も必要だと述べています。
しかし、Anthropicが今すぐ約束したのは常設評価者の受け入れです。業界共通の減速基準、各国政府の合意、違反時の制裁、実施日は決まっていません。外部評価チームの名称、契約締結日、最初の公開報告日も記事執筆時点では未確認です。競合企業が同じ権限を認めず、報告が長く公開されなければ、開発速度を変える業界標準には届かず、Anthropic単独の透明性施策にとどまります。
| 項目 | 現在の状態 | 確認すべき次の証拠 |
|---|---|---|
| 常設の外部評価者 | Anthropicが実施を表明 | 評価組織、開始日、実際の権限 |
| 独立した公表 | 不利な所見も会社判断だけで削除しない方針 | 初回報告と編集・削除の履歴 |
| 企業間の速度調整 | 提案段階 | 参加企業、共通基準、検証方法 |
| 国際協調 | 提案段階 | 政府間合意、順守確認、違反時対応 |
AI調達では、評価者の権限と公表条件を契約前に聞く
日本企業がすぐにモデル利用を止める必要はありません。変わるのは、AI事業者の安全説明を比べる物差しです。「第三者評価済み」という表示だけで決めず、評価者が完成モデルだけを触ったのか、訓練工程や事故記録まで見たのか、会社の承認なしに結果を公表できるのかを確認します。高い自律性を持つエージェントへ外部通信、書き込み、資格情報へのアクセスを渡す案件ほど、この差が効きます。
調達票には、外部評価の対象範囲、実施頻度、重大事故の通知期限、評価者がアクセスを拒まれた場合の開示、契約終了後の報告保存を入れると比較しやすくなります。自社側でも、AIに与える権限を最小限にし、送信や削除は人が承認し、異常時に止められる経路を残すべきです。ベンダーの監査が強くても、利用企業の権限設計まで代わりに担うわけではありません。
今後、常設評価者が具体的な事故や改善前後の差を継続公開すれば、企業はモデル名や性能だけでなく、運用の検証可能性で提供元を選べます。反対にアクセス範囲が例外だらけで、重要な所見が見えないままなら、「社員同等」という表現の価値は薄れます。まず見るべきは宣言の強さではなく、誰が何を見て、どこまで独立して話せたかです。
※ 本記事は公開時点の一次情報にもとづいています。最新の状況は出典をご確認ください。
AI検索・LLMO対策
月額5万円で、AIに引用される会社へ
AIの進化が速いほど、自社の情報がAIにどう読まれるかも変わります。ChatGPTやGoogleのAI検索で正しく引用される状態を、AIMAが月額5万円でつくります。相談はチャットで回数の制限なし。記事・FAQの制作から公開・保守まで、本数・回数の上限なし。最低契約期間はありません。
監修者:水間 雄紀
株式会社AIMA 代表取締役
1986年和歌山県生まれ、近畿大学卒。金融機関、経営コンサルティング会社を経て、2018年にコンテンツ制作の専門会社である株式会社circlizeを創業。2024年、ラグザス株式会社に事業譲渡。現在は株式会社AIMAにてAI×マーケティング事業に従事し、株式会社ラグザス・クリエイトでコンテンツの品質管理責任者を務める。
監修者・運営会社について