IBM、AIエージェントの記憶量を8モデル比較 精度と費用の選び方

- IBM Researchは、AIエージェントへ過去の教訓をどれだけ渡すべきかを8モデルで比較した
- gpt-oss-120bは必要な教訓だけを選ぶ方式で完了率が16.1ポイント上がり、トークン増加は5%だった
- 企業は記憶機能を一律に有効化せず、モデルごとに無記憶・全量・選択の3条件で精度と費用を比べるべきだ
過去の失敗を覚えさせても、渡し方で結果が変わる
IBM Researchは8月18日、AIエージェントへ過去の仕事から得た教訓をどれだけ渡すべきかを、8つのAIモデルで比較した結果を公開しました。対象のALTK-Evolveは、エージェントが仕事を進めた記録から、うまくいった戦略、避けるべき失敗、例外時の対処を抽出し、次の仕事で再利用する仕組みです。モデル自体を再学習させるのではなく、実行時の指示へ教訓を加えます。
比較したのは、教訓を入れない状態、蓄積した教訓を全て入れる状態、信頼度の高い共通ルールと仕事に関係する教訓だけを選ぶ状態です。カレンダー、メッセージ、決済など9つの模擬アプリで585件の複数手順タスクを使い、個々の仕事を完了できた割合と、条件違いを含む全パターンを通せた割合を測りました。
エージェントの記憶は、過去の会話を再生することではない。成功した戦略、避けるべき失敗、例外条件を実行記録から教訓として抽出し、次の仕事で使う仕組みだ。
出典:IBM Research「How Much Memory Does Your Agent Actually Need?」(原文を日本語で要約)
これまでの流れでは、エージェントが経験を蓄積すれば同じ失敗を減らせると期待されてきました。IBMは4月にALTK-Evolveを公開し、実行記録から使える教訓を作る方法を示しています。今回はその次の段階として、同じ教訓でもモデルへ渡す量が精度と費用を左右する点を調べました。企業にとっては、記憶機能の有無より、どのモデルへ何を毎回送るかが運用品質を分けるということです。
弱いモデルは選択、余力のあるモデルは全量が有利だった
gpt-oss-120bでは、必要な教訓だけを選ぶ方式で仕事の完了率が39.9%から56.0%へ上がり、16.1ポイント改善しました。平均トークン使用量は1タスクあたり11万から11万6,000へ増え、上昇率は5%です。全ての教訓を入れた場合は16万6,000トークンまで51%増えましたが、精度の伸びは選択方式より小さかったと報告されています。
一方、DeepSeek-V3.2は全ての教訓を渡す方式が最も良く、完了率は79.8%から89.3%へ9.5ポイント上昇しました。Claude Opus 4.6とGPT-5.5も全量方式で改善しています。ただしGLM-5は87.5%のまま変化がなく、記憶を追加しても測定可能な効果が出ませんでした。モデルの規模だけで決まるわけではなく、元の成績、文脈の長さ、教訓の質、仕事の種類が関係すると研究チームは説明しています。
| モデルの状態 | 有効だった渡し方 | 企業が見る指標 |
|---|---|---|
| 完了率が低め | 共通ルール+仕事別の教訓 | 完了率、入力トークン、選択漏れ |
| 高性能だが改善余地あり | 教訓の全量 | 厳しい条件での成功率、キャッシュ後の費用 |
| 対象業務で上限付近 | 追加しない判断も含む | 改善ゼロの確認、残る失敗の種類 |
gpt-oss-120bは選択した教訓で完了率が16.1ポイント改善し、トークン増加は5%だった。DeepSeek-V3.2は全量の教訓で9.5ポイント改善した。
出典:IBM Research・8モデル比較結果(原文を日本語で要約)
企業の差は、記憶の量より評価の回し方に出る
編集部は、今後1〜3年のAIエージェント導入では、長い社内マニュアルを接続した企業より、失敗を分類して必要な教訓だけを戻せる企業が有利になるとみます。全量投入が効くモデルもありますが、入力が増えれば実行のたびに費用と待ち時間が積み上がります。モデルを切り替えた後も同じ記憶設定を使い続けると、以前は効いた教訓が新しいモデルを邪魔する可能性もあります。
ALTK-Evolveが扱う教訓は、人が書いた一般的な注意事項ではありません。エージェント自身の成功と失敗の記録から抽出し、重複をまとめ、次の仕事に関係するものを取り出します。元の論文は、複雑なタスクで条件違いを全て通す成功率が最大28.5ポイント改善したと報告しています。つまり、記憶の価値はログを保存した量ではなく、どの判断が失敗や回復につながったかを再利用できる形に変えたかで決まります。
ALTK-Evolveは実行記録から戦略、回復、効率化の教訓を作り、仕事の文脈に合うものを取り出す。元の研究では複雑なタスクのシナリオ完了率が最大28.5ポイント改善した。
出典:Fangほか「Trajectory-Informed Memory Generation for Self-Improving Agent Systems」(原文を日本語で要約)
ただし、今回の結果はAppWorldという一つの模擬環境での評価です。実際の顧客対応、購買、社内申請でも同じ改善幅になるかは未確認で、IBMも実運用と別のベンチマークでの検証を今後の課題に挙げています。入力できる文脈の長さだけを分離した比較も終わっていません。別の仕事で順位が入れ替われば、モデルの強弱ではなく業務との相性が主因だったと判断する必要があります。
無記憶・全量・選択を同じ仕事で比べる
導入時は、エージェントが繰り返し失敗する一つの仕事を選びます。たとえば、複数システムをまたぐ申請確認、顧客情報の照合、定例レポート作成のように、完了条件を機械的に判定できる業務が向いています。過去の実行記録から、成功手順、失敗回避、例外対応を分けて保存し、教訓なし、全量、仕事別の選択という3条件を同じ問題群で比べてください。
記録するのは完了率だけではありません。入力トークン、処理時間、人の修正時間、同じ条件違いへの安定性を並べます。全量方式が勝っても費用増が大きければ、固定部分を同じ順序で保ち、プロンプトキャッシュが効く設計にする余地があります。選択方式が勝つなら、検索で取り出した教訓と選ばれなかった教訓を残し、失敗時に選択漏れだったか、教訓自体が悪かったかを分けます。
重要なのは、一度決めた記憶設定をモデル名にひも付けて固定しないことです。モデル更新、教訓数の増加、業務変更のたびに同じ評価セットを再実行し、精度の伸びが止まったら入力を増やさない。この運用なら、AIエージェントを物知りに見せるための長文ではなく、仕事を最後まで終えるために必要な経験だけへ費用を払えます。
※ 本記事は公開時点の一次情報にもとづいています。最新の状況は出典をご確認ください。
AI検索・LLMO対策
月額5万円で、AIに引用される会社へ
AIの進化が速いほど、自社の情報がAIにどう読まれるかも変わります。ChatGPTやGoogleのAI検索で正しく引用される状態を、AIMAが月額5万円でつくります。相談はチャットで回数の制限なし。記事・FAQの制作から公開・保守まで、本数・回数の上限なし。最低契約期間はありません。
監修者:水間 雄紀
株式会社AIMA 代表取締役
1986年和歌山県生まれ、近畿大学卒。金融機関、経営コンサルティング会社を経て、2018年にコンテンツ制作の専門会社である株式会社circlizeを創業。2024年、ラグザス株式会社に事業譲渡。現在は株式会社AIMAにてAI×マーケティング事業に従事し、株式会社ラグザス・クリエイトでコンテンツの品質管理責任者を務める。
監修者・運営会社について