NVIDIA、AIエージェントによる強化学習研究を実演──精度25%から96.9%へ

- NVIDIAが、AIエージェントに強化学習研究を進めさせる実例を公開した
- NeMo RLとNeMo Gymを使い、環境構築、実験、評価を一連で進めた
- 星の色別個数を数える課題で、正解率は25%から96.9%まで上がった
何が発表されたか
NVIDIAは2026年7月14日、AIエージェントに強化学習の研究作業を進めさせる方法を、公式技術ブログで公開しました。使ったのは、NVIDIAのオープンソース基盤であるNeMo RLとNeMo Gym、そしてコーディングAIエージェントです。
AIエージェントは、研究者が決めた目標に沿って、ソフトウェアの準備、実験環境の作成、学習の実行、結果の比較までを進めました。NVIDIAは、長い時間がかかる機械学習研究で、AIが実務的な作業役になり始めている例として紹介しています。
どこまで自動で進めたのか
実演では、まずAIエージェントがNeMo RLとNeMo Gymの動作環境を整え、GPUメモリーや保存容量の問題を解決しながら、学習が最後まで動く状態を作りました。その後、さまざまな大きさの画面に表示された星を色別に数えるstar countという新しい課題を作りました。
対象モデルはQwen3-VL-2B-Instructです。学習前に固定の64問で測ると、完全に正解した割合は25.0%でした。LoRAを使った教師あり学習を重ねた結果、最良の実験では4096件の学習用データと512件の検証用データを使い、正解率は96.875%に達しました。公式発表では、この結果を丸めて96.9%と示しています。
AIエージェントは1回だけ学習を実行したのではありません。最初の成績を測り、実験案を立て、条件を変えて学習し、途中のモデルを比べ、残った間違いの傾向まで整理しました。さらに、研究論文を読んで新しい強化学習の方法をコードにする別の実演も行われました。
なぜ仕事や会社に重要なのか
これまでAI研究では、環境の準備やエラー対応、実験結果の記録などに多くの時間がかかっていました。今回の実演は、目標と評価方法を人が決めれば、繰り返し作業の大部分をAIエージェントに任せられる可能性を示しています。研究開発の担当者は、作業そのものよりも、どの実験を行うか、結果をどう判断するかに時間を使いやすくなります。
ただし、NVIDIAはAIに研究を丸投げする考えではないと明記しています。人は目標設定、節目での確認、研究方針の修正、最終判断を担当します。また、96.9%という数字は今回作った星の数を数える専用課題での結果です。ほかの業務やモデルでも同じ改善が出ることを意味しません。
会社で試す場合は、最初に小さな課題を選び、成功の基準、使える計算時間、停止条件、人が確認するタイミングを決めることが重要です。AIエージェントの速さだけでなく、実験の記録が残るか、社内データや知的財産を守れるかも確認する必要があります。
※ 本記事は公開時点の一次情報にもとづいています。最新の状況は出典をご確認ください。
AI検索・LLMO対策
月額5万円で、AIに引用される会社へ
AIの進化が速いほど、自社の情報がAIにどう読まれるかも変わります。ChatGPTやGoogleのAI検索で正しく引用される状態を、AIMAが月額5万円でつくります。相談はチャットで回数の制限なし。記事・FAQの制作から公開・保守まで、本数・回数の上限なし。最低契約期間はありません。
監修者:水間 雄紀
株式会社AIMA 代表取締役
1986年和歌山県生まれ、近畿大学卒。金融機関、経営コンサルティング会社を経て、2018年にコンテンツ制作の専門会社である株式会社circlizeを創業。2024年、ラグザス株式会社に事業譲渡。現在は株式会社AIMAにてAI×マーケティング事業に従事し、株式会社ラグザス・クリエイトでコンテンツの品質管理責任者を務める。
監修者・運営会社について