本文へ移動

重要なAIニュースを、速く、わかりやすく。

運営:AIMA

NVIDIA NeMo AutoModel、Diffusers対応──画像・動画AIの分散学習を簡単に

NVIDIA NeMo AutoModel、Diffusers対応──画像・動画AIの分散学習を簡単に
3行でわかる
  • NVIDIA NeMo AutoModelが、Hugging Face Diffusers形式の画像・動画モデルに対応した
  • モデルを別形式へ変換せず、通常の追加学習とLoRAを1台から複数GPUまで広げられる
  • 現時点の対象はflow-matching方式で、すべてのDiffusersモデルがすぐ使えるわけではない

何が発表されたか

NVIDIAとHugging Faceは2026年7月17日、オープンソースの学習ライブラリNeMo AutoModelを、Hugging FaceのDiffusers形式に対応させたと発表しました。画像生成AIや動画生成AIを、自社の画像や動画に合わせて追加学習しやすくするための機能です。

Diffusersは、画像や動画を作る生成AIを共通した方法で扱うためのライブラリです。一方のNeMo AutoModelは、NVIDIAのNeMoに含まれる学習用ライブラリで、PyTorchの分散学習機能を使い、1台のGPUから複数台の大きな環境まで学習を広げることを狙っています。

今回の連携により、Hugging Face Hubにある対応モデルをNeMo AutoModelで読み込み、追加学習した結果をDiffusersへ戻せます。公式記事では、別のチェックポイント形式へ変換したり、モデルごとに学習コードをすべて書き直したりする手間を減らせると説明しています。

通常の追加学習とLoRAの両方に対応

NeMo AutoModelは、モデル全体を学習し直すフルファインチューニングと、変更する部分を絞って必要な計算量を減らすLoRA形式の学習に対応します。品質を優先して大きなGPU環境を使う方法と、費用や時間を抑えて小さく試す方法を選べます。

発表時点で用意されているレシピは、動画向けのWan 2.1、Wan 2.2、HunyuanVideo 1.5、画像向けのFLUX.1-dev、FLUX.2-dev、Qwen-Imageです。たとえばWan 2.1の13億パラメータ版は、公式記事で40GBのA100 GPU 1台に収まると説明されています。

大きなモデルでは、データや計算を複数GPUへ分けるFSDP2、テンソル並列、コンテキスト並列、パイプライン並列などを設定で選べます。モデルのコードを分散学習用に書き直すのではなく、設定を変えて規模を広げる考え方です。現在はSLURMによる複数ノード実行に対応し、Kubernetes対応は今後の予定とされています。

使えるモデルには現時点で制限がある

「Diffusers対応」といっても、すべての画像・動画モデルがそのまま使えるわけではありません。公式記事では、NeMo AutoModelが現時点で対応するのはflow-matching方式のモデルだけだと明記されています。まずは公式レシピに名前があるモデルから試すのが安全です。

追加学習には、学習用の画像や動画、説明文、GPU環境の準備も必要です。公式の実行例では、事前に画像をVAEの潜在表現へ変換して保存し、学習中の処理を軽くしています。また、性能測定はNVIDIA H100 80GBを8基積んだ1台の環境で行われています。同じ速度がすべての会社の環境で出るという意味ではありません。

NeMo AutoModelはApache 2.0で公開されています。ただし、学習対象のモデルやデータには別の利用条件があります。会社で使うときは、NeMo AutoModelのライセンスだけでなく、元モデル、学習データ、生成物の利用条件をそれぞれ確認する必要があります。

なぜ仕事や会社に重要なのか

広告、映像、ゲーム、ECなどでは、自社の商品や表現に合う画像・動画AIを作るため、既存モデルの追加学習が使われます。しかし、小さな実験から本番向けの大きな学習へ進むときに、モデルの変換や分散学習のコード変更が増えやすいことが課題でした。

今回の連携は、Hugging Face上のモデルを使う流れと、NVIDIAの大規模学習機能をつなぎます。まずLoRAで小さく試し、効果が確認できたら複数GPUの学習へ広げる道筋を作りやすくなります。追加学習後のモデルをDiffusersの生成パイプラインで使える点も、既存の開発環境へ戻しやすい利点です。

ただし、導入判断では「学習できるか」だけでなく、必要なGPU費用、データの権利、生成物の検査方法まで見る必要があります。最初は公式レシピのある1モデルと小さなデータで試し、学習時間、画質、必要メモリを測ってから規模を広げるのが現実的です。

※ 本記事は公開時点の一次情報にもとづいています。最新の状況は出典をご確認ください。

AI検索・LLMO対策

月額5万円で、AIに引用される会社へ

AIの進化が速いほど、自社の情報がAIにどう読まれるかも変わります。ChatGPTやGoogleのAI検索で正しく引用される状態を、AIMAが月額5万円でつくります。相談はチャットで回数の制限なし。記事・FAQの制作から公開・保守まで、本数・回数の上限なし。最低契約期間はありません。

SUPERVISOR
監修者 水間 雄紀

監修者:水間 雄紀

株式会社AIMA 代表取締役

1986年和歌山県生まれ、近畿大学卒。金融機関、経営コンサルティング会社を経て、2018年にコンテンツ制作の専門会社である株式会社circlizeを創業。2024年、ラグザス株式会社に事業譲渡。現在は株式会社AIMAにてAI×マーケティング事業に従事し、株式会社ラグザス・クリエイトでコンテンツの品質管理責任者を務める。

監修者・運営会社について
← AI深報トップへ