本文へ移動

重要なAIニュースを、速く、わかりやすく。

運営:AIMA

投稿監視AIを社内で動かせる Mistral「Shieldstral」の実力と限界

投稿監視AIを社内で動かせる Mistral「Shieldstral」の実力と限界
3行でわかる
  • Mistralは、投稿文やAIの回答、画像が会社の安全ルールに反していないかを判定する「Shieldstral」を公開した
  • 約38億パラメーターのモデルを1枚の16GB GPUで動かせ、文章で判定ルールを変えられるため、機密データを外部サービスへ送らない運用を選べる
  • ただし日本語単独の精度は公表されておらず、導入には技術者、社内ルールの文章化、人による最終確認が必要になる

Mistralが文章と画像を監視するAIを公開

フランスのAI企業Mistralは2026年8月4日、文章と画像の安全性を判定するAI「Shieldstral 1.0」を公開しました。SNSの投稿、利用者がAIへ送る質問、AIが返す回答、画像と説明文の組み合わせを、会社が決めたルールに沿って確認するためのモデルです。

ここでいうモデルは、完成した監視サービスではなく、会社が自分のシステムへ組み込むためのAI本体です。Mistralの公式モデルカードでは約38億パラメーター、文脈長は3万2000トークン、公開段階は「Public Preview」とされています。Apache 2.0ライセンスで、商用・非商用の双方に利用できます。

Shieldstralは、文章で書いた安全方針に対して内容を評価し、一つの連続した安全スコアを返す、小型のマルチモーダル安全分類モデルです。

出典:Mistral公式モデルカード(原文を日本語訳)

「マルチモーダル」は、文章だけでなく画像も同じ仕組みで扱えるという意味です。たとえば、文章だけなら問題がなくても、添付画像と組み合わせると危険になる投稿を、両方を見て判定できます。

会社のルールを文章で差し替えられる

従来の投稿監視AIは、暴力、差別、自傷など、開発会社が先に決めた分類へ当てはめる製品が中心でした。Shieldstralは「この画像は未成年者へ表示してよいか」「この文章は特定の集団への暴力を促しているか」のように、会社が質問文でルールを渡します。AIは内容を読んで「はい」「いいえ」に相当する確率を返します。

同じ内容でも、医療相談、学校、ゲーム、サイバーセキュリティ研究では許容範囲が違います。ShieldstralはAI本体を学習し直さず、実行時の質問文で判定基準を変えられる点が特徴です。新しい社内規程や年齢区分へ対応するたびに、モデルを作り直す負担を減らせる可能性があります。

方針は実行時に普通の言葉で質問として与えます。再学習なしで、一つの仕組みが文章と画像の安全評価へ対応します。

出典:Mistral公式発表(原文を日本語訳)

一方、公式の使い方では原則として一度に一つの方針を質問します。複数の禁止事項を細かく調べる場合は、方針ごとに繰り返し判定する必要があります。「安全か」の一問だけで全社規程を完全に確認できる仕組みではありません。

1枚の16GB GPUで動かせる意味

Mistralは、ShieldstralをBF16という標準的な精度で動かす場合、16GBの映像用メモリーを持つGPU 1枚に収まると説明しています。クラウドの巨大なAI基盤を必須としないため、社内サーバーや管理したクラウド環境へ置き、審査対象の文章や画像を外部の監視APIへ送らない構成を選べます。

これは、顧客相談、社内文書、未公開商品画像などを扱う企業にとって重要です。外部送信をゼロにできるかは周辺ソフトやログ設定にも左右されますが、少なくとも判定モデル自体を自社環境へ置ける選択肢が増えます。利用料も「1件ごとのAPI料金」ではなく、機器、電力、保守担当者の費用として考える必要があります。

選択肢主な利点主な負担
外部の監視API短期間で始めやすく、運用を任せやすいデータ送信条件、従量料金、提供会社の方針変更を確認
Shieldstralを自社運用データの置き場所と判定ルールを管理しやすいGPU、導入技術者、監視、更新、障害対応が必要

「無料公開」は「導入費ゼロ」という意味ではありません。Apache 2.0でAI本体の利用料を抑えられても、安全なサーバー設定、処理速度の確認、誤判定への対応、モデル更新の管理は会社側の仕事です。

競合6モデルとの比較で分かったこと

AI深報は、Mistralが公開したモデルカードの比較表を確認しました。文章の危険判定では、Shieldstralが全ての試験で1位だったわけではありません。質問文の判定5試験では2試験、AI回答の判定6試験では2試験で最高値でした。残りはGPT-OSS-Safeguard-20B、Qwen3Guard-8Bなどが上回っています。

画像を含む3試験では、ShieldstralがVLGuardとUnsafeBenchで最高値でしたが、LlavaGuard試験ではLlavaGuard-7Bが81.4、Shieldstralは72.0でした。公式発表の「最大7倍の大きさのモデルに匹敵または上回る」は、複数試験をまとめた主張です。どの用途でも常に最高精度という意味ではありません。

確認した分野Shieldstralが最高だった試験読み方
利用者の質問文5試験中2試験用途によってQwenやGPT系が上回る
AIの回答文6試験中2試験一つの平均値だけで選べない
画像を含む判定3試験中2試験特定の画像試験では他モデルが上
拒否回答の検出3試験中0試験GPT-OSS-Safeguard-20Bが3試験で上

さらに、これらはMistral自身が選んだデータと条件による公表値です。論文では学習に約5410万件のデータを使い、評価用の例は学習から除いたと説明していますが、第三者による実運用評価ではありません。会社は自社の日本語、画像、隠語、誤字を使った試験を別に行う必要があります。

日本語対応は「評価済み」と同じではない

公式モデルカードは対応言語に日本語を含めています。ただし公開された多言語試験は複数言語をまとめた値で、日本語だけの正答率、見逃し率、誤って止める率は示されていません。日本語は、主語の省略、遠回しな表現、当て字、ひらがなと漢字の混在で意味が変わりやすく、英語の結果をそのまま当てはめるのは危険です。

また、論文は危険画像を大量に作ることが難しく、画像用の安全データが限られていると説明しています。Mistralは一般的な画像データを「安全な例」として補い、別のAIで組み合わせを確認しました。この方法はデータ不足を補いますが、現実の投稿で起きる新しい加工や文脈まで網羅した保証ではありません。

危険画像は文章のようにAIで合成しにくいため、視覚の安全データは不足しています。限られた監視データを一般画像などで補いました。

出典:Shieldstral技術論文(原文を日本語訳)

Public Previewは正式な安定版ではありません。Mistralも今後の課題として、多言語対応、長い文書での安定性、より広い画像安全性を挙げています。いま導入するなら、モデル更新で判定が変わる前提を契約や運用へ入れるべきです。

導入前に会社が決める5項目

第一に、何を止めるかを日本語の具体例付きで文章化します。第二に、間違って止めてもよい場面と、見逃しを最小化する場面を分け、判定スコアの基準を変えます。第三に、日本語、画像、社内用語を含む自社データで、見逃しと誤停止を測ります。

第四に、AIだけでアカウント停止、通報、処分を確定しません。高い危険度は人へ回し、本人が異議を申し立てられる手順を用意します。第五に、判定ルール、モデルの版、スコア、人が行った判断を記録し、後から理由を説明できるようにします。

導入前の質問確認する内容
何を守るか利用者、社員、未成年者、機密情報の優先順位
どこで動かすか社内、管理クラウド、外部APIのデータ経路
何語で試すか日本語、隠語、誤字、画像と説明文の組み合わせ
誰が最終判断するか停止、削除、通報、処分を承認する担当者
どう説明するか版、方針、スコア、人の判断を残す記録

「小型で高性能」という説明だけで導入を決めることはできません。競合との公表値は試験ごとに勝敗が異なり、日本語単独の精度は未公表で、製品もPublic Previewです。自社運用でも機器と担当者の費用が残るため、人の判断を支える部品として検討する必要があります。

※ 本記事は公開時点の一次情報にもとづいています。最新の状況は出典をご確認ください。

AI検索・LLMO対策

月額5万円で、AIに引用される会社へ

AIの進化が速いほど、自社の情報がAIにどう読まれるかも変わります。ChatGPTやGoogleのAI検索で正しく引用される状態を、AIMAが月額5万円でつくります。相談はチャットで回数の制限なし。記事・FAQの制作から公開・保守まで、本数・回数の上限なし。最低契約期間はありません。

SUPERVISOR
監修者 水間 雄紀

監修者:水間 雄紀

株式会社AIMA 代表取締役

1986年和歌山県生まれ、近畿大学卒。金融機関、経営コンサルティング会社を経て、2018年にコンテンツ制作の専門会社である株式会社circlizeを創業。2024年、ラグザス株式会社に事業譲渡。現在は株式会社AIMAにてAI×マーケティング事業に従事し、株式会社ラグザス・クリエイトでコンテンツの品質管理責任者を務める。

監修者・運営会社について
← AI深報トップへ