本文へ移動

重要なAIニュースを、速く、わかりやすく。

運営:AIMA

GoogleのAIアバターが一般提供 接客AIは「声」から顔つきへ

GoogleのAIアバターが一般提供 接客AIは「声」から顔つきへ
3行でわかる
  • GoogleはGemini 3.8 Live with Live AvatarをGemini Enterpriseで一般提供し、音声と動画を同期した対話AIを本番利用できるようにした
  • 97言語、会話を止めない非同期ツール実行、画像からの専用アバター作成に対応するが、専用アバターは許可制で提供地域も米国とEUが中心だ
  • 企業は見た目の派手さより、解決率、人への切り替え、発話時間当たりの費用、肖像利用の同意を小さな実証で確かめてから広げる

画面の中のAIが、声だけでなく表情を持つ

Googleは9月24日、Gemini 3.8 Live with Live AvatarをGemini Enterpriseで一般提供しました。音声で受け答えするGeminiに、発話と同期した口元、表情、映像を加え、Web、スマートフォン、店頭端末で対話できる企業向け機能です。Google Cloud Next 2026での予告から、本番環境で使える段階へ進みました。

目新しさは「AIに顔がついた」ことだけではありません。利用者が話している間も映像と音声を処理し、AIは回答しながら裏側で検索や予約などのツールを動かせます。ホテルのチェックイン、商品の案内、顧客サポートのように、会話を止めずに別の処理を進める設計です。

Live Avatarは、聞き、見て、話す対話へ、ほぼリアルタイムの視覚的な存在感を加える。

出典:Google公式発表を編集部訳

音声と映像を一体で動かすAIは、電話や文字チャットより説明を伝えやすくなる可能性があります。一方、顔があるだけで回答の正しさが上がるわけではありません。編集部は、接客AIの競争軸が応答速度から、表情、言語、業務実行を含む体験全体へ移った発表だとみます。

97言語と非同期処理が、窓口の役割を広げる

Googleによると、Live Avatarは97言語を扱い、会話の途中で言語が変わっても口の動きと表情を合わせます。あらかじめ用意されたアバターに加え、1枚の参照画像から企業専用の見た目を作る機能もあります。ただし専用アバターは現時点で企業向けの許可制です。

企業が注目したいのは、非同期のツール実行です。従来の音声AIは外部システムを呼ぶたびに沈黙しやすく、待ち時間が会話を不自然にしました。今回の仕組みでは、AIが対話を続けながら裏で情報を取得できます。予約状況を調べつつ必要事項を聞く、在庫を確認しながら代替品を説明する、といった流れを作りやすくなります。

一般提供の対象はGemini Enterpriseで、Google Cloudは米国とEUのエンドポイント、企業向けコンプライアンス、データ統制、予約型の処理能力を案内しています。日本語を扱えることと、日本国内リージョンで同じ条件を使えることは別です。国内導入ではデータの保存場所、販売窓口、契約条件を個別に確認する必要があります。

料金は「会話時間」より実際に話した長さで動く

料金表では、Gemini 3.8 Live APIの動画アバター出力は100万トークン当たり1ドルです。動画は1秒当たり6192トークンに換算され、アバターが話している時間だけ課金されます。単純計算では、映像の発話1分が約0.37ドルです。これに音声入出力、文字、画像、ツール側の費用が加わります。

したがって、店頭で8時間待機させること自体より、長い説明を何回返すかが動画費用を左右します。さらに会話履歴は各ターンで再処理されるため、長い対話ほど文脈の課金も積み上がります。月額ライセンスだけで予算を決めず、1件の案内を完了するまでの発話秒数、ターン数、外部ツール呼び出しを測るほうが現実的です。

試験で見る項目理由判断の目安
自己解決率表情の印象だけでなく成果を見る人へ渡さず完了した割合
人への切り替え誤案内を長引かせない迷った時に即座に転送できるか
発話時間とターン数従量費用を見積もる完了1件当たりの総費用
再問い合わせその場しのぎの回答を見抜く同じ用件で戻った割合

顔を使うなら、回答精度より前に権利を決める

人らしい見た目は親しみを生む一方、本人の発言と誤解される危険も増やします。Googleは、企業のアバター例として、利用許可を得た社員や、契約と肖像利用の同意を済ませた出演者を挙げています。生成物には音声と映像へSynthIDの透かしを入れ、AI生成だと検出できるようにすると説明しました。

試すなら、実在の社員そっくりの顔から始めないほうが安全です。権利関係が明確な架空キャラクターを使い、画面上でAIだと表示し、注文確定、契約、医療・金融判断の前では人へ切り替えます。外部システムへ書き込める権限も、在庫の閲覧と予約の確定を分けるべきです。

すべての出力はSynthIDで透かし処理され、AI生成コンテンツを検出できるようにする。

出典:Google公式発表を編集部訳

今後、顔つきAIが文字や電話より高い解決率を出し、費用と誤案内を抑えられれば、受付、案内、研修の標準画面になるでしょう。反対に、見た目の信頼感だけが先行し、回答精度、人への切り替え、肖像管理が追いつかなければ、本番利用は限定的になります。企業が最初に比べるべきなのは「人間らしく見えるか」ではなく、同じ用件を最後まで安全に終えられるかです。

※ 本記事は公開時点の一次情報にもとづいています。最新の状況は出典をご確認ください。

AI検索・LLMO対策

月額5万円で、AIに引用される会社へ

AIの進化が速いほど、自社の情報がAIにどう読まれるかも変わります。ChatGPTやGoogleのAI検索で正しく引用される状態を、AIMAが月額5万円でつくります。相談はチャットで回数の制限なし。記事・FAQの制作から公開・保守まで、本数・回数の上限なし。最低契約期間はありません。

SUPERVISOR
監修者 水間 雄紀

監修者:水間 雄紀

株式会社AIMA 代表取締役

1986年和歌山県生まれ、近畿大学卒。金融機関、経営コンサルティング会社を経て、2018年にコンテンツ制作の専門会社である株式会社circlizeを創業。2024年、ラグザス株式会社に事業譲渡。現在は株式会社AIMAにてAI×マーケティング事業に従事し、株式会社ラグザス・クリエイトでコンテンツの品質管理責任者を務める。

監修者・運営会社について
← AI深報トップへ