GoogleのAIアバターが一般提供 接客AIは「声」から顔つきへ

- GoogleはGemini 3.8 Live with Live AvatarをGemini Enterpriseで一般提供し、音声と動画を同期した対話AIを本番利用できるようにした
- 97言語、会話を止めない非同期ツール実行、画像からの専用アバター作成に対応するが、専用アバターは許可制で提供地域も米国とEUが中心だ
- 企業は見た目の派手さより、解決率、人への切り替え、発話時間当たりの費用、肖像利用の同意を小さな実証で確かめてから広げる
画面の中のAIが、声だけでなく表情を持つ
Googleは9月24日、Gemini 3.8 Live with Live AvatarをGemini Enterpriseで一般提供しました。音声で受け答えするGeminiに、発話と同期した口元、表情、映像を加え、Web、スマートフォン、店頭端末で対話できる企業向け機能です。Google Cloud Next 2026での予告から、本番環境で使える段階へ進みました。
目新しさは「AIに顔がついた」ことだけではありません。利用者が話している間も映像と音声を処理し、AIは回答しながら裏側で検索や予約などのツールを動かせます。ホテルのチェックイン、商品の案内、顧客サポートのように、会話を止めずに別の処理を進める設計です。
Live Avatarは、聞き、見て、話す対話へ、ほぼリアルタイムの視覚的な存在感を加える。
出典:Google公式発表を編集部訳
音声と映像を一体で動かすAIは、電話や文字チャットより説明を伝えやすくなる可能性があります。一方、顔があるだけで回答の正しさが上がるわけではありません。編集部は、接客AIの競争軸が応答速度から、表情、言語、業務実行を含む体験全体へ移った発表だとみます。
97言語と非同期処理が、窓口の役割を広げる
Googleによると、Live Avatarは97言語を扱い、会話の途中で言語が変わっても口の動きと表情を合わせます。あらかじめ用意されたアバターに加え、1枚の参照画像から企業専用の見た目を作る機能もあります。ただし専用アバターは現時点で企業向けの許可制です。
企業が注目したいのは、非同期のツール実行です。従来の音声AIは外部システムを呼ぶたびに沈黙しやすく、待ち時間が会話を不自然にしました。今回の仕組みでは、AIが対話を続けながら裏で情報を取得できます。予約状況を調べつつ必要事項を聞く、在庫を確認しながら代替品を説明する、といった流れを作りやすくなります。
一般提供の対象はGemini Enterpriseで、Google Cloudは米国とEUのエンドポイント、企業向けコンプライアンス、データ統制、予約型の処理能力を案内しています。日本語を扱えることと、日本国内リージョンで同じ条件を使えることは別です。国内導入ではデータの保存場所、販売窓口、契約条件を個別に確認する必要があります。
料金は「会話時間」より実際に話した長さで動く
料金表では、Gemini 3.8 Live APIの動画アバター出力は100万トークン当たり1ドルです。動画は1秒当たり6192トークンに換算され、アバターが話している時間だけ課金されます。単純計算では、映像の発話1分が約0.37ドルです。これに音声入出力、文字、画像、ツール側の費用が加わります。
したがって、店頭で8時間待機させること自体より、長い説明を何回返すかが動画費用を左右します。さらに会話履歴は各ターンで再処理されるため、長い対話ほど文脈の課金も積み上がります。月額ライセンスだけで予算を決めず、1件の案内を完了するまでの発話秒数、ターン数、外部ツール呼び出しを測るほうが現実的です。
| 試験で見る項目 | 理由 | 判断の目安 |
|---|---|---|
| 自己解決率 | 表情の印象だけでなく成果を見る | 人へ渡さず完了した割合 |
| 人への切り替え | 誤案内を長引かせない | 迷った時に即座に転送できるか |
| 発話時間とターン数 | 従量費用を見積もる | 完了1件当たりの総費用 |
| 再問い合わせ | その場しのぎの回答を見抜く | 同じ用件で戻った割合 |
顔を使うなら、回答精度より前に権利を決める
人らしい見た目は親しみを生む一方、本人の発言と誤解される危険も増やします。Googleは、企業のアバター例として、利用許可を得た社員や、契約と肖像利用の同意を済ませた出演者を挙げています。生成物には音声と映像へSynthIDの透かしを入れ、AI生成だと検出できるようにすると説明しました。
試すなら、実在の社員そっくりの顔から始めないほうが安全です。権利関係が明確な架空キャラクターを使い、画面上でAIだと表示し、注文確定、契約、医療・金融判断の前では人へ切り替えます。外部システムへ書き込める権限も、在庫の閲覧と予約の確定を分けるべきです。
すべての出力はSynthIDで透かし処理され、AI生成コンテンツを検出できるようにする。
出典:Google公式発表を編集部訳
今後、顔つきAIが文字や電話より高い解決率を出し、費用と誤案内を抑えられれば、受付、案内、研修の標準画面になるでしょう。反対に、見た目の信頼感だけが先行し、回答精度、人への切り替え、肖像管理が追いつかなければ、本番利用は限定的になります。企業が最初に比べるべきなのは「人間らしく見えるか」ではなく、同じ用件を最後まで安全に終えられるかです。
※ 本記事は公開時点の一次情報にもとづいています。最新の状況は出典をご確認ください。
AI検索・LLMO対策
月額5万円で、AIに引用される会社へ
AIの進化が速いほど、自社の情報がAIにどう読まれるかも変わります。ChatGPTやGoogleのAI検索で正しく引用される状態を、AIMAが月額5万円でつくります。相談はチャットで回数の制限なし。記事・FAQの制作から公開・保守まで、本数・回数の上限なし。最低契約期間はありません。
監修者:水間 雄紀
株式会社AIMA 代表取締役
1986年和歌山県生まれ、近畿大学卒。金融機関、経営コンサルティング会社を経て、2018年にコンテンツ制作の専門会社である株式会社circlizeを創業。2024年、ラグザス株式会社に事業譲渡。現在は株式会社AIMAにてAI×マーケティング事業に従事し、株式会社ラグザス・クリエイトでコンテンツの品質管理責任者を務める。
監修者・運営会社について