Google、音声を整えて文字にするGemini 3.5 Transcribe公開

- Googleは音声を文字に変える新モデルGemini 3.5 Transcribeを公開し、Gemini APIなどで公開プレビューを始めた
- 85超の言語、リアルタイム処理、話者分離、単語単位の時刻、専門用語の登録に対応し、録音版の有料料金目安は1分約0.005ドルだ
- 会社は会議録を自動化する前に、逐語録と読みやすい要約のどちらが必要かを決め、固有名詞・数字・話者の重なりを含む実データで評価するのが安全だ
話した内容を、そのまま残すか読みやすく整えるか選べる
Googleは2026年8月26日、音声認識モデル「Gemini 3.5 Transcribe」を発表しました。開発者向けにはGoogle AI StudioのGemini API、企業向けにはGemini Enterprise Agent Platformで公開プレビューを開始しています。リアルタイム版はgemini-3.5-transcribe-live、録音ファイル版はgemini-3.5-transcribeとして提供されます。
変化は、音声を一字一句テキストへ置き換えるだけではありません。逐語的に残す「verbatim」では、話者の分離や単語単位の時刻を付けられます。一方の「smart」は、言い直しや「あの」「ええと」といったフィラーを除き、句読点、段落、箇条書き、日付や金額の表記まで整えます。会議の証跡を残したい場面と、話した内容をメールや議事録の下書きへ変えたい場面を、同じモデル群で分けられる設計です。
Gemini 3.5 Transcribeは、生の音声を正確で整形済みの文章へ変換し、開発者はリアルタイムと録音処理の2つのAPIを使える。
出典:Google公式発表を要約
会議録、窓口対応、音声入力が同じ基盤へ近づく
公式資料によると、自動言語検出は85超の言語に対応し、会話の途中で言語が切り替わる場面も扱います。録音処理では話者分離と単語単位のタイムスタンプを出せるほか、社名、製品名、略語などを最大1,000語まで優先語彙として渡せます。Googleは、ストリーミングで1秒未満の遅延、録音処理では最大3人の話者を正式対応範囲として説明し、3人を超える話者は実験的対応としています。
この発表が広く効く理由は、音声認識が単独の文字起こしサービスから、仕事を始める入口へ移るためです。会議後に議事録を作るだけでなく、電話中の字幕、問い合わせ内容の分類、音声で作った指示から別のAIを呼び出す流れまで同じ基盤に載せられます。GoogleはGboard、Geminiアプリ、Antigravityにもモデルを組み込み、Chromeではウェブ上の入力欄へ音声で書き込む機能を近日提供するとしています。
ただし、一般利用者が今日から日本語で全機能を使えるという発表ではありません。macOS版Geminiアプリは英語、AndroidのRamblerは対象国・言語に限定され、Chrome版はまだ提供前です。現時点で条件が最も明確なのはAPIを試せる開発者と、公開プレビューへ参加する企業です。
1分の単価だけでなく、修正に残る時間を比べる
Gemini APIの料金表では、録音版の有料料金は音声入力と文字出力を合わせた目安で1分約0.005ドル、リアルタイム版は約0.009ドルです。無料枠もありますが、無料利用の入力と出力は製品改善に使われる設定、Paidでは使われない設定と明記されています。会議、顧客通話、医療・人事の会話などを扱う企業は、安さだけで無料枠を選ばず、データの扱いと自社の規程を先に照合する必要があります。
| 用途 | 向く設定 | 確認する点 |
|---|---|---|
| 監査用の会議記録 | verbatim+話者分離+時刻 | 話者の重なり、固有名詞、数字 |
| 読みやすい議事録 | smart | 言い直しを消して意味が変わらないか |
| 電話中の字幕 | Live API | 遅延、途中結果、回線不安定時 |
| 大量の録音処理 | 録音版API | 単価、処理時間、保存と削除 |
smartモードは話者分離や単語単位タイムスタンプと同時に使えません。読みやすさと証跡性を一度に最大化できるわけではなく、ここが導入判断の分かれ目です。法務確認や監査が必要なら逐語録を原本として残し、別工程で要約を作るほうが安全です。社内メモならsmartで編集時間を減らす価値が大きくなります。
Chirp 3との違いは、文字起こし後の仕事まで見ていること
Googleには既存の音声認識モデルChirp 3があり、Google CloudのSpeech-to-Text V2で一般提供されています。Chirp 3も多言語、自動言語検出、話者分離に対応します。対してGemini 3.5 TranscribeはGemini API側の公開プレビューで、読みやすく整えるsmartモードや、他のGeminiモデルを呼ぶ機能へつなげやすい点を前面に出しました。
編集部は、音声入力が「記録を作る機能」から「AIへ仕事を渡す共通画面」へ変わる流れだとみます。キーボード操作が難しい場面だけでなく、移動中の下書き、現場点検、接客記録など、画面を見続けにくい仕事へAIの入口が広がるからです。ただし、Chromeや日本語の一般向け展開が遅れ、APIでも雑音や複数話者への修正時間が従来製品と変わらなければ、変化は開発者向けの選択肢追加にとどまります。
導入前に30分の実音声で、誤りと作業時間を測る
企業が試すなら、きれいなデモ音声ではなく、自社の会議や窓口で生じる条件を30分程度に切り出します。固有名詞、英数字、金額、日付、話者のかぶり、雑音を含む音声を使い、誤変換の数だけでなく、人が直す時間、話者ラベルの修正回数、要約前後で意味が変わった箇所を記録します。音声1分のAPI単価より、30分の会議録を完成させるまで何分かかるかのほうが、導入費用を左右します。
録音データの保存先、保持期間、削除方法、無料・有料枠での製品改善利用も契約前に確認したい項目です。まず用途を一つに絞り、逐語録を残す業務ではverbatim、下書き作成ではsmartを別々に評価します。正式提供後に日本語、地域、管理機能の条件が固まれば対象を広げ、条件が合わなければ一般提供済みのChirp 3や既存サービスと修正時間で比べればよいでしょう。
※ 本記事は公開時点の一次情報にもとづいています。最新の状況は出典をご確認ください。
AI検索・LLMO対策
月額5万円で、AIに引用される会社へ
AIの進化が速いほど、自社の情報がAIにどう読まれるかも変わります。ChatGPTやGoogleのAI検索で正しく引用される状態を、AIMAが月額5万円でつくります。相談はチャットで回数の制限なし。記事・FAQの制作から公開・保守まで、本数・回数の上限なし。最低契約期間はありません。
監修者:水間 雄紀
株式会社AIMA 代表取締役
1986年和歌山県生まれ、近畿大学卒。金融機関、経営コンサルティング会社を経て、2018年にコンテンツ制作の専門会社である株式会社circlizeを創業。2024年、ラグザス株式会社に事業譲渡。現在は株式会社AIMAにてAI×マーケティング事業に従事し、株式会社ラグザス・クリエイトでコンテンツの品質管理責任者を務める。
監修者・運営会社について