GoogleがGemini 3.8 Liveを公開、音声対音声AIのリアルタイム化が加速

ネイティブ音声モデルの進化と開発者向けツールの拡充

Googleは2026年9月15日に、Gemini Audioモデル群の新モデルを開発者向けに公開した。中核となるGemini 3.8 Liveと3.8 Live Extended Thinkingは音声を直接音声で処理するネイティブな音声対音声アーキテクチャーを採用し、会話の流れを保ちながらタスク実行や推論を行える。Alisa Fortin氏とThor Schaeff氏が紹介するこのモデルは、Artificial AnalysisのSpeech-to-Speechリーダーボードで1位を獲得している。

3.8 Liveの機能が示す音声エージェントの新基準

Gemini 3.8 Liveの特徴は、非同期関数呼び出し、ライブ映像入力との連携、アルファベットや数字高精度な解析、97言語以上の多言語対応など、実用性に直結する機能が揃っている点だ。特に非同期関数呼び出しは、APIやツールの実行をバックグラウンドで進めながら音声応答を継続して届ける。Extended Thinkingは複雑な多段階推論をバックグラウンドで処理しつつ進捗をナレーションできる。音声入力は1分あたり0.005ドル、出力は0.018ドルという価格設定も、リアルタイム音声アプリケーションのスケールを後押しする。

3.5 Transcribeと周辺モデルによる音声エコシステムの完成度

同時に公開されたGemini 3.5 Transcribeは、85言語以上に対応する音声認以上に対応する音声認識モデルで、ストリーミング時の単語誤り率が4.0パーセントと高精度だ。自動コードスイッチングやカスタムボキャブラリーによる領域特化の認識精度向上、スマート書き起こしモードによるフィラー除去など、実務での使い勝手が重視されている。さらに3.5 Live Translateや3.1 Flash TTS、Lyria 3.5などと組み合わせることで、音声の認識・理解・生成・翻訳・音楽生成までを一貫したAPIで扱える。Googleが音声を用途別に最適化したモデル群として提供する戦略は、開発者が必要な機能を組み合わせて使いやすいエコシステムの形成につながる。