結論
Googleは、リアルタイムでの音声会話を可能にする新しいAIモデルとして、「Gemini 3.8 Live」および「Gemini 3.8 Live Extended Thinking」を発表しました。音声入力および出力に対応した対話モデルであり、各種ベンチマークで高い評価を獲得しています。
何が発表・変更されたか
今回リリースされたのは、リアルタイムの音声対話に特化した2つのモデルです。いずれのモデルも、97以上の言語をサポートしており、会話の途中で自動的に言語を検知して切り替える機能を備えています。
また、開発者向けにはGemini APIおよびGoogle AI Studioを介して提供され、開発者が音声アプリケーションを構築しやすい環境が整えられています。
確認済みの具体情報
各モデルの性能や評価に関しては、公的なベンチマークテストにおいて以下のような結果が確認されています。
- Gemini 3.8 Live Extended Thinkingは、Artificial AnalysisのSpeech to Speech Quality Indexにおいてスコア82.6を記録し、総合1位を獲得しました。
- 同モデルは、τ-Voiceで68.6%、Sierraのτ-Voice-bankingベンチマークで35.1%、Big Bench Audioで97.7%のスコアを記録しています。
- Gemini 3.8 Liveは、Speech Agent Arenaにおいて第2位を獲得しています。
開発者向けの利用料金は、音声入力が1分あたり0.005ドル、音声出力が1分あたり0.018ドルに設定されています。
安全性と透明性の取り組み
GoogleのAI製品によって生成されるすべての音声には、誤情報の防止やコンテンツの透明性確保を目的として、SynthIDによるウォーターマークが直接織り込まれています。
提供プラットフォームと展開範囲
それぞれのモデルは、用途やプランに応じて複数のプラットフォームやアプリケーションに順次展開されています。
Gemini 3.8 Liveは、Gemini API、Google AI Studio、Search Live、およびGemini Enterpriseのプライベートプレビュー版で展開されています。
一方、Gemini 3.8 Live Extended Thinkingは、Gemini API、Google AI Studio、Gemini Enterprise、およびGoogle Workspaceアプリ(Docs、Gmail、Keepなど)のサブスクライバー向けに展開されています。

なぜ重要か
リアルタイム音声対話モデルの進化により、人間とAIのインタラクションはより自然でスムーズなものになりつつあります。特に、複数言語の自動検出・切り替え機能や、高い品質スコアを記録した推論能力は、グローバルな音声アプリケーションの可能性を広げる要素となります。
まとめ
Googleによる「Gemini 3.8 Live」および「Gemini 3.8 Live Extended Thinking」のリリースは、音声対話AIの性能と開発者向けのアクセシビリティを大きく前進させるものです。明確なベンチマーク実績や料金体系、SynthIDによる安全対策が示されたことで、今後の活用範囲の拡大が注目されます。


コメント