結論
Googleは、新たな音声合成AIモデルとして「Gemini 3.8 Flash TTS」および「Gemini 3.8 Flash-Lite TTS」の2モデルをリリースしました。クリエイティブな表現力に特化したモデルと、大規模かつコスト効率を重視したモデルの2種類を提供し、幅広いニーズに対応しています。
何が発表・変更されたか
今回Googleが発表した音声合成モデルは、テキストから自然な音声を生成するための先進的なシステムです。両モデルともに、100を超える言語や方言をサポートしており、そのまま実運用に利用できる2,000以上の音声を備えています。
用途に合わせて異なる特性を持つ2つのモデルが用意されており、開発者やクリエイターはプロジェクトの目的に応じて選択することが可能です。
確認済みの具体情報
それぞれのモデルの主な特徴と設計思想は以下の通りです。
- Gemini 3.8 Flash TTS:深いクリエイティブディレクションやキャラクターデザイン向けに構築されており、クリエイターが自然言語のプロンプトを用いてゼロからまったく新しい声を独自に作成できる機能を持っています。
- Gemini 3.8 Flash-Lite TTS:大量のデータを扱うハイボリュームな用途において、コスト効率良くスケールさせたい目的に特化して構築されています。
また、Artificial Analysisのデータによると、料金体系はGemini 3.8 Flash TTSが100万文字あたり32.98ドル、Gemini 3.8 Flash-Lite TTSが100万文字あたり22.07ドルに設定されています。処理速度については、Gemini 3.8 Flash TTSが秒間44.1文字、Gemini 3.8 Flash-Lite TTSが秒間40.2文字を処理します。

音声の複製と安全性・透明性の確保
本モデルでは、わずか30秒の音声サンプルを使用することで音声の複製(ボイスレプリケーション)がサポートされています。ただし、安全性を担保するため厳格な仕組みが組み込まれています。
音声の複製を行う際には同意確認(コンセント・ベリフィケーション)が必須となります。具体的には、音声の所有者本人がリファレンス話者と一致する音声による同意の録音を提供する必要があり、これが確認されない限り音声は作成できません。また、不正利用を防ぎAI生成音声の検出を確実にするため、すべての生成音声クリップにはSynthIDによるウォーターマークが埋め込まれ、開発者や声の提供者を保護するためにC2PAクレデンシャルも併用されています。
なぜ重要か
多様な言語や方言への対応、そして豊富な事前学習済み音声の提供は、グローバルなコンテンツ展開を行う企業や開発者にとって大きな利点となります。さらに、自然言語プロンプトによる新しい声の自由な生成や、30秒のサンプルによる効率的な音声複製は、キャラクターボイス制作や音声コンテンツの制作プロセスを大きく変える可能性があります。
利用者・開発者・企業への影響
コスト効率に優れたFlash-Liteモデル(1M文字あたり22.07ドル)の存在により、大量のテキストを音声化するサービスやアプリケーションの運用コストを抑えることが可能になります。一方で、クリエイティブ用途向けのFlash TTS(1M文字あたり32.98ドル)を活用することで、独自のこだわりを持ったキャラクターボイスの設計や自由度の高い音声演出を実現できます。
また、SynthIDウォーターマークや厳格な同意確認プロセスが組み込まれているため、コンプライアンスや偽情報対策を重視する企業にとっても、安全性を確認しながら導入を検討しやすい仕様となっています。
未確定点
現時点で公開されている公式情報および二次分析データ以外の詳細な提供プラットフォームの仕様、APIの具体的な詳細な利用規約、あるいは今後追加される予定の機能などについては確認できていません。
まとめ
Googleの「Gemini 3.8 Flash TTS」および「Gemini 3.8 Flash-Lite TTS」のリリースは、音声合成AIの選択肢をさらに広げるものです。クリエイティブな音声デザインから高コストパフォーマンスな大規模処理までをカバーしつつ、SynthIDウォーターマークや同意確認などの安全対策を備えている点が大きな特徴と言えます。


コメント