Google、テキストから音声を生成する「Gemini 3.8 Flash TTS」公開 日本語対応や安全対策も実装

音声合成とAIをイメージしたデジタル音波のグラフィック AI・テクノロジー

Googleが新たな音声生成モデルを発表

米Googleは9月23日(現地時間)、テキストから音声を生成するTTSモデル「Gemini 3.8 Flash TTS」および「Gemini 3.8 Flash-Lite TTS」を発表しました。この新しいモデルは、多言語対応と実用的な提供形態を備えています。

日本語を含む多言語対応と提供形態

今回発表された2つのモデルの言語対応は以下の通りです。

  • Gemini 3.8 Flash TTS:130言語に対応
  • Gemini 3.8 Flash-Lite TTS:101言語に対応

いずれも日本語に対応しています。

提供形態について、Flash TTSは開発者向けにGemini APIとGoogle AI Studioで提供され、一般ユーザーは「Gemini Notebook」で利用できます。

利用料金(Gemini API 有料プラン)

Gemini APIの有料プランの料金(100万トークン当たり)は以下の通りです。

  • Gemini 3.8 Flash TTS:入力 0.5ドル、出力(音声) 9ドル
  • Gemini 3.8 Flash-Lite TTS:入力 0.5ドル、出力 6ドル
デジタルセキュリティと認証を表現したグラフィック

安全対策とボイスレプリケーションに関する仕様

生成した音声にはGoogleの電子透かし技術「SynthID」を埋め込みます。ボイスレプリケーションにはコンテンツの来歴を示す「C2PA」の認証情報も付与します。

ボイスレプリケーションの対象は自分の声か、利用する権利を持つ声に限る仕様となっています。また、利用時には声の持ち主が口頭で同意した録音を提出する必要があり、録音の話者が参照音声と一致するかを確認する仕組みを設けたとされています。

Google AI Studioにおける利用制限

Google AI Studioでのボイスレプリケーションは、以下の地域では利用できません。

  • 米国のイリノイ州とテキサス州
  • 欧州経済領域(EEA)
  • 英国
  • スイス
  • インド

まとめ

Googleの「Gemini 3.8 Flash TTS」および「Gemini 3.8 Flash-Lite TTS」は、多言語対応や多様な提供形態を通じてテキストから音声を生成するTTSモデルです。SynthIDやC2PAの採用、同意確認、地域別の利用制限といった仕様も含めて発表されています。

情報元

コメント