結論:リアルタイム音声対話と動画生成が融合した新モデルが登場
米Googleは9月24日(現地時間)、リアルタイム音声対話モデル「Gemini 3.8 Live」に動画生成アバター機能「Live Avatar」を組み合わせた「Gemini 3.8 Live with Live Avatar」を発表しました。同日から企業向けの「Gemini Enterprise」で一般提供が開始されています。
何が発表・変更されたか
今回の発表では、音声対話と高品質な動画生成アバターをリアルタイムで同期させる機能が新たに導入されました。対応言語は日本語を含む97言語となっており、会話の途中で言語が切り替わった場合でも、リップシンクや表情を自然に追従させることが可能です。
また、利用環境としては米国とEUのエンドポイントで提供され、プロビジョンドスループットにも対応しています。カスタムアバターの作成機能も用意されており、高品質な参照画像1枚を基に独自の生成が行えます。

確認済みの具体情報と料金体系
本機能の利用料金は従量課金制を採用しており、100万トークン当たりの価格が設定されています。
- アバター映像の出力:1ドル(1秒当たり6192トークンとして計算)
- テキスト入力:0.75ドル
- 画像・動画入力:1ドル
- 音声入力:3ドル
- テキスト出力:4.5ドル
- 音声出力:12ドル
なお、高品質な参照画像1枚を基にしたカスタムアバターの作成については、安全性の観点からGoogleの許可リストに登録された企業に限って提供されます。
安全性と利用制限に関する取り組み
なりすましなどの悪用を防ぐため、厳格な対策が講じられています。カスタムアバターの作成には許可リストへの登録と厳格な検証の手続きが必要となります。また、生成された音声と映像にはすべて電子透かし「SynthID」が埋め込まれ、AI生成コンテンツであることが検出可能な仕組みになっています。モデルカードによると、社内の安全・責任チームと連携した人による評価、レッドチーミング、子どもの安全に関する評価などが実施されています。
なぜ重要か・企業への影響
多言語対応のリアルタイム音声対話と表情豊かな動画生成アバターが企業向けに提供されたことで、カスタマーサポートやインタラクティブなビジネスアプリケーションにおいて、より自然で臨場感のあるユーザー体験の構築が可能になります。一方で、利用は許可リストに限定されるなど、安全性と信頼性を担保するための厳格なコントロール下で運用される仕組みとなっています。


コメント