Gemini 3.8 テキスト音声合成がこんにちはを言う

Gemini
GoogleがGemini 3.8 Flash TTSとFlash-Lite TTSという新しいTTSモデルを発表しました。

概要

Googleは2つの新しいテキスト音声合成(TTS)モデルを発表しました:Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSです。Flash TTSは深い創造的ディレクションとキャラクターデザインのために構築されており、ユーザーは自然言語のプロンプトを使用して100以上の言語・方言でカスタムボイスをゼロから作成できます。また、2,000以上のプロダクション対応ボイスへのアクセス、30秒の音声サンプルからのボイス複製(同意検証とSynthIDウォーターマークによる保護付き)、演技指示やペーシング、方言変化を細かく制御しながら行ごとにパフォーマンスをディレクションできます。Flash-Lite TTSは大規模・高効率なダビングや音声エージェント向けに最適化されています。両モデルは長時間連続音声生成、ネイティブな2話者のシーン演出、スクリプト付きの感情表現・フィードバック応答に対応し、リアルな会話の質感を生み出します。Gemini 3.8 Flash TTSはHume AIのVoice Design Benchmarkとアクセントモデリングで1位を獲得し、両モデルはHume AIのOverall Quality Indexで1位と2位を記録しました。モデルはGoogle AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook、Google Vidsで利用可能で、Figma、HeyGen、Linguana、Wondercraft、99.co、Ollangなどの企業と提携しています。

(出典:Gemini)