Gemini 3.5 Transcribe によるインテリジェントな文字起こし
概要
Googleは、高精度かつインテリジェントな音声インタラクションを実現する最新の音声認識モデル「Gemini 3.5 Transcribe」を発表しました。このモデルは、背景雑音、言い直し、フィラーワードを適切に処理しながら、生の音声を直接洗練されたフォーマット済みのテキストに変換します。Google AI StudioおよびGemini Enterprise Agent PlatformのGemini APIを通じて開発者に提供され、リアルタイムストリーミング処理と話者識別付きの事前録音音声処理をサポートしています。主な機能として、低い単語誤り率(WER)、カスタム語彙の認識、関数呼び出し、85言語以上の自動検出などが挙げられます。Android、macOS、Gboard、および今後Chromeにも統合される予定です。
(出典:Gemini)