使用 Gemini 3.5 Transcribe 进行智能转写
内容摘要
Google 推出了 Gemini 3.5 Transcribe,这是其迄今为止最精准的语音转文本模型,专为智能语音交互而设计。该模型能够将原始音频直接转换为精炼且格式化的文本,同时处理背景噪音、自我修正和填充词。它面向开发者在 Google AI Studio 和 Gemini Enterprise Agent Platform 中推出,支持实时流式传输和带说话人归属的预录音频处理。主要功能包括低词错误率、自定义词汇支持、函数调用以及自动检测 85 种以上的语言。相关集成已扩展至 Android、macOS、Gboard 以及即将推出的 Chrome 功能,为开发者和消费者提供自然的语音交互能力。
(来源:Gemini)