据IT之家9月23日报道,谷歌为Gemini家族新增Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS两款文本转语音模型。前者侧重角色设计和创意表达,后者面向大容量配音、音频内容创作及语音代理等场景。
两款模型都支持逐行指导台词表演,用户可以在脚本中指定演绎方式。报道还列出长篇音频生成、从单个脚本编排双声音对话等能力。声音选择方面,报道提及通过自然语言提示创建定制语音,以及使用2000多种现成语音;语音混音功能则标为即将推出。
报道援引的Hume AI评估显示,Gemini 3.8 Flash TTS在语音设计基准测试中获得71.4分。语音复制功能据称可凭30秒音频样本重现声音特征,并配有同意验证、SynthID水印和C2PA凭据。
