谷歌推出Gemini新语音模型,配音可定制还能“演”出来

谷歌推出Gemini新语音模型,配音可定制还能“演”出来

昨日,谷歌宣布Gemini家族新增Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS两款文本转语音模型,将语音生成从静态预设转变为动态创意工作室,帮助创作者、开发者和企业打造更丰富、更具表现力的音频体验,同时改进Gemini Notebook和Google Vids等产品。

两款模型定位不同。Flash TTS面向深度创意和角色设计,用户可通过自然语言提示从头创建新语音,适用于游戏、沉浸式有声读物、播客和互动媒体,并能精细控制表演、节奏和方言转换。Flash-Lite则主打大容量、高性价比场景,优化大容量配音、音频内容创作和富有表现力的语音代理,可微调音调、节奏和表现力。用户还能从原有30种语音扩展到无限语音库,访问2000多种现成语音,覆盖100多种语言和方言,包括墨西哥西班牙语、魁北克法语、苏格兰英语等区域变体。

功能方面,新模型支持生成式语音设计、语音复制、保存扩展和即将推出的语音混音。仅需30秒音频样本即可复现一致声音,并内置同意验证、SynthID水印和C2PA凭据。选好声音后,用户可逐行指导表演,在数小时长篇音频中保持自然节奏和角色音色,还能编排双声音对话,加入笑声、叹气等非语言反馈,增添逼真感。

性能上,Gemini 3.8 Flash TTS在Hume AI语音设计基准测试中以71.4分位居总体第一,口音建模60.8分领先。两款模型在整体质量指数中分列第一和第二,相比Gemini 3.1 Flash TTS在长格式内容和双扬声器剧本控制等场景有明显改进。

原创文章,作者:Google,如若转载,请注明出处:https://www.kejixun.co/article/763148.html

Google的头像Google认证作者

相关推荐

发表回复

登录后才能评论