
当地时间9月15日,谷歌宣布推出Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking,称这是其迄今最先进的实时对话模型,在智能和并行推理方面有重大升级。两款新品分别面向规模部署与成本优化,以及高复杂度任务和多步推理。
Gemini 3.8 Live兼顾对话智能、流畅交流和视觉理解,适合大规模部署,在Speech Agent Arena排名第二。它能近实时处理视觉输入,自动检测并切换97种语言,还能后台调用工具和API而不打断对话。Extended Thinking在多项基准测试中领先,拿下Artificial Analysis语音对语音质量指数第一,得分82.6%;τ-Voice完成率68.6%,Sierra τ-Voice-banking达35.1%,Big Bench Audio得分97.7%。它支持推理与发言同步,用“让我确认一下”等提示自然回应,并实时讲解多步后台任务。
开发者可通过Gemini Live API在声网、LiveKit、Pipecat、Vercel等平台构建语音界面,谷歌还与Salesforce、Genspark、Lumeris等合作。所有AI生成音频均嵌入SynthID隐形水印,用于检测AI内容、防止虚假信息传播。目前,Gemini 3.8 Live已在Gemini API和Google AI Studio开放,企业用户可在Gemini Enterprise抢先体验,普通用户可在Search Live体验;Extended Thinking也向开发者开放,并将在Gemini Live、Google Workspace、Gmail和Keep等场景推送。
原创文章,作者:Google,如若转载,请注明出处:https://www.kejixun.co/article/762201.html