微软测试首款原生实时语音模型,全双工对话支持16种语言

微软测试首款原生实时语音模型,全双工对话支持16种语言

科技媒体TestingCatalog近日报道,微软正在测试其首款自研原生实时语音模型MAI Realtime,标志着该公司在AI语音交互领域迈出重要一步。该模型已向部分合作伙伴开放,在MAI Playground平台进行早期测试,不过微软尚未透露其何时上线Microsoft Foundry或扩展至Copilot语音功能。

MAI Realtime采用双向全双工交互方式,打破了传统“用户说完、模型再答”的轮次交替限制,能够同步聆听并实时回应,甚至支持用户在对话中随时插话打断,系统可自动调整输出。这种设计让对话更接近人类自然交流的节奏。在语言能力方面,模型支持包括中文、英语、日语、韩语、阿拉伯语等在内的16种语言,并提供Victoria和Grant两种语音风格,据称比Copilot现有语音模式更加自然流畅。用户既可以主动指定对话语言,也可启用自动检测功能,模型能够在对话中途自动识别并切换语言,极大提升了跨语言使用的灵活性。

值得注意的是,MAI Realtime的定位仍专注于对话系统,不支持唱歌或生成非语音音效。调试面板可显示实时延迟、模型思考内容及处理步骤,便于开发者优化体验。此前微软发布的MAI语音模型均为单向产品,如用于语音合成的MAI-Voice-2及其Flash版本,以及用于语音识别的MAI-Transcribe-1.5,而此次的全双工实时模型则是微软在端到端语音交互上的首次自研尝试。随着测试范围逐步扩大,样本分享功能也有望向平台用户开放,业内普遍关注这款模型能否在未来赋能Copilot等核心产品,为AI助手带来更接近人类的对话体验。

原创文章,作者:Microsoft,如若转载,请注明出处:https://www.kejixun.co/article/758966.html

Microsoft的头像Microsoft认证作者

相关推荐

发表回复

登录后才能评论