
科技媒体9to5Mac昨日报道,Meta公司正式推出Muse Voice Transcribe,这是其首个实时音频感知模型,开发者现可通过Meta Model API调用该能力。定价方面,每1000分钟音频仅需3美元(约合20.2元人民币),折合每小时0.18美元(约合1.2元人民币),极具竞争力。该模型在同一流程中整合了流式自动语音识别、说话人分离与端点检测技术,用户说话时系统可同步输出文字,无需等待完整录音结束再处理,延迟更低,尤其适合实时听写、会议记录和通话字幕等场景。
在多人识别能力上,Muse Voice Transcribe可在包含20余名说话者的复杂录音中精准分离不同发言者,并能自动识别说话是否结束以确定输入边界。模型训练覆盖70余种语言,其中25种已在发布时完成验证,支持超过1小时的长音频以及句内或句间的自然语言切换。开发者还可通过语言、关键词和上下文偏置,针对性提升特定术语或场景下的识别效果,满足多样化应用需求。
技术层面,Meta为兼顾实时响应与识别准确度,引入了名为自适应延迟的动态决策机制。该系统不会对所有词语采用统一的处理速度,而是针对每个词独立判断需要额外接收多少音频后再输出结果。对于发音清晰的语音,系统可快速提交转写;对于发音不清、术语较多或语境复杂的词语,则会调用更多前后文音频信息辅助识别,从而在低延迟与高精度之间取得更优平衡。据Meta称,截至2026年9月1日,Muse Voice Transcribe已在Artificial Analysis流式语音转文本排行榜中位列第一,彰显其在行业内的技术领先地位。
原创文章,作者:聆听,如若转载,请注明出处:https://www.kejixun.co/article/760983.html