
今日,OpenAI在X平台正式发布两款转录模型——GPT-Live-Transcribe与GPT-Transcribe,并即日起开放API调用。前者专为实时场景设计,主打低延迟语音转文字;后者则面向已完成音频文件及批量异步转录需求。两款模型均在上下文理解上显著提升,能更精准处理口音、专业术语、数字及嘈杂背景音下的语音内容,号称在真实世界音频场景中表现远超此前标杆模型Whisper。
在定价方面,OpenAI给出了差异化方案:低延迟实时转录的GPT-Live-Transcribe按每分钟0.017美元计费(约合人民币0.12元),而异步优化的GPT-Transcribe仅为每分钟0.0045美元(约合人民币0.03元),后者价格不足前者的三分之一,适合大规模离线处理任务。官方表示,新模型在Context Aware ASR基准测试中,引入上下文后语义准确率从41.6%跃升至45.2%;而在覆盖22种语言的Common Voice测试集上,GPT-Transcribe的错误率低至19.27%,同期Whisper-1则高达40.37%。在九种语言的真实世界录音基准中,新模型错误率仅8.98%,较Whisper-1的15.21%近乎减半。
此次发布意味着OpenAI在语音转录赛道再次加码,通过两条产品线分别满足会议实时字幕、电话客服与播客归档、媒体后期制作等不同场景。低延迟版本瞄准需要即时反馈的交互应用,而高性价比的异步版本则为海量数据转写降低成本门槛。随着API接口开放,开发者可灵活按需调用,业界普遍认为这将进一步挤压现有第三方转录服务的市场空间,并推动语音AI在医疗、教育、跨国沟通等领域的落地效率。OpenAI同时强调,模型对多种口音和背景噪音的鲁棒性提升,将显著改善非英语母语用户的使用体验。
原创文章,作者:校草,如若转载,请注明出处:https://www.kejixun.co/article/758579.html