蚂蚁集团发布Ling-3.0-flash混合推理模型,仅用十分之一参数对标旗舰性能

蚂蚁集团发布Ling-3.0-flash混合推理模型,仅用十分之一参数对标旗舰性能

蚂蚁集团旗下百灵大模型昨日正式推出新一代原生混合推理模型Ling-3.0-flash,并同步在OpenRouter与百灵官方平台开放限时免费API调用,免费期截至8月3日23时。官方同时宣布,该模型权重将在免费期结束后正式开源。

据官方介绍,Ling-3.0-flash总参数量为124B,仅约为上一代1T级旗舰思考模型Ring-2.6-1T的12.4%,而其激活参数量更是只有5.1B,约为前代的8.1%。在如此显著的参数压缩下,新模型却在传统推理、指令遵循与长文本能力上实现了全方位对标甚至超越,展现出极高的“智能密度”。这一突破源于其从预训练阶段即采用的原生混合线性注意力架构,以5:1交替堆叠KDA与MLA,并升级了细粒度对角门控与1/64稀疏MoE,在长上下文效率、状态记忆与计算成本之间实现了协同跃升。

围绕真实生产力场景,Ling-3.0-flash在Agent能力上进行了深度进化。团队扩展了超过1万个可交互训练环境,使Coding、General与Deep Research Agent任务实现全程闭环,做到能力强、响应快、协同稳。同时,模型创新接入了SGLang HiCache与Mooncake分级缓存架构,通过物理双池与集群共享L3,使长程交互无需重复计算,长输入场景下首字响应时间(TTFT)降低60%至80%以上,极大提升了复杂Agent应用的高效落地能力。蚂蚁集团表示,Ling-3.0-flash追求“快、省、可落地”的智效比极限,此次开放免费调用旨在让更多开发者和企业抢先体验这一轻量级旗舰的潜力。

原创文章,作者:李小白,如若转载,请注明出处:https://www.kejixun.co/article/758390.html

李小白的头像李小白认证作者

相关推荐

发表回复

登录后才能评论