百灵发布124B‘执行型’大模型Ling-3.0-flash:以极致稀疏激活与分级缓存重构AI Agent效能边界

蚂蚁百灵发布124B执行型大模型Ling-3.0-flash,以1/64专家激活率实现5.1B参数高效推理,智能密度与智效比双登顶;代码、Agent、指令遵循、长上下文等维度多项第一,首创分级缓存架构显著降低TTFT,重新定义轻量高能AI Agent范式。

就在黄仁勋公开力挺开源生态的同一天,蚂蚁集团百灵团队正式推出全新1240亿参数‘执行优先’大模型Ling-3.0-flash。该模型在34项权威评测中斩获15项第一、19项第二,综合均分与DeepSeek-V4-Flash并列榜首,大幅领先万亿级旗舰Ring-2.6-1T近8分。尤为突出的是其‘智能密度’(0.5)与‘智效比’(13.2)双双登顶业界——仅用约51亿激活参数(总参124B,专家激活率压缩至1/64),即实现顶尖性能。代码能力方面,SWE-Bench Pro达56.6%、ArtifactsBench达77.0%,均居首位;MiniAppBench通过率达25.3%,媲美参数量翻倍的开源SOTA。通用Agent能力全面领跑:BFCL-v4函数调用准确率73.0%,与Claude-Sonnet-4.6并列第一;端到端GDPVal v2-AA得分1107,全模型最高;Tau3-banking-AA金融任务表现仅次于Claude。搜索与多智能体协作亦极具竞争力:BrowseComp达82.0%,WideSearch位列第三;指令遵循能力稳健,LIFEBench长期记忆测试以77.3%夺冠。数学与跨学科推理(HLE)稳居前列,256K原生上下文支持下,MRCR_256K达81.1%,Multi-IF达87.7%。技术底座创新采用‘Ling Scaling Law’指导下的超细粒度专家路由,并深度融合SGLang HiCache与Mooncake双池分级缓存架构(GPU内存/L1、主机内存/L2、分布式存储/L3),实测长输入首字响应时间(TTFT)降低60%–80%,彻底释放Agent长程交互潜力。

来源:智东西

AI 前线

智元WITA-Omni登顶全球全模态理解榜首:具身智能原生大模型实现系统性突破

2026-7-30 4:41:58

AI 前线

小米澎程N90‘加92’争议背后:营销能力与信任赤字的双重镜像

2026-7-30 6:41:58

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索