百灵Ling-3.0-tiny发布:融合KDA与MLA的79亿参数轻量级混合推理模型,原生支持本地Agent与无限知识下钻

百灵开源Ling-3.0-tiny:7.9B参数混合架构轻量模型,融合KDA与MLA注意力机制及128专家稀疏MoE,单Token仅激活1.3B参数;支持原生混合推理与本地Agent部署,Mac端实现实时知识下钻,首Token延迟<100ms,零云端依赖;AI综合评测得分25分,性能媲美4B级MoE模型,定位代码辅助与本地知识引擎。

蚂蚁集团旗下百灵实验室正式开源Ling-3.0-tiny——一款兼具高性能与低门槛的7.9B参数轻量级大模型。该模型创新性地采用3:1交替堆叠架构,融合月之暗面自研的Kimi增量注意力(KDA)与DeepSeek多头潜在注意力(MLA),并集成含128个专家的稀疏MoE前馈网络,单Token仅激活8个路由专家+1个共享专家,实际激活参数仅1.3B,在长上下文建模、参数效率与计算开销间实现精妙平衡。其原生混合推理机制支持通过enable_thinking参数动态切换‘直答’与‘多步思考’模式,通用于代码生成、数理推理、工具调用及指令遵循等任务。实测显示:FP8精度下,DGX Spark吞吐达100–105 tokens/s,M4 Pro MacBook达86–90 tokens/s;8K上下文峰值内存仅8.34GiB。在MacBook Pro(36GB内存)上完整复刻Infinite Wiki体验——点击任意术语即时生成上下文解释卡片,支持多层知识下钻,全程纯本地运行,首Token延迟<100ms,数据零上传、无API计费,真正实现高速、私密、可嵌入的知识引擎。在涵盖真实任务执行、工具使用、代码能力、科学推理、知识可靠性与长上下文等九维指标的Artificial Analysis Intelligence Index中,Ling-3.0-tiny获25分,仅比Gemma-4-26B-A4B低1分,显著优于Qwen3.5-9B、Gemma-4-12B等同类竞品,性能逼近激活参数约4B的更大MoE模型。它已超越传统‘能装进设备’的小模型定位,成为面向代码辅助、知识工作流与本地智能体(Local Agent)落地的坚实基座。

来源:智东西

AI 前线

大语言模型如何重塑AI开发范式?2024年深度破局解析

2026-8-12 10:25:07

AI 前线

iOS 27 Beta曝光苹果AI分级收费机制:iCloud+成Apple Intelligence核心通行证

2026-8-12 15:45:17

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索