ITCOW牛新网 8月11日消息,蚂蚁百灵团队今日在 Hugging Face 放出 Ling-3.0-tiny 的开源权重,这款轻量混合推理 MoE 模型以 7.9B 总参、1.3B 每 token 激活的规模,把“能在桌面级小机器上跑推理”的门槛又往下压了一截,BF16、FP8、INT4 三种精度权重同步提供,方便不同显存与功耗条件的设备各取所需。

架构上它走的是高效混合线性路线,把 KDA(Kimi Delta Attention)与 MLA(多头潜在注意力)按 3:1 交替堆叠,前馈网络则用了含 128 个路由专家的稀疏 MoE,在上下文承载力和单次计算开销之间找平衡点。模型原生支持快速响应与多步骤推理两种模式切换,定位就是给本地化场景用的,不是云端大模型的缩水演示版。
据ITCOW牛新网了解,官方实测覆盖英伟达 DGX Spark、Apple Silicon MacBook 与 Mac mini 等终端,在 M4 Pro 的 MacBook 上跑出约 86—90 Token/s 的吞吐,8K 上下文时峰值显存占用约 8.34 GiB,这意味着一台普通开发用笔记本就能端侧承载中等复杂度对话,不再强制绑 A100/H100 或走 API 回调。把混合推理 MoE 拆到十亿激活量级并验证过消费级硬件,是这次开源最实际的落点。