摘要
Meta 旗下 Superintelligence Labs 于 8 月 10 日开源 Muse Glimmer——一个 30B 参数的端侧智能体模型,Apache 2.0 许可,量化后体积不足 20GB,单张消费级 GPU 即可运行。它从旗舰模型 Muse Spark 蒸馏而来,主打本地常驻智能体场景:工具调用、多步推理、失败重试、图文多模态。在 SWE-Bench、MCP-Atlas 等智能体基准上,官方称其表现超过同尺寸的 Gemma4-31B 与 Qwen3.6-27B。配合 DFlash 推测解码,RTX 5090 上生成速度提升 3.1 倍。
正文
Meta 昨天(8 月 10 日)通过 Superintelligence Labs 放出了开源模型 Muse Glimmer,30B 参数,Apache 2.0 许可,权重已经在 HuggingFace 上线。这个模型的定位很明确:常驻本地的智能体工作流。小到能在一张消费级 GPU 上跑,Mac 或 PC 都行,不需要连网。
先说规格。Muse Glimmer 是 30B 参数的稠密模型,带一个专门的感知编码器,可以处理图文交错的输入——截图、图表、文档都能读。训练上走的是蒸馏路线:预训练阶段用教师模型 Muse Spark 的输出做 logit distillation,中间训练灌入更长上下文、更偏智能体的数据,最后用 SFT 加 on-policy 蒸馏和强化学习收尾。也就是说,它是把旗舰模型的智能体能力压缩到端侧尺寸的一次尝试。
官方强调的能力有几块:端到端任务完成(DeepSearch QA、MCP-Atlas、τ-Bench、SWE-Bench 这类全流程基准)、精确的工具调用、跨长任务的连贯推理、工具调用失败后的诊断重试,还有可控的思考强度,以及 100 多种语言支持。评测对比对象是同尺寸的 Gemma4-31B 和 Qwen3.6-27B,官方称在智能体相关基准上表现更强。具体数字在评测报告里,社区普遍认为这个尺寸段又回到了密集模型的竞争节奏上。
本地跑得动是这款模型的核心卖点。30B 全精度需要 55GB 以上显存,Meta 用 4-bit 量化把语言模型压到 17GB 左右,加上 KV cache、感知编码器和推测解码 drafter,24GB 或 32GB 的显存内能整体跑起来。官方验证过量化对智能体任务的损伤很小。生成速度方面,Muse Glimmer 带一个基于 DFlash 的轻量 drafter 模型,一次提议整块 token 再由主模型并行验证,实测 RTX 5090 上解码速度提升 3.1 倍,M5 Max 提升 1.8 倍,M4 Max 提升 1.5 倍。
生态方面给得比较全。llama.cpp、MLX、ExecuTorch 的优化集成会在接下来几天落地,vLLM 和 SGLang 可以服务化部署,Ollama、LM Studio、Unsloth 这类本地工具也在接入名单里,Together AI、Fireworks AI、OpenRouter 则提供托管。AMD、Arm、Dell、Intel、NVIDIA 都在硬件适配合作名单上。想自己微调的话,PyTorch 的 TorchTitan 支持继续训练。模型还兼容 OpenClaw 等智能体编排框架。
社区反应很热闹。HN 主帖一天内冲到 1000 多分,评论里讨论最多的是两点:一是 Muse Glimmer 和本周即将发布的 Qwen3.8 27B 会怎么比,二是 Meta 还预告了 Muse Spark 1.2 的开放权重版。有人觉得这个时间点发布,明显是在跟中国厂商的开源模型抢这个尺寸段的生态位。也有人提醒说 dense 30B 这个档位又重新热起来了。
对开发者来说,Muse Glimmer 的意义在于把"智能体跑在本地"这件事的门槛又压低了一截。之前想要本地 agent,要么用更小的模型凑合,要么忍受云端调用的延迟和隐私问题。现在 17GB 的量化版可以直接塞进显存,常驻运行,隐私数据不出设备。当然,它毕竟只有 30B,和云端旗舰模型在复杂推理上的差距是客观存在的,适合的是工具调用、文件整理、自动化这类对延迟和隐私敏感的场景。
HuggingFace 地址是 meta-models/Muse-Glimmer-30B,开发者文档在 Meta AI Developer Center。发布当天 HuggingFace 上已经有 700 多点赞,GGUF 和 ExecuTorch 版本也同步放出了。




