刚刚,Meta 开源了一个 30B 的智能体模型,Muse Glimmer。
Muse Glimmer
Apache 2.0 协议,权重已经发布到了 Hugging Face,只需要一张 24GB 的消费级显卡就能跑起来,地址是:https://huggingface.co/meta-models。
而这也是继 Llama 之后,Meta 再一次回到开源社区的牌桌。而 Llama 系列模型,则呆在了另一个老地方:huggingface.co/meta-llama。
Alexandr Wang 推文
Meta 超级智能实验室负责人 Alexandr Wang 在其官宣推文中写道:
“
很高兴今天放出 Muse Glimmer 的开源权重,这是一个能在单张消费级 GPU 上运行的 30B 模型。Muse Spark 1.2 的一个开源权重版本,也即将放出。
两个非常不同的模型,都在走进大家的手里,后面还有更多。
Meta 发布 Muse Glimmer
这透露出,除了本次 30B 的小模型,Meta 最新最强的基础模型 Muse Spark 1.2,也决定向国产模型们学习,要开源了。
挑战 Qwen3.6
01
先来看眼模型的成绩单。
有意思的是,官方给出的数据里,就只对比了 Gemma4-31B 和 Qwen3.6-27B 两个同级别参数的模型:
benchmark 对比
在主打的智能体类的 Benchmark 上,Muse Glimmer 基本都实现了领先:MCP Atlas 75.5 远高于 Qwen3.6 的 62.5,以及 DeepSearch QA 74.6 战胜了 71.1,在 GAIA2 和 SWE-Bench Pro 上也都要更高一些。
在 AIME 2026 的数学能力上拿到了 94.7 分,也略微超 Qwen3.6 的 94.1。
不过在 OSWorld-Verified(桌面操作)和 TerminalBench 2.1 两个榜单上,Qwen3.6 则以 75.6 和 60.7 明显领先于 Muse Glimmer,均高出了近 10 分。
也就是说,在工具调用、检索、软件工程等智能体相关场景上,Muse Glimmer 确实超过了 Qwen3.6-27B,但在桌面和终端操作上,还是 Qwen 胜出。
4-bit 量化
02
Muse Glimmer 定位是跑在用户的电脑上,成为一个全天候常驻的本地智能体,不上云。
但端侧部署的第一个问题是:显存。
但 30B 参数在全精度部署时可是需要 55GB 以上的内存,这在大部分消费级设备上都很难装下。
量化
Meta 通过 4-bit 量化将模型权重压到了 20GB 以内,这样在 24GB 或 32GB 的显存预算下,也能给 KV 缓存、感知编码器和投机解码留出空间。
推理速度
Meta 表示,量化模型在智能体任务上经过了全面的验证,几乎没有质量损失。
DFlash
03
然后是端侧的第二个问题:速度。
智能体能在本地工作且实用的另一个前提是,推理速度需要足够快。
Dflash
Muse Glimmer 使用了投机解码的方案,配备一个轻量级的 DFlash 起草模型,先由它一次性生成一批 token,再交给主模型来并行进行验证。
相比于逐个生成 token,这大幅提升了推理速度,且质量几乎完全一致。起草模型也同样提供了量化版本,只有很小的内存开销。
这样,模型便能支撑流畅的用户对话和实时的智能体交互,并且全程都跑在用户的设备上,不需要联网。
故障自愈
04
Muse Glimmer 针对智能体循环进行了专门的训练,覆盖规划、函数调用、多步推理、自行检查结果,到一路解决故障等各个 Agent 工作场景。
针对智能体场景训练
而关于故障恢复的能力,Meta 称这是在训练阶段就设下的目标:当某次工具调用失败、或者返回了预期之外的东西时,模型会自行诊断原因并重试,而非中断摆烂。
模型规格上,Muse Glimmer 是一个 30B 的原生多模态稠密模型,可支持文本 + 图像的交织输入,并带有专门的感知编码。同时覆盖 100 多种语言,并支持调节推理强度,灵活控制质量和速度。
官方还演示了一个案例,仅给出一句自然语言指令,它便能自己发现局域网中的智能家居设备,并进行 API 查询,然后从零写出并部署好了一个控制面板页面,全过程均在本地完成。
另外它还适配了 OpenClaw 等智能体框架,还在玩🦞的可以安排上。
如何部署
05
权重已经发布到了 Hugging Face 上,并将在本周内完成 Ollama、LM Studio、vLLM、SGLang、llama.cpp、MLX、ExecuTorch 的支持;同时,OpenRouter,Together 和 Fireworks 也已经上线可以直接调用了。
权重下载
同时,Meta 还在和 AMD、Arm、Dell、Intel、英伟达合作进行设备级的推理优化。
值得一提的是,这个模型是在 Meta 的前沿 AI 风险评估框架下过审之后,才放出了开源权重的。
如果你有 24GB 显卡、或者大内存的 Mac 可以先把这个 30B 跑起来试试了!
但我呢,还是等等本周即将开源的 Qwen-3.8 27B 吧……
(Meta 是真的会抢时间)
◇ ◆ ◇
Hugging Face:https://huggingface.co/meta-models
技术博客:https://go.meta.me/museglimmer
开发者资源:https://developer.meta.com/ai/models/muse-glimmer/
官方推文:https://x.com/AIatMeta/status/2086757844544811485