Muse Glimmer 是 Meta 重返开源的标志——一个 300 亿参数密集多模态模型,于 2026 年 8 月 10 日以 Apache 2.0 许可发布,这是 Meta 有史以来给予基础模型最宽松的许可。它的设计目标只有一个:在你自己拥有的硬件上运行自主智能体。
在 Muse Spark 1.2 以闭源 API 产品发布仅五天后,Meta 开源了 Glimmer 并承诺也将发布 Spark 1.2 权重。信号很明确:分发比控制更重要。
架构
| 规格 | 数值 |
|---|---|
| 参数 | 30B 密集(含视觉编码器 29.6B) |
| 类型 | 密集多模态 transformer |
| 上下文窗口 | 131K+ tokens |
| 输入模态 | 文本、图像(含视觉编码器) |
| 输出模态 | 文本 |
| 许可 | Apache 2.0 |
DFlash 推测解码
随权重附带量化 DFlash 推测解码器——一个小型伴生模型,通过推测解码加速生成:
| 硬件 | 加速倍数 |
|---|---|
| NVIDIA RTX 5090 | 3.1× |
| Apple M5 Max | 1.8× |
在消费级硬件上即可实现流畅对话和实时智能体交互。
本地部署
量化后 24GB 显存即可运行——单张 RTX 4090 或 Apple Silicon Mac 即可胜任。
Day-0 生态支持:transformers、llama.cpp、vLLM、MLX、ExecuTorch(即将)、Ollama/LM Studio/Unsloth(即将)、Together AI/Fireworks/OpenRouter。
横向对比
- vs Muse Spark 1.2: Spark 是前沿模型(AA 54,TB 2.1 82.9%)。Glimmer 是 30B 本地模型。不同定位——Spark 做云推理,Glimmer 做边缘智能体。
- vs Gemma4-31B / Qwen3.6-27B: 同级别直接竞品。Meta 声称 Glimmer 在智能体基准上表现强劲。三者面向相似硬件。
- vs GLM-5.2 / Kimi K2.7 Code: 这些是更大的开放模型(需服务器硬件)。Glimmer 以能力换取真正的消费设备部署。
意义
这是 Meta 有史以来首个 Apache 2.0 模型。从 Llama 时代带商用上限的自定义许可,到 Muse 时代的闭源 API,Apache 2.0 标志着战略转向。扎克伯格发布了 14 页长信力挺开放 AI 系统。
全景参见 2026 LLM 指南。
适用场景
- 笔记本和工作站上的常驻本地编码智能体
- 无法将数据发送至云端的隐私敏感智能体工作流
- 消费级硬件上的函数调用和工具使用
- 本地 LLM-as-a-judge 评估
- 领域专用智能体的微调基座
优缺点
优势
- Apache 2.0——Meta 首个完全开源模型,无营收上限或使用限制
- 量化后 24GB 显存可运行(单张消费级 GPU)——真正的本地部署
- DFlash 推测解码随权重附带——RTX 5090 上生成速度提升最高 3.1 倍
- 30B 级别智能体基准表现强劲——与 Gemma4-31B、Qwen3.6-27B 竞争
局限
- 30B 级别——无法与 100B+ 模型在深度推理或编码上竞争
- 发布时无独立基准评分——Meta 的对比是自选的
- 131K 上下文远小于前沿模型的 1M 窗口
- Meta 无官方托管 API——依赖合作伙伴可用性
常见问题
Muse Glimmer 什么时候发布的?
2026 年 8 月 10 日,权重立即在 Hugging Face 上以 Apache 2.0 许可发布。
Muse Glimmer 需要什么硬件?
完整 BF16 约 30B 参数。4-bit 量化后约 24GB 显存——RTX 4090、M4 Max 或类似硬件可运行。DFlash 推测解码在 RTX 5090 上达 3.1 倍加速,M5 Max 上达 1.8 倍。
Muse Glimmer 与 Muse Spark 的关系?
定位不同。Spark 1.2 是 Meta 的前沿模型(发布时仅 API,开放权重即将到来)。Glimmer 是 30B 模型,专为本地部署设计。Glimmer 从 Muse 蒸馏——面向边缘端而非云端。
为什么选择 Apache 2.0?
这是 Meta 历史上首个 Apache 2.0 基础模型发布。此前 Muse 模型为闭源,Llama 使用 Meta 自定义许可(有商用限制)。Apache 2.0 意味着无营收上限、无使用限制、完全商业自由。