资讯

AI 一周回顾:Meta 开源 Muse Glimmer、Grok 图像模型跃升 #2、Wan 3.0 文档生成视频等

本周 Meta 回归开源、xAI 拿下图像编辑亚军、阿里发明了视频生成的新输入模态。以下是 2026 年 8 月 5–11 日的关键动态。

头条:Meta 的开源转向

Meta 本周做了两件事,重塑了开放权重格局:

Muse Spark 1.2(8 月 5 日)——编码导向旗舰,与 Muse Code(首个终端智能体)联合训练。TB 2.1 82.9%,AA 指数 54,标准层 $1.25/$4.25,贡献者层 $0.10/$0.20。每项编码基准都落后 Opus 5——靠价格而非峰值竞争。

Muse Glimmer(8 月 10 日)——30B 密集模型,Apache 2.0 许可,是 Meta 历史上首个完全开源发布。24GB 显存可运行,DFlash 推测解码在 RTX 5090 上加速 3.1 倍。扎克伯格发 14 页长信力挺开放 AI,并承诺「数周内」发布 Spark 1.2 权重。

信号:分发比控制更重要。从闭源 API 发布到 Apache 2.0 兄弟模型,仅隔五天。

图像生成:xAI 的大跃进

Grok Imagine Image 2.0(8 月 7 日)在 Arena T2I(Elo 1,320)和图像编辑(Elo 1,439)排行榜上全球 #2——仅次于 GPT-Image-2。前代 Quality Mode 在两个榜上都处于中游。

编辑工具组合:魔术棒、分割、去背、多参考合成(最多 5 张图)、智能缩放、专业模板。API 访问「即将推出」。

视频生成:文档输入来了

Wan 3.0(8 月 6 日,公测)将时长延长至 30 秒(Wan 2.7 的 2 倍),并引入文档和网页输入——PDF、PPT、电子表格、URL 直接转化为视频。目前没有其他主流视频模型能做到。定价 $0.05–$0.20/秒。代价:与 Wan 2.7 的开放权重不同,Wan 3.0 是闭源云端产品。

MAGI-2 Preview(8 月 5 日)是 Sand.ai 的 114B MoE(6B 激活)视频模型,Apache 2.0——首个开源的 100B 级视频生成模型。生成 10 秒视频配同步音频。需 8 块 Hopper GPU。研究预览,但完整权重 + 代码 + 报告全部公开。

OpenAI 更新:Sol 滑块、Luna 免费、Cyber 面向安全

GPT-5.6 Sol 改进了准确性并新增推理深度滑块(8 月 6 日)。GPT-5.6 Luna 成为免费用户默认模型,提供无限文本对话和 Think 按钮。

GPT-5.6-Cyber(8 月 10 日)是 Sol 的安全微调版:高级网安任务完成率 95%(GPT-5.5-Cyber 为 57.3%)。限审核合格的安全厂商和研究人员使用。

本周其他

动态厂商日期意义
Nemotron 3.5 LightningNVIDIA8/11面向长时程智能体的开放权重模型,配套 NeMo Switchyard 多模型路由库。
Qwen 3.8-Max 开放权重Alibaba8/12(明天)ModelScope 倒计时确认 2.4T 模型权重明天发布。Qwen3.8-27B 随后跟进。
NVIDIA Magpie TTS 更新NVIDIA8/10364M 多语言 TTS 新增阿拉伯语、韩语、巴西葡萄牙语。开放权重。
webAI TwiL-LMwebAI8/101.7B/3B 形式逻辑小模型,iPhone 可运行。非商用许可。

本周三大趋势

  1. Meta 重返开源。 Apache 2.0 的 Glimmer 加上 Spark 1.2 开放权重承诺在同一周。从 Llama 的自定义许可到 Muse 的闭源 API,再到现在——这是一次真正的战略转向。

  2. 本地智能体模型成为品类。 Muse Glimmer(30B/24GB)、Nemotron 3.5 Lightning、TwiL-LM(iPhone 可运行)——三个独立实验室都在发布面向本地硬件的智能体模型。云推理不再是唯一选择。

  3. 视频输入正在超越文本和图像。 Wan 3.0 的文档转视频是真正的新能力。MAGI-2 的 114B MoE Apache 2.0 让 100B 级视频生成首次开源。视频模型领域的多样化速度超过了 LLM 同阶段。

详见各模型页面链接。全景参见 2026 LLM 指南

来源

← 全部资讯