目录
AI 模型
五大模态中值得了解的模型——每个都附有注明来源的规格、当前价格与中肯点评。可按类型筛选。
Muse Glimmer
Meta 首个 Apache 2.0 模型——30B 密集多模态智能体,为消费级 GPU 本地部署优化,DFlash 推测解码加速推理。
Muse Spark 1.2
Meta 编码旗舰——与 Muse Code 终端智能体联合训练,TB 2.1 82.9%,$1.25/$4.25 标准定价,1M 上下文,已宣布将开放权重。
Qwen3.8-Max
阿里巴巴新旗舰——2.4T 参数稀疏 MoE(95B 激活),多模态,智能体/研究基准顶尖,$2/$6 定价,开放权重即将发布。
Claude Opus 5
Anthropic 2026 年 7 月旗舰——以 Opus 定价($5/$25)实现接近 Fable 的智能,Frontier-Bench、ARC-AGI-3 与 OSWorld 2.0 均为 SOTA,默认开启推理。
Gemini 3.6 Flash
Google 2026 年 7 月主力模型——比 3.5 Flash 少 17% 输出 token,更便宜($1.50/$7.50),为智能体编码与知识工作优化。
Kimi K3
全球首个开放权重的 3T 级前沿模型——2.8T 参数(104B 激活 MoE),1M 上下文,原生视觉,自定义收入分级许可。
Grok 4.5
xAI 于 2026 年 7 月发布的编程与智能体旗舰——500K 上下文、$2/$6 每 100 万 token,默认用于 Grok Build 与 Cursor,并与 Cursor 联合训练。
Claude Sonnet 5
Anthropic 迄今最具智能体能力的 Sonnet——以 $2/$10 的首发价提供接近 Opus 的编码、智能体与知识工作能力,并成为 claude.ai 的新默认模型。
GPT-5.6
OpenAI 的 GPT-5.6 家族——旗舰 Sol、均衡 Terra 与快省 Luna——具备 max/ultra 推理模式与分档定价。2026 年 7 月 9 日全面上线。
Sakana Fugu
东京 Sakana AI 于 2026 年 6 月推出的多智能体编排系统——以单一 OpenAI 兼容模型交付,动态把每个任务路由到一个可替换的前沿与开源模型池。
GLM-5.2
Z.ai 的开源权重长跨度旗舰——753B 参数 MoE,MIT 许可下稳定 1M 上下文,在多个编码基准上击败 GPT-5.5。
Kimi K2.7 Code
Moonshot 的开源权重智能体编码旗舰——1T 参数 MoE(32B 激活),256K 上下文,原生图像/视频输入,思考量比 K2.6 精简约 30%。
Claude Fable 5
Anthropic 首个面向大众的 Mythos 级模型——几乎所有基准都是 SOTA,并配备安全分类器,敏感话题自动回落到 Opus 4.8。6 月 12–30 日曾因美国出口管制下线,7 月 1 日起全球恢复。
Claude Opus 4.8
2026 年 6 月的整体智能领跑者,也是智能体编码的顶尖模型,拥有所有前沿模型中最审慎的幻觉校准。
DeepSeek V4-Pro
开源权重的性价比冠军——以 MIT 许可、1M token 上下文,在闭源模型的零头价格下实现接近前沿的编码能力(SWE-V ~85%)。
GPT-5.5
OpenAI 的统一推理与对话旗舰——终端原生智能体工作的最强模型,原生全模态,覆盖文本、图像、音频与视频。
Gemini 3.1 Pro
性价比最高的闭源前沿模型——顶级推理与原生多模态,约 $2 每 100 万输入 token,配 1M token 上下文。
Nemotron 3.5 Lightning
NVIDIA 面向长时程智能体工作流的最高效率开放模型——由 Nemotron Coalition 构建,配套 NeMo Switchyard 智能多模型路由。
Inkling
Mira Murati 的首个模型——975B/41B 激活的开放权重 MoE,Apache 2.0 许可,原生文本/图像/音频,1M 上下文,定位为微调基础模型。
MiniMax M3
首个把前沿编码、1M token 上下文与原生多模态合于一身的开源权重模型——基于稀疏注意力构建的 428B MoE(22B 激活)。
Ornith-1.0
Ornith-1.0 是 DeepReinforce 面向智能体编码的开源、自我改进 LLM 家族——从 9B 边缘模型到在 SWE-Bench 上比肩 Claude Opus 4.7 的 397B MoE。
Qwen3.7-Max
阿里巴巴的专有“Agent Frontier”旗舰——顶尖的知识得分与跨 1M token 上下文的长跨度自主能力。
Grok 4.3
xAI 的预算前沿模型——强劲的智能体工具调用与自报的低幻觉率,搭配 1M token 窗口,价格 $1.25 / $2.50 每 100 万。
FLUX.2
照片级真实感、文字渲染与开发者工作流的开源权重冠军——通过 API 或自托管,以每图几美分实现顶级质量。
Nano Banana 2
Google 的 Gemini 3 Pro Image 模型——在 Gemini 应用内免费的 4K 照片级真实感,文字渲染近乎完美,支持对话式编辑。
Midjourney v8.1
原始艺术质量与审美打磨的业界领跑者——一款深受设计师与概念艺术家喜爱的仅订阅图像生成器。
Grok Imagine Image 2.0
xAI 编辑优先的图像模型——Arena T2I 和图像编辑双榜全球 #2(仅次于 GPT-Image-2),具备魔术棒、分割、多参考合成和模板功能。
GPT Image 2
OpenAI 的图像模型——在提示指令遵循与对话式编辑上最强,原生融入 ChatGPT 与 OpenAI API 技术栈。
Boogu-Image 0.1
Apache-2.0 开源图像生成与编辑家族(Base / Turbo / Edit),双语文字渲染强、质量接近闭源——训练数据约少 10×,且完全可自托管。
Recraft V4
设计与品牌专家——矢量/SVG 输出、品牌风格一致性与强排版,为专业设计工作打造。
Ideogram 3.0
排版与 logo 设计的专家——在生成图像内渲染正确、易读文字最可靠的模型。
Imagen 4
Google 的照片级真实感领跑者——同类最佳的排版与人物表现,可通过 Gemini Advanced 廉价使用,或在 Vertex AI 上按图计费。
Stable Diffusion 3.5
本地、私密、可定制图像生成的开源权重标准——在你自己的 GPU 上运行、无每图成本,或通过 Stability 的 API 使用。
MiniMax H3
首个主流开放权重视频模型——33B 全模态 transformer,支持原生立体声音频,可生成 4–15 秒视频,分辨率最高 2K。
FLUX 3
BFL 统一多模态模型——视频(最长 20 秒带原生音频)、图像和动作预测共用一组权重,基于 Self-Flow。视频 2026 年 8 月 4 日起 GA。
Seedance 2.5
字节跳动的长序列视频模型——原生 30 秒单镜头、原生 4K、最多 50 个多模态参考素材、音素级唇同步与单次渲染同步音频。
PixVerse V6
短视频的最佳免费之选——多镜头角色一致、原生音频与 20+ 电影镜头控制,每日赠送免费额度。
Kling 3.0
性价比顶尖的视频模型——出色的人物运动与面部一致性、原生 4K 输出与多语言音频。
Veo 3.1
Google 的电影级视频模型,带原生音频——精致、声画同步片段的质量领跑者,在 Gemini API 上按秒计费。
Runway Gen-4.5
专业人士的视频模型——运动笔刷、镜头运动等丰富创意控制,内置于成熟的剪辑工具集中。
Wan 3.0
阿里巴巴统一视频生成模型——30 秒单次生成、支持文档和网页输入、$0.05–$0.20/秒 API 定价。
MAGI-2 Preview
Sand.ai 开源 114B MoE 视频模型——每 token 仅激活 6B 参数,生成 10 秒视频配同步音频。Apache 2.0。
Grok Imagine Video 1.5
xAI 专用视频生成模型——原生 1080p,6–15 秒带同步音频,支持图像/语音引用,基于 Aurora 自回归引擎。
Wan 2.7
阿里巴巴的旗舰视频模型——1080p、原生音频同步、首/尾帧与多场景控制,出自其开源血统造就社区基座的 Wan 系列。
Seedance 2.0
为电商与重参考任务打造的多模态可控视频模型——图生视频契合度强、运动物理出色、支持多素材输入。
Hailuo 2.3
AI 视频的预算速度冠军——同类最低的按秒成本与快速出片,适合草稿与高并发社交内容。
Sora 2
OpenAI 以物理真实感与同步音频著称的视频模型,通过 ChatGPT 与 API 提供。
Suno v5.5
领先的 AI 音乐生成器,能产出完整、可直接上电台的歌曲——自然人声、真实歌曲结构、声音克隆与 30+ 流派,仅需一条文本提示。
ACE-Step
开源的整曲生成器——免费、可自托管、带人声的音乐,可在单块消费级 GPU 上运行。
ElevenLabs v3
业界标准的文本转语音模型——最具表现力、情感丰富的语音合成,支持 70+ 语言与多说话人对话。
MiniMax Speech 2.8
名列前茅的文本转语音模型——富表现力、多语言的语音合成,支持快速声音克隆与庞大的内置音色库。
ElevenLabs Music v2
商用最安全的 AI 音乐生成器——与唱片公司及出版商合作打造,支持逐段编辑、完整 API 与录音室级导出。
Lyria 3
Google DeepMind 的音乐生成模型——最长三分钟的高保真 48kHz 音频,通过 Vertex AI 与 Gemini API 提供。
Stable Audio 2.5
Stability 的音乐与声音模型——快速、商用已清权的器乐曲目与声音设计,配企业友好的 API。
Udio v4
AI 音乐工具中的音质领跑者——48kHz 渲染、同类最干净的乐器分离,面向电影与品牌级音乐。
Meshy 5
AI 3D 中最可靠的全能选手——同类最佳的 PBR 贴图、快速迭代,以及面向 Blender 与 Unity 的深厚插件生态。
Rodin Gen-2
保真度最高的 AI 3D 生成器——生产级几何与干净的四边面拓扑,主角级资产与照片级写实的首选。
Hunyuan3D 2.1
领先的开源 3D 生成器——完全开放的权重与训练代码,配生产级 PBR 贴图流水线,可免费自托管。
Hitem3D
超精细专家——面向手办、电商与产品可视化的高分辨率 3D 模型。
Luma Genie
来自 Luma AI 的免费、易上手的文生 3D 生成器——经网页与 Discord 把提示快速变成 3D 模型,零成本。
Sloyd AI
参数化、游戏可用的 3D——即时生成低面资产,拓扑干净,专为实时引擎调校。
TRELLIS 2
微软的开源 3D 生成器,以高质量高斯泼溅视觉与灵活的输出表征著称,可由图像或文本生成。
Tripo 3.0
游戏可用 3D 的速度与性价比领跑者——干净的低面拓扑与自动绑定,单资产成本最低。