术语表

扩散模型(Diffusion model)

最后更新:2026-07-02

**扩散模型(diffusion model)**是通过学习逆转一个破坏过程来生成图像——以及越来越多的视频和音频——的生成式模型。训练时,真实图像被逐步淹没在噪声里,模型学习撤销每一步。生成时把这项技能倒着跑:从纯随机噪点出发,一步一步去噪,连贯的画面逐渐浮现——文本编码器全程为「画面与文字有多匹配」打分,把过程引向你的 prompt

这条路线为什么赢下了图像生成

与前辈 GAN 相比,扩散模型训练更稳定,对提示词的还原度也高得多——文本编码器的引导作用于每一个去噪步骤,给了整个过程几十次纠偏机会。多数系统还在**潜空间(latent space)**工作(一种压缩表示,Stable Diffusion 成名的「潜扩散」即此),而非原始像素——生成 2K 图像的计算量因此才可承受。

扩散 vs. LLM——两种不同的押注

LLM 按顺序构建输出,一次一个 token;扩散模型则同时打磨整张画布,由粗到细。这是扩散模型擅长全局构图的原因。2026 年两大阵营正在融合:许多图像模型用 LLM 式的 transformer 做去噪主干(DiT 架构),部分视频模型改用自回归生成,GPT Image 2 这类混合系统则把生成能力折叠进多模态大模型。今天说「扩散」,指的更多是去噪技术,而非某个固定架构。

你在哪见过它

我们收录的大多数图像模型——FLUX.2Stable Diffusion 3.5Midjourney v8.1——以及相当一部分 AI 视频模型,背后都是扩散或其混合体。要直接选型,看最佳 AI 图像生成模型榜单

来源

← 全部术语