Appearance
生成式扩散模型:从噪声中"雕刻"出世界
更新: 7/18/2026 字数: 0 字 时长: 0 分钟
近年来 AI 绘画、AI 视频的爆发,背后的核心引擎正是扩散模型(Diffusion Model)。它的思路出奇地优雅:先教 AI 如何把一张清晰图片一步步"打碎"成噪声,再让它学会逆向操作——从纯噪声中一步步"还原"出全新的图像。 下面用通俗的方式系统讲解这项技术。

一、核心原理:加噪与去噪的双向游戏
扩散模型的灵感来自物理学中的扩散现象——一滴墨水滴入清水,会逐渐扩散直至均匀。图像生成把这个过程反过来用:从"均匀的墨水(噪声)"倒推出"那滴墨水最初的样子(图像)"。
整个机制由两个方向相反的过程构成。

1.1 前向过程(加噪 / Forward Diffusion)
- 做什么:拿一张清晰图片,分成很多步(如 1000 步),每一步往里掺入一点点高斯噪声(一种数学上标准的随机噪点)。
- 结果:经过足够多步后,原图被彻底"淹没",变成一张完全随机的、看不出任何内容的纯噪声图。
- 关键点:这个过程是固定的、无需学习的,纯粹按数学规则加噪。它的作用是制造训练素材——让模型看到"某张图 + 某个噪声程度"长什么样。
1.2 反向过程(去噪 / Reverse Denoising)——模型真正要学的
- 做什么:训练一个神经网络,学习前向过程的逆操作——给它一张带噪声的图,让它预测"这一步添加的噪声是什么",从而减掉噪声、还原得更清晰一点。
- 生成时:从一张纯随机噪声出发,让训练好的网络一步步去噪,反复迭代几十到上千步,最终"浮现"出一张全新的、清晰的图像。
- 精髓:模型学会的不是"背下某张图",而是数据的内在规律(分布)。所以它能生成训练集里从未出现过的全新内容。
一句话类比:就像雕塑家面对一块粗糙的大理石(噪声),凭借对"人像应该长什么样"的理解(学到的分布),一凿一凿去掉多余部分,最终雕出一尊雕像。
1.3 关键辅助技术
- U-Net / DiT(去噪网络骨架):执行去噪预测的神经网络。早期多用 U-Net(一种擅长图像处理的网络结构),新一代模型转向基于 Transformer 的 DiT(Diffusion Transformer),可扩展性更强。
- 潜空间扩散(Latent Diffusion):直接在高清像素上做扩散计算量巨大。Stable Diffusion 的关键创新是先把图像压缩到一个低维的"潜空间(latent space,可理解为图像的浓缩语义编码)"里做扩散,大幅降低算力需求,让扩散模型得以在消费级显卡上运行。
- 条件引导(Conditioning):通过 CLIP 等技术把文字描述编码后注入去噪过程,引导生成朝着"文字所描述的内容"收敛——这就是文生图的实现原理。
- CFG(无分类器引导):一种增强文本控制力的技巧,让生成结果更贴合提示词。
二、发展脉络:从冷门理论到爆款技术
- 2015 年——思想起源:扩散概率模型的理论框架被首次提出,但受限于效果和算力,长期未受关注。
- 2020 年——奠基之作 DDPM:《Denoising Diffusion Probabilistic Models》让扩散模型的生成质量首次比肩当时最强的 GAN,成为技术转折点。
- 2021 年——超越 GAN:研究证明扩散模型在图像质量上可全面超越 GAN,并引入 CFG 等引导技术,奠定了文生图的基础。
- 2022 年——全面爆发:
- DALL·E 2、Imagen 展示了惊艳的文生图能力;
- Stable Diffusion 凭借潜空间扩散 + 开源,让全民 AI 绘画成为现实,引爆行业。
- 2023 年至今——多模态与视频:扩散模型扩展到视频生成(如 Sora 类模型,基于 DiT 架构)、3D、音频等领域,并向更高分辨率、更强可控性、更快采样速度持续演进。
三、主流应用场景

- 文生图(Text-to-Image):输入文字描述生成图像,是最广为人知的应用(Stable Diffusion、Midjourney、DALL·E)。
- 图像编辑与修复:
- 图像修复(Inpainting):抹掉图中不想要的物体并自然填补。
- 扩展绘制(Outpainting):把画面向外延伸补全。
- 图生图(Image-to-Image):按参考图和提示词生成风格化变体。
- 超分辨率与画质增强:将低清图像放大、去噪、修复老照片。
- 文生视频(Text-to-Video):根据文字生成连贯视频片段,是当前最前沿的方向。
- 3D 内容生成:生成 3D 模型与场景,服务游戏、影视、工业设计。
- 音频与音乐生成:生成语音、音效和音乐。
- 科学领域:分子结构生成、药物设计、蛋白质结构预测等前沿探索。
四、与其他主流生成模型的对比

在扩散模型之前,生成领域主要由 GAN 和 VAE 主导。三者对比如下:
| 维度 | 扩散模型(Diffusion) | GAN(生成对抗网络) | VAE(变分自编码器) |
|---|---|---|---|
| 核心机制 | 逐步去噪还原 | 生成器与判别器相互对抗 | 编码压缩 + 解码重建 |
| 生成质量 | 极高,细节丰富 | 高,但易有瑕疵 | 中等,偏模糊 |
| 多样性 | 强,覆盖数据分布全面 | 较弱,易模式崩溃(只会生成少数几类) | 强 |
| 训练稳定性 | 稳定,易收敛 | 不稳定,难训练 | 稳定 |
| 生成速度 | 慢(需多步迭代) | 快(一次前向) | 快 |
| 典型代表 | Stable Diffusion、Sora | StyleGAN | VAE、VQ-VAE |
关键结论:
- 扩散模型的优势:生成质量高、多样性好、训练稳定,克服了 GAN"训练难、易模式崩溃"的顽疾,这是它成为主流的根本原因。
- 扩散模型的短板:生成速度慢——需要几十到上千步迭代去噪,远慢于 GAN 的"一步出图"。这也是当前研究的核心攻关方向。
- 加速方向:通过 DDIM(减少采样步数)、蒸馏技术(如 LCM、一步生成模型) 等手段,已能将生成压缩到几步甚至一步,大幅逼近实时。
补充:近年还出现了 GAN 与扩散融合、自回归 + 扩散等混合路线,以及以 Flow Matching(流匹配) 为代表的新框架,进一步简化和加速了生成过程。
结语
扩散模型的成功,源于它把一个困难的"凭空创造"问题,巧妙地转化为一系列简单的"去噪"小步骤——用"化整为零、逐步求精"的思路,换来了高质量与训练稳定性的双赢。
理解扩散模型,抓住三个要点即可:前向加噪造数据、反向去噪学分布、条件引导控内容。尽管它存在生成速度较慢的短板,但随着潜空间扩散、采样加速和 DiT 架构的持续演进,扩散模型已从图像领域延伸到视频、3D 乃至科学计算,成为当今生成式 AI 最重要的技术基石之一。