🧊 前沿科技知识库
全部 / 人工智能(AI)

扩散与图像生成

2026-09-26 · 人工智能(AI)
最后更新:2026-09-26 | 领域:AI·生成与多模态 | 说明:信息来源为公开网络资料,详见文末参考来源

概述

扩散模型(Diffusion Model)已成为文生图(Text-to-Image)与图像编辑的主流范式。其核心思想是通过前向加噪与反向去噪学习数据分布,早期由 DDPM(Denoising Diffusion Probabilistic Models)与 DDIM(Denoising Diffusion Implicit Models)奠定基础;随后 Latent Diffusion 将扩散过程搬进潜空间(代表作为 Stable Diffusion),大幅降低算力成本。2022 年 Peebles 与 Xie 提出以 Transformer 替换 U-Net 的 Diffusion Transformer(DiT),此后 DiT 成为 SD3、FLUX、Stable Cascade,以及 Sora、Veo 等模型的主干架构(Module 86 — Diffusion Deep Dive)。2025–2026 年的代表组合是「latent flow matching + 大规模视觉语言模型」,例如 FLUX.2 将 Mistral-3 24B VLM 与 rectified flow transformer 耦合,使生成与编辑共用同一架构(FLUX.2: Frontier Visual Intelligence)。

最新进展(2025–2026)

核心技术与关键概念

代表性项目 / 公司 / 产品(附官方链接)

关键数据与评测结果(附来源)

趋势与争议

参考来源

← 对话助手与语音(Conversational Assistants & Voice)分布式训练与并行策略 →