相比 GAN 的单次前向出图,扩散模型需要多步串行去噪,推理延迟较高,在对实时性要求极高的场景(如高频交易可视化、极速游戏渲染)中仍受限制。尽管少步数采样与蒸馏技术已大幅缓解这一问题,但仍是其主要短板。
模型学习的是整体视觉模式而非精确的几何与解剖规则,因此生成精细、结构化的细节时容易出错——典型如多画手指、文字错乱、复杂布局难以严格遵循。虽然 ControlNet 等可控工具能部分缓解,但精确控制仍是难点。
从零训练一个高质量扩散模型需要大规模 GPU 集群连续运行数天到数周,高分辨率推理也较耗显存。此外,训练数据多来自互联网,涉及版权归属争议,生成内容也可能被滥用于伪造信息或深度伪造,带来伦理与合规挑战。