NVIDIA与Hugging Face联合推出可扩展扩散模型微调方案

NVIDIA与Hugging Face联合发布了一项重要集成:通过NeMo Automodel开源库,用户可以直接对Hugging Face Hub上任意Diffusers格式的扩散模型(如FLUX.1-dev、Wan 2.1、HunyuanVideo)进行生产级分布式微调,无需任何检查点转换或模型重写。
NeMo Automodel是NVIDIA NeMo框架的一部分,基于PyTorch DTensor原生训练库,核心设计原则包括:Hugging Face原生支持(直接使用pretrained_model_name_or_path指向Hub模型ID)和任意规模扩展(通过配置而非代码切换FSDP2、张量并行、专家并行、上下文并行、流水线并行等策略)。目前支持流匹配模型,训练目标为流匹配,采用潜在空间训练(预编码VAE输出)和多分辨率分桶。
工作流程包括:1)预编码数据集;2)使用现有FLUX YAML启动训练;3)从微调检查点生成;4)性能评估。该集成已记录在Diffusers训练指南中,完全开源(Apache 2.0)。对于使用API构建应用的开发者,此方案直接降低了大规模微调的成本和复杂度。
关键信息
- NVIDIA与Hugging Face合作,通过NeMo Automodel与Diffusers集成,实现扩散模型分布式微调
- 支持FLUX.1-dev、Wan 2.1、HunyuanVideo等模型,无需检查点转换或模型重写
- 基于PyTorch DTensor原生训练,支持FSDP2、张量并行等多种并行策略
- 可从单GPU扩展到数百GPU,配置驱动而非代码重写
- 完全开源(Apache 2.0),文档已更新至Diffusers训练指南
- 目前仅支持流匹配模型,训练目标为流匹配
Point pretrained_model_name_or_path at any Diffusers model ID on the Hub and start training.
将pretrained_model_name_or_path指向Hub上的任何Diffusers模型ID,即可开始训练。
Hugging Face Blog
为什么上榜
如果你在微调视频/图像扩散模型,这套方案能大幅降低分布式训练门槛。
每天早上,把当日 AI 精选送进你的邮箱
公众号 AI去噪 · 每日一期同步推送
