基础设施与工程

Hugging Face 将 Nunchaku 4-bit 扩散推理接入 Diffusers,消费级 GPU 跑图再往前一步

Hugging Face 将基于 SVDQuant 的 Nunchaku Lite 4-bit 量化后端接入 Diffusers,使开发者可以通过 from_pretrained() 直接加载预量化管线并按需下载 CUDA kernels,显著降低本地编译门槛。官方基准显示在支持的 NVIDIA 硬件上能在保持较低显存的同时显著加速生成推理,这让量化从压缩工具走向实际部署路径。

Hugging Face 将 Nunchaku 4-bit 扩散推理接入 Diffusers,消费级 GPU 跑图再往前一步

Hugging Face 将基于 SVDQuant 的 Nunchaku Lite 4-bit 量化后端接入 Diffusers,使开发者可以通过 from_pretrained() 直接加载预量化管线并按需下载 CUDA kernels,显著降低本地编译门槛。官方基准显示在支持的 NVIDIA 硬件上能在保持较低显存的同时显著加速生成推理,这让量化从压缩工具走向实际部署路径。

Hugging Face 7 月 23 日发布博文《Bringing Nunchaku 4-bit Diffusion Inference to Diffusers》,宣布把基于 SVDQuant 的 Nunchaku Lite 量化后端纳入 Diffusers 的常规工作流。对开发者来说,最直接的变化是:过去往往需要独立推理引擎、甚至本地 CUDA 编译的 Nunchaku 检查点,现在可以像普通 Diffusers 模型一样通过 from_pretrained() 直接加载。

这次更新把扩散模型量化的重点,从“只省显存”进一步推向“省显存且更快”。Hugging Face 介绍说,传统 4-bit 量化后端多属于 weight-only 路线,只把权重压低精度、推理时再还原,通常不会让推理更快;Nunchaku 走的是 W4A4 路线,把权重和激活都压到 4 bit,并借助低秩分支处理异常值。相关论文是 SVDQuant: Absorbing Outliers by Low-Rank Components for 4-Bit Diffusion Models,底层引擎来自 Nunchakudiffuse-compressor

直接接入 Diffusers,门槛明显下降

按照官方博文和文档的说法,用户只需安装 diffuserstransformersacceleratekernelsbitsandbytes,就可以加载预量化管线。Hugging Face 同时把 CUDA kernels 放到 Hub 上按需下载,省去了本地编译步骤。官方示例使用的是 lite-infer/ERNIE-Image-Turbo-nunchaku-lite-nvfp4_r32-bnb4-text-encoder,输出 1024×1024 图像只需约 1.7 秒。

文档还给出了一条更清晰的硬件边界:NVFP4 检查点面向 NVIDIA Blackwell 架构,也就是 RTX 50 系列、RTX PRO 6000 和 B200;如果是更早的 GPU,则要用 INT4 版本。Hugging Face 还说,Nunchaku Lite 保留了 Diffusers 的常规组件接口,因此调度器、LoRA 加载、offloading 和 torch.compile 都可以照常使用。

4-bit 不只是“更小”,也在追求“更快”

在官方文档列出的基准里,Nunchaku Lite NVFP4 版本在 RTX PRO 6000 上把 BF16 基线的端到端时间从 3.00 秒降到 2.27 秒;再配合 torch.compile() 后可降到 1.68 秒,峰值显存仍为 20.6GB。若再把文本编码器也量化为 NF4,峰值显存可进一步降到 16.0GB。

这意味着 Hugging Face 正在把“推理后端优化”收回到 Diffusers 主线,而不是只留给单独的实验项目。对图像生成模型来说,这种变化让开发者不必在“开源模型”“专门引擎”“复杂编译流程”之间反复切换,默认栈本身就开始承担更多优化能力。此前 AIFlux 对 Hugging Face:transformers 后端达原生 vLLM 性能 的报道,也呈现出类似方向:把原本分散在外部系统里的性能优化,逐步收回到框架自身。

这对生成式图像模型意味着什么

Nunchaku Lite 的意义不只是又多了一个 4-bit 后端,而是它把“量化”从模型压缩工具,变成了实际部署路径的一部分。Hugging Face 给出的示例已经不再停留在研究演示,而是明确指向 from_pretrained()、Hub 分发和可复用的 Diffusers 仓库格式。对于希望把图像生成模型部署到消费级硬件、边缘工作站或成本敏感环境的团队来说,这比单纯的参数压缩更接近可落地方案。

这也与近期一些图像生成发布的叙事趋同。AIFlux 早前在 Qwen-Image-3.0:阿里巴巴把图像生成推向“更像工作工具”的阶段 的报道里提到,图像生成模型正在从“好看”转向“好用”——更长提示词、更强版面理解和更接近生产工具的输出。Nunchaku Lite 讨论的则是另一半问题:当模型真的要进入日常工作流时,它是否能在不牺牲太多质量的前提下,跑得更省、更快。

仍待观察的地方

目前这次更新仍主要覆盖预量化 checkpoint 和特定硬件组合,通用性有多大、更多架构的适配进度如何、不同模型上的实际速度收益是否稳定,后续还需要更多公开基准来验证。官方博文已经给出入口,但这更像是一次框架层的放行,而不是问题的终点。

相关官方资料见 Hugging Face 文档SVDQuant 论文Nunchaku 仓库

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读