
基础设施与工程 7 天前
Hugging Face 将 Nunchaku 4-bit 扩散推理接入 Diffusers,消费级 GPU 跑图再往前一步
Hugging Face 将基于 SVDQuant 的 Nunchaku Lite 4-bit 量化后端接入 Diffusers,使开发者可以通过 from_pretrained() 直接加载预量化管线并按需下载 CUDA kernels,显著降低本地编译门槛。官方基准显示在支持的 NVIDIA 硬件上能在保持较低显存的同时显著加速生成推理,这让量化从压缩工具走向实际部署路径。
编辑部