Nunchaku Lite : inférence 4-bit pour Diffusers
Nunchaku Lite permet désormais une inférence 4-bit pour les modèles de diffusion via Diffusers, réduisant la mémoire VRAM nécessaire de 24GB à 12GB sur RTX 5090. Cette solution élimine aussi la nécessité de compilation CUDA locale.