Transformers backend pour vLLM : performances natives optimisées
Le backend transformers pour vLLM permet désormais d'exécuter des modèles LLM avec une vitesse égale ou supérieure aux implémentations natives de vLLM. Cette intégration simplifie le déploiement des modèles Hugging Face avec des techniques d'inférence optimisées comme le batching continu.