Selon un billet de blog de Hugging Face, le backend vLLM pour la bibliothèque transformers fonctionne désormais aussi vite, voire plus vite, que les implémentations vLLM personnalisées spécialisées pour de nombreuses architectures de grands modèles de langage. Cette mise à jour permet aux modèles d'utiliser automatiquement leurs implémentations existantes dans transformers pour obtenir une inférence ultra-rapide.

Les développeurs de modèles peuvent désormais accéder à une inférence haute performance sans avoir à écrire de code séparé ni à maintenir des versions uniques de leurs modèles pour des moteurs d'accélération spécifiques. Cette fonctionnalité est disponible gratuitement dans le cadre de la pile d'outils standard.

Ce changement comble le fossé entre la facilité d'utilisation de la bibliothèque universelle transformers et la vitesse maximale des moteurs spécialisés. Les auteurs de modèles bénéficient de l'optimisation dès la mise à jour des dépendances, sans effort d'intégration supplémentaire.