Según una publicación en el blog de Hugging Face, el backend vLLM para la biblioteca transformers ahora funciona tan rápido o incluso más rápido que las implementaciones personalizadas especializadas de vLLM para numerosas arquitecturas de grandes modelos de lenguaje. Esta actualización permite que los modelos utilicen automáticamente sus implementaciones existentes en transformers para lograr una inferencia ultrarrápida.

Los desarrolladores de modelos ahora pueden acceder a una inferencia de alto rendimiento sin necesidad de escribir código separado ni mantener versiones únicas de sus modelos para motores de aceleración específicos. La funcionalidad está disponible gratuitamente dentro del conjunto de herramientas estándar.

Este cambio elimina la brecha entre la facilidad de uso de la biblioteca universal transformers y la máxima velocidad de los motores especializados. Los autores de los modelos se benefician de la optimización inmediatamente después de actualizar las dependencias, sin requerir esfuerzos adicionales de integración.