Согласно сообщению в блоге Hugging Face, бэкенд vLLM для библиотеки transformers теперь работает так же быстро или даже быстрее, чем специализированные кастомные реализации vLLM для множества архитектур больших языковых моделей. Это обновление позволяет моделям автоматически использовать существующие реализации в transformers для получения сверхбыстрого вывода.

Разработчики моделей теперь могут получать доступ к высокопроизводительному инференсу без необходимости писать отдельный код или поддерживать уникальные версии своих моделей под конкретные движки ускорения. Функциональность становится доступной бесплатно в рамках стандартного стека инструментов.

Данное изменение устраняет разрыв между удобством использования универсальной библиотеки transformers и максимальной скоростью работы специализированных движков. Авторы моделей получают выгоду от оптимизации сразу после обновления зависимостей, не требуя дополнительных усилий по интеграции.