Hugging Face のブログ投稿によると、transformers ライブラリ用の vLLM バックエンドは、現在、多数の大規模言語モデル(LLM)アーキテクチャ向けに専門化されたカスタム vLLM 実装と同等か、場合によってはそれ以上に高速に動作します。この更新により、モデルは既存の transformers 実装を自動的に利用して超高速な推論を行うことが可能になります。

モデル開発者は、特定の加速エンジン用に個別のコードを作成したり、モデルの固有バージョンを維持したりすることなく、高性能な推論にアクセスできるようになりました。この機能は、標準的なツールスタックの一部として無料で提供されます。

この変更により、汎用ライブラリである transformers の使いやすさと、専用エンジンの最大速度との間のギャップが解消されました。モデルの作者は、統合のための追加 effort を必要とせず、依存関係を更新するだけで最適化の恩恵を即座に受けることができます。