De acordo com uma publicação no blog da Hugging Face, o backend vLLM para a biblioteca transformers agora opera tão rápido ou até mais rápido do que as implementações personalizadas especializadas do vLLM para diversas arquiteturas de grandes modelos de linguagem. Esta atualização permite que os modelos utilizem automaticamente as suas implementações existentes no transformers para obter inferência ultrarrápida.

Os desenvolvedores de modelos agora podem acessar inferência de alto desempenho sem a necessidade de escrever código separado ou manter versões únicas dos seus modelos para motores de aceleração específicos. A funcionalidade torna-se disponível gratuitamente como parte do conjunto padrão de ferramentas.

Esta mudança elimina a lacuna entre a facilidade de uso da biblioteca universal transformers e a velocidade máxima de operação de motores especializados. Os autores de modelos beneficiam da otimização imediatamente após a atualização das dependências, sem exigir esforços adicionais de integração.