A NVIDIA lançou o TensorRT Model Connect (TRTMC) em versão prévia pública. Segundo dados da MarkTechPost, o projeto, sob licença Apache-2.0, converte um checkpoint suportado do Hugging Face ou um checkpoint local em uma inferência completa do TensorRT usando dois comandos, sem necessidade de exportação intermediária para ONNX.

A compilação gera um artefato chamado versioned.bundle, que é executado por meio de interfaces nativas de tarefas em C++. No cenário descrito, o PyTorch não faz parte do caminho de execução da inferência.

Para contexto: um instantâneo da NVIDIA para GB300 datado de 29 de julho de 2026 abrange 105 perfis de lançamento e 76 famílias de modelos. A fonte não fornece dados sobre o desempenho do TRTMC, a compatibilidade com todos os modelos ou prazos para a saída da versão prévia.