NVIDIA a lancé TensorRT Model Connect (TRTMC) en version préliminaire publique. Selon MarkTechPost, ce projet sous licence Apache-2.0 convertit un point de contrôle pris en charge depuis Hugging Face ou un point de contrôle local en une inférence TensorRT de bout en bout à l'aide de deux commandes, sans nécessiter d'exportation intermédiaire vers ONNX.

La compilation génère un artefact nommé versioned.bundle, qui s'exécute via des interfaces de tâches C++ natives. Dans le scénario décrit, PyTorch ne fait pas partie du chemin d'exécution de l'inférence.

Pour contexte: un instantané NVIDIA pour GB300 daté du 29 juillet 2026 couvre 105 profils de versions et 76 familles de modèles. La source ne fournit aucune donnée sur les performances de TRTMC, la compatibilité de tous les modèles ou les dates de sortie de la version préliminaire.