
NVIDIA a lancé TensorRT Model Connect (TRTMC) en version préliminaire publique. Selon MarkTechPost, ce projet sous licence Apache-2.0 convertit un point de contrôle pris en charge depuis Hugging Face ou un point de contrôle local en une inférence TensorRT de bout en bout à l'aide de deux commandes, sans nécessiter d'exportation intermédiaire vers ONNX.
La compilation génère un artefact nommé versioned.bundle, qui s'exécute via des interfaces de tâches C++ natives. Dans le scénario décrit, PyTorch ne fait pas partie du chemin d'exécution de l'inférence.
Pour contexte: un instantané NVIDIA pour GB300 daté du 29 juillet 2026 couvre 105 profils de versions et 76 familles de modèles. La source ne fournit aucune donnée sur les performances de TRTMC, la compatibilité de tous les modèles ou les dates de sortie de la version préliminaire.
commentaire éditorial
Pourquoi c’est important
Une conséquence probable est la simplification de la transition du point de contrôle au déploiement TensorRT pour les modèles pris en charge. Le prochain signal observable sera la liste des architectures compatibles et les mesures de performance publiées. Une incertitude substantielle subsiste en raison du statut préliminaire, de l'unicité de la source et de l'absence de documentation technique primaire dans le paquet présenté.