NVIDIA a présenté NeMo Switchyard, une approche visant à répartir les charges de travail d'IA entre plusieurs modèles. Cette information figure dans une publication du blog NVIDIA Developer en date du 11 août 2026.

Selon le synopsis de la source, les différents modèles présentent des forces, des faiblesses et des profils de coûts distincts. Ces caractéristiques peuvent varier en fonction de la tâche ou d'une étape spécifique au sein d'une même tâche.

À titre d'exemple, NVIDIA cite une séquence où une classification est d'abord requise, suivie d'un raisonnement, tandis qu'un modèle plus petit suffit pour les actions subséquentes courantes. La source étant présentée sous forme de métadonnées, les détails de mise en œuvre et les résultats d'utilisation restent incertains.