NVIDIA presentó la integración de NVIDIA TensorRT Multi-Device con NVIDIA Dynamo-Triton para simplificar el servicio de modelos en múltiples GPU. Esto se indica en el título del material del NVIDIA Developer Blog.

Según el sinopsis de la publicación, los requisitos computacionales y de memoria de la IA generativa superan cada vez más las capacidades de una sola GPU. Por lo tanto, el tema aborda la distribución de carga al ejecutar dichos modelos.

La información proporcionada se limita a metadatos y un breve sinopsis. No incluyen datos sobre configuraciones compatibles, mejoras de rendimiento, plazos de disponibilidad o verificación independiente de la solución.