El desarrollo de modelos avanzados de inteligencia artificial ha migrado hacia la arquitectura de mezcla de expertos (MoE), lo que cambia radicalmente las limitaciones para el entrenamiento a gran escala. Según el comunicado de NVIDIA, este cambio ha llevado al establecimiento de un récord mundial de velocidad de preentrenamiento para dichos modelos en el nuevo sistema GB300 NVL72.

A medida que disminuyen los costos computacionales por token, el factor clave de eficiencia se convierte en la velocidad de intercambio de datos. Ahora son las capacidades de comunicación las que determinan cuán exitosamente puede escalar un modelo a través de miles de unidades de procesamiento gráfico.

El logro demuestra cómo el nuevo hardware aborda los cuellos de botella emergentes en el desarrollo de la IA, permitiendo procesar volúmenes masivos de información más rápido mediante la optimización de las conexiones entre los nodos computacionales.