A NVIDIA apresentou a integração do NVIDIA TensorRT Multi-Device com o NVIDIA Dynamo-Triton para simplificar a servir modelos em várias GPUs. Isso é afirmado no título da matéria do NVIDIA Developer Blog.

De acordo com o resumo da publicação, as exigências computacionais e de memória da IA generativa excedem cada vez mais as capacidades de uma única GPU. Portanto, o tema aborda a distribuição de carga na execução desses modelos.

As informações fornecidas limitam-se aos metadados e a um breve resumo. Elas não contêm dados sobre configurações suportadas, ganho de desempenho, prazos de disponibilidade ou verificação independente da solução.