NVIDIA представила интеграцию NVIDIA TensorRT Multi-Device с NVIDIA Dynamo-Triton для упрощения обслуживания моделей на нескольких GPU. Об этом говорится в заголовке материала NVIDIA Developer Blog.

По данным синопсиса публикации, вычислительные и memory-требования генеративного ИИ всё чаще превышают возможности одной GPU. Поэтому тема касается распределения нагрузки при запуске таких моделей.

Предоставленные сведения ограничены метаданными и кратким синопсисом. В них нет данных о поддерживаемых конфигурациях, приросте производительности, сроках доступности или независимой проверке решения.