
AWS Machine Learning Blog описал бенчмарк инференса двух 30B MoE-моделей — Qwen3-Coder-30B и NVIDIA Nemotron-3-Nano-30B — на GPU-инстансах G5, G6, G6e и G7 в Amazon SageMaker AI.
Сравнение охватывает пропускную способность, задержку и стоимость токена. По описанию AWS, тестирование показывает измеримые преимущества G7 с GPU NVIDIA Blackwell по соотношению цены и производительности для инференса LLM в реальном времени.
Эти выводы основаны на одной публикации AWS Machine Learning Blog и представлены в пакете только как метаданные и краткое резюме, а не как полный текст исследования. Независимое подтверждение отсутствует.
комментарий редакции
Что это значит
Вероятное практическое следствие — интерес к выбору GPU-инстансов для задач инференса в реальном времени. Следующим проверяемым сигналом станут опубликованные численные результаты или независимые тесты. Существенная неопределённость сохраняется из-за отсутствия в пакете полной методики, таблиц измерений и сторонней corroboration.