O AWS Machine Learning Blog descreveu um benchmark de inferência de duas 30B MoE-models — Qwen3-Coder-30B e NVIDIA Nemotron-3-Nano-30B — em instâncias GPU G5, G6, G6e e G7 no Amazon SageMaker AI.

A comparação abrange largura de banda, latência e custo por token. Conforme descrito pela AWS, o teste mostra vantagens mensuráveis de G7 com GPU NVIDIA Blackwell no que diz respeito a relação custo-desempenho para inferência de LLM em tempo real.

Essas conclusões são baseadas em uma única publicação do AWS Machine Learning Blog e apresentadas no pacote apenas como metadados e resumo, não como o texto completo do estudo. Não há confirmação independente.