AWS Machine Learning Blog a décrit un benchmark d’inférence de deux 30B MoE-modèles — Qwen3-Coder-30B et NVIDIA Nemotron-3-Nano-30B — sur des instances GPU G5, G6, G6e et G7 dans Amazon SageMaker AI.

La comparaison porte sur la bande passante, la latence et le coût du token. Selon la description d’AWS, le benchmark montre des avantages mesurables pour G7 avec les GPU NVIDIA Blackwell en matière de rapport coût/performance pour l’inférence en temps réel des LLM.

Ces conclusions reposent sur une seule publication du AWS Machine Learning Blog et ne sont présentées dans le paquet que comme des métadonnées et un résumé, et non comme une étude complète. Aucune vérification indépendante n’est fournie.