
AWS Machine Learning Blog a décrit un benchmark d’inférence de deux 30B MoE-modèles — Qwen3-Coder-30B et NVIDIA Nemotron-3-Nano-30B — sur des instances GPU G5, G6, G6e et G7 dans Amazon SageMaker AI.
La comparaison porte sur la bande passante, la latence et le coût du token. Selon la description d’AWS, le benchmark montre des avantages mesurables pour G7 avec les GPU NVIDIA Blackwell en matière de rapport coût/performance pour l’inférence en temps réel des LLM.
Ces conclusions reposent sur une seule publication du AWS Machine Learning Blog et ne sont présentées dans le paquet que comme des métadonnées et un résumé, et non comme une étude complète. Aucune vérification indépendante n’est fournie.
commentaire éditorial
Pourquoi c’est important
Éventuelle conséquence pratique — intérêt à choisir des instances GPU pour des tâches d’inférence en temps réel. Le prochain signal vérifiable sera des résultats numériques publiés ou des tests indépendants. Une incertitude substantielle demeure en raison de l’absence dans le paquet d’une méthodologie complète, de tableaux de mesures et de corroboration externe.