
AWS Machine Learning Blog describió un benchmark de inferencia de dos modelos MoE 30B: Qwen3-Coder-30B y NVIDIA Nemotron-3-Nano-30B —, en las instancias de GPU G5, G6, G6e y G7 dentro de Amazon SageMaker AI.
La comparación abarca el rendimiento, la latencia y el costo por token. Según la descripción de AWS, las pruebas muestran ventajas medibles de G7 con GPU NVIDIA Blackwell en la relación precio-rendimiento para la inferencia de LLM en tiempo real.
Estas conclusiones se basan en una única publicación de AWS Machine Learning Blog y se presentan en el paquete solo como metadatos y un resumen breve, no como el texto completo de la investigación. No existe confirmación independiente.
comentario editorial
Por qué importa
La consecuencia práctica probable es un mayor interés en la selección de instancias de GPU para tareas de inferencia en tiempo real. La siguiente señal a verificar serán los resultados numéricos publicados o pruebas independientes. Persiste una incertidumbre significativa debido a la ausencia en el paquete de una metodología completa, tablas de medición y corroboración de terceros.