AWS Machine Learning Blog beschreibt einen Benchmark der Inferenz zweier 30B MoE-Modelle—Qwen3-Coder-30B und NVIDIA Nemotron-3-Nano-30B — auf den GPU-Instanzen G5, G6, G6e und G7 in Amazon SageMaker AI.

Der Vergleich umfasst Durchsatz, Latenz und Token-Kosten. Laut Beschreibung von AWS zeigen die Messwerte messbare Vorteile von G7 mit NVIDIA Blackwell im Kosten-Nutzen-Verhältnis für Inferenz von LLMs in Echtzeit.

Diese Schlussfolgerungen basieren auf einer einzigen AWS Machine Learning Blog-Veröffentlichung und werden im Paket lediglich als Metadaten und Kurzfassung dargestellt, unabhängige Bestätigung liegt nicht vor.