Laut der Überschrift eines Beitrags im NVIDIA Blog setzt das NVIDIA Vera Rubin NVL72 einen neuen Maßstab für die Effizienz bei KI-Arbeitslasten: bis zu 30-mal mehr Arbeit pro Watt.

Der Beitrag führt zudem Daten von OpenRouter an, wonach solche Arbeitslasten 15-mal mehr Tokens verbrauchen als eine einfache Chat-Anfrage. Als Beispiel wird eine Unternehmensanalyse für eine Investitionsentscheidung genannt.

Die praktische Bedeutung der Aussage liegt in der Bewertung der Rechenleistung nicht nur nach der Hardwarekapazität, sondern auch nach dem Volumen der ausgeführten Arbeit. Das verfügbare Paket enthält jedoch lediglich eine Zusammenfassung der Metadaten, sodass die Berechnungsmethodik und die vergleichbaren Bedingungen unbekannt bleiben.