
Dans son article « How XPUs Meet a World-Class AI Factory », NVIDIA décrit une approche de l'infrastructure destinée aux usines d'IA fonctionnant en continu. L'accent est mis sur le résultat de production: la vitesse de génération de jetons, le nombre de jetons par watt, le coût par jeton, le taux d'utilisation et le temps de fonctionnement sans panne.
Selon l'exposé de NVIDIA, pour une telle économie, l'infrastructure doit être conçue et construite comme une usine à part entière, et non comme un ensemble d'accélérateurs individuels.
Cela est important car la comparaison de puces individuelles ne révèle pas l'efficacité globale du système. Toutefois, le document disponible se présente sous forme de métadonnées et d'un bref résumé de publication; par conséquent, les détails architecturaux, la liste des participants et les résultats pratiques restent inconnus.
commentaire éditorial
Pourquoi c’est important
Conséquence probable : les fournisseurs d'infrastructure d'IA compareront plus fréquemment les systèmes en fonction de la production et du coût des résultats, et non uniquement selon les caractéristiques des accélérateurs individuels. Le prochain signal observable sera la publication de mesures concernant le taux d'utilisation, le coût par jeton et le temps de fonctionnement sans panne. Une incertitude substantielle subsiste car la source accessible ne contient aucun détail technique ni vérification indépendante.