MarkTechPost a publié le benchmark API d'inférence pour les agents vocaux et en temps réel. Au cœur de l'analyse — le temps jusqu'au premier token (TTFT), que les équipes utilisent souvent lors du choix d'une API.

Le matériel examine quatre couches de la pile vocale: grands modèles linguistiques, reconnaissance vocale, synthèse vocale et transformation de parole en parole. Il est indiqué que les indicateurs ont été vérifiés par rapport à des sources primaires le 30 août 2026 année, et l'origine de chaque chiffre est marquée séparément.

Le paquet de sources ne contient pas les résultats numériques eux-mêmes, la liste des participants ou le classement final. Il confirme donc la couverture méthodologique du benchmark, mais ne permet pas de nommer l'API la plus rapide.