A MarkTechPost publicou um benchmark de APIs de inferência para agentes de voz e em tempo real. No centro da análise está o tempo até o primeiro token (TTFT), que as equipes frequentemente utilizam na seleção de APIs.

O material examina quatro camadas da pilha de voz: grandes modelos de linguagem, reconhecimento de fala, síntese de fala e conversão de fala em fala. A descrição afirma que as métricas foram verificadas junto a fontes primárias 30 de agosto de 2026, e a origem de cada número foi indicada separadamente.

O pacote da fonte não contém os próprios resultados numéricos, a lista de participantes ou uma classificação final. Portanto, ele confirma o escopo metodológico do benchmark, mas não permite identificar a API mais rápida.