MarkTechPost publicó un benchmark de APIs de inferencia para voz y agentes en tiempo real. En el centro del análisis está el tiempo hasta el primer token (TTFT), que las compañías suelen utilizar al seleccionar una API.

El material examina cuatro capas de la pila de voz: grandes modelos de lenguaje, reconocimiento de voz, síntesis de voz y conversión de voz en voz. En la descripción se indica que los resultados se verificaron con fuentes primarias 30 de agosto 2026 del año, y que el origen de cada cifra se marcó por separado como independiente del proveedor o medido por el proveedor en su propio producto.

El paquete de la fuente no contiene los resultados numéricos, la lista de participantes ni una clasificación final. Por lo tanto, confirma el alcance metodológico del benchmark, pero no permite nombrar la API más rápida.