Cohere informó sobre un sistema de servidor para grandes modelos de lenguaje construido alrededor de un decode megakernel. Según la descripción en el blog de la empresa, el sistema ha recibido el estatus de listo para uso industrial y mostró una aceleración de 1,58 veces en comparación con vLLM.

La declaración fue publicada por la propia Cohere; en el paquete disponible solo hay metadatos y una breve descripción de la publicación, sin detalles sobre el banco de pruebas, la carga o la metodología de comparación. Por lo tanto, el resultado debe considerarse como una afirmación de la fuente y no como un benchmark confirmado independientemente.

Si la métrica se mantiene en pruebas independientes, este enfoque podría reducir los costos computacionales o aumentar el rendimiento de los servicios basados en LLM. La próxima señal importante serán las condiciones de prueba publicadas y los resultados de comparaciones de terceros.