Cohere a annoncé un système serveur pour les grands modèles de langage, construit autour d'un méganoïau de décodage (decode megakernel). Selon la description publiée sur le blog de l'entreprise, le système est prêt pour un usage industriel et a démontré une accélération par un facteur de 1,58 par rapport à vLLM.

Cette annonce émane directement de Cohere; le dossier disponible contient uniquement des métadonnées et une brève description de la publication, sans détails sur le banc d'essai, la charge de travail ou la méthodologie de comparaison. Par conséquent, ce résultat doit être considéré comme une affirmation de la source et non comme un benchmark indépendamment confirmé.

Si cette performance se maintient lors de tests indépendants, une telle approche pourrait réduire les coûts de calcul ou augmenter le débit des services basés sur les LLM. Le prochain signal important sera la publication des conditions d'essai et des résultats de comparaisons tierces.