
Cohere a annoncé un système serveur pour les grands modèles de langage, construit autour d'un méganoïau de décodage (decode megakernel). Selon la description publiée sur le blog de l'entreprise, le système est prêt pour un usage industriel et a démontré une accélération par un facteur de 1,58 par rapport à vLLM.
Cette annonce émane directement de Cohere; le dossier disponible contient uniquement des métadonnées et une brève description de la publication, sans détails sur le banc d'essai, la charge de travail ou la méthodologie de comparaison. Par conséquent, ce résultat doit être considéré comme une affirmation de la source et non comme un benchmark indépendamment confirmé.
Si cette performance se maintient lors de tests indépendants, une telle approche pourrait réduire les coûts de calcul ou augmenter le débit des services basés sur les LLM. Le prochain signal important sera la publication des conditions d'essai et des résultats de comparaisons tierces.
commentaire éditorial
Pourquoi c’est important
Conséquence probable : un intérêt accru pour les architectures accélérant le service des LLM si le résultat revendiqué est confirmé en dehors de Cohere. Le signal observable le plus proche sera la publication de la méthodologie et des comparaisons indépendantes. Une incertitude substantielle persiste en raison de l'absence, dans le jeu de données accessible, d'informations sur l'environnement de test, la charge et les limites du système.