Cohere gab ein Serversystem für große Sprachmodelle bekannt, das um einen Decode-Megakernel herum aufgebaut ist. Laut der Beschreibung im Blog des Unternehmens hat das System den Status der Produktionsreife erreicht und zeigte eine 1,58-fache Beschleunigung im Vergleich zu vLLM.

Die Ankündigung wurde von Cohere selbst veröffentlicht; im vorliegenden Paket liegen lediglich Metadaten und eine Kurzbeschreibung des Beitrags vor, ohne Einzelheiten zum Teststand, zur Last oder zur Vergleichsmethodik. Daher sollte das Ergebnis als Aussage der Quelle und nicht als unabhängig verifizierter Benchmark betrachtet werden.

Falls sich dieser Wert in unabhängigen Tests bestätigt, könnte ein solcher Ansatz die Rechenkosten senken oder den Durchsatz von Diensten auf LLM-Basis erhöhen. Das nächste wichtige Signal werden die veröffentlichten Testbedingungen und Ergebnisse externer Vergleiche sein.