Cohere は、decode megakernel を中核とした大規模言語モデル向けのサーバーシステムを発表した。同社のブログによると、このシステムは実運用-ready な状態にあり、vLLM と比較して 1,58 倍の高速化を実現したという。

この発表は Cohere 自身によるものであり、利用可能なパッケージにはメタデータと投稿の概要のみが含まれ、テスト環境、負荷条件、または比較手法に関する詳細は含まれていない。したがって、この結果は独立して検証されたベンチマークではなく、情報源からの主張として扱うべきである。

もしこの数値が独立したテストでも維持されれば、このようなアプローチは LLM ベースのサービスの計算コストを削減するか、スループットを向上させる可能性がある。次の重要な兆候は、試験条件の公表と第三者による比較結果となるだろう。