Cohere сообщила о серверной системе для больших языковых моделей, построенной вокруг decode megakernel. По описанию в блоге компании, система получила статус готовой к промышленному использованию и показала ускорение в 1,58 раза по сравнению с vLLM.

Заявление опубликовано самой Cohere; в доступном пакете есть только метаданные и краткое описание публикации, без подробностей о стенде, нагрузке или методике сравнения. Поэтому результат следует рассматривать как утверждение источника, а не как независимо подтверждённый бенчмарк.

Если показатель сохранится в независимых тестах, такой подход может сократить вычислительные затраты или повысить пропускную способность сервисов на базе LLM. Следующим важным сигналом станут опубликованные условия испытаний и результаты сторонних сравнений.