A Cohere relatou um sistema de servidor para grandes modelos de linguagem, construído em torno do decode megakernel. De acordo com a descrição no blog da empresa, o sistema recebeu o status de pronto para uso industrial e mostrou uma aceleração de 1,58 vezes em comparação com o vLLM.

O anúncio foi publicado pela própria Cohere; no pacote disponível, há apenas metadados e uma breve descrição da publicação, sem detalhes sobre o ambiente de teste, carga ou metodologia de comparação. Portanto, o resultado deve ser considerado como uma afirmação da fonte, e não como um benchmark independentemente confirmado.

Se a métrica se mantiver em testes independentes, tal abordagem pode reduzir custos computacionais ou aumentar a capacidade de processamento de serviços baseados em LLMs. O próximo sinal importante serão as condições de teste publicadas e os resultados de comparações de terceiros.