
O Amazon SageMaker Inference recebeu roteamento consciente de prefixo. Solicitações com o mesmo início de prompt são direcionadas para a mesma instância para manter o cache KV aquecido.
Em benchmarks no Llama 3.1 70B, esse esquema reduziu o tempo P50 até o primeiro token em até 77%. A taxa de acertos no cache KV aumentou de aproximadamente 25% para mais de 80%.
O significado prático é uma resposta potencialmente mais rápida para serviços onde as solicitações usam regularmente um prefixo comum. A fonte não relata como essas métricas se comportam em outros cenários e com outros modelos.
comentário editorial
Por que importa
Uma consequência provável é um maior interesse no roteamento que considera contexto repetitivo em serviços de aplicação baseados em modelos de linguagem. O próximo sinal observável serão os resultados fora do teste Llama 3.1 70B e dados sobre o desempenho da função sob carga real. Uma incerteza substancial relaciona-se ao fato de que o pacote apresenta apenas uma fonte e metadados de sua publicação.