O Amazon SageMaker Inference recebeu roteamento consciente de prefixo. Solicitações com o mesmo início de prompt são direcionadas para a mesma instância para manter o cache KV aquecido.

Em benchmarks no Llama 3.1 70B, esse esquema reduziu o tempo P50 até o primeiro token em até 77%. A taxa de acertos no cache KV aumentou de aproximadamente 25% para mais de 80%.

O significado prático é uma resposta potencialmente mais rápida para serviços onde as solicitações usam regularmente um prefixo comum. A fonte não relata como essas métricas se comportam em outros cenários e com outros modelos.