Amazon SageMaker Inference recibió enrutamiento con enrutamiento por prefijo. Las solicitudes con el mismo inicio de indicación se envían al mismo ejemplar para mantener caliente la caché KV.

En las pruebas con Llama 3.1 70B el tiempo P50 hasta el primer token se redujo como máximo en 77%. La tasa de aciertos en la caché KV aumentó de aproximadamente 25% a más de 80%.

El significado práctico: potencialmente una respuesta más rápida para servicios donde las solicitudes utilizan con frecuencia un prefijo común. La fuente no indica cómo se comportan estos resultados en otros escenarios o con otros modelos.