
Amazon SageMaker Inference recibió enrutamiento con enrutamiento por prefijo. Las solicitudes con el mismo inicio de indicación se envían al mismo ejemplar para mantener caliente la caché KV.
En las pruebas con Llama 3.1 70B el tiempo P50 hasta el primer token se redujo como máximo en 77%. La tasa de aciertos en la caché KV aumentó de aproximadamente 25% a más de 80%.
El significado práctico: potencialmente una respuesta más rápida para servicios donde las solicitudes utilizan con frecuencia un prefijo común. La fuente no indica cómo se comportan estos resultados en otros escenarios o con otros modelos.
comentario editorial
Por qué importa
La consecuencia probable es un mayor interés en la enrutación que considera el contexto repetitivo, en servicios prácticos basados en modelos de lenguaje. La próxima señal observada serán los resultados fuera de la prueba con Llama 3.1 70B y datos sobre el desempeño de la función bajo carga real. Una incertidumbre sustancial es que en el paquete solo hay una fuente y sus metadatos de publicación.