Amazon SageMaker Inference a reçu le routage prenant en compte le préfixe. Les requêtes ayant le même début de prompt sont dirigées vers le même instance afin de maintenir le KV‑cache chauds.

Dans les benchmarks sur Llama 3.1 70B 50-le temps jusqu’au premier token a diminué d’au maximum 77% et le taux de réussite dans le KV‑cache est passé d’environ 25% à plus de 80%.

Le sens pratique — un éventuel délai de réponse plus rapide pour les services où les requêtes utilisent régulièrement le même préfixe. La source ne précise pas comment ces chiffres se comportent dans d’autres scénarios et avec d’autres modèles.