
Amazon SageMaker Inference a reçu le routage prenant en compte le préfixe. Les requêtes ayant le même début de prompt sont dirigées vers le même instance afin de maintenir le KV‑cache chauds.
Dans les benchmarks sur Llama 3.1 70B 50-le temps jusqu’au premier token a diminué d’au maximum 77% et le taux de réussite dans le KV‑cache est passé d’environ 25% à plus de 80%.
Le sens pratique — un éventuel délai de réponse plus rapide pour les services où les requêtes utilisent régulièrement le même préfixe. La source ne précise pas comment ces chiffres se comportent dans d’autres scénarios et avec d’autres modèles.
commentaire éditorial
Pourquoi c’est important
Une conséquence probable est un intérêt accru pour le routage tenant compte du contexte récurrent dans les services appliqués basés sur des modèles de langage. Le prochain signal observé sera les résultats hors test sur Llama 3.1 70B et les données sur le fonctionnement de la fonction sous charge réelle. L’incertitude substantielle réside dans le fait qu’il n’y a qu’une seule source dans le paquet et que les métadonnées de sa publication.