Amazon SageMaker Inference erhielt ein prefix‑bewusstes Routing. Anfragen mit demselben Anfang der Eingabe werden auf denselben Instanz gerichtet, um den KV‑Cache warm zu halten.

In Benchmarks zu Llama 3.1 70B betrug die Reduktion der P50‑Zeit bis zum ersten Token maximal 77%. Die Trefferquote im KV‑Cache stieg von ungefähr 25% auf mehr als 80%.

Praktischer Sinn — potenziell schnellere Reaktionen für Dienste, bei denen Anfragen regelmäßig denselben Präfix verwenden. Der Bericht nennt nicht, wie diese Werte sich in anderen Szenarien und bei anderen Modellen verhalten.