Amazon SageMaker Inference にプレフィックス認識ルーティングが導入された。プロンプトの開始部分が同一であるリクエストは、KV キャッシュをウォームな状態に保つために同じインスタンスへ送られる。

Llama 3.1 70B でのベンチマークでは、この仕組みにより最初のトークンまでの P50 時間が最大 77% 減少した。KV キャッシュのヒット率は約 25% から 80% 超へと上昇した。

実用的な意義としては、リクエストで共通プレフィックスが定期的に使用されるサービスにおいて、応答が潜在的に高速化される点が挙げられる。出典は、これらの指標が他のシナリオや異なるモデルにおいてどのように振る舞うかについては言及していない。