
Amazon SageMaker Inference にプレフィックス認識ルーティングが導入された。プロンプトの開始部分が同一であるリクエストは、KV キャッシュをウォームな状態に保つために同じインスタンスへ送られる。
Llama 3.1 70B でのベンチマークでは、この仕組みにより最初のトークンまでの P50 時間が最大 77% 減少した。KV キャッシュのヒット率は約 25% から 80% 超へと上昇した。
実用的な意義としては、リクエストで共通プレフィックスが定期的に使用されるサービスにおいて、応答が潜在的に高速化される点が挙げられる。出典は、これらの指標が他のシナリオや異なるモデルにおいてどのように振る舞うかについては言及していない。
編集部コメント
なぜ重要か
考えられる帰結として、言語モデルベースのアプリケーションサービスにおいて、繰り返しコンテキストを考慮したルーティングへの関心が高まることが予想される。次の観測可能な兆候は、Llama 3.1 70B を超えたテストの結果および実負荷における動作データとなるであろう。 существенная неопределенность(重大な不確実性)は、パッケージ内に単一の情報源しかなく、その公開メタデータのみが提示されている点に関連している。