Amazon SageMaker Inference получил маршрутизацию с учетом префикса. Запросы с одинаковым началом подсказки направляются на один и тот же экземпляр, чтобы сохранить прогретым KV-кэш.

В бенчмарках на Llama 3.1 70B такая схема снизила P50-время до первого токена максимум на 77%. Доля попаданий в KV-кэш выросла примерно с 25% до более чем 80%.

Практический смысл — потенциально более быстрый отклик для сервисов, где запросы регулярно используют общий префикс. Источник не сообщает, как эти показатели ведут себя в других сценариях и при иных моделях.