AWS Machine Learning Blog описал многоуровневый KV-кэш для крупных языковых моделей на Amazon SageMaker HyperPod. Решение расширяет кэш в общий распределённый пул NVMe-накопителей с Curvine.

По описанию источника, такой пул должен позволять репликам повторно использовать кэш на скоростях, близких к локальному диску, вместо выбора между более крупными GPU-инстансами и медленным временем до первого токена.

Практическое значение подхода — перенос части требований к кэшу за пределы GPU и совместное использование этого слоя несколькими репликами. Источник не приводит численных оценок ускорения, экономии или масштабирования.