Le blog AWS Machine Learning a décrit un cache KV hiérarchisé pour les grands modèles de langage sur Amazon SageMaker HyperPod. La solution étend le cache vers un pool distribué partagé de stockage NVMe avec Curvine.

Selon la description de la source, ce pool devrait permettre aux répliques de réutiliser le cache à des vitesses proches de celles d'un disque local, évitant ainsi de choisir entre des instances GPU plus grandes et un temps lent jusqu'au premier token.

La signification pratique de cette approche consiste à déplacer une partie des exigences de cache hors du GPU et à partager cette couche entre plusieurs répliques. La source ne fournit aucune estimation chiffrée de l'accélération, des économies ou de la mise à l'échelle.