
Le blog AWS Machine Learning a décrit un cache KV hiérarchisé pour les grands modèles de langage sur Amazon SageMaker HyperPod. La solution étend le cache vers un pool distribué partagé de stockage NVMe avec Curvine.
Selon la description de la source, ce pool devrait permettre aux répliques de réutiliser le cache à des vitesses proches de celles d'un disque local, évitant ainsi de choisir entre des instances GPU plus grandes et un temps lent jusqu'au premier token.
La signification pratique de cette approche consiste à déplacer une partie des exigences de cache hors du GPU et à partager cette couche entre plusieurs répliques. La source ne fournit aucune estimation chiffrée de l'accélération, des économies ou de la mise à l'échelle.
commentaire éditorial
Pourquoi c’est important
Une conséquence probable est une réduction de la dépendance aux plus grandes instances GPU lors de requêtes répétées, si les vitesses annoncées sont confirmées par des mesures. Le prochain signal observable sera la publication de benchmarks concernant la latence, le coût et l'échelle de réplication. Une incertitude substantielle subsiste en raison de l'absence du texte intégral, de résultats numériques et d'une vérification indépendante.