O AWS Machine Learning Blog descreveu um cache KV em camadas para grandes modelos de linguagem no Amazon SageMaker HyperPod. A solução expande o cache para um pool distribuído compartilhado de drives NVMe com a Curvine.

De acordo com a descrição da fonte, tal pool deve permitir que as réplicas reutilizem o cache em velocidades próximas às de um disco local, em vez de escolher entre instâncias de GPU maiores ou um tempo lento até o primeiro token.

O significado prático da abordagem é transferir parte dos requisitos de cache para fora da GPU e compartilhar essa camada entre várias réplicas. A fonte não fornece estimativas numéricas de aceleração, economia ou escalabilidade.