
O AWS Machine Learning Blog descreveu um cache KV em camadas para grandes modelos de linguagem no Amazon SageMaker HyperPod. A solução expande o cache para um pool distribuído compartilhado de drives NVMe com a Curvine.
De acordo com a descrição da fonte, tal pool deve permitir que as réplicas reutilizem o cache em velocidades próximas às de um disco local, em vez de escolher entre instâncias de GPU maiores ou um tempo lento até o primeiro token.
O significado prático da abordagem é transferir parte dos requisitos de cache para fora da GPU e compartilhar essa camada entre várias réplicas. A fonte não fornece estimativas numéricas de aceleração, economia ou escalabilidade.
comentário editorial
Por que importa
A consequência provável é a redução da dependência das maiores instâncias de GPU em consultas repetidas, caso as velocidades alegadas sejam confirmadas por medições. O próximo sinal observável serão os benchmarks publicados de latência, custo e escala de replicação. Incerteza substancial permanece devido à ausência do texto completo, resultados numéricos e verificação independente.