El blog de Machine Learning de AWS describió una caché KV escalonada para grandes modelos de lenguaje en Amazon SageMaker HyperPod. La solución extiende la caché a un grupo compartido distribuido de unidades NVMe con Curvine.

Según la descripción de la fuente, dicho grupo debería permitir que las réplicas reutilicen la caché a velocidades cercanas a las del disco local, en lugar de tener que elegir entre instancias GPU más grandes o un tiempo lento hasta el primer token.

La implicación práctica del enfoque es trasladar parte de los requisitos de caché fuera de la GPU y compartir esta capa entre varias réplicas. La fuente no proporciona estimaciones numéricas sobre aceleración, ahorro de costes o escalabilidad.