AWS Machine Learning Blog describierte einen mehrstufigen KV‑Cache für große Sprachmodelle auf Amazon SageMaker HyperPod. Die Lösung erweitert den Cache in einen gemeinsamen verteilten NVMe‑Speicherpool mit Curvine.

Nach Beschreibung der Quelle sollte dieser Pool Replikas das erneute Verwenden des Caches mit Geschwindigkeiten ermöglichen, die nahe an lokalen Festplatten liegen, statt zwischen größeren GPU-Instanzen und langsamer Zeit bis zum ersten Token zu wählen.

Der praktische Wert des Ansatzes besteht darin, Teile der Cache‑Anforderungen außerhalb der GPU zu verlagern und diese Schicht mehreren Replikas gemeinsam zu nutzen. Die Quelle enthält keine numerischen Bewertungen von Beschleunigungen, Einsparungen oder Skalierung.