AWS Machine Learning Blog は、Amazon SageMaker HyperPod 上の大規模言語モデル向けに階層型 KV キャッシュについて記述した。このソリューションは、Curvine を用いてキャッシュを共有分散 NVMe ストレージプールへと拡張するものである。

情報源の説明によれば、このようなプールにより、レプリカはより大規模な GPU インスタンスを選択するか、最初のトークンまでの時間を遅延させるかの二者択一を行う代わりに、ローカルディスクに近い速度でキャッシュを再利用できるようになるはずである。

このアプローチの実践的な意義は、キャッシュ要件の一部を GPU から外部へ移行し、このレイヤーを複数のレプリカで共有することにある。情報源は、加速効果、コスト削減、またはスケーリングに関する数値評価を提供していない。