
AWS Machine Learning Blog は、Amazon SageMaker HyperPod 上の大規模言語モデル向けに階層型 KV キャッシュについて記述した。このソリューションは、Curvine を用いてキャッシュを共有分散 NVMe ストレージプールへと拡張するものである。
情報源の説明によれば、このようなプールにより、レプリカはより大規模な GPU インスタンスを選択するか、最初のトークンまでの時間を遅延させるかの二者択一を行う代わりに、ローカルディスクに近い速度でキャッシュを再利用できるようになるはずである。
このアプローチの実践的な意義は、キャッシュ要件の一部を GPU から外部へ移行し、このレイヤーを複数のレプリカで共有することにある。情報源は、加速効果、コスト削減、またはスケーリングに関する数値評価を提供していない。
編集部コメント
なぜ重要か
想定される帰結としては、主張された速度が測定によって確認されれば、再問い合わせ時における最大規模の GPU インスタンスへの依存度が低下することである。次に観測可能な兆候は、遅延、コスト、およびレプリケーション規模に関する公表されたベンチマークとなるだろう。全文、数値結果、および独立した検証の欠如により、実質的な不確実性が残存している。