AWS Machine Learning Blog は、同じコンテキストが基礎モデルに繰り返し送信される場合における Amazon Bedrock のプロンプトキャッシングの適用について報告した。公開概要によると、このアプローチにより入力トークンのコストを 90% まで削減できる。

В статье рассмотрены шесть сценариев через Converse API: кэширование содержимого сообщений, системной инструкции и описания инструмента, смешанные сроки хранения, изоляция арендаторов и интеграция с LangChain.

このアプローチの実用的価値は、コンテキストがどの程度繰り返されるか、また具体的なワークロードがどのように構成されているかに依存する。提示されたパッケージには、テスト構成、実際のレイテンシ、または最大限の節約が達成される条件に関する詳細は含まれていない。