AWS Machine Learning Blog сообщил о применении кэширования запросов в Amazon Bedrock для случаев, когда один и тот же контекст неоднократно передаётся базовым моделям. По данным синопсиса публикации, такой подход сокращает расходы на входные токены до 90%.

В статье рассмотрены шесть сценариев через Converse API: кэширование содержимого сообщений, системной инструкции и описания инструмента, смешанные сроки хранения, изоляция арендаторов и интеграция с LangChain.

Практическая ценность подхода зависит от того, насколько часто повторяется контекст и как устроена конкретная нагрузка. В представленном пакете нет подробностей о тестовой конфигурации, фактических задержках или условиях, при которых достигается максимальная экономия.