Le blog AWS Machine Learning a rapporté l'application de la mise en cache des requêtes dans Amazon Bedrock pour les cas où un même contexte est transmis à plusieurs reprises aux modèles de base. Selon le synopsis de la publication, cette approche réduit les coûts des jetons d'entrée jusqu'à 90%.

L'article examine six scénarios via l'API Converse: la mise en cache du contenu des messages, des instructions système et des descriptions d'outils, ainsi que des durées de conservation mixtes, l'isolation des locataires et l'intégration avec LangChain.

La valeur pratique de cette approche dépend de la fréquence à laquelle le contexte se répète et de la manière dont la charge de travail spécifique est structurée. Le paquet présenté ne contient pas de détails sur la configuration des tests, les latences réelles ou les conditions dans lesquelles l'économie maximale est atteinte.