O AWS Machine Learning Blog relatou a aplicação de cache de prompts no Amazon Bedrock para casos em que o mesmo contexto é transmitido repetidamente aos modelos fundamentais. De acordo com o resumo da publicação, essa abordagem reduz os custos com tokens de entrada em até 90%.

O artigo examina seis cenários por meio da API Converse: cache de conteúdo de mensagens, instruções do sistema e descrições de ferramentas, prazos de retenção mistos, isolamento de locatários e integração com LangChain.

O valor prático da abordagem depende da frequência com que o contexto se repete e de como a carga de trabalho específica é estruturada. O pacote apresentado não contém detalhes sobre a configuração de teste, latências reais ou as condições sob as quais a economia máxima é alcançada.