Le AWS Machine Learning Blog décrit pour Amazon Bedrock un schéma de compression du contexte prenant en compte la requête de l'utilisateur. Après extraction des fragments, un modèle plus petit sélectionne parmi eux les parties pertinentes, puis le modèle principal élabore la réponse.

Selon AWS, cet ordre réduit le nombre de jetons d'entrée et les coûts du RAG tout en maintenant la qualité de la réponse. Le matériel décrit l'application de cette approche dans des systèmes RAG fonctionnant à grande échelle.

Les données disponibles se présentent comme des métadonnées et une description succincte de la publication, et non comme le texte complet de l'article. Par conséquent, il n'est pas possible d'établir les modèles spécifiques, l'ampleur des économies, les mesures de qualité ou les conditions de l'expérience à partir de celles-ci.