AWS Machine Learning Blog descreveu para Amazon Bedrock um esquema de compressão de contexto que leva em conta a consulta do usuário. Após a extração, a menor modelo seleciona as partes relevantes entre os fragmentos, e então a modelo principal gera a resposta.

Segundo a descrição da AWS, essa ordem reduz o número de tokens de entrada e os custos de RAG mantendo a qualidade da resposta. No material, o enfoque é a aplicação do método em sistemas RAG de grande escala.

Os dados disponíveis são apresentados como metadados e descrição curta, e não como o texto completo do artigo. Portanto, não é possível estabelecer quais modelos foram usados, qual foi a economia de tamanho, as métricas de qualidade ou as condições do experimento.