
AWS Machine Learning Blog descreveu para Amazon Bedrock um esquema de compressão de contexto que leva em conta a consulta do usuário. Após a extração, a menor modelo seleciona as partes relevantes entre os fragmentos, e então a modelo principal gera a resposta.
Segundo a descrição da AWS, essa ordem reduz o número de tokens de entrada e os custos de RAG mantendo a qualidade da resposta. No material, o enfoque é a aplicação do método em sistemas RAG de grande escala.
Os dados disponíveis são apresentados como metadados e descrição curta, e não como o texto completo do artigo. Portanto, não é possível estabelecer quais modelos foram usados, qual foi a economia de tamanho, as métricas de qualidade ou as condições do experimento.
comentário editorial
Por que importa
Provável consequência — desenvolvedores de sistemas RAG obterão uma forma adicional de controlar custos por meio da filtragem preliminar do contexto. O próximo sinal observado será a publicação pela AWS de resultados de economia de tokens e qualidade das respostas. Há uma incerteza significativa associada à ausência de métricas específicas no material disponível e ao texto completo do material.