AWS Machine Learning Blog describió para Amazon Bedrock un esquema de compresión de contexto que tiene en cuenta la consulta del usuario. Después de extraer los fragmentos, un modelo más pequeño selecciona las partes relevantes y luego el modelo principal genera la respuesta.

Según la descripción de AWS, ese orden reduce el número de tokens de entrada y los costos de RAG manteniendo la calidad de la respuesta. El material se refiere a la aplicación del enfoque en sistemas RAG que operan a gran escala.

Los datos disponibles se presentan como metadatos y una descripción breve de la publicación, y no como el texto completo del artículo. Por lo tanto, no se pueden establecer de ellos modelos específicos, tamaño del ahorro, mediciones de calidad o condiciones del experimento.