
AWS Machine Learning Blog describió para Amazon Bedrock un esquema de compresión de contexto que tiene en cuenta la consulta del usuario. Después de extraer los fragmentos, un modelo más pequeño selecciona las partes relevantes y luego el modelo principal genera la respuesta.
Según la descripción de AWS, ese orden reduce el número de tokens de entrada y los costos de RAG manteniendo la calidad de la respuesta. El material se refiere a la aplicación del enfoque en sistemas RAG que operan a gran escala.
Los datos disponibles se presentan como metadatos y una descripción breve de la publicación, y no como el texto completo del artículo. Por lo tanto, no se pueden establecer de ellos modelos específicos, tamaño del ahorro, mediciones de calidad o condiciones del experimento.
comentario editorial
Por qué importa
Es probable que, como consecuencia, los desarrolladores de sistemas RAG obtengan una vía adicional para controlar los costos mediante filtrado previo del contexto. El siguiente indicador observable serán los resultados publicados por AWS sobre el ahorro de tokens y la calidad de las respuestas. Una considerable incertidumbre está asociada a la ausencia de métricas concretas y del texto completo en los datos disponibles.