AWS Machine Learning Blog описал для Amazon Bedrock схему сжатия контекста, учитывающую запрос пользователя. После извлечения фрагментов меньшая модель отбирает из них релевантные части, а затем основная модель формирует ответ.

По описанию AWS, такой порядок сокращает число входных токенов и расходы на RAG при сохранении качества ответа. В материале речь идёт о применении подхода в RAG-системах, работающих в большом масштабе.

Доступные данные представлены как метаданные и краткое описание публикации, а не как полный текст статьи. Поэтому из них нельзя установить конкретные модели, размер экономии, измерения качества или условия эксперимента.