
AWS Machine Learning Blog описал для Amazon Bedrock схему сжатия контекста, учитывающую запрос пользователя. После извлечения фрагментов меньшая модель отбирает из них релевантные части, а затем основная модель формирует ответ.
По описанию AWS, такой порядок сокращает число входных токенов и расходы на RAG при сохранении качества ответа. В материале речь идёт о применении подхода в RAG-системах, работающих в большом масштабе.
Доступные данные представлены как метаданные и краткое описание публикации, а не как полный текст статьи. Поэтому из них нельзя установить конкретные модели, размер экономии, измерения качества или условия эксперимента.
комментарий редакции
Что это значит
Вероятное следствие — разработчики RAG-систем получат дополнительный способ контролировать расходы за счёт предварительной фильтрации контекста. Следующим наблюдаемым сигналом будут опубликованные AWS результаты по экономии токенов и качеству ответов. Существенная неопределённость связана с отсутствием в доступных данных конкретных метрик и полного текста материала.