В блоге AWS Machine Learning представлен метод, выходящий за рамки традиционного поиска с генерацией (RAG), который часто сталкивается с ограничениями при анализе массивов из сотен документов. Решение называется Task-aware knowledge compression (TAKC) и предполагает предварительное сжатие целых баз знаний в представления, специфичные для конкретных задач.

Технология работает на инфраструктуре AWS и включает кэширование данных на нескольких уровнях точности. Система автоматически направляет каждый запрос пользователя к тому уровню детализации, который необходим для ответа, избегая избыточной обработки информации.

Авторы публикации сообщают о доступности реализации с открытым исходным кодом, которую компании могут развернуть в своей среде. Это позволяет адаптировать процесс сжатия и маршрутизации под внутренние требования предприятия без зависимости от закрытых проприетарных черных ящиков.