O blog AWS Machine Learning apresenta um método que vai além da recuperação e geração tradicionais (RAG), que frequentemente enfrentam limitações ao analisar conjuntos de centenas de documentos. A solução, chamada Task-aware knowledge compression (TAKC), envolve a compressão prévia de bases de conhecimento inteiras em representações específicas para tarefas concretas.

A tecnologia opera na infraestrutura da AWS e inclui o cache de dados em vários níveis de fidelidade. O sistema encaminha automaticamente cada consulta do usuário ao nível de detalhe necessário para a resposta, evitando o processamento excessivo de informações.

Os autores da publicação relatam a disponibilidade de uma implementação de código aberto, que as empresas podem implantar em seus próprios ambientes. Isso permite adaptar o processo de compressão e roteamento aos requisitos internos da empresa, sem depender de caixas-pretas proprietárias fechadas.