En el blog de Machine Learning de AWS se presenta un método que va más allá de la búsqueda y generación tradicionales (RAG), las cuales a menudo enfrentan limitaciones al analizar conjuntos de cientos de documentos. La solución, denominada Task-aware knowledge compression (TAKC), implica la compresión previa de bases de conocimiento completas en representaciones específicas para tareas concretas.

La tecnología opera sobre la infraestructura de AWS e incluye el almacenamiento en caché de datos en múltiples niveles de precisión (fidelity tiers). El sistema enruta automáticamente cada consulta del usuario al nivel de detalle necesario para la respuesta, evitando el procesamiento excesivo de información.

Los autores de la publicación informan sobre la disponibilidad de una implementación de código abierto que las empresas pueden desplegar en sus propios entornos. Esto permite adaptar el proceso de compresión y enrutamiento a los requisitos internos de la empresa sin depender de cajas negras propietarias cerradas.