Im AWS Machine Learning Blog wird eine Methode vorgestellt, die über das traditionelle Retrieval-Augmented Generation (RAG) hinausgeht, welches bei der Analyse von Arrays aus Hunderten von Dokumenten oft an Grenzen stößt. Die Lösung heißt Task-aware Knowledge Compression (TAKC) und sieht eine Vorab-Komprimierung ganzer Wissensdatenbanken in darstellungen vor, die spezifisch für bestimmte Aufgaben sind.

Die Technologie arbeitet auf der AWS-Infrastruktur und umfasst ein Caching von Daten auf mehreren Genauigkeitsstufen (Fidelity Tiers). Das System leitet jede Benutzeranfrage automatisch an die Detailstufe weiter, die für die Antwort erforderlich ist, und vermeidet so eine übermäßige Informationsverarbeitung.

Die Autoren der Veröffentlichung berichten über die Verfügbarkeit einer Open-Source-Implementierung, die Unternehmen in ihrer eigenen Umgebung bereitstellen können. Dies ermöglicht es, den Komprimierungs- und Routing-Prozess an interne Unternehmensanforderungen anzupassen, ohne von geschlossenen proprietären Blackbox-Lösungen abhängig zu sein.