AWS Machine Learning Blogは、Amazon Bedrock向けにクエリを考慮したコンテキスト圧縮のスキームを説明した。フラグメントを抽出した後、より小さなモデルがそれらの中から関連部分を選択し、続いて主要なモデルが回答を作成する。

AWSによると、この順序は入力トークンの数とRAGコストを削減しつつ、回答の品質を維持する。材料は、大規模なRAGシステムへのアプローチの適用について言及している。

公開されたデータは、記事の全文ではなくメタデータと簡要な説明として提示されている。そのため、具体的なモデル、節約額、品質の測定、実験条件を特定することはできない。