
AWS Machine Learning Blogは、Amazon Bedrock向けにクエリを考慮したコンテキスト圧縮のスキームを説明した。フラグメントを抽出した後、より小さなモデルがそれらの中から関連部分を選択し、続いて主要なモデルが回答を作成する。
AWSによると、この順序は入力トークンの数とRAGコストを削減しつつ、回答の品質を維持する。材料は、大規模なRAGシステムへのアプローチの適用について言及している。
公開されたデータは、記事の全文ではなくメタデータと簡要な説明として提示されている。そのため、具体的なモデル、節約額、品質の測定、実験条件を特定することはできない。
編集部コメント
なぜ重要か
予想される結果は、RAGシステムの開発者が事前のコンテキストフィルタリングによって費用を追加的に抑制する方法を得ることになる。次に観測されるサインは、トークンの節約と回答の品質に関するAWSの公開結果となる。重大な不確定性は、利用可能なデータに具体的な指標と材料の完全な本文が欠如していることにある。