Amazon Science は、実際のビジネス手順において AI エージェントを評価するための拡張可能なシステムである SOP-Bench について報告しました。プロジェクトの概要によれば、これは個別の間接的なタスクではなく、手順を成功裡に完了するために必要な全能力のセットを検証するものです。

このアプローチの意義は、ワークフローの実行をより包括的に検証する点にあります。一方で、情報源はテストの構成、比較結果、または対象となる手順の一覧を開示していないため、この開発の規模と実用的な価値は現時点では不明確です。