
Keenable AI は MarkTechPost によると、ウェブ検索を評価するためのベンチマーク NEEDLE のソースコードを公開した。記事の説明によれば、クエリセットは毎時再構成される。
公刊が指摘する問題は、データ取得ツールへの検索エンジンのアクセスに関係している。参照解答が公開データセットに含まれている場合、評価時に検証されるシステムがそれらを読み込み、実際の検索を回避してしまう可能性がある。
アプローチの意義は、更新されたタスクがそのようなシナリオをどれだけ防ぐかに依存する。入手可能なパッケージには NEEDLE の結果、クエリセットの構成、他のベンチマークとの比較に関する情報が含まれていない。
編集部コメント
なぜ重要か
可能性のある結果は、事前に利用可能な標準データのせいで通過が難しいテストへの関心が高まること。次に観察される兆候は、NEEDLEの方法論、結果、および他の評価との比較が公開されること。重大な不確実性が残る:現パッケージには論文全文と技術的詳細が含まれていない。