
Keenable AI a ouvert le code source de NEEDLE - un benchmark pour l’évaluation de la recherche sur le Web, rapporte MarkTechPost. Selon la description du média, l’ensemble de requêtes y est reconstruit chaque heure.
Le problème souligné par la publication concerne l’accès de l’outil de récupération de données par le moteur de recherche. Si les réponses de référence se trouvent dans un ensemble public, le système évalué peut les télécharger pendant l’évaluation et contourner la recherche elle-même.
L’importance de l’approche dépend de la capacité des tâches mises à jour à réellement empêcher un tel scénario. Dans le paquet disponible, il n’y a pas d’informations sur les résultats de NEEDLE, la composition de son ensemble de requêtes ou les comparaisons avec d’autres benchmark.
commentaire éditorial
Pourquoi c’est important
Conséquence probable — un intérêt accru pour les tests qui sont plus difficiles à passer en raison des données de référence préalablement accessibles. Le prochain signal observable sera les méthodologies publiées, les résultats et les comparaisons de NEEDLE avec d'autres évaluations. Une incertitude importante demeure : le paquet actuel ne contient pas le texte complet de la publication et les détails techniques du projet.