Keenable AI a ouvert le code source de NEEDLE - un benchmark pour l’évaluation de la recherche sur le Web, rapporte MarkTechPost. Selon la description du média, l’ensemble de requêtes y est reconstruit chaque heure.

Le problème souligné par la publication concerne l’accès de l’outil de récupération de données par le moteur de recherche. Si les réponses de référence se trouvent dans un ensemble public, le système évalué peut les télécharger pendant l’évaluation et contourner la recherche elle-même.

L’importance de l’approche dépend de la capacité des tâches mises à jour à réellement empêcher un tel scénario. Dans le paquet disponible, il n’y a pas d’informations sur les résultats de NEEDLE, la composition de son ensemble de requêtes ou les comparaisons avec d’autres benchmark.