
Keenable AI abriu o código-fonte do NEEDLE — um benchmark para avaliação da busca na web, segundo a MarkTechPost. Segundo a publicação, o conjunto de consultas nele é refeito a cada hora.
O problema apontado pela notícia está relacionado ao acesso da ferramenta de coleta de dados pela ferramenta de busca. Se as respostas de referência estiverem em um conjunto público, o sistema avaliado pode obtê‑las durante a avaliação, contornando a busca efetiva.
A importância da abordagem depende de quão bem os empregos atualizados dificultam esse cenário. No pacote disponível não há informações sobre os resultados do NEEDLE, a composição de seu conjunto de consultas ou comparações com outros benchmarks.
comentário editorial
Por que importa
Provavelmente haverá maior interesse em testes que sejam mais difíceis de contornar devido a dados de referência previamente disponíveis. O próximo sinal observado serão as metodologias, resultados e comparações do NEEDLE com outras avaliações. Dúvidas substanciais permanecem: o pacote atual não contém o texto completo da publicação e detalhes técnicos do projeto.