La division de recherche Apple Machine Learning Research a présenté une nouvelle méthode appelée GH-ESD, conçue pour détecter les erreurs dans les modèles de vision par ordinateur. Les approches traditionnelles considèrent souvent les défaillances comme des grappes dans l'espace des représentations ou des combinaisons d'attributs prédéfinis, ce qui fonctionne bien pour la classification d'images en général.

Cependant, les auteurs de l'étude soulignent que ces formulations sont insuffisantes pour les tâches au niveau des instances, telles que la détection et la segmentation d'objets. Dans ces scénarios, les erreurs surviennent souvent en raison de motifs visuels contextuels relationnels et spatialement fondés que les méthodes précédentes ont manqués.

L'hypothèse proposée vise à identifier précisément les sous-ensembles de données sémantiquement cohérents où les modèles présentent des défaillances systématiques. Cela permet de passer d'une évaluation générale de la fiabilité à une analyse plus approfondie des conditions spécifiques de défaillance.