À quoi il sert
Sur Quelle IA, EnigmaEval sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks.
RaisonnementFiche benchmark · Scale AI, avec le Center for AI Safety et le MIT · labs.scale.com
1 184 énigmes de chasses aux énigmes, du niveau débutant au MIT Mystery Hunt, mêlant texte et images et exigeant de longues déductions.
Sur Quelle IA, EnigmaEval sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks.
Part d'énigmes dont la réponse finale est exactement la bonne.
Les énigmes viennent de concours publics, d'où un risque de fuite que le classement signale lui-même. Scores bas, 39 % au mieux.
Scale AI, avec le Center for AI Safety et le MIT.
labs.scale.com/leaderboard/enigma_eval · tâche Raisonnement · 41 modèles mesurés
En tête : Claude Fable 5, 39,3 %
Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 47 %. Le meilleur, Claude Fable 5, atteint 39,3 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,67 %du score général. EnigmaEval porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.
En couleur, la tâche Raisonnement dans le score général. En noir, la part d'EnigmaEval.