À quoi il sert
Sur Quelle IA, SimpleBench sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 82.
RaisonnementFiche benchmark · Équipe SimpleBench (chaîne YouTube AI Explained) · simple-bench.com
213 questions pièges de bon sens, sur l'espace, le temps et les relations sociales, qu'un adulte réussit dans 84 % des cas.
Sur Quelle IA, SimpleBench sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 82.
Part de bonnes réponses à six choix, en moyenne sur cinq passages ; le hasard donne 17 %.
Pour le calcul, ce score est ramené entre 0 et 1 : 17 %, le niveau du hasard, vaut 0 et 100 % vaut 1.
L'essentiel des questions est privé, ce qui limite les fuites mais interdit toute vérification. Les meilleurs modèles rejoignent le niveau humain mesuré.
Équipe SimpleBench (chaîne YouTube AI Explained).
simple-bench.com · tâche Raisonnement · 82 modèles mesurés
En tête : Claude Fable 5, 81,9 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 58 % a un score IA d'environ 82. Le meilleur, Claude Fable 5, atteint 81,9 %. Le benchmark sera dit saturé quand un modèle atteindra 95,8 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,67 %du score général. SimpleBench porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.
En couleur, la tâche Raisonnement dans le score général. En noir, la part de SimpleBench.