À quoi il sert
Sur Quelle IA, Chess Puzzles sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 95.
RaisonnementFiche benchmark · Epoch AI · epoch.ai
100 positions d'échecs inédites où il faut trouver le seul meilleur coup, celui que donne le moteur Stockfish.
Sur Quelle IA, Chess Puzzles sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 95.
Part de positions où le coup proposé est exactement le bon.
Pour le calcul, ce score est ramené entre 0 et 1 : 5 %, le niveau du hasard, vaut 0 et 100 % vaut 1.
Epoch le dit lui-même : bien jouer aux échecs a peu de portée pratique. Le test renseigne sur la planification et la lecture d'une position, rien de plus.
Epoch AI.
epoch.ai/benchmarks/chess-puzzles · tâche Raisonnement · 136 modèles mesurés
En tête : GPT-6 Astra, 72 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 52 % a un score IA d'environ 95. Le meilleur, GPT-6 Astra, atteint 72 %. Le benchmark sera dit saturé quand un modèle atteindra 95,2 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,67 %du score général. Chess Puzzles porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.
En couleur, la tâche Raisonnement dans le score général. En noir, la part de Chess Puzzles.