À quoi il sert
Sur Quelle IA, ARC-AGI-2 sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 85.
RaisonnementFiche benchmark · ARC Prize Foundation · arcprize.org
Des puzzles de grilles plus durs que ceux d'ARC-AGI-1, où chaque règle combine plusieurs idées ; des humains ont résolu chacun d'eux.
Sur Quelle IA, ARC-AGI-2 sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 85.
Part de puzzles résolus sur le jeu semi-privé (120 tâches), avec deux essais par grille.
Conçu pour résister à la force brute, il est pourtant presque résolu en 2026 : 95 % pour le meilleur système, souvent à un coût élevé par puzzle.
ARC Prize Foundation.
arcprize.org/leaderboard · tâche Raisonnement · 80 modèles mesurés
En tête : GPT-6 Astra, 95 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 85. Le meilleur, GPT-6 Astra, atteint 95 %. Le seuil de saturation (95 %) est franchi : au sommet, les meilleurs modèles ne se départagent plus.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,67 %du score général. ARC-AGI-2 porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.
En couleur, la tâche Raisonnement dans le score général. En noir, la part d'ARC-AGI-2.