À quoi il sert
Sur Quelle IA, ARC-AGI-1 sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 74.
RaisonnementFiche benchmark · ARC Prize Foundation (test créé par François Chollet en 2019) · arcprize.org
Des puzzles de grilles colorées : déduire une règle à partir de quelques exemples et l'appliquer à une nouvelle grille.
Sur Quelle IA, ARC-AGI-1 sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 74.
Part de puzzles résolus exactement sur le jeu semi-privé de l'ARC Prize (100 tâches).
Facile pour un humain et désormais presque résolu : les meilleurs systèmes dépassent 95 %, parfois au prix de dizaines de dollars par puzzle.
ARC Prize Foundation (test créé par François Chollet en 2019).
arcprize.org/arc-agi/1 · tâche Raisonnement · 82 modèles mesurés
En tête : 2 modèles, 98,5 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 74. 2 modèles partagent la première place avec 98,5 %. Le seuil de saturation (95 %) est franchi : au sommet, les meilleurs modèles ne se départagent plus.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,67 %du score général. ARC-AGI-1 porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.
En couleur, la tâche Raisonnement dans le score général. En noir, la part d'ARC-AGI-1.