À quoi il sert
ARC (AI2 Reasoning Challenge) est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Test historiqueFiche benchmark · Allen Institute for AI · allenai.org
Des questions de sciences de niveau école et collège, à choix multiples, choisies pour résister à une simple recherche de mots-clés.
ARC (AI2 Reasoning Challenge) est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Part de bonnes réponses sur la partie difficile du jeu (Challenge) ; le hasard donne 25 %.
Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.
Test de 2018, saturé par les modèles récents. À ne pas confondre avec ARC-AGI, qui porte sur des puzzles de grilles.
Allen Institute for AI.
allenai.org/data/arc · test historique · 76 modèles mesurés
En tête : 2 modèles, 95,3 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 62 % a un score IA d'environ 2. 2 modèles partagent la première place avec 95,3 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. ARC (AI2 Reasoning Challenge) est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.