Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

Test historiqueFiche benchmark · Allen Institute for AI · allenai.org

ARC (AI2 Reasoning Challenge)

Des questions de sciences de niveau école et collège, à choix multiples, choisies pour résister à une simple recherche de mots-clés.

ARCHIVÉ

À quoi il sert

ARC (AI2 Reasoning Challenge) est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

Comment c'est noté

Part de bonnes réponses sur la partie difficile du jeu (Challenge) ; le hasard donne 25 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

Ce qu'il ne dit pas

Test de 2018, saturé par les modèles récents. À ne pas confondre avec ARC-AGI, qui porte sur des puzzles de grilles.

Comment lire le score

76 modèles mesurés · 134 mesures

En tête : 2 modèles, 95,3 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 62 % a un score IA d'environ 2. 2 modèles partagent la première place avec 95,3 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
90 %
Score IA 76niveau de Claude Sonnet 4.5
96 %
Score IA 100niveau de Claude Opus 5.5
98 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. ARC (AI2 Reasoning Challenge) est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1DeepSeek-V3DeepSeek · poids ouvertsNon précisée95,3 %72,2
1Llama 3.1-405BMeta AI · poids ouvertsNon précisée95,3 %72,2
3Qwen2.5-72BAlibaba · poids ouvertsNon précisée94,5 %67,8
4DeepSeek-V2 (MoE-236B, May 2024)DeepSeek · poids ouvertsNon précisée92,2 %57,8
5phi-3-medium 14BMicrosoft · poids ouvertsNon précisée91,6 %55,7
6phi-3-small 7.4BMicrosoft · poids ouvertsNon précisée90,7 %52,7
7GPT-3.5 Turbo (Nov 2023)OpenAINon précisée87,4 %43,5
8Mixtral 8x7BMistral AI · poids ouverts · 2 configurationsNon précisée87,3 %43,2
9Claude InstantAnthropic · 2 configurationsNon précisée86,3 %40,8
10Stable Beluga 2Stability AI · poids ouvertsNon précisée86,1 %40,4
76 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 76 →Replier le classement ↑
11davinci-002OpenAINon précisée85,2 %38,4
11PaLM (540B)Google Research · 5 configurationsNon précisée85,2 %38,4
13phi-3-mini 3.8BMicrosoft · poids ouvertsNon précisée84,9 %37,7
14Qwen-14BAlibaba · poids ouverts · 2 configurationsNon précisée84,4 %36,7
15Llama 3-8BMeta AI · poids ouvertsNon précisée82,8 %33,4
16internlm-20bShanghai AI LaboratoryNon précisée81,7 %31,3
17Mistral 7B v0.1Mistral AI · poids ouverts · 4 configurationsNon précisée78,6 %25,8
18Llama 2-70BMeta AI · poids ouverts · 4 configurationsNon précisée78,3 %25,3
18Gemma 7BGoogle DeepMind · poids ouverts · 3 configurationsNon précisée78,3 %25,3
20Phi-2Microsoft · poids ouvertsNon précisée75,9 %21,4
21Qwen-7BAlibaba · poids ouvertsNon précisée75,3 %20,4
22Qwen2.5-Coder-32BAlibaba · poids ouvertsNon précisée70,5 %13,2
23LLaMA-65BMeta AI · poids ouverts · 3 configurationsNon précisée69,5 %11,8
23internlm-7bShanghai AI LaboratoryNon précisée69,5 %11,8
25PaLM 2-LGoogle DeepMind · 2 configurationsNon précisée69,2 %11,3
26Falcon-180BTechnology Innovation Institute · poids ouverts · 2 configurationsNon précisée67,8 %9,3
27LLaMA-33BMeta AI · poids ouverts · 4 configurationsNon précisée67,5 %8,9
28Qwen2.5-Coder-14BAlibabaNon précisée66 %6,8
29PaLM 2-MGoogle DeepMind · 2 configurationsNon précisée64,9 %5,3
30DeepSeek-Coder-V2 236BDeepSeek · poids ouvertsNon précisée64,3 %4,5
31Falcon-40BTechnology Innovation Institute · poids ouverts · 4 configurationsNon précisée61,9 %1,1
32chatglm2-6bZ.ai (Zhipu AI)Non précisée61 %-0,1
33Qwen2.5-Coder (7B)Alibaba · poids ouvertsNon précisée60,9 %-0,3
34Llama 2-13BMeta AI · poids ouverts · 6 configurationsNon précisée60,3 %-1,1
35PaLM 2-SGoogle DeepMind · 2 configurationsNon précisée59,6 %-2,1
36DeepSeek-Coder-V2-Lite-BaseDeepSeekNon précisée57,3 %-5,3
37Yi-9B01.AINon précisée55,6 %-7,7
38Nemotron-4 15BNVIDIANon précisée55,5 %-7,8
39INTELLECT-1Prime IntellectNon précisée54,5 %-9,3
40Llama 2-34BMeta AI · 3 configurationsNon précisée54,5 %-9,3
41InstructGPT 175BOpenAI · 5 configurationsNon précisée53,2 %-11,2
41Qwen-1_8BAlibabaNon précisée53,2 %-11,2
43Qwen2.5-Coder-3BAlibabaNon précisée52,9 %-11,6
44LLaMA-13BMeta AI · poids ouverts · 3 configurationsNon précisée52,7 %-11,9
45PaLM 62BGoogle DeepMindNon précisée52,5 %-12,2
46MPT-30BMosaicML · poids ouvertsNon précisée50,6 %-15,1
47Yi 6B01.AI · poids ouvertsNon précisée50,3 %-15,6
48Falcon-7BTechnology Innovation Institute · poids ouverts · 7 configurationsNon précisée47,9 %-19,4
49LLaMA-7BMeta AI · poids ouverts · 5 configurationsNon précisée47,6 %-19,9
50StarCoder 2 15BHugging Face · poids ouvertsNon précisée47,2 %-20,5
51Llama 2-7BMeta AI · poids ouverts · 6 configurationsNon précisée45,9 %-22,7
52Qwen2.5-Coder (1.5B)Alibaba · poids ouvertsNon précisée45,2 %-23,9
53Phi-1.5Microsoft · poids ouvertsNon précisée44,4 %-25,4
54vicuna-13b-v1.1Non précisée43,2 %-27,6
55MPT-7BMosaicML · poids ouverts · 4 configurationsNon précisée42,6 %-28,7
56DeepSeek Coder 33BDeepSeek · poids ouvertsNon précisée42,2 %-29,5
57Gemma 2BGoogle DeepMind · poids ouvertsNon précisée42,1 %-29,7
58XGen-7BSalesforce · poids ouvertsNon précisée41,2 %-31,5
59GPT-NeoX-20BEleutherAI · poids ouvertsNon précisée41,1 %-31,7
60Dolly 2.0-12bDatabricks · poids ouvertsNon précisée39,6 %-34,9
61RedPajama-INCITE-7B-BaseNon précisée39,1 %-36,0
62StarCoder 2 7BHugging Face · poids ouvertsNon précisée38,7 %-36,9
62open_llama_7bNon précisée38,7 %-36,9
64Baichuan2-13BBaichuan · poids ouvertsNon précisée38 %-38,6
65DeepSeek Coder 6.7BDeepSeek · poids ouvertsNon précisée36,4 %-42,6
66GPT-J-6BEleutherAI · poids ouvertsNon précisée36,3 %-42,9
67opt-13bMeta AINon précisée35,8 %-44,3
68CodeQwen1.5-7BAlibabaNon précisée35,7 %-44,6
69Qwen2.5-Coder-0.5BAlibaba · poids ouvertsNon précisée34,4 %-48,5
70StarCoder 2 3BHugging Face · poids ouvertsNon précisée34,2 %-49,1
71Baichuan 2-7BBaichuan · poids ouvertsNon précisée32,5 %-55,1
72Cerebras-GPT-13BCerebras Systems · poids ouvertsNon précisée32,4 %-55,4
73stablelm-tuned-alpha-7bStability AINon précisée27 %-91,4
74DeepSeek Coder 1.3BDeepSeek · poids ouvertsNon précisée25,4 %-117,3
75GPT-2 (1.5B)OpenAI · poids ouvertsNon précisée25 %-117,3
76OPT-1.3BMeta AI · poids ouvertsNon précisée23,2 %-117,3

En bref

Que mesure ARC (AI2 Reasoning Challenge) ?
Des questions de sciences de niveau école et collège, à choix multiples, choisies pour résister à une simple recherche de mots-clés. C'est un test historique, hors des scores d'aujourd'hui.
Comment ARC (AI2 Reasoning Challenge) est-il noté ?
Part de bonnes réponses sur la partie difficile du jeu (Challenge) ; le hasard donne 25 %. Un modèle qui obtient 62 % a un score IA d'environ 2.
Qui est en tête sur ARC (AI2 Reasoning Challenge) ?
DeepSeek-V3 et Llama 3.1-405B sont en tête d'ARC (AI2 Reasoning Challenge) avec 95,3 %, dans l'édition du 28 septembre 2026. Suivent Qwen2.5-72B (94,5 %) et DeepSeek-V2 (MoE-236B, May 2024) (92,2 %). 76 modèles y sont mesurés.
Quelles sont les limites d'ARC (AI2 Reasoning Challenge) ?
Test de 2018, saturé par les modèles récents. À ne pas confondre avec ARC-AGI, qui porte sur des puzzles de grilles. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse ARC (AI2 Reasoning Challenge) dans le score IA ?
ARC (AI2 Reasoning Challenge) compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.
Qui maintient ARC (AI2 Reasoning Challenge) ?
Allen Institute for AI. Sa page de référence : allenai.org/data/arc.

Les autres tests historiques

Tous les benchmarks →Comment le score IA est calculé →