# ARC (AI2 Reasoning Challenge)

> Fiche du benchmark ARC (AI2 Reasoning Challenge) sur Quelle IA, édition du 28 septembre 2026. Des questions de sciences de niveau école et collège, à choix multiples, choisies pour résister à une simple recherche de mots-clés. En tête au 28 septembre 2026 : 2 modèles ex æquo (95,3 %). Notation, limites et classement des 76 modèles mesurés.

Page : https://quelleia.com/benchmarks/arc_ai2/
Source du benchmark : https://allenai.org/data/arc
Mainteneur : Allen Institute for AI
Tâche : Tests historiques
État : archivé

## À quoi il sert

ARC (AI2 Reasoning Challenge) est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

## Comment c'est noté

Part de bonnes réponses sur la partie difficile du jeu (Challenge) ; le hasard donne 25 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

## Ce qu'il ne dit pas

Test de 2018, saturé par les modèles récents. À ne pas confondre avec ARC-AGI, qui porte sur des puzzles de grilles.

## Qui le tient

Allen Institute for AI.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 62 % a un score IA d'environ 2. 2 modèles partagent la première place avec 95,3 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 90 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 96 %
- Score IA 100 (niveau de Claude Opus 5.5) : 98 %

## Son poids dans le score IA

0 % du score général. ARC (AI2 Reasoning Challenge) est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

## Classement (76 modèles mesurés · 134 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [DeepSeek-V3](https://quelleia.com/modeles/deepseek-v3.md) | DeepSeek | non précisée | 95,3 % | 72,2 | https://epoch.ai/benchmarks |
| 1 | [Llama 3.1-405B](https://quelleia.com/modeles/llama-3-1-405b.md) | Meta AI | non précisée | 95,3 % | 72,2 | https://epoch.ai/benchmarks |
| 3 | [Qwen2.5-72B](https://quelleia.com/modeles/qwen2-5-72b.md) | Alibaba | non précisée | 94,5 % | 67,8 | https://epoch.ai/benchmarks |
| 4 | [DeepSeek-V2 (MoE-236B, May 2024)](https://quelleia.com/modeles/deepseek-v2-moe-236b-may-2024.md) | DeepSeek | non précisée | 92,2 % | 57,8 | https://epoch.ai/benchmarks |
| 5 | [phi-3-medium 14B](https://quelleia.com/modeles/phi-3-medium-14b.md) | Microsoft | non précisée | 91,6 % | 55,7 | https://epoch.ai/benchmarks |
| 6 | [phi-3-small 7.4B](https://quelleia.com/modeles/phi-3-small-7-4b.md) | Microsoft | non précisée | 90,7 % | 52,7 | https://epoch.ai/benchmarks |
| 7 | [GPT-3.5 Turbo (Nov 2023)](https://quelleia.com/modeles/gpt-3-5-turbo-nov-2023.md) | OpenAI | non précisée | 87,4 % | 43,5 | https://epoch.ai/benchmarks |
| 8 | [Mixtral 8x7B](https://quelleia.com/modeles/mixtral-8x7b.md) | Mistral AI | non précisée | 87,3 % | 43,2 | https://epoch.ai/benchmarks |
| 9 | [Claude Instant](https://quelleia.com/modeles/claude-instant.md) | Anthropic | non précisée | 86,3 % | 40,8 | https://epoch.ai/benchmarks |
| 10 | [Stable Beluga 2](https://quelleia.com/modeles/stable-beluga-2.md) | Stability AI | non précisée | 86,1 % | 40,4 | https://epoch.ai/benchmarks |
| 11 | [davinci-002](https://quelleia.com/modeles/davinci-002.md) | OpenAI | non précisée | 85,2 % | 38,4 | https://epoch.ai/benchmarks |
| 11 | [PaLM (540B)](https://quelleia.com/modeles/palm-540b.md) | Google Research | non précisée | 85,2 % | 38,4 | https://epoch.ai/benchmarks |
| 13 | [phi-3-mini 3.8B](https://quelleia.com/modeles/phi-3-mini-3-8b.md) | Microsoft | non précisée | 84,9 % | 37,7 | https://epoch.ai/benchmarks |
| 14 | [Qwen-14B](https://quelleia.com/modeles/qwen-14b.md) | Alibaba | non précisée | 84,4 % | 36,7 | https://epoch.ai/benchmarks |
| 15 | [Llama 3-8B](https://quelleia.com/modeles/llama-3-8b.md) | Meta AI | non précisée | 82,8 % | 33,4 | https://epoch.ai/benchmarks |
| 16 | [internlm-20b](https://quelleia.com/modeles/internlm-20b.md) | Shanghai AI Laboratory | non précisée | 81,7 % | 31,3 | https://epoch.ai/benchmarks |
| 17 | [Mistral 7B v0.1](https://quelleia.com/modeles/mistral-7b-v0-1.md) | Mistral AI | non précisée | 78,6 % | 25,8 | https://epoch.ai/benchmarks |
| 18 | [Llama 2-70B](https://quelleia.com/modeles/llama-2-70b.md) | Meta AI | non précisée | 78,3 % | 25,3 | https://epoch.ai/benchmarks |
| 18 | [Gemma 7B](https://quelleia.com/modeles/gemma-7b.md) | Google DeepMind | non précisée | 78,3 % | 25,3 | https://epoch.ai/benchmarks |
| 20 | [Phi-2](https://quelleia.com/modeles/phi-2.md) | Microsoft | non précisée | 75,9 % | 21,4 | https://epoch.ai/benchmarks |
| 21 | [Qwen-7B](https://quelleia.com/modeles/qwen-7b.md) | Alibaba | non précisée | 75,3 % | 20,4 | https://epoch.ai/benchmarks |
| 22 | [Qwen2.5-Coder-32B](https://quelleia.com/modeles/qwen2-5-coder-32b.md) | Alibaba | non précisée | 70,5 % | 13,2 | https://epoch.ai/benchmarks |
| 23 | [LLaMA-65B](https://quelleia.com/modeles/llama-65b.md) | Meta AI | non précisée | 69,5 % | 11,8 | https://epoch.ai/benchmarks |
| 23 | [internlm-7b](https://quelleia.com/modeles/internlm-7b.md) | Shanghai AI Laboratory | non précisée | 69,5 % | 11,8 | https://epoch.ai/benchmarks |
| 25 | [PaLM 2-L](https://quelleia.com/modeles/palm-2-l.md) | Google DeepMind | non précisée | 69,2 % | 11,3 | https://epoch.ai/benchmarks |
| 26 | [Falcon-180B](https://quelleia.com/modeles/falcon-180b.md) | Technology Innovation Institute | non précisée | 67,8 % | 9,3 | https://epoch.ai/benchmarks |
| 27 | [LLaMA-33B](https://quelleia.com/modeles/llama-33b.md) | Meta AI | non précisée | 67,5 % | 8,9 | https://epoch.ai/benchmarks |
| 28 | [Qwen2.5-Coder-14B](https://quelleia.com/modeles/qwen2-5-coder-14b.md) | Alibaba | non précisée | 66 % | 6,8 | https://epoch.ai/benchmarks |
| 29 | [PaLM 2-M](https://quelleia.com/modeles/palm-2-m.md) | Google DeepMind | non précisée | 64,9 % | 5,3 | https://epoch.ai/benchmarks |
| 30 | [DeepSeek-Coder-V2 236B](https://quelleia.com/modeles/deepseek-coder-v2-236b.md) | DeepSeek | non précisée | 64,3 % | 4,5 | https://epoch.ai/benchmarks |
| 31 | [Falcon-40B](https://quelleia.com/modeles/falcon-40b.md) | Technology Innovation Institute | non précisée | 61,9 % | 1,1 | https://epoch.ai/benchmarks |
| 32 | [chatglm2-6b](https://quelleia.com/modeles/chatglm2-6b.md) | Z.ai (Zhipu AI) | non précisée | 61 % | -0,1 | https://epoch.ai/benchmarks |
| 33 | [Qwen2.5-Coder (7B)](https://quelleia.com/modeles/qwen2-5-coder-7b.md) | Alibaba | non précisée | 60,9 % | -0,3 | https://epoch.ai/benchmarks |
| 34 | [Llama 2-13B](https://quelleia.com/modeles/llama-2-13b.md) | Meta AI | non précisée | 60,3 % | -1,1 | https://epoch.ai/benchmarks |
| 35 | [PaLM 2-S](https://quelleia.com/modeles/palm-2-s.md) | Google DeepMind | non précisée | 59,6 % | -2,1 | https://epoch.ai/benchmarks |
| 36 | [DeepSeek-Coder-V2-Lite-Base](https://quelleia.com/modeles/deepseek-coder-v2-lite-base.md) | DeepSeek | non précisée | 57,3 % | -5,3 | https://epoch.ai/benchmarks |
| 37 | [Yi-9B](https://quelleia.com/modeles/yi-9b.md) | 01.AI | non précisée | 55,6 % | -7,7 | https://epoch.ai/benchmarks |
| 38 | [Nemotron-4 15B](https://quelleia.com/modeles/nemotron-4-15b.md) | NVIDIA | non précisée | 55,5 % | -7,8 | https://epoch.ai/benchmarks |
| 39 | [INTELLECT-1](https://quelleia.com/modeles/intellect-1.md) | Prime Intellect | non précisée | 54,5 % | -9,3 | https://epoch.ai/benchmarks |
| 40 | [Llama 2-34B](https://quelleia.com/modeles/llama-2-34b.md) | Meta AI | non précisée | 54,5 % | -9,3 | https://epoch.ai/benchmarks |
| 41 | [InstructGPT 175B](https://quelleia.com/modeles/instructgpt-175b.md) | OpenAI | non précisée | 53,2 % | -11,2 | https://epoch.ai/benchmarks |
| 41 | [Qwen-1_8B](https://quelleia.com/modeles/qwen-1-8b.md) | Alibaba | non précisée | 53,2 % | -11,2 | https://epoch.ai/benchmarks |
| 43 | [Qwen2.5-Coder-3B](https://quelleia.com/modeles/qwen2-5-coder-3b.md) | Alibaba | non précisée | 52,9 % | -11,6 | https://epoch.ai/benchmarks |
| 44 | [LLaMA-13B](https://quelleia.com/modeles/llama-13b.md) | Meta AI | non précisée | 52,7 % | -11,9 | https://epoch.ai/benchmarks |
| 45 | [PaLM 62B](https://quelleia.com/modeles/palm-62b.md) | Google DeepMind | non précisée | 52,5 % | -12,2 | https://epoch.ai/benchmarks |
| 46 | [MPT-30B](https://quelleia.com/modeles/mpt-30b.md) | MosaicML | non précisée | 50,6 % | -15,1 | https://epoch.ai/benchmarks |
| 47 | [Yi 6B](https://quelleia.com/modeles/yi-6b.md) | 01.AI | non précisée | 50,3 % | -15,6 | https://epoch.ai/benchmarks |
| 48 | [Falcon-7B](https://quelleia.com/modeles/falcon-7b.md) | Technology Innovation Institute | non précisée | 47,9 % | -19,4 | https://epoch.ai/benchmarks |
| 49 | [LLaMA-7B](https://quelleia.com/modeles/llama-7b.md) | Meta AI | non précisée | 47,6 % | -19,9 | https://epoch.ai/benchmarks |
| 50 | [StarCoder 2 15B](https://quelleia.com/modeles/starcoder-2-15b.md) | Hugging Face | non précisée | 47,2 % | -20,5 | https://epoch.ai/benchmarks |
| 51 | [Llama 2-7B](https://quelleia.com/modeles/llama-2-7b.md) | Meta AI | non précisée | 45,9 % | -22,7 | https://epoch.ai/benchmarks |
| 52 | [Qwen2.5-Coder (1.5B)](https://quelleia.com/modeles/qwen2-5-coder-1-5b.md) | Alibaba | non précisée | 45,2 % | -23,9 | https://epoch.ai/benchmarks |
| 53 | [Phi-1.5](https://quelleia.com/modeles/phi-1-5.md) | Microsoft | non précisée | 44,4 % | -25,4 | https://epoch.ai/benchmarks |
| 54 | [vicuna-13b-v1.1](https://quelleia.com/modeles/vicuna-13b-v1-1.md) |  | non précisée | 43,2 % | -27,6 | https://epoch.ai/benchmarks |
| 55 | [MPT-7B](https://quelleia.com/modeles/mpt-7b.md) | MosaicML | non précisée | 42,6 % | -28,7 | https://epoch.ai/benchmarks |
| 56 | [DeepSeek Coder 33B](https://quelleia.com/modeles/deepseek-coder-33b.md) | DeepSeek | non précisée | 42,2 % | -29,5 | https://epoch.ai/benchmarks |
| 57 | [Gemma 2B](https://quelleia.com/modeles/gemma-2b.md) | Google DeepMind | non précisée | 42,1 % | -29,7 | https://epoch.ai/benchmarks |
| 58 | [XGen-7B](https://quelleia.com/modeles/xgen-7b.md) | Salesforce | non précisée | 41,2 % | -31,5 | https://epoch.ai/benchmarks |
| 59 | [GPT-NeoX-20B](https://quelleia.com/modeles/gpt-neox-20b.md) | EleutherAI | non précisée | 41,1 % | -31,7 | https://epoch.ai/benchmarks |
| 60 | [Dolly 2.0-12b](https://quelleia.com/modeles/dolly-2-0-12b.md) | Databricks | non précisée | 39,6 % | -34,9 | https://epoch.ai/benchmarks |
| 61 | [RedPajama-INCITE-7B-Base](https://quelleia.com/modeles/redpajama-incite-7b-base.md) |  | non précisée | 39,1 % | -36,0 | https://epoch.ai/benchmarks |
| 62 | [StarCoder 2 7B](https://quelleia.com/modeles/starcoder-2-7b.md) | Hugging Face | non précisée | 38,7 % | -36,9 | https://epoch.ai/benchmarks |
| 62 | [open_llama_7b](https://quelleia.com/modeles/open-llama-7b.md) |  | non précisée | 38,7 % | -36,9 | https://epoch.ai/benchmarks |
| 64 | [Baichuan2-13B](https://quelleia.com/modeles/baichuan2-13b.md) | Baichuan | non précisée | 38 % | -38,6 | https://epoch.ai/benchmarks |
| 65 | [DeepSeek Coder 6.7B](https://quelleia.com/modeles/deepseek-coder-6-7b.md) | DeepSeek | non précisée | 36,4 % | -42,6 | https://epoch.ai/benchmarks |
| 66 | [GPT-J-6B](https://quelleia.com/modeles/gpt-j-6b.md) | EleutherAI | non précisée | 36,3 % | -42,9 | https://epoch.ai/benchmarks |
| 67 | [opt-13b](https://quelleia.com/modeles/opt-13b.md) | Meta AI | non précisée | 35,8 % | -44,3 | https://epoch.ai/benchmarks |
| 68 | [CodeQwen1.5-7B](https://quelleia.com/modeles/codeqwen1-5-7b.md) | Alibaba | non précisée | 35,7 % | -44,6 | https://epoch.ai/benchmarks |
| 69 | [Qwen2.5-Coder-0.5B](https://quelleia.com/modeles/qwen2-5-coder-0-5b.md) | Alibaba | non précisée | 34,4 % | -48,5 | https://epoch.ai/benchmarks |
| 70 | [StarCoder 2 3B](https://quelleia.com/modeles/starcoder-2-3b.md) | Hugging Face | non précisée | 34,2 % | -49,1 | https://epoch.ai/benchmarks |
| 71 | [Baichuan 2-7B](https://quelleia.com/modeles/baichuan-2-7b.md) | Baichuan | non précisée | 32,5 % | -55,1 | https://epoch.ai/benchmarks |
| 72 | [Cerebras-GPT-13B](https://quelleia.com/modeles/cerebras-gpt-13b.md) | Cerebras Systems | non précisée | 32,4 % | -55,4 | https://epoch.ai/benchmarks |
| 73 | [stablelm-tuned-alpha-7b](https://quelleia.com/modeles/stablelm-tuned-alpha-7b.md) | Stability AI | non précisée | 27 % | -91,4 | https://epoch.ai/benchmarks |
| 74 | [DeepSeek Coder 1.3B](https://quelleia.com/modeles/deepseek-coder-1-3b.md) | DeepSeek | non précisée | 25,4 % | -117,3 | https://epoch.ai/benchmarks |
| 75 | [GPT-2 (1.5B)](https://quelleia.com/modeles/gpt-2-1-5b.md) | OpenAI | non précisée | 25 % | -117,3 | https://epoch.ai/benchmarks |
| 76 | [OPT-1.3B](https://quelleia.com/modeles/opt-1-3b.md) | Meta AI | non précisée | 23,2 % | -117,3 | https://epoch.ai/benchmarks |

## En bref

**Que mesure ARC (AI2 Reasoning Challenge) ?** Des questions de sciences de niveau école et collège, à choix multiples, choisies pour résister à une simple recherche de mots-clés. C'est un test historique, hors des scores d'aujourd'hui.

**Comment ARC (AI2 Reasoning Challenge) est-il noté ?** Part de bonnes réponses sur la partie difficile du jeu (Challenge) ; le hasard donne 25 %. Un modèle qui obtient 62 % a un score IA d'environ 2.

**Qui est en tête sur ARC (AI2 Reasoning Challenge) ?** DeepSeek-V3 et Llama 3.1-405B sont en tête d'ARC (AI2 Reasoning Challenge) avec 95,3 %, dans l'édition du 28 septembre 2026. Suivent Qwen2.5-72B (94,5 %) et DeepSeek-V2 (MoE-236B, May 2024) (92,2 %). 76 modèles y sont mesurés.

**Quelles sont les limites d'ARC (AI2 Reasoning Challenge) ?** Test de 2018, saturé par les modèles récents. À ne pas confondre avec ARC-AGI, qui porte sur des puzzles de grilles. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse ARC (AI2 Reasoning Challenge) dans le score IA ?** ARC (AI2 Reasoning Challenge) compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

**Qui maintient ARC (AI2 Reasoning Challenge) ?** Allen Institute for AI. Sa page de référence : allenai.org/data/arc.

## Les autres tests historiques

- [MMLU](https://quelleia.com/benchmarks/mmlu.md) : 127 modèles · hors score, archivé
- [WinoGrande](https://quelleia.com/benchmarks/winogrande.md) : 77 modèles · hors score, archivé
- [BoolQ](https://quelleia.com/benchmarks/boolq.md) : 76 modèles · hors score, archivé
- [HellaSwag](https://quelleia.com/benchmarks/hellaswag.md) : 75 modèles · hors score, archivé
- [PIQA](https://quelleia.com/benchmarks/piqa.md) : 59 modèles · hors score, archivé
- [LiveBench](https://quelleia.com/benchmarks/livebench.md) : 48 modèles · hors score, archivé
- [BIG-Bench Hard (BBH)](https://quelleia.com/benchmarks/bbh.md) : 45 modèles · hors score, archivé
- [OpenBookQA](https://quelleia.com/benchmarks/openbookqa.md) : 42 modèles · hors score, archivé
- [TriviaQA](https://quelleia.com/benchmarks/triviaqa.md) : 38 modèles · hors score, archivé
- [LAMBADA](https://quelleia.com/benchmarks/lambada.md) : 26 modèles · hors score, archivé
- [ScienceQA](https://quelleia.com/benchmarks/scienceqa.md) : 23 modèles · hors score, archivé
- [ANLI (Adversarial NLI)](https://quelleia.com/benchmarks/anli.md) : 11 modèles · hors score, archivé
- [SuperGLUE](https://quelleia.com/benchmarks/superglue.md) : 8 modèles · hors score, archivé
- [CommonsenseQA 2.0](https://quelleia.com/benchmarks/csqa2.md) : 6 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
