# ARC-AGI-1

> Fiche du benchmark ARC-AGI-1 sur Quelle IA, édition du 28 septembre 2026. Des puzzles de grilles colorées : déduire une règle à partir de quelques exemples et l'appliquer à une nouvelle grille. En tête au 28 septembre 2026 : 2 modèles ex æquo (98,5 %). Notation, limites et classement des 82 modèles mesurés.

Page : https://quelleia.com/benchmarks/arc_agi/
Source du benchmark : https://arcprize.org/arc-agi/1/
Mainteneur : ARC Prize Foundation (test créé par François Chollet en 2019)
Tâche : Raisonnement
État : saturé

## À quoi il sert

Sur Quelle IA, ARC-AGI-1 sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 74.

## Comment c'est noté

Part de puzzles résolus exactement sur le jeu semi-privé de l'ARC Prize (100 tâches).

## Ce qu'il ne dit pas

Facile pour un humain et désormais presque résolu : les meilleurs systèmes dépassent 95 %, parfois au prix de dizaines de dollars par puzzle.

## Qui le tient

ARC Prize Foundation (test créé par François Chollet en 2019).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 74. 2 modèles partagent la première place avec 98,5 %. Le seuil de saturation (95 %) est franchi : au sommet, les meilleurs modèles ne se départagent plus.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 2 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 60 %
- Score IA 100 (niveau de Claude Opus 5.5) : 99 %

## Son poids dans le score IA

1,67 % du score général. ARC-AGI-1 porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.

## Classement (82 modèles mesurés · 246 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | Élevée | 98,5 % | 98,6 | https://arcprize.org/leaderboard |
| 1 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Maximale | 98,5 % | 98,6 | https://arcprize.org/leaderboard |
| 3 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 98 % | 96,9 | https://epoch.ai/benchmarks |
| 4 | [Claude Opus 5.5](https://quelleia.com/modeles/claude-opus-5-5.md) | Anthropic | Maximale | 97,5 % | 95,5 | https://arcprize.org/leaderboard |
| 4 | [Claude Fable 5.1](https://quelleia.com/modeles/claude-fable-5-1.md) | Anthropic | Maximale | 97,5 % | 95,5 | https://arcprize.org/leaderboard |
| 4 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | Élevée | 97,5 % | 95,5 | https://arcprize.org/leaderboard |
| 4 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 97,5 % | 95,5 | https://arcprize.org/leaderboard |
| 8 | [GPT-5.5 Pro](https://quelleia.com/modeles/gpt-5-5-pro.md) | OpenAI | Élevée | 96,5 % | 93,5 | https://arcprize.org/leaderboard |
| 8 | [GPT-5.6 Terra](https://quelleia.com/modeles/gpt-5-6-terra.md) | OpenAI | Maximale | 96,5 % | 93,5 | https://arcprize.org/leaderboard |
| 10 | [Gemini 3 Deep Think](https://quelleia.com/modeles/gemini-3-deep-think.md) | Google DeepMind | non précisée | 96 % | 92,7 | https://arcprize.org/leaderboard |
| 11 | [Gemini 3.7 Flash](https://quelleia.com/modeles/gemini-3-7-flash.md) | Google DeepMind | Élevée | 95,5 % | 92,0 | https://arcprize.org/leaderboard |
| 12 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Maximale | 95 % | 91,3 | https://arcprize.org/leaderboard |
| 13 | [GPT-5.4 Pro](https://quelleia.com/modeles/gpt-5-4-pro.md) | OpenAI | Maximale | 94,5 % | 90,7 | https://epoch.ai/benchmarks |
| 13 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | Maximale | 94,5 % | 90,7 | https://arcprize.org/leaderboard |
| 15 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | Budget | 94 % | 90,2 | https://arcprize.org/leaderboard |
| 16 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Maximale | 93,7 % | 89,8 | https://epoch.ai/benchmarks |
| 17 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | Élevée | 93,5 % | 89,7 | https://arcprize.org/leaderboard |
| 18 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Maximale | 92,5 % | 88,8 | https://arcprize.org/leaderboard |
| 18 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | Élevée | 92,5 % | 88,8 | https://arcprize.org/leaderboard |
| 20 | [Gemini 3.6 Flash](https://quelleia.com/modeles/gemini-3-6-flash.md) | Google DeepMind | Élevée | 91,2 % | 87,7 | https://arcprize.org/leaderboard |
| 21 | [GPT-5.2 Pro](https://quelleia.com/modeles/gpt-5-2-pro.md) | OpenAI | Maximale | 90,5 % | 87,3 | https://arcprize.org/leaderboard |
| 21 | [DeepSeek V4 Pro 0813](https://quelleia.com/modeles/deepseek-v4-pro-0813.md) | DeepSeek | Faible | 90,5 % | 87,3 | https://arcprize.org/leaderboard |
| 23 | [Grok 4.20](https://quelleia.com/modeles/grok-4-20.md) | xAI | non précisée | 89,5 % | 86,6 | https://arcprize.org/leaderboard |
| 24 | [DeepSeek V4 Flash 0731](https://quelleia.com/modeles/deepseek-v4-flash-0731.md) | DeepSeek | Maximale | 89 % | 86,3 | https://arcprize.org/leaderboard |
| 25 | [GPT-5.6 Luna](https://quelleia.com/modeles/gpt-5-6-luna.md) | OpenAI | Maximale | 88 % | 85,7 | https://arcprize.org/leaderboard |
| 26 | [Grok 4.6](https://quelleia.com/modeles/grok-4-6.md) | xAI | Moyenne | 87,5 % | 85,4 | https://arcprize.org/leaderboard |
| 27 | [Grok 4.5](https://quelleia.com/modeles/grok-4-5.md) | xAI | Moyenne | 87,2 % | 85,3 | https://arcprize.org/leaderboard |
| 28 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | Élevée | 86,5 % | 84,9 | https://epoch.ai/benchmarks |
| 29 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | Maximale | 86,2 % | 84,8 | https://epoch.ai/benchmarks |
| 30 | [Gemini 3 Flash](https://quelleia.com/modeles/gemini-3-flash.md) | Google DeepMind | non précisée | 84,7 % | 84,0 | https://epoch.ai/benchmarks |
| 31 | [Inkling-Small](https://quelleia.com/modeles/inkling-small.md) | Thinking Machines | Maximale | 84 % | 83,7 | https://arcprize.org/leaderboard |
| 32 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | Budget | 80 % | 82,1 | https://arcprize.org/leaderboard |
| 33 | [Inkling](https://quelleia.com/modeles/inkling.md) | Thinking Machines | non précisée | 79,5 % | 82,0 | https://arcprize.org/leaderboard |
| 34 | [GLM-5.2](https://quelleia.com/modeles/glm-5-2.md) | Z.ai (Zhipu AI) | non précisée | 77 % | 81,1 | https://arcprize.org/leaderboard |
| 35 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | non précisée | 75 % | 80,4 | https://epoch.ai/benchmarks |
| 36 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | Élevée | 72,8 % | 79,8 | https://arcprize.org/leaderboard |
| 37 | [GPT-5 Pro](https://quelleia.com/modeles/gpt-5-pro.md) | OpenAI | Élevée | 70,2 % | 79,0 | https://epoch.ai/benchmarks |
| 38 | [Grok 4](https://quelleia.com/modeles/grok-4.md) | xAI | non précisée | 66,7 % | 78,1 | https://epoch.ai/benchmarks |
| 39 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Élevée | 65,7 % | 77,8 | https://arcprize.org/leaderboard |
| 40 | [Kimi K2.5](https://quelleia.com/modeles/kimi-k2-5.md) | Moonshot | non précisée | 65,3 % | 77,7 | https://epoch.ai/benchmarks |
| 41 | [GPT-5.4 Mini](https://quelleia.com/modeles/gpt-5-4-mini.md) | OpenAI | Maximale | 63,7 % | 77,3 | https://arcprize.org/leaderboard |
| 41 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | Budget | 63,7 % | 77,3 | https://epoch.ai/benchmarks |
| 41 | [MiniMax-M2.5](https://quelleia.com/modeles/minimax-m2-5.md) | MiniMax | non précisée | 63,7 % | 77,3 | https://epoch.ai/benchmarks |
| 44 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Élevée | 60,8 % | 76,6 | https://arcprize.org/leaderboard |
| 45 | [o3-pro](https://quelleia.com/modeles/o3-pro.md) | OpenAI | Élevée | 59,3 % | 76,2 | https://arcprize.org/leaderboard |
| 46 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Élevée | 58,7 % | 76,0 | https://arcprize.org/leaderboard |
| 47 | [DeepSeek-V3.2](https://quelleia.com/modeles/deepseek-v3-2.md) | DeepSeek | non précisée | 57 % | 75,6 | https://epoch.ai/benchmarks |
| 48 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | Élevée | 54,3 % | 75,0 | https://epoch.ai/benchmarks |
| 49 | [Gemini 3.5 Flash-Lite](https://quelleia.com/modeles/gemini-3-5-flash-lite.md) | Google DeepMind | Élevée | 53,5 % | 74,8 | https://arcprize.org/leaderboard |
| 50 | [GPT-5.4 Nano](https://quelleia.com/modeles/gpt-5-4-nano.md) | OpenAI | Maximale | 51,5 % | 74,3 | https://arcprize.org/leaderboard |
| 51 | [Grok 4 Fast](https://quelleia.com/modeles/grok-4-fast.md) | xAI | non précisée | 48,5 % | 73,6 | https://epoch.ai/benchmarks |
| 52 | [Claude Haiku 4.5](https://quelleia.com/modeles/claude-haiku-4-5.md) | Anthropic | Budget | 47,7 % | 73,4 | https://epoch.ai/benchmarks |
| 53 | [GLM-5](https://quelleia.com/modeles/glm-5.md) | Z.ai (Zhipu AI) | non précisée | 44,7 % | 72,7 | https://epoch.ai/benchmarks |
| 54 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | Budget | 41 % | 71,8 | https://epoch.ai/benchmarks |
| 55 | [tiny-recursion-model](https://quelleia.com/modeles/tiny-recursion-model.md) |  | non précisée | 40 % | 71,6 | https://epoch.ai/benchmarks |
| 55 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | Budget | 40 % | 71,6 | https://epoch.ai/benchmarks |
| 57 | [Claude Opus 4](https://quelleia.com/modeles/claude-opus-4.md) | Anthropic | Budget | 35,7 % | 70,5 | https://arcprize.org/leaderboard |
| 58 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Élevée | 34,5 % | 70,2 | https://epoch.ai/benchmarks |
| 59 | [Gemini 2.5 Flash (May 2025)](https://quelleia.com/modeles/gemini-2-5-flash-may-2025.md) | Google DeepMind | non précisée | 33,3 % | 69,9 | https://arcprize.org/leaderboard |
| 60 | [Gemini 2.5 Pro (Mar 2025)](https://quelleia.com/modeles/gemini-2-5-pro-mar-2025.md) | Google DeepMind | non précisée | 33 % | 69,8 | https://epoch.ai/benchmarks |
| 61 | [Gemini 2.5 Flash (Apr 2025)](https://quelleia.com/modeles/gemini-2-5-flash-apr-2025.md) | Google DeepMind | non précisée | 32,3 % | 69,6 | https://epoch.ai/benchmarks |
| 62 | [o1](https://quelleia.com/modeles/o1.md) | OpenAI | Moyenne | 30,7 % | 69,2 | https://epoch.ai/benchmarks |
| 63 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | Budget | 28,6 % | 68,6 | https://epoch.ai/benchmarks |
| 64 | [codex-mini-2025-05-16](https://quelleia.com/modeles/codex-mini-2025-05-16.md) | OpenAI | non précisée | 27,3 % | 68,2 | https://arcprize.org/leaderboard |
| 65 | [o1-pro](https://quelleia.com/modeles/o1-pro.md) | OpenAI | Faible | 23,3 % | 67,0 | https://epoch.ai/benchmarks |
| 66 | [DeepSeek-R1 (May 2025)](https://quelleia.com/modeles/deepseek-r1-may-2025.md) | DeepSeek | non précisée | 21,2 % | 66,3 | https://arcprize.org/leaderboard |
| 67 | [GPT-5 nano](https://quelleia.com/modeles/gpt-5-nano.md) | OpenAI | Moyenne | 20,7 % | 66,1 | https://epoch.ai/benchmarks |
| 68 | [o1-preview](https://quelleia.com/modeles/o1-preview.md) | OpenAI | non précisée | 18 % | 65,0 | https://epoch.ai/benchmarks |
| 69 | [Grok-3 mini](https://quelleia.com/modeles/grok-3-mini.md) | xAI | Faible | 16,5 % | 64,4 | https://epoch.ai/benchmarks |
| 70 | [DeepSeek-R1](https://quelleia.com/modeles/deepseek-r1.md) | DeepSeek | non précisée | 15,8 % | 64,1 | https://epoch.ai/benchmarks |
| 71 | [o1-mini](https://quelleia.com/modeles/o1-mini.md) | OpenAI | Moyenne | 14 % | 63,3 | https://epoch.ai/benchmarks |
| 72 | [Qwen3-235B-A22B-Instruct (Jul 2025)](https://quelleia.com/modeles/qwen3-235b-a22b-instruct-jul-2025.md) | Alibaba | non précisée | 11 % | 61,7 | https://epoch.ai/benchmarks |
| 73 | [GPT-4.5](https://quelleia.com/modeles/gpt-4-5.md) | OpenAI | non précisée | 10,3 % | 61,2 | https://epoch.ai/benchmarks |
| 74 | [Magistral Medium 1.1](https://quelleia.com/modeles/magistral-medium-1-1.md) | Mistral AI | non précisée | 6,1 % | 57,9 | https://arcprize.org/leaderboard |
| 75 | [Grok 3](https://quelleia.com/modeles/grok-3.md) | xAI | non précisée | 5,5 % | 57,2 | https://epoch.ai/benchmarks |
| 75 | [GPT-4.1](https://quelleia.com/modeles/gpt-4-1.md) | OpenAI | non précisée | 5,5 % | 57,2 | https://epoch.ai/benchmarks |
| 77 | [Magistral Small 1.0](https://quelleia.com/modeles/magistral-small-1-0.md) | Mistral AI | non précisée | 5 % | 56,6 | https://epoch.ai/benchmarks |
| 78 | [GPT-4o (Nov 2024)](https://quelleia.com/modeles/gpt-4o-nov-2024.md) | OpenAI | non précisée | 4,5 % | 56,0 | https://epoch.ai/benchmarks |
| 79 | [Llama 4 Maverick](https://quelleia.com/modeles/llama-4-maverick.md) | Meta AI | non précisée | 4,4 % | 55,8 | https://arcprize.org/leaderboard |
| 80 | [GPT-4.1 mini](https://quelleia.com/modeles/gpt-4-1-mini.md) | OpenAI | non précisée | 3,5 % | 54,4 | https://epoch.ai/benchmarks |
| 81 | [Llama 4 Scout](https://quelleia.com/modeles/llama-4-scout.md) | Meta AI | non précisée | 0,5 % | 46,9 | https://epoch.ai/benchmarks |
| 82 | [GPT-4.1 nano](https://quelleia.com/modeles/gpt-4-1-nano.md) | OpenAI | non précisée | 0 % | 46,9 | https://epoch.ai/benchmarks |

## En bref

**Que mesure ARC-AGI-1 ?** Des puzzles de grilles colorées : déduire une règle à partir de quelques exemples et l'appliquer à une nouvelle grille. Sur Quelle IA, il est rangé dans la tâche Raisonnement.

**Comment ARC-AGI-1 est-il noté ?** Part de puzzles résolus exactement sur le jeu semi-privé de l'ARC Prize (100 tâches). Un modèle qui obtient 50 % a un score IA d'environ 74.

**Qui est en tête sur ARC-AGI-1 ?** GPT-6 Astra et Claude Fable 5 sont en tête d'ARC-AGI-1 avec 98,5 %, dans l'édition du 28 septembre 2026. Suivent Gemini 3.1 Pro (98 %) et Claude Opus 5.5 (97,5 %). 82 modèles y sont mesurés.

**Quelles sont les limites d'ARC-AGI-1 ?** Facile pour un humain et désormais presque résolu : les meilleurs systèmes dépassent 95 %, parfois au prix de dizaines de dollars par puzzle. Au 28 septembre 2026, le benchmark est saturé.

**Combien pèse ARC-AGI-1 dans le score IA ?** ARC-AGI-1 compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.

**Qui maintient ARC-AGI-1 ?** ARC Prize Foundation (test créé par François Chollet en 2019). Sa page de référence : arcprize.org/arc-agi/1.

## Les autres benchmarks de la tâche Raisonnement

- [DTBench](https://quelleia.com/benchmarks/dtbench.md) : 168 modèles · 1,67 % du score, saturé
- [Chess Puzzles](https://quelleia.com/benchmarks/chess_puzzles.md) : 136 modèles · 1,67 % du score
- [LMCA](https://quelleia.com/benchmarks/lmca.md) : 130 modèles · 1,67 % du score
- [SimpleBench](https://quelleia.com/benchmarks/simplebench.md) : 82 modèles · 1,67 % du score
- [ARC-AGI-2](https://quelleia.com/benchmarks/arc_agi_2.md) : 80 modèles · 1,67 % du score, saturé
- [ForecastBench](https://quelleia.com/benchmarks/forecastbench.md) : 77 modèles · 1,67 % du score
- [Mystery Game Puzzles](https://quelleia.com/benchmarks/mystery_game_puzzles.md) : 69 modèles · 1,67 % du score
- [EnigmaEval](https://quelleia.com/benchmarks/enigmaeval.md) : 41 modèles · 1,67 % du score
- [LiveBench, raisonnement](https://quelleia.com/benchmarks/livebench_raisonnement.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
