Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

RaisonnementFiche benchmark · ARC Prize Foundation · arcprize.org

ARC-AGI-2

Des puzzles de grilles plus durs que ceux d'ARC-AGI-1, où chaque règle combine plusieurs idées ; des humains ont résolu chacun d'eux.

SATURÉ

À quoi il sert

Sur Quelle IA, ARC-AGI-2 sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 85.

Comment c'est noté

Part de puzzles résolus sur le jeu semi-privé (120 tâches), avec deux essais par grille.

Ce qu'il ne dit pas

Conçu pour résister à la force brute, il est pourtant presque résolu en 2026 : 95 % pour le meilleur système, souvent à un coût élevé par puzzle.

Comment lire le score

80 modèles mesurés · 229 mesures

En tête : GPT-6 Astra, 95 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 85. Le meilleur, GPT-6 Astra, atteint 95 %. Le seuil de saturation (95 %) est franchi : au sommet, les meilleurs modèles ne se départagent plus.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
moins de 1 %
Score IA 76niveau de Claude Sonnet 4.5
13 %
Score IA 100niveau de Claude Opus 5.5
97 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,67 %du score général. ARC-AGI-2 porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.

En couleur, la tâche Raisonnement dans le score général. En noir, la part d'ARC-AGI-2.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-6 AstraOpenAI · 6 configurationsMaximale95 %98,1
2Claude Opus 5.5Anthropic · 2 configurationsMaximale92,5 %96,1
2GPT-5.6 SolOpenAI · 6 configurationsMaximale92,5 %96,1
4Claude Opus 5Anthropic · 3 configurationsMaximale90,4 %95,0
5Claude Fable 5.1Anthropic · 5 configurationsMaximale90 %94,8
6Claude Fable 5Anthropic · 5 configurationsMaximale89,2 %94,4
7GPT-5.5OpenAI · 5 configurationsMaximale85 %92,7
8Gemini 3.7 FlashGoogle DeepMind · 3 configurationsÉlevée84,6 %92,6
9GPT-5.5 ProOpenAI · 3 configurationsÉlevée84,6 %92,6
9Gemini 3 Deep ThinkGoogle DeepMind · 2 configurationsNon précisée84,6 %92,6
80 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 80 →Replier le classement ↑
11GPT-5.6 TerraOpenAI · 6 configurationsMaximale83,9 %92,3
12GPT-5.4 ProOpenAI · 2 configurationsMaximale83,3 %92,2
13Gemini 3.1 ProGoogle DeepMind · 2 configurationsNon précisée77,1 %90,4
14Claude Opus 4.7Anthropic · 6 configurationsMaximale75,8 %90,1
15GPT-5.4OpenAI · 5 configurationsMaximale74 %89,6
16Claude Opus 4.8Anthropic · 3 configurationsÉlevée72,1 %89,2
16Gemini 3.5 FlashGoogle DeepMind · 2 configurationsÉlevée72,1 %89,2
18Claude Opus 4.6Anthropic · 4 configurationsBudget69,2 %88,6
19Grok 4.6xAI · 4 configurationsMaximale67,1 %88,2
20Grok 4.20xAINon précisée65,1 %87,8
21DeepSeek V4 Flash 0731DeepSeek · poids ouverts · 4 configurationsMaximale61,4 %87,1
22DeepSeek V4 Pro 0813DeepSeek · poids ouverts · 4 configurationsMaximale61,3 %87,1
23Claude Sonnet 4.6Anthropic · 2 configurationsÉlevée60,4 %86,9
24Kimi K3Moonshot · poids ouverts · 3 configurationsMaximale60,4 %86,9
24Gemini 3.6 FlashGoogle DeepMind · 4 configurationsÉlevée60,4 %86,9
26GPT-5.6 LunaOpenAI · 6 configurationsMaximale59,5 %86,7
27GPT-5.2 ProOpenAI · 2 configurationsÉlevée54,2 %85,8
28GPT-5.2OpenAI · 7 configurationsMaximale52,9 %85,6
29Grok 4.5xAI · 3 configurationsÉlevée52,6 %85,5
30Inkling-SmallThinking Machines · poids ouverts · 6 configurationsMaximale40,1 %83,3
31Claude Opus 4.5Anthropic · 4 configurationsBudget37,6 %82,8
32InklingThinking Machines · poids ouvertsNon précisée36,5 %82,6
33Gemini 3 FlashGoogle DeepMind · 4 configurationsNon précisée33,6 %82,0
34Gemini 3 ProGoogle DeepMindNon précisée31,1 %81,5
35GLM-5.2Z.ai (Zhipu AI) · poids ouvertsNon précisée22,8 %79,6
36GPT-5.4 MiniOpenAI · 5 configurationsMaximale18,9 %78,6
37GPT-5 ProOpenAINon précisée18,3 %78,4
38GPT-5.1OpenAI · 4 configurationsÉlevée17,6 %78,2
39Grok 4xAINon précisée16 %77,7
40Claude Sonnet 4.5Anthropic · 5 configurationsBudget13,6 %76,9
41Kimi K2.5Moonshot · poids ouvertsNon précisée11,8 %76,1
42Gemini 3.5 Flash-LiteGoogle DeepMind · 4 configurationsÉlevée10,3 %75,5
43GPT-5OpenAI · 5 configurationsÉlevée9,9 %75,3
44Claude Opus 4Anthropic · 4 configurationsBudget8,6 %74,6
45o3OpenAI · 3 configurationsÉlevée6,5 %73,3
46tiny-recursion-modelNon précisée6,3 %73,1
47o4-miniOpenAI · 3 configurationsÉlevée6,1 %73,0
48Claude Sonnet 4Anthropic · 4 configurationsBudget5,9 %72,8
49GPT-5.4 NanoOpenAI · 5 configurationsMaximale5,7 %72,6
50Grok 4 FastxAINon précisée5,3 %72,3
51o3-proOpenAI · 3 configurationsÉlevée4,9 %71,9
51GLM-5Z.ai (Zhipu AI) · poids ouvertsNon précisée4,9 %71,9
51MiniMax-M2.5MiniMax · poids ouvertsNon précisée4,9 %71,9
51Gemini 2.5 Pro (Jun 2025)Google DeepMind · 4 configurationsBudget4,9 %71,9
55GPT-5 miniOpenAI · 4 configurationsÉlevée4,4 %71,5
56DeepSeek-V3.2DeepSeek · poids ouvertsNon précisée4 %71,0
56Claude Haiku 4.5Anthropic · 5 configurationsBudget4 %71,0
58o3-miniOpenAI · 3 configurationsÉlevée3 %69,7
59GPT-5 nanoOpenAI · 4 configurationsÉlevée2,6 %69,0
60Gemini 2.5 Flash (May 2025)Google DeepMind · 5 configurationsBudget2,5 %68,9
61DeepSeek-R1DeepSeek · poids ouvertsNon précisée1,3 %65,9
61Gemini 2.0 Flash (Feb 2025)Google DeepMindNon précisée1,3 %65,9
63codex-mini-2025-05-16OpenAINon précisée1,3 %65,8
64Qwen3-235B-A22B-Instruct (Jul 2025)Alibaba · poids ouvertsNon précisée1,3 %65,7
65DeepSeek-R1 (May 2025)DeepSeek · poids ouvertsNon précisée1,1 %65,2
66Claude 3.7 SonnetAnthropic · 4 configurationsBudget0,9 %64,7
67o1-miniOpenAINon précisée0,8 %64,7
68GPT-4.5OpenAINon précisée0,8 %64,7
68Gemini 1.5 Pro (Sept 2024)Google DeepMindNon précisée0,8 %64,7
70Grok-3 minixAIFaible0,4 %64,7
70GPT-4.1OpenAINon précisée0,4 %64,7
72Grok 3xAINon précisée0 %64,7
72GPT-4.1 miniOpenAINon précisée0 %64,7
72Magistral Small 1.0Mistral AI · poids ouvertsNon précisée0 %64,7
72Llama 4 MaverickMeta AI · poids ouvertsNon précisée0 %64,7
72GPT-4.1 nanoOpenAINon précisée0 %64,7
72Llama 4 ScoutMeta AI · poids ouvertsNon précisée0 %64,7
72GPT-4o (Nov 2024)OpenAINon précisée0 %64,7
72Magistral Medium 1.1Mistral AI · 2 configurationsNon précisée0 %64,7
72GPT-4o miniOpenAINon précisée0 %64,7

En bref

Que mesure ARC-AGI-2 ?
Des puzzles de grilles plus durs que ceux d'ARC-AGI-1, où chaque règle combine plusieurs idées ; des humains ont résolu chacun d'eux. Sur Quelle IA, il est rangé dans la tâche Raisonnement.
Comment ARC-AGI-2 est-il noté ?
Part de puzzles résolus sur le jeu semi-privé (120 tâches), avec deux essais par grille. Un modèle qui obtient 50 % a un score IA d'environ 85.
Qui est en tête sur ARC-AGI-2 ?
GPT-6 Astra (OpenAI) est en tête d'ARC-AGI-2 avec 95 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5.5 (92,5 %) et GPT-5.6 Sol (92,5 %). 80 modèles y sont mesurés.
Quelles sont les limites d'ARC-AGI-2 ?
Conçu pour résister à la force brute, il est pourtant presque résolu en 2026 : 95 % pour le meilleur système, souvent à un coût élevé par puzzle. Au 28 septembre 2026, le benchmark est saturé.
Combien pèse ARC-AGI-2 dans le score IA ?
ARC-AGI-2 compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.
Qui maintient ARC-AGI-2 ?
ARC Prize Foundation. Sa page de référence : arcprize.org/leaderboard.

Les autres benchmarks de la tâche Raisonnement

Tous les benchmarks →Comment le score IA est calculé →