Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

RaisonnementFiche benchmark · ARC Prize Foundation (test créé par François Chollet en 2019) · arcprize.org

ARC-AGI-1

Des puzzles de grilles colorées : déduire une règle à partir de quelques exemples et l'appliquer à une nouvelle grille.

SATURÉ

À quoi il sert

Sur Quelle IA, ARC-AGI-1 sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 74.

Comment c'est noté

Part de puzzles résolus exactement sur le jeu semi-privé de l'ARC Prize (100 tâches).

Ce qu'il ne dit pas

Facile pour un humain et désormais presque résolu : les meilleurs systèmes dépassent 95 %, parfois au prix de dizaines de dollars par puzzle.

Comment lire le score

82 modèles mesurés · 246 mesures

En tête : 2 modèles, 98,5 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 74. 2 modèles partagent la première place avec 98,5 %. Le seuil de saturation (95 %) est franchi : au sommet, les meilleurs modèles ne se départagent plus.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
2 %
Score IA 76niveau de Claude Sonnet 4.5
60 %
Score IA 100niveau de Claude Opus 5.5
99 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,67 %du score général. ARC-AGI-1 porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.

En couleur, la tâche Raisonnement dans le score général. En noir, la part d'ARC-AGI-1.

Le classement du benchmark

Scores relevés auprès de 2 sources · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-6 AstraOpenAI · 6 configurationsÉlevée98,5 %98,6
1Claude Fable 5Anthropic · 5 configurationsMaximale98,5 %98,6
3Gemini 3.1 ProGoogle DeepMindNon précisée98 %96,9
4Claude Opus 5.5Anthropic · 2 configurationsMaximale97,5 %95,5
4Claude Fable 5.1Anthropic · 5 configurationsMaximale97,5 %95,5
4Claude Opus 5Anthropic · 3 configurationsÉlevée97,5 %95,5
4GPT-5.6 SolOpenAI · 6 configurationsMaximale97,5 %95,5
8GPT-5.5 ProOpenAI · 3 configurationsÉlevée96,5 %93,5
8GPT-5.6 TerraOpenAI · 6 configurationsMaximale96,5 %93,5
10Gemini 3 Deep ThinkGoogle DeepMind · 3 configurationsNon précisée96 %92,7
82 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 82 →Replier le classement ↑
11Gemini 3.7 FlashGoogle DeepMind · 3 configurationsÉlevée95,5 %92,0
12GPT-5.5OpenAI · 5 configurationsMaximale95 %91,3
13GPT-5.4 ProOpenAI · 2 configurationsMaximale94,5 %90,7
13Kimi K3Moonshot · poids ouverts · 3 configurationsMaximale94,5 %90,7
15Claude Opus 4.6Anthropic · 5 configurationsBudget94 %90,2
16GPT-5.4OpenAI · 5 configurationsMaximale93,7 %89,8
17Claude Opus 4.7Anthropic · 6 configurationsÉlevée93,5 %89,7
18Claude Opus 4.8Anthropic · 4 configurationsMaximale92,5 %88,8
18Gemini 3.5 FlashGoogle DeepMind · 2 configurationsÉlevée92,5 %88,8
20Gemini 3.6 FlashGoogle DeepMind · 4 configurationsÉlevée91,2 %87,7
21GPT-5.2 ProOpenAI · 5 configurationsMaximale90,5 %87,3
21DeepSeek V4 Pro 0813DeepSeek · poids ouverts · 4 configurationsFaible90,5 %87,3
23Grok 4.20xAINon précisée89,5 %86,6
24DeepSeek V4 Flash 0731DeepSeek · poids ouverts · 4 configurationsMaximale89 %86,3
25GPT-5.6 LunaOpenAI · 6 configurationsMaximale88 %85,7
26Grok 4.6xAI · 4 configurationsMoyenne87,5 %85,4
27Grok 4.5xAI · 3 configurationsMoyenne87,2 %85,3
28Claude Sonnet 4.6Anthropic · 2 configurationsÉlevée86,5 %84,9
29GPT-5.2OpenAI · 8 configurationsMaximale86,2 %84,8
30Gemini 3 FlashGoogle DeepMind · 4 configurationsNon précisée84,7 %84,0
31Inkling-SmallThinking Machines · poids ouverts · 6 configurationsMaximale84 %83,7
32Claude Opus 4.5Anthropic · 7 configurationsBudget80 %82,1
33InklingThinking Machines · poids ouvertsNon précisée79,5 %82,0
34GLM-5.2Z.ai (Zhipu AI) · poids ouvertsNon précisée77 %81,1
35Gemini 3 ProGoogle DeepMindNon précisée75 %80,4
36GPT-5.1OpenAI · 6 configurationsÉlevée72,8 %79,8
37GPT-5 ProOpenAI · 2 configurationsÉlevée70,2 %79,0
38Grok 4xAINon précisée66,7 %78,1
39GPT-5OpenAI · 4 configurationsÉlevée65,7 %77,8
40Kimi K2.5Moonshot · poids ouvertsNon précisée65,3 %77,7
41GPT-5.4 MiniOpenAI · 5 configurationsMaximale63,7 %77,3
41Claude Sonnet 4.5Anthropic · 5 configurationsBudget63,7 %77,3
41MiniMax-M2.5MiniMax · poids ouvertsNon précisée63,7 %77,3
44o3OpenAI · 3 configurationsÉlevée60,8 %76,6
45o3-proOpenAI · 3 configurationsÉlevée59,3 %76,2
46o4-miniOpenAI · 3 configurationsÉlevée58,7 %76,0
47DeepSeek-V3.2DeepSeek · poids ouvertsNon précisée57 %75,6
48GPT-5 miniOpenAI · 4 configurationsÉlevée54,3 %75,0
49Gemini 3.5 Flash-LiteGoogle DeepMind · 4 configurationsÉlevée53,5 %74,8
50GPT-5.4 NanoOpenAI · 5 configurationsMaximale51,5 %74,3
51Grok 4 FastxAINon précisée48,5 %73,6
52Claude Haiku 4.5Anthropic · 5 configurationsBudget47,7 %73,4
53GLM-5Z.ai (Zhipu AI) · poids ouvertsNon précisée44,7 %72,7
54Gemini 2.5 Pro (Jun 2025)Google DeepMind · 5 configurationsBudget41 %71,8
55tiny-recursion-modelNon précisée40 %71,6
55Claude Sonnet 4Anthropic · 4 configurationsBudget40 %71,6
57Claude Opus 4Anthropic · 4 configurationsBudget35,7 %70,5
58o3-miniOpenAI · 3 configurationsÉlevée34,5 %70,2
59Gemini 2.5 Flash (May 2025)Google DeepMind · 5 configurationsNon précisée33,3 %69,9
60Gemini 2.5 Pro (Mar 2025)Google DeepMindNon précisée33 %69,8
61Gemini 2.5 Flash (Apr 2025)Google DeepMindNon précisée32,3 %69,6
62o1OpenAI · 2 configurationsMoyenne30,7 %69,2
63Claude 3.7 SonnetAnthropic · 4 configurationsBudget28,6 %68,6
64codex-mini-2025-05-16OpenAINon précisée27,3 %68,2
65o1-proOpenAIFaible23,3 %67,0
66DeepSeek-R1 (May 2025)DeepSeek · poids ouvertsNon précisée21,2 %66,3
67GPT-5 nanoOpenAI · 4 configurationsMoyenne20,7 %66,1
68o1-previewOpenAINon précisée18 %65,0
69Grok-3 minixAI · 2 configurationsFaible16,5 %64,4
70DeepSeek-R1DeepSeek · poids ouvertsNon précisée15,8 %64,1
71o1-miniOpenAI · 2 configurationsMoyenne14 %63,3
72Qwen3-235B-A22B-Instruct (Jul 2025)Alibaba · poids ouvertsNon précisée11 %61,7
73GPT-4.5OpenAINon précisée10,3 %61,2
74Magistral Medium 1.1Mistral AI · 2 configurationsNon précisée6,1 %57,9
75Grok 3xAINon précisée5,5 %57,2
75GPT-4.1OpenAINon précisée5,5 %57,2
77Magistral Small 1.0Mistral AI · poids ouvertsNon précisée5 %56,6
78GPT-4o (Nov 2024)OpenAINon précisée4,5 %56,0
79Llama 4 MaverickMeta AI · poids ouvertsNon précisée4,4 %55,8
80GPT-4.1 miniOpenAINon précisée3,5 %54,4
81Llama 4 ScoutMeta AI · poids ouvertsNon précisée0,5 %46,9
82GPT-4.1 nanoOpenAINon précisée0 %46,9

En bref

Que mesure ARC-AGI-1 ?
Des puzzles de grilles colorées : déduire une règle à partir de quelques exemples et l'appliquer à une nouvelle grille. Sur Quelle IA, il est rangé dans la tâche Raisonnement.
Comment ARC-AGI-1 est-il noté ?
Part de puzzles résolus exactement sur le jeu semi-privé de l'ARC Prize (100 tâches). Un modèle qui obtient 50 % a un score IA d'environ 74.
Qui est en tête sur ARC-AGI-1 ?
GPT-6 Astra et Claude Fable 5 sont en tête d'ARC-AGI-1 avec 98,5 %, dans l'édition du 28 septembre 2026. Suivent Gemini 3.1 Pro (98 %) et Claude Opus 5.5 (97,5 %). 82 modèles y sont mesurés.
Quelles sont les limites d'ARC-AGI-1 ?
Facile pour un humain et désormais presque résolu : les meilleurs systèmes dépassent 95 %, parfois au prix de dizaines de dollars par puzzle. Au 28 septembre 2026, le benchmark est saturé.
Combien pèse ARC-AGI-1 dans le score IA ?
ARC-AGI-1 compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.
Qui maintient ARC-AGI-1 ?
ARC Prize Foundation (test créé par François Chollet en 2019). Sa page de référence : arcprize.org/arc-agi/1.

Les autres benchmarks de la tâche Raisonnement

Tous les benchmarks →Comment le score IA est calculé →