Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

MathsFiche benchmark · Epoch AI ; problèmes écrits par des élèves du programme OTIS · epoch.ai

OTIS Mock AIME 2024-2025

45 problèmes de concours de mathématiques, plus durs que MATH Level 5, dont la réponse est un entier entre 0 et 999.

SATURÉ

À quoi il sert

Sur Quelle IA, OTIS Mock AIME 2024-2025 sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks. Il départage surtout les modèles dont le score IA approche 62.

Comment c'est noté

Part de réponses exactes sur les 45 problèmes, tirés de trois examens blancs.

Ce qu'il ne dit pas

Avec 45 problèmes, un seul pèse plus de deux points. Plusieurs modèles atteignent 100 % et les énoncés sont publics.

Comment lire le score

190 modèles mesurés · 293 mesures

En tête : 9 modèles, 100 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 62. 9 modèles partagent la première place avec 100 %. Le seuil de saturation (95 %) est franchi : au sommet, les meilleurs modèles ne se départagent plus.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
16 %
Score IA 76niveau de Claude Sonnet 4.5
89 %
Score IA 100niveau de Claude Opus 5.5
plus de 99 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,25 %du score général. OTIS Mock AIME 2024-2025 porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.

En couleur, la tâche Mathématiques dans le score général. En noir, la part d'OTIS Mock AIME 2024-2025.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Opus 5.5AnthropicMaximale100 %93,8
1GPT-6 AstraOpenAIMaximale100 %93,8
1Claude Sonnet 5.5AnthropicMaximale100 %93,8
1Claude Fable 5.1AnthropicMaximale100 %93,8
1GPT-5.5 ProOpenAIMaximale100 %93,8
1Claude Fable 5Anthropic · 3 configurationsÉlevée100 %93,8
1GPT-5.6 SolOpenAI · 3 configurationsMaximale100 %93,8
1GPT-5.5OpenAI · 3 configurationsMaximale100 %93,8
1Qwen3.8 Max (0902)AlibabaMaximale100 %93,8
10GPT-5.6 TerraOpenAI · 3 configurationsMaximale99,7 %93,8
190 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 190 →Replier le classement ↑
11Qwen 3.8 MaxAlibabaMaximale99,4 %93,8
12Muse Spark 1.3Meta AIMaximale99,2 %93,8
12Grok 4.6xAI · 2 configurationsMaximale99,2 %93,8
14Claude Opus 5Anthropic · 3 configurationsMaximale98,9 %93,1
14Gemini 3.8 FlashGoogle DeepMindÉlevée98,9 %93,1
16DeepSeek V4 Pro 0813DeepSeek · poids ouvertsMaximale98,6 %91,5
17Claude Opus 4.8Anthropic · 3 configurationsMaximale98,3 %90,3
17GPT-5.6 LunaOpenAI · 3 configurationsMaximale98,3 %90,3
19Claude Opus 4.7Anthropic · 2 configurationsMaximale97,8 %88,3
20GPT-5.4OpenAI · 5 configurationsÉlevée97,8 %88,2
20Grok 4.5xAIÉlevée97,8 %88,2
22Kimi K3Moonshot · poids ouverts · 3 configurationsMaximale97,2 %86,7
22Gemini 3.7 FlashGoogle DeepMindÉlevée97,2 %86,7
24DeepSeek-V4-ProDeepSeek · poids ouverts · 3 configurationsMaximale96,7 %85,4
25GPT-5.2OpenAI · 5 configurationsÉlevée96,1 %84,3
25Kimi K2.6Moonshot · poids ouvertsNon précisée96,1 %84,3
27Gemini 3.1 ProGoogle DeepMind · 2 configurationsNon précisée95,6 %83,4
28Gemini 3.5 FlashGoogle DeepMind · 3 configurationsÉlevée95,6 %83,3
28Qwen3.7-MaxAlibabaNon précisée95,6 %83,3
28Gemini 3 FlashGoogle DeepMind · 2 configurationsÉlevée95,6 %83,3
28Kimi K2.7 CodeMoonshot · poids ouvertsNon précisée95,6 %83,3
32Claude Sonnet 5Anthropic · 2 configurationsMaximale94,7 %82,1
33Claude Opus 4.6Anthropic · 3 configurationsBudget94,4 %81,7
33DeepSeek V4 Flash 0731DeepSeek · poids ouvertsMaximale94,4 %81,7
35Gemini 3.6 FlashGoogle DeepMind · 3 configurationsÉlevée94,2 %81,4
36GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsMaximale93,9 %81,1
37GLM-5.1Z.ai (Zhipu AI) · poids ouvertsNon précisée93,3 %80,4
37Qwen 3.6 PlusAlibabaNon précisée93,3 %80,4
37Qwen3.7-PlusAlibaba · 2 configurationsNon précisée93,3 %80,4
37Grok 4.3 BetaxAIÉlevée93,3 %80,4
41Grok 4.20xAINon précisée92,2 %79,3
42Kimi K2.5Moonshot · poids ouvertsNon précisée92,2 %79,3
43Gemini 3 ProGoogle DeepMindNon précisée91,4 %78,5
43GPT-5OpenAI · 3 configurationsÉlevée91,4 %78,5
45GLM-5.3Z.ai (Zhipu AI) · poids ouvertsMaximale91,1 %78,3
45Qwen 3.6 Max (Preview)AlibabaNon précisée91,1 %78,3
45Qwen3.6 27BAlibaba · poids ouverts · 2 configurationsNon précisée91,1 %78,3
48Inkling-SmallThinking Machines · poids ouvertsMaximale90 %77,4
49Muse SparkMeta AINon précisée88,9 %76,6
50GPT-5.4 MiniOpenAI · 3 configurationsMaximale88,9 %76,6
50InklingThinking Machines · poids ouvertsMaximale88,9 %76,6
50Qwen3.5 397B-A17BAlibaba · poids ouverts · 2 configurationsNon précisée88,9 %76,6
50gpt-oss-120bOpenAI · poids ouvertsÉlevée88,9 %76,6
54GPT-5.1OpenAI · 4 configurationsÉlevée88,6 %76,4
55DeepSeek-V3.2DeepSeek · poids ouverts · 2 configurationsNon précisée87,8 %75,9
56GPT-5.4 NanoOpenAI · 3 configurationsÉlevée87,8 %75,9
57Nemotron 3 UltraNVIDIA · poids ouvertsNon précisée86,7 %75,2
57Qwen 3.5 Plus (hosted 397B-A17B)AlibabaNon précisée86,7 %75,2
57GPT-5 miniOpenAI · 3 configurationsÉlevée86,7 %75,2
57Qwen3.7 FlashAlibaba · 2 configurationsNon précisée86,7 %75,2
57Qwen 3.6 35B-A3BAlibaba · poids ouverts · 2 configurationsNon précisée86,7 %75,2
57Qwen3-235B-A22B-Thinking (Jul 2025)AlibabaNon précisée86,7 %75,2
63GLM-5.2Z.ai (Zhipu AI) · poids ouverts · 3 configurationsMaximale86,4 %75,0
64Claude Opus 4.5Anthropic · 3 configurationsBudget86,1 %74,8
65Claude Sonnet 4.6Anthropic · 4 configurationsBudget85,8 %74,7
66Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée84,7 %74,1
67o3OpenAI · 3 configurationsMoyenne84,4 %73,9
67Qwen 3.6 FlashAlibabaNon précisée84,4 %73,9
67Qwen 3.5 Flash (hosted 35B-A3B)AlibabaNon précisée84,4 %73,9
70Grok 4xAINon précisée84 %73,7
71GLM-4.7Z.ai (Zhipu AI) · poids ouvertsNon précisée83,3 %73,4
72Kimi K2 ThinkingMoonshot · poids ouvertsNon précisée83,1 %73,2
73Gemma 4 26B A4BGoogle DeepMind · poids ouvertsFaible82,2 %72,8
74o4-miniOpenAI · 3 configurationsÉlevée81,7 %72,6
75GPT-5 nanoOpenAI · 4 configurationsÉlevée81,1 %72,3
76GLM-5Z.ai (Zhipu AI) · poids ouvertsNon précisée80 %71,8
76Gemini 3.1 Flash-LiteGoogle DeepMind · 3 configurationsÉlevée80 %71,8
78Claude Sonnet 4.5Anthropic · 4 configurationsBudget77,8 %70,9
78Grok-3 minixAI · 2 configurationsÉlevée77,8 %70,9
80o3-miniOpenAI · 3 configurationsÉlevée76,9 %70,6
81Gemma 4 31B ITGoogle DeepMind · poids ouvertsFaible73,3 %69,3
81Qwen3-MaxAlibabaNon précisée73,3 %69,3
81o1OpenAI · 3 configurationsMoyenne73,3 %69,3
84Gemini 2.5 Flash (Apr 2025)Google DeepMindNon précisée73,1 %69,2
85MiniMax-M3MiniMax · poids ouverts · 2 configurationsNon précisée71,1 %68,5
85Gemini 3.5 Flash-LiteGoogle DeepMind · 3 configurationsÉlevée71,1 %68,5
85Claude Sonnet 4Anthropic · 4 configurationsBudget71,1 %68,5
88Gemini 2.5 Flash (May 2025)Google DeepMindNon précisée70,8 %68,4
89Qwen3-30B-A3B-Thinking (Jul 2025)Alibaba · poids ouvertsNon précisée70,3 %68,2
90Qwen3.5-35B-A3BAlibaba · poids ouverts · 2 configurationsSans70 %68,2
91Claude Opus 4.1Anthropic · 3 configurationsBudget68,9 %67,8
92GPT-5.5 InstantOpenAINon précisée68,1 %67,5
93seed-oss-36b-instructByteDanceNon précisée67,5 %67,4
94Qwen3-32BAlibaba · poids ouverts · 2 configurationsNon précisée66,9 %67,2
95Claude Haiku 4.5Anthropic · 2 configurationsBudget66,7 %67,1
96DeepSeek-R1 (May 2025)DeepSeek · poids ouvertsNon précisée66,4 %67,0
96Qwen3-14BAlibaba · poids ouverts · 2 configurationsNon précisée66,4 %67,0
98gpt-oss-20bOpenAI · poids ouverts · 3 configurationsMoyenne65,3 %66,7
99Claude Opus 4Anthropic · 3 configurationsBudget64,4 %66,4
100Qwen3-30B-A3BAlibaba · poids ouverts · 2 configurationsNon précisée62,8 %65,9
101Qwen3-30B-A3B-Instruct (Jul 2025)Alibaba · poids ouvertsNon précisée62,2 %65,8
102Qwen3.5-9BAlibaba · poids ouverts · 2 configurationsSans61,7 %65,6
103QwQ-32BAlibaba · poids ouvertsNon précisée59,2 %64,9
104glm-4.7-flashZ.ai (Zhipu AI) · poids ouvertsNon précisée58,3 %64,7
105Claude 3.7 SonnetAnthropic · 4 configurationsBudget57,8 %64,5
105Gemini 2.0 Flash Thinking (Jan 2025)Google DeepMindNon précisée57,8 %64,5
107Qwen3-8BAlibaba · poids ouverts · 2 configurationsNon précisée56,1 %64,0
108Qwen3.5-4BAlibaba · poids ouvertsSans55,8 %64,0
109Grok 3xAINon précisée55,6 %63,9
109DeepSeek-R1-Distill-Qwen-32BDeepSeekNon précisée55,6 %63,9
111DeepSeek-R1DeepSeek · poids ouvertsNon précisée53,3 %63,3
112qwen3-4b-instruct-2507AlibabaNon précisée52,2 %63,0
113DeepSeek-R1-Distill-Llama-70BDeepSeek · poids ouvertsNon précisée51,4 %62,7
114DeepSeek-R1-Distill-Qwen-14BDeepSeekNon précisée50,6 %62,5
115o1-miniOpenAI · 2 configurationsÉlevée46,9 %61,5
116GPT-4.1 miniOpenAINon précisée44,7 %60,9
117deepseek-r1-0528-qwen3-8bDeepSeek · poids ouvertsNon précisée43,9 %60,7
118GPT-4.1OpenAINon précisée38,3 %59,1
119GPT-4.5OpenAINon précisée37,8 %58,9
119DeepSeek-V3 (Mar 2025)DeepSeek · poids ouvertsNon précisée37,8 %58,9
121Mistral Medium 3Mistral AINon précisée32,2 %57,3
122o1-previewOpenAINon précisée31,1 %56,9
122Gemini 2.0 Flash (Feb 2025)Google DeepMindNon précisée31,1 %56,9
124Mistral Small 3.2Mistral AI · poids ouvertsNon précisée30,3 %56,6
125Magistral Small 1.0Mistral AI · poids ouvertsNon précisée30 %56,6
126GPT-4.1 nanoOpenAINon précisée28,9 %56,2
127Magistral Small 1.2Mistral AI · poids ouvertsNon précisée28,1 %55,9
128glm-4.7-flash_noneZ.ai (Zhipu AI)Sans25 %54,8
129Gemini 1.5 Pro (Sept 2024)Google DeepMindNon précisée23,1 %54,1
130Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée22,5 %53,9
131DeepSeek-R1-Distill-Qwen-1.5BDeepSeekNon précisée21,4 %53,4
132Llama 4 MaverickMeta AI · poids ouvertsNon précisée20,6 %53,1
133Qwen Plus (Jan 2025)AlibabaNon précisée17,8 %51,9
134Gemma 3 12BGoogle DeepMind · poids ouvertsNon précisée16,7 %51,3
135Gemini 1.5 Flash (Sep 2024)Google DeepMindNon précisée16,3 %51,1
136Qwen2.5-MaxAlibabaNon précisée16,1 %51,0
137DeepSeek-V3DeepSeek · poids ouvertsNon précisée15,8 %50,9
138Phi-4Microsoft · poids ouvertsNon précisée13,8 %49,8
139Grok-2 (Dec 2024)xAINon précisée11,5 %48,4
140Llama 3.1-405BMeta AI · poids ouvertsNon précisée9,7 %47,1
141Claude 3.5 Sonnet (October 2024)AnthropicNon précisée8,5 %46,0
141Mistral Large 2 (Jul 2024)Mistral AINon précisée8,5 %46,0
143Qwen2.5-72BAlibaba · poids ouvertsNon précisée8,1 %45,6
143Qwen3-1.7BAlibabaSans8,1 %45,6
145Llama 4 ScoutMeta AI · poids ouvertsNon précisée7,8 %45,4
145Mistral Large 2 (Nov 2024)Mistral AI · poids ouvertsNon précisée7,8 %45,4
147Gemma 3 4BGoogle DeepMind · poids ouvertsNon précisée7,5 %45,1
148Qwen2.5-32BAlibaba · poids ouvertsNon précisée7,4 %45,0
149GPT-4o miniOpenAINon précisée6,9 %44,5
150Gemini 1.5 Pro (May 2024)Google DeepMindNon précisée6,8 %44,4
151GPT-4 Turbo (Apr 2024)OpenAINon précisée6,7 %44,2
151Mistral Small 3Mistral AI · 2 configurationsNon précisée6,7 %44,2
153Claude 3.5 SonnetAnthropicNon précisée6,5 %44,1
154GPT-4o (Aug 2024)OpenAINon précisée6,4 %43,9
155GPT-4o (May 2024)OpenAINon précisée6,3 %43,7
155GPT-4o (Nov 2024)OpenAINon précisée6,3 %43,7
157Qwen-TurboAlibabaNon précisée6,1 %43,6
158Mistral Small 3.1Mistral AI · 2 configurationsNon précisée5,8 %43,2
159Llama 3.3 70BMeta AI · poids ouvertsNon précisée5,1 %42,3
160Claude 3 OpusAnthropicNon précisée4,7 %41,7
161Gemini 1.5 Flash 8BGoogle DeepMindNon précisée4,6 %41,5
162Tulu 3 (Tülu 3) 70BAllen Institute for AI · poids ouvertsNon précisée4,4 %41,2
163Claude 3.5 HaikuAnthropicNon précisée4,3 %41,0
163Llama 3-70BMeta AI · poids ouvertsNon précisée4,3 %41,0
165Gemini 1.5 Flash (May 2024)Google DeepMindNon précisée3,9 %40,3
166Llama 3.1-70BMeta AI · poids ouvertsNon précisée3,6 %39,7
167granite-4.0-microIBM · poids ouvertsNon précisée2,8 %37,8
168Llama 3.2 90BMeta AI · poids ouvertsNon précisée2,6 %37,4
169Claude 3 SonnetAnthropicNon précisée2,5 %37,0
169Hermes 2 Theta Llama-3 70BNous Research · poids ouvertsNon précisée2,5 %37,0
169Claude 2AnthropicNon précisée2,5 %37,0
169Qwen2.5-7BAlibaba · poids ouvertsNon précisée2,5 %37,0
173GPT-3.5 Turbo (Jan 2024)OpenAINon précisée2,2 %36,2
174Mistral LargeMistral AI · poids ouvertsNon précisée1,9 %35,2
174Claude 2.1AnthropicNon précisée1,9 %35,2
174Llama 3-8BMeta AI · poids ouvertsNon précisée1,9 %35,2
177Claude 3 HaikuAnthropicNon précisée1,8 %34,6
178Llama 3.1-8BMeta AI · poids ouvertsNon précisée1,7 %34,1
179Gemma 2 27BGoogle DeepMindNon précisée1,4 %32,7
180GPT-4 (Jun 2023)OpenAINon précisée1,1 %31,0
180Gemini 1.0 ProGoogle DeepMindNon précisée1,1 %31,0
180Gemma 3 1BGoogle DeepMind · poids ouvertsNon précisée1,1 %31,0
183granite-4.0-1bIBMNon précisée0,8 %30,9
183DeepSeek LLM 67BDeepSeek · poids ouvertsNon précisée0,8 %30,9
185GPT-4 (Mar 2023)OpenAINon précisée0,6 %30,9
185Gemma 2 9BGoogle DeepMind · poids ouvertsNon précisée0,6 %30,9
185Llama 3.2 1BMeta AI · poids ouvertsNon précisée0,6 %30,9
188granite-4.0-350mIBMNon précisée0,3 %30,9
188Mistral 7B v0.3Mistral AI · poids ouvertsNon précisée0,3 %30,9
190Llama 2-70BMeta AI · poids ouvertsNon précisée0 %30,9

En bref

Que mesure OTIS Mock AIME 2024-2025 ?
45 problèmes de concours de mathématiques, plus durs que MATH Level 5, dont la réponse est un entier entre 0 et 999. Sur Quelle IA, il est rangé dans la tâche Mathématiques.
Comment OTIS Mock AIME 2024-2025 est-il noté ?
Part de réponses exactes sur les 45 problèmes, tirés de trois examens blancs. Un modèle qui obtient 50 % a un score IA d'environ 62.
Qui est en tête sur OTIS Mock AIME 2024-2025 ?
Claude Opus 5.5, GPT-6 Astra, Claude Sonnet 5.5 et 6 autres sont en tête d'OTIS Mock AIME 2024-2025 avec 100 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.6 Terra (99,7 %) et Qwen 3.8 Max (99,4 %). 190 modèles y sont mesurés.
Quelles sont les limites d'OTIS Mock AIME 2024-2025 ?
Avec 45 problèmes, un seul pèse plus de deux points. Plusieurs modèles atteignent 100 % et les énoncés sont publics. Au 28 septembre 2026, le benchmark est saturé.
Combien pèse OTIS Mock AIME 2024-2025 dans le score IA ?
OTIS Mock AIME 2024-2025 compte pour 1,25 % du score général, dans l'édition du 28 septembre 2026. Il porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.
Qui maintient OTIS Mock AIME 2024-2025 ?
Epoch AI ; problèmes écrits par des élèves du programme OTIS. Sa page de référence : epoch.ai/benchmarks/otis-mock-aime-2024-2025.

Les autres benchmarks de la tâche Mathématiques

Tous les benchmarks →Comment le score IA est calculé →