Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

MathsFiche benchmark · OpenAI (Cobbe et al., 2021) · github.com

GSM8K

Des problèmes d'arithmétique de niveau école et collège, rédigés en langage courant, à résoudre en quelques étapes de calcul.

ARCHIVÉ

À quoi il sert

GSM8K servait à noter la tâche Mathématiques. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

Comment c'est noté

Part de réponses numériques exactement justes.

Ce qu'il ne dit pas

Saturé et très présent dans les données d'entraînement. Il ne sert plus qu'à situer d'anciens modèles.

Comment lire le score

82 modèles mesurés · 170 mesures

En tête : DeepSeek-Coder-V2 236B, 94,5 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 3. Le meilleur, DeepSeek-Coder-V2 236B, atteint 94,5 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
91 %
Score IA 76niveau de Claude Sonnet 4.5
97 %
Score IA 100niveau de Claude Opus 5.5
plus de 99 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. GSM8K est archivé et ne compte plus : la tâche Mathématiques (10 % du score général) repose sur 8 autres benchmarks.

En couleur, la tâche Mathématiques dans le score général. GSM8K n'y a plus de part.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1DeepSeek-Coder-V2 236BDeepSeek · poids ouverts · 2 configurationsNon précisée94,5 %62,1
2Qwen2.5-Coder-14B-InstructAlibabaNon précisée94,2 %60,9
3Qwen2.5-Coder-32B-InstructAlibaba · poids ouvertsNon précisée93 %56,7
4GPT-4 (Mar 2023)OpenAINon précisée92 %53,7
5GPT-4o miniOpenAINon précisée91,3 %51,8
6Qwen2.5-Coder-32BAlibaba · poids ouvertsNon précisée91,1 %51,2
7GPT-4 (Jun 2023)OpenAINon précisée90 %48,5
8Phi-3.5-MoEMicrosoft · poids ouvertsNon précisée88,7 %45,7
8Qwen2.5-Coder-14BAlibabaNon précisée88,7 %45,7
10DeepSeek-Coder-V2-Lite-InstructDeepSeekNon précisée87,6 %43,5
82 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 82 →Replier le classement ↑
11Claude InstantAnthropic · 2 configurationsNon précisée86,7 %41,8
11Qwen2.5-Coder (7B)Alibaba · poids ouverts · 2 configurationsNon précisée86,7 %41,8
13Phi-3.5-miniMicrosoft · poids ouvertsNon précisée86,2 %40,9
14Gemma 2 9BGoogle DeepMind · poids ouvertsNon précisée84,9 %38,7
15Mistral NeMoMistral AI · poids ouvertsNon précisée84,2 %37,6
16Gemini 1.5 Flash (May 2024)Google DeepMindNon précisée82,4 %34,9
16Llama 3.1-8BMeta AI · poids ouvertsNon précisée82,4 %34,9
18Qwen2.5-Coder-3B-InstructAlibabaNon précisée80,7 %32,6
19davinci-003OpenAI · 4 configurationsNon précisée78,2 %29,4
20Yi-34B01.AI · poids ouverts · 3 configurationsNon précisée76 %26,8
21Qwen2.5-Coder-3BAlibabaNon précisée75,7 %26,4
22Mixtral 8x7BMistral AI · poids ouvertsNon précisée74,4 %25,0
23Stable Beluga 2Stability AI · poids ouvertsNon précisée69,6 %20,0
23Llama 2-70BMeta AI · poids ouverts · 8 configurationsNon précisée69,6 %20,0
25DeepSeek-Coder-V2-Lite-BaseDeepSeekNon précisée67,1 %17,6
26Qwen2.5-Coder (1.5B)Alibaba · poids ouvertsNon précisée65,8 %16,4
27internlm-20bShanghai AI Laboratory · 3 configurationsNon précisée62,9 %13,7
28Qwen-14BAlibaba · poids ouverts · 5 configurationsNon précisée61,3 %12,3
29GPT-3.5 Turbo (Jun 2023)OpenAI · 2 configurationsNon précisée57,8 %9,3
30StarCoder 2 15BHugging Face · poids ouvertsNon précisée57,7 %9,2
31davinci-002OpenAI · 2 configurationsNon précisée56,8 %8,4
32PaLM (540B)Google ResearchNon précisée56,5 %8,2
33Falcon-180BTechnology Innovation Institute · poids ouvertsNon précisée54,4 %6,4
33LLaMA-65BMeta AI · poids ouverts · 5 configurationsNon précisée54,4 %6,4
33Mistral 7B v0.1Mistral AI · poids ouverts · 5 configurationsNon précisée54,4 %6,4
36Falcon 2 11BTechnology Innovation Institute · poids ouvertsNon précisée53,8 %5,9
37Baichuan2-13BBaichuan · poids ouverts · 4 configurationsNon précisée52,8 %5,1
38Qwen-7BAlibaba · poids ouverts · 2 configurationsNon précisée51,7 %4,1
39Gemma 7BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée46,4 %-0,3
40Nemotron-4 15BNVIDIANon précisée46 %-0,6
41Baichuan2-13B-ChatBaichuan AI · 2 configurationsNon précisée45,7 %-0,9
42Yi 6B01.AI · poids ouverts · 3 configurationsNon précisée44,9 %-1,6
43LLaMA-33BMeta AI · poids ouverts · 5 configurationsNon précisée44,1 %-2,2
44Llama 2-34BMeta AI · 4 configurationsNon précisée42,2 %-3,8
45INTELLECT-1Prime IntellectNon précisée38,6 %-7,0
46CodeQwen1.5-7BAlibabaNon précisée37,7 %-7,8
47Llama 2-13BMeta AI · poids ouverts · 9 configurationsNon précisée36,9 %-8,5
48Mistral 7B v0.2Mistral AINon précisée35,4 %-9,8
48DeepSeek Coder 33BDeepSeek · poids ouvertsNon précisée35,4 %-9,8
50Qwen2.5-Coder-0.5BAlibaba · poids ouvertsNon précisée34,5 %-10,7
51MPT-30BMosaicML · poids ouverts · 4 configurationsNon précisée34,4 %-10,8
52Falcon-40BTechnology Innovation Institute · poids ouverts · 5 configurationsNon précisée33,8 %-11,3
53PaLM 62BGoogle DeepMindNon précisée33 %-12,1
54StarCoder 2 7BHugging Face · poids ouvertsNon précisée32,7 %-12,3
55chatglm2-6bZ.ai (Zhipu AI) · 3 configurationsNon précisée32,4 %-12,6
56internlm-7bShanghai AI LaboratoryNon précisée31,2 %-13,8
57vicuna-13b-v1.1Non précisée28,1 %-16,9
58Baichuan 1-13BBaichuan · poids ouvertsNon précisée26,8 %-18,2
59Baichuan 2-7BBaichuan · poids ouverts · 3 configurationsNon précisée24,6 %-20,7
60Vicuna-13B-v1.3Large Model Systems Organization · poids ouvertsNon précisée22,6 %-23,0
61StarCoder 2 3BHugging Face · poids ouvertsNon précisée21,6 %-24,2
62DeepSeek Coder 6.7BDeepSeek · poids ouvertsNon précisée21,3 %-24,6
63Qwen-1_8BAlibabaNon précisée21,2 %-24,7
64LLaMA-13BMeta AI · poids ouverts · 5 configurationsNon précisée20,5 %-25,5
65Gemma 2BGoogle DeepMind · poids ouvertsNon précisée17,7 %-29,3
66Llama 2-7BMeta AI · poids ouverts · 7 configurationsNon précisée16,7 %-30,8
67internlm-chat-20bShanghai AI LaboratoryNon précisée15,7 %-32,3
68LLaMA-7BMeta AI · poids ouverts · 6 configurationsNon précisée11 %-40,9
69BLOOM-176BHugging Face · poids ouvertsNon précisée9,5 %-44,3
70Baichuan1-7BBaichuan · poids ouvertsNon précisée9,2 %-45,1
71MPT-7BMosaicML · poids ouverts · 4 configurationsNon précisée9,1 %-45,3
72GPT-3 175B (davinci)OpenAINon précisée9 %-45,6
73Falcon-7BTechnology Innovation Institute · poids ouverts · 6 configurationsNon précisée6,8 %-51,9
74DeepSeek Coder 1.3BDeepSeek · poids ouvertsNon précisée4,4 %-61,5
75OPT-175BMeta AI · poids ouvertsNon précisée4 %-63,6
76OPT-66BMeta AI · poids ouvertsNon précisée1,8 %-80,7
77GPT-3 6.7BOpenAINon précisée1,6 %-83,2
78GPT-3 XL (babbage)OpenAINon précisée0,7 %-93,2
79GPT-3 MediumOpenAINon précisée0,6 %-93,2
79InstructGPT 6BOpenAINon précisée0,6 %-93,2
81InstructGPT 350MOpenAINon précisée0,4 %-93,2
82InstructGPT 1.3BOpenAINon précisée0 %-93,2

En bref

Que mesure GSM8K ?
Des problèmes d'arithmétique de niveau école et collège, rédigés en langage courant, à résoudre en quelques étapes de calcul. Sur Quelle IA, il est rangé dans la tâche Mathématiques.
Comment GSM8K est-il noté ?
Part de réponses numériques exactement justes. Un modèle qui obtient 50 % a un score IA d'environ 3.
Qui est en tête sur GSM8K ?
DeepSeek-Coder-V2 236B (DeepSeek) est en tête de GSM8K avec 94,5 %, dans l'édition du 28 septembre 2026. Suivent Qwen2.5-Coder-14B-Instruct (94,2 %) et Qwen2.5-Coder-32B-Instruct (93 %). 82 modèles y sont mesurés.
Quelles sont les limites de GSM8K ?
Saturé et très présent dans les données d'entraînement. Il ne sert plus qu'à situer d'anciens modèles. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse GSM8K dans le score IA ?
GSM8K compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Mathématiques (10 % du score général) repose sur 8 autres benchmarks.
Qui maintient GSM8K ?
OpenAI (Cobbe et al., 2021). Sa page de référence : github.com/openai/grade-school-math.

Les autres benchmarks de la tâche Mathématiques

Tous les benchmarks →Comment le score IA est calculé →