# GSM8K

> Fiche du benchmark GSM8K sur Quelle IA, édition du 28 septembre 2026. Des problèmes d'arithmétique de niveau école et collège, rédigés en langage courant, à résoudre en quelques étapes de calcul. En tête au 28 septembre 2026 : DeepSeek-Coder-V2 236B (94,5 %). Notation, limites et classement des 82 modèles mesurés.

Page : https://quelleia.com/benchmarks/gsm8k/
Source du benchmark : https://github.com/openai/grade-school-math
Mainteneur : OpenAI (Cobbe et al., 2021)
Tâche : Mathématiques
État : archivé

## À quoi il sert

GSM8K servait à noter la tâche Mathématiques. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

## Comment c'est noté

Part de réponses numériques exactement justes.

## Ce qu'il ne dit pas

Saturé et très présent dans les données d'entraînement. Il ne sert plus qu'à situer d'anciens modèles.

## Qui le tient

OpenAI (Cobbe et al., 2021).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 3. Le meilleur, DeepSeek-Coder-V2 236B, atteint 94,5 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 91 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 97 %
- Score IA 100 (niveau de Claude Opus 5.5) : plus de 99 %

## Son poids dans le score IA

0 % du score général. GSM8K est archivé et ne compte plus : la tâche Mathématiques (10 % du score général) repose sur 8 autres benchmarks.

## Classement (82 modèles mesurés · 170 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [DeepSeek-Coder-V2 236B](https://quelleia.com/modeles/deepseek-coder-v2-236b.md) | DeepSeek | non précisée | 94,5 % | 62,1 | https://epoch.ai/benchmarks |
| 2 | [Qwen2.5-Coder-14B-Instruct](https://quelleia.com/modeles/qwen2-5-coder-14b-instruct.md) | Alibaba | non précisée | 94,2 % | 60,9 | https://epoch.ai/benchmarks |
| 3 | [Qwen2.5-Coder-32B-Instruct](https://quelleia.com/modeles/qwen2-5-coder-32b-instruct.md) | Alibaba | non précisée | 93 % | 56,7 | https://epoch.ai/benchmarks |
| 4 | [GPT-4 (Mar 2023)](https://quelleia.com/modeles/gpt-4-mar-2023.md) | OpenAI | non précisée | 92 % | 53,7 | https://epoch.ai/benchmarks |
| 5 | [GPT-4o mini](https://quelleia.com/modeles/gpt-4o-mini.md) | OpenAI | non précisée | 91,3 % | 51,8 | https://epoch.ai/benchmarks |
| 6 | [Qwen2.5-Coder-32B](https://quelleia.com/modeles/qwen2-5-coder-32b.md) | Alibaba | non précisée | 91,1 % | 51,2 | https://epoch.ai/benchmarks |
| 7 | [GPT-4 (Jun 2023)](https://quelleia.com/modeles/gpt-4-jun-2023.md) | OpenAI | non précisée | 90 % | 48,5 | https://epoch.ai/benchmarks |
| 8 | [Phi-3.5-MoE](https://quelleia.com/modeles/phi-3-5-moe.md) | Microsoft | non précisée | 88,7 % | 45,7 | https://epoch.ai/benchmarks |
| 8 | [Qwen2.5-Coder-14B](https://quelleia.com/modeles/qwen2-5-coder-14b.md) | Alibaba | non précisée | 88,7 % | 45,7 | https://epoch.ai/benchmarks |
| 10 | [DeepSeek-Coder-V2-Lite-Instruct](https://quelleia.com/modeles/deepseek-coder-v2-lite-instruct.md) | DeepSeek | non précisée | 87,6 % | 43,5 | https://epoch.ai/benchmarks |
| 11 | [Claude Instant](https://quelleia.com/modeles/claude-instant.md) | Anthropic | non précisée | 86,7 % | 41,8 | https://epoch.ai/benchmarks |
| 11 | [Qwen2.5-Coder (7B)](https://quelleia.com/modeles/qwen2-5-coder-7b.md) | Alibaba | non précisée | 86,7 % | 41,8 | https://epoch.ai/benchmarks |
| 13 | [Phi-3.5-mini](https://quelleia.com/modeles/phi-3-5-mini.md) | Microsoft | non précisée | 86,2 % | 40,9 | https://epoch.ai/benchmarks |
| 14 | [Gemma 2 9B](https://quelleia.com/modeles/gemma-2-9b.md) | Google DeepMind | non précisée | 84,9 % | 38,7 | https://epoch.ai/benchmarks |
| 15 | [Mistral NeMo](https://quelleia.com/modeles/mistral-nemo.md) | Mistral AI | non précisée | 84,2 % | 37,6 | https://epoch.ai/benchmarks |
| 16 | [Gemini 1.5 Flash (May 2024)](https://quelleia.com/modeles/gemini-1-5-flash-may-2024.md) | Google DeepMind | non précisée | 82,4 % | 34,9 | https://epoch.ai/benchmarks |
| 16 | [Llama 3.1-8B](https://quelleia.com/modeles/llama-3-1-8b.md) | Meta AI | non précisée | 82,4 % | 34,9 | https://epoch.ai/benchmarks |
| 18 | [Qwen2.5-Coder-3B-Instruct](https://quelleia.com/modeles/qwen2-5-coder-3b-instruct.md) | Alibaba | non précisée | 80,7 % | 32,6 | https://epoch.ai/benchmarks |
| 19 | [davinci-003](https://quelleia.com/modeles/davinci-003.md) | OpenAI | non précisée | 78,2 % | 29,4 | https://epoch.ai/benchmarks |
| 20 | [Yi-34B](https://quelleia.com/modeles/yi-34b.md) | 01.AI | non précisée | 76 % | 26,8 | https://epoch.ai/benchmarks |
| 21 | [Qwen2.5-Coder-3B](https://quelleia.com/modeles/qwen2-5-coder-3b.md) | Alibaba | non précisée | 75,7 % | 26,4 | https://epoch.ai/benchmarks |
| 22 | [Mixtral 8x7B](https://quelleia.com/modeles/mixtral-8x7b.md) | Mistral AI | non précisée | 74,4 % | 25,0 | https://epoch.ai/benchmarks |
| 23 | [Stable Beluga 2](https://quelleia.com/modeles/stable-beluga-2.md) | Stability AI | non précisée | 69,6 % | 20,0 | https://epoch.ai/benchmarks |
| 23 | [Llama 2-70B](https://quelleia.com/modeles/llama-2-70b.md) | Meta AI | non précisée | 69,6 % | 20,0 | https://epoch.ai/benchmarks |
| 25 | [DeepSeek-Coder-V2-Lite-Base](https://quelleia.com/modeles/deepseek-coder-v2-lite-base.md) | DeepSeek | non précisée | 67,1 % | 17,6 | https://epoch.ai/benchmarks |
| 26 | [Qwen2.5-Coder (1.5B)](https://quelleia.com/modeles/qwen2-5-coder-1-5b.md) | Alibaba | non précisée | 65,8 % | 16,4 | https://epoch.ai/benchmarks |
| 27 | [internlm-20b](https://quelleia.com/modeles/internlm-20b.md) | Shanghai AI Laboratory | non précisée | 62,9 % | 13,7 | https://epoch.ai/benchmarks |
| 28 | [Qwen-14B](https://quelleia.com/modeles/qwen-14b.md) | Alibaba | non précisée | 61,3 % | 12,3 | https://epoch.ai/benchmarks |
| 29 | [GPT-3.5 Turbo (Jun 2023)](https://quelleia.com/modeles/gpt-3-5-turbo-jun-2023.md) | OpenAI | non précisée | 57,8 % | 9,3 | https://epoch.ai/benchmarks |
| 30 | [StarCoder 2 15B](https://quelleia.com/modeles/starcoder-2-15b.md) | Hugging Face | non précisée | 57,7 % | 9,2 | https://epoch.ai/benchmarks |
| 31 | [davinci-002](https://quelleia.com/modeles/davinci-002.md) | OpenAI | non précisée | 56,8 % | 8,4 | https://epoch.ai/benchmarks |
| 32 | [PaLM (540B)](https://quelleia.com/modeles/palm-540b.md) | Google Research | non précisée | 56,5 % | 8,2 | https://epoch.ai/benchmarks |
| 33 | [Falcon-180B](https://quelleia.com/modeles/falcon-180b.md) | Technology Innovation Institute | non précisée | 54,4 % | 6,4 | https://epoch.ai/benchmarks |
| 33 | [LLaMA-65B](https://quelleia.com/modeles/llama-65b.md) | Meta AI | non précisée | 54,4 % | 6,4 | https://epoch.ai/benchmarks |
| 33 | [Mistral 7B v0.1](https://quelleia.com/modeles/mistral-7b-v0-1.md) | Mistral AI | non précisée | 54,4 % | 6,4 | https://epoch.ai/benchmarks |
| 36 | [Falcon 2 11B](https://quelleia.com/modeles/falcon-2-11b.md) | Technology Innovation Institute | non précisée | 53,8 % | 5,9 | https://epoch.ai/benchmarks |
| 37 | [Baichuan2-13B](https://quelleia.com/modeles/baichuan2-13b.md) | Baichuan | non précisée | 52,8 % | 5,1 | https://epoch.ai/benchmarks |
| 38 | [Qwen-7B](https://quelleia.com/modeles/qwen-7b.md) | Alibaba | non précisée | 51,7 % | 4,1 | https://epoch.ai/benchmarks |
| 39 | [Gemma 7B](https://quelleia.com/modeles/gemma-7b.md) | Google DeepMind | non précisée | 46,4 % | -0,3 | https://epoch.ai/benchmarks |
| 40 | [Nemotron-4 15B](https://quelleia.com/modeles/nemotron-4-15b.md) | NVIDIA | non précisée | 46 % | -0,6 | https://epoch.ai/benchmarks |
| 41 | [Baichuan2-13B-Chat](https://quelleia.com/modeles/baichuan2-13b-chat.md) | Baichuan AI | non précisée | 45,7 % | -0,9 | https://epoch.ai/benchmarks |
| 42 | [Yi 6B](https://quelleia.com/modeles/yi-6b.md) | 01.AI | non précisée | 44,9 % | -1,6 | https://epoch.ai/benchmarks |
| 43 | [LLaMA-33B](https://quelleia.com/modeles/llama-33b.md) | Meta AI | non précisée | 44,1 % | -2,2 | https://epoch.ai/benchmarks |
| 44 | [Llama 2-34B](https://quelleia.com/modeles/llama-2-34b.md) | Meta AI | non précisée | 42,2 % | -3,8 | https://epoch.ai/benchmarks |
| 45 | [INTELLECT-1](https://quelleia.com/modeles/intellect-1.md) | Prime Intellect | non précisée | 38,6 % | -7,0 | https://epoch.ai/benchmarks |
| 46 | [CodeQwen1.5-7B](https://quelleia.com/modeles/codeqwen1-5-7b.md) | Alibaba | non précisée | 37,7 % | -7,8 | https://epoch.ai/benchmarks |
| 47 | [Llama 2-13B](https://quelleia.com/modeles/llama-2-13b.md) | Meta AI | non précisée | 36,9 % | -8,5 | https://epoch.ai/benchmarks |
| 48 | [Mistral 7B v0.2](https://quelleia.com/modeles/mistral-7b-v0-2.md) | Mistral AI | non précisée | 35,4 % | -9,8 | https://epoch.ai/benchmarks |
| 48 | [DeepSeek Coder 33B](https://quelleia.com/modeles/deepseek-coder-33b.md) | DeepSeek | non précisée | 35,4 % | -9,8 | https://epoch.ai/benchmarks |
| 50 | [Qwen2.5-Coder-0.5B](https://quelleia.com/modeles/qwen2-5-coder-0-5b.md) | Alibaba | non précisée | 34,5 % | -10,7 | https://epoch.ai/benchmarks |
| 51 | [MPT-30B](https://quelleia.com/modeles/mpt-30b.md) | MosaicML | non précisée | 34,4 % | -10,8 | https://epoch.ai/benchmarks |
| 52 | [Falcon-40B](https://quelleia.com/modeles/falcon-40b.md) | Technology Innovation Institute | non précisée | 33,8 % | -11,3 | https://epoch.ai/benchmarks |
| 53 | [PaLM 62B](https://quelleia.com/modeles/palm-62b.md) | Google DeepMind | non précisée | 33 % | -12,1 | https://epoch.ai/benchmarks |
| 54 | [StarCoder 2 7B](https://quelleia.com/modeles/starcoder-2-7b.md) | Hugging Face | non précisée | 32,7 % | -12,3 | https://epoch.ai/benchmarks |
| 55 | [chatglm2-6b](https://quelleia.com/modeles/chatglm2-6b.md) | Z.ai (Zhipu AI) | non précisée | 32,4 % | -12,6 | https://epoch.ai/benchmarks |
| 56 | [internlm-7b](https://quelleia.com/modeles/internlm-7b.md) | Shanghai AI Laboratory | non précisée | 31,2 % | -13,8 | https://epoch.ai/benchmarks |
| 57 | [vicuna-13b-v1.1](https://quelleia.com/modeles/vicuna-13b-v1-1.md) |  | non précisée | 28,1 % | -16,9 | https://epoch.ai/benchmarks |
| 58 | [Baichuan 1-13B](https://quelleia.com/modeles/baichuan-1-13b.md) | Baichuan | non précisée | 26,8 % | -18,2 | https://epoch.ai/benchmarks |
| 59 | [Baichuan 2-7B](https://quelleia.com/modeles/baichuan-2-7b.md) | Baichuan | non précisée | 24,6 % | -20,7 | https://epoch.ai/benchmarks |
| 60 | [Vicuna-13B-v1.3](https://quelleia.com/modeles/vicuna-13b-v1-3.md) | Large Model Systems Organization | non précisée | 22,6 % | -23,0 | https://epoch.ai/benchmarks |
| 61 | [StarCoder 2 3B](https://quelleia.com/modeles/starcoder-2-3b.md) | Hugging Face | non précisée | 21,6 % | -24,2 | https://epoch.ai/benchmarks |
| 62 | [DeepSeek Coder 6.7B](https://quelleia.com/modeles/deepseek-coder-6-7b.md) | DeepSeek | non précisée | 21,3 % | -24,6 | https://epoch.ai/benchmarks |
| 63 | [Qwen-1_8B](https://quelleia.com/modeles/qwen-1-8b.md) | Alibaba | non précisée | 21,2 % | -24,7 | https://epoch.ai/benchmarks |
| 64 | [LLaMA-13B](https://quelleia.com/modeles/llama-13b.md) | Meta AI | non précisée | 20,5 % | -25,5 | https://epoch.ai/benchmarks |
| 65 | [Gemma 2B](https://quelleia.com/modeles/gemma-2b.md) | Google DeepMind | non précisée | 17,7 % | -29,3 | https://epoch.ai/benchmarks |
| 66 | [Llama 2-7B](https://quelleia.com/modeles/llama-2-7b.md) | Meta AI | non précisée | 16,7 % | -30,8 | https://epoch.ai/benchmarks |
| 67 | [internlm-chat-20b](https://quelleia.com/modeles/internlm-chat-20b.md) | Shanghai AI Laboratory | non précisée | 15,7 % | -32,3 | https://epoch.ai/benchmarks |
| 68 | [LLaMA-7B](https://quelleia.com/modeles/llama-7b.md) | Meta AI | non précisée | 11 % | -40,9 | https://epoch.ai/benchmarks |
| 69 | [BLOOM-176B](https://quelleia.com/modeles/bloom-176b.md) | Hugging Face | non précisée | 9,5 % | -44,3 | https://epoch.ai/benchmarks |
| 70 | [Baichuan1-7B](https://quelleia.com/modeles/baichuan1-7b.md) | Baichuan | non précisée | 9,2 % | -45,1 | https://epoch.ai/benchmarks |
| 71 | [MPT-7B](https://quelleia.com/modeles/mpt-7b.md) | MosaicML | non précisée | 9,1 % | -45,3 | https://epoch.ai/benchmarks |
| 72 | [GPT-3 175B (davinci)](https://quelleia.com/modeles/gpt-3-175b-davinci.md) | OpenAI | non précisée | 9 % | -45,6 | https://epoch.ai/benchmarks |
| 73 | [Falcon-7B](https://quelleia.com/modeles/falcon-7b.md) | Technology Innovation Institute | non précisée | 6,8 % | -51,9 | https://epoch.ai/benchmarks |
| 74 | [DeepSeek Coder 1.3B](https://quelleia.com/modeles/deepseek-coder-1-3b.md) | DeepSeek | non précisée | 4,4 % | -61,5 | https://epoch.ai/benchmarks |
| 75 | [OPT-175B](https://quelleia.com/modeles/opt-175b.md) | Meta AI | non précisée | 4 % | -63,6 | https://epoch.ai/benchmarks |
| 76 | [OPT-66B](https://quelleia.com/modeles/opt-66b.md) | Meta AI | non précisée | 1,8 % | -80,7 | https://epoch.ai/benchmarks |
| 77 | [GPT-3 6.7B](https://quelleia.com/modeles/gpt-3-6-7b.md) | OpenAI | non précisée | 1,6 % | -83,2 | https://epoch.ai/benchmarks |
| 78 | [GPT-3 XL (babbage)](https://quelleia.com/modeles/gpt-3-xl-babbage.md) | OpenAI | non précisée | 0,7 % | -93,2 | https://epoch.ai/benchmarks |
| 79 | [GPT-3 Medium](https://quelleia.com/modeles/gpt-3-medium.md) | OpenAI | non précisée | 0,6 % | -93,2 | https://epoch.ai/benchmarks |
| 79 | [InstructGPT 6B](https://quelleia.com/modeles/instructgpt-6b.md) | OpenAI | non précisée | 0,6 % | -93,2 | https://epoch.ai/benchmarks |
| 81 | [InstructGPT 350M](https://quelleia.com/modeles/instructgpt-350m.md) | OpenAI | non précisée | 0,4 % | -93,2 | https://epoch.ai/benchmarks |
| 82 | [InstructGPT 1.3B](https://quelleia.com/modeles/instructgpt-1-3b.md) | OpenAI | non précisée | 0 % | -93,2 | https://epoch.ai/benchmarks |

## En bref

**Que mesure GSM8K ?** Des problèmes d'arithmétique de niveau école et collège, rédigés en langage courant, à résoudre en quelques étapes de calcul. Sur Quelle IA, il est rangé dans la tâche Mathématiques.

**Comment GSM8K est-il noté ?** Part de réponses numériques exactement justes. Un modèle qui obtient 50 % a un score IA d'environ 3.

**Qui est en tête sur GSM8K ?** DeepSeek-Coder-V2 236B (DeepSeek) est en tête de GSM8K avec 94,5 %, dans l'édition du 28 septembre 2026. Suivent Qwen2.5-Coder-14B-Instruct (94,2 %) et Qwen2.5-Coder-32B-Instruct (93 %). 82 modèles y sont mesurés.

**Quelles sont les limites de GSM8K ?** Saturé et très présent dans les données d'entraînement. Il ne sert plus qu'à situer d'anciens modèles. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse GSM8K dans le score IA ?** GSM8K compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Mathématiques (10 % du score général) repose sur 8 autres benchmarks.

**Qui maintient GSM8K ?** OpenAI (Cobbe et al., 2021). Sa page de référence : github.com/openai/grade-school-math.

## Les autres benchmarks de la tâche Mathématiques

- [Arena, questions de maths](https://quelleia.com/benchmarks/arena_maths.md) : 269 modèles · 1,25 % du score
- [OTIS Mock AIME 2024-2025](https://quelleia.com/benchmarks/otis_mock_aime_2024_2025.md) : 190 modèles · 1,25 % du score, saturé
- [FrontierMath, paliers 1 à 3 (v2)](https://quelleia.com/benchmarks/frontiermath_tiers_1_3_v2.md) : 77 modèles · 1,25 % du score
- [FrontierMath, paliers 1 à 3 (version 2025)](https://quelleia.com/benchmarks/frontiermath.md) : 70 modèles · 1,25 % du score
- [ProofBench](https://quelleia.com/benchmarks/proofbench.md) : 70 modèles · 1,25 % du score, saturé
- [FrontierMath, palier 4 (v2)](https://quelleia.com/benchmarks/frontiermath_tier_4_v2.md) : 59 modèles · 1,25 % du score, saturé
- [FrontierMath, palier 4 (version 2025)](https://quelleia.com/benchmarks/frontiermath_tier_4.md) : 55 modèles · 1,25 % du score
- [FrontierMath Erdős](https://quelleia.com/benchmarks/frontiermath_erdos.md) : 5 modèles · 1,25 % du score
- [MATH Level 5](https://quelleia.com/benchmarks/math_level_5.md) : 94 modèles · hors score, archivé
- [LiveBench, mathématiques](https://quelleia.com/benchmarks/livebench_maths.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
