# MMLU

> Fiche du benchmark MMLU sur Quelle IA, édition du 28 septembre 2026. Des milliers de questions à choix multiples sur 57 matières, du lycée au niveau professionnel : droit, médecine, histoire, physique. En tête au 28 septembre 2026 : GPT-4o (Nov 2024) (88,1 %). Notation, limites et classement des 127 modèles mesurés.

Page : https://quelleia.com/benchmarks/mmlu/
Source du benchmark : https://github.com/hendrycks/test
Mainteneur : Hendrycks et al. (UC Berkeley, 2020)
Tâche : Tests historiques
État : archivé

## À quoi il sert

MMLU est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

## Comment c'est noté

Part de bonnes réponses à quatre choix ; le hasard donne 25 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

## Ce qu'il ne dit pas

Saturé autour de 90 %, présent dans les données d'entraînement et entaché de quelques questions erronées. Il ne départage plus les modèles récents.

## Qui le tient

Hendrycks et al. (UC Berkeley, 2020).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 63 % a un score IA d'environ 12. Le meilleur, GPT-4o (Nov 2024), atteint 88,1 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 83 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 91 %
- Score IA 100 (niveau de Claude Opus 5.5) : 95 %

## Son poids dans le score IA

0 % du score général. MMLU est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

## Classement (127 modèles mesurés · 217 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-4o (Nov 2024)](https://quelleia.com/modeles/gpt-4o-nov-2024.md) | OpenAI | non précisée | 88,1 % | 66,1 | https://epoch.ai/benchmarks |
| 2 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 87,3 % | 63,6 | https://epoch.ai/benchmarks |
| 3 | [DeepSeek-V3](https://quelleia.com/modeles/deepseek-v3.md) | DeepSeek | non précisée | 87,2 % | 63,3 | https://epoch.ai/benchmarks |
| 4 | [Gemini 1.5 Pro (Sept 2024)](https://quelleia.com/modeles/gemini-1-5-pro-sept-2024.md) | Google DeepMind | non précisée | 86,9 % | 62,4 | https://epoch.ai/benchmarks |
| 5 | [Claude 3.5 Sonnet](https://quelleia.com/modeles/claude-3-5-sonnet.md) | Anthropic | non précisée | 86,5 % | 61,2 | https://epoch.ai/benchmarks |
| 6 | [GPT-4 (Mar 2023)](https://quelleia.com/modeles/gpt-4-mar-2023.md) | OpenAI | non précisée | 86,4 % | 60,9 | https://epoch.ai/benchmarks |
| 7 | [Llama 3.3 70B](https://quelleia.com/modeles/llama-3-3-70b.md) | Meta AI | non précisée | 86,3 % | 60,6 | https://epoch.ai/benchmarks |
| 8 | [Gemini 1.5 Pro (May 2024)](https://quelleia.com/modeles/gemini-1-5-pro-may-2024.md) | Google DeepMind | non précisée | 85,9 % | 59,5 | https://epoch.ai/benchmarks |
| 9 | [Qwen2.5-72B](https://quelleia.com/modeles/qwen2-5-72b.md) | Alibaba | non précisée | 85,3 % | 57,8 | https://epoch.ai/benchmarks |
| 10 | [Phi-4](https://quelleia.com/modeles/phi-4.md) | Microsoft | non précisée | 84,8 % | 56,5 | https://epoch.ai/benchmarks |
| 11 | [Claude 3 Opus](https://quelleia.com/modeles/claude-3-opus.md) | Anthropic | non précisée | 84,6 % | 56,0 | https://epoch.ai/benchmarks |
| 12 | [Llama 3.1-405B](https://quelleia.com/modeles/llama-3-1-405b.md) | Meta AI | non précisée | 84,5 % | 55,7 | https://epoch.ai/benchmarks |
| 13 | [GPT-4o (Aug 2024)](https://quelleia.com/modeles/gpt-4o-aug-2024.md) | OpenAI | non précisée | 84,3 % | 55,2 | https://epoch.ai/benchmarks |
| 14 | [GPT-4o (May 2024)](https://quelleia.com/modeles/gpt-4o-may-2024.md) | OpenAI | non précisée | 84,2 % | 54,9 | https://epoch.ai/benchmarks |
| 15 | [Gemini 1.5 Pro (Feb 2024)](https://quelleia.com/modeles/gemini-1-5-pro-feb-2024.md) | Google DeepMind | non précisée | 82,7 % | 51,2 | https://epoch.ai/benchmarks |
| 16 | [GPT-4 (Jun 2023)](https://quelleia.com/modeles/gpt-4-jun-2023.md) | OpenAI | non précisée | 82,4 % | 50,4 | https://epoch.ai/benchmarks |
| 16 | [Qwen2-72B](https://quelleia.com/modeles/qwen2-72b.md) | Alibaba | non précisée | 82,4 % | 50,4 | https://epoch.ai/benchmarks |
| 18 | [Amazon Nova Pro](https://quelleia.com/modeles/amazon-nova-pro.md) | Amazon | non précisée | 82 % | 49,5 | https://epoch.ai/benchmarks |
| 19 | [GPT-4o mini](https://quelleia.com/modeles/gpt-4o-mini.md) | OpenAI | non précisée | 81,8 % | 49,0 | https://epoch.ai/benchmarks |
| 20 | [GPT-4 Turbo (Apr 2024)](https://quelleia.com/modeles/gpt-4-turbo-apr-2024.md) | OpenAI | non précisée | 81,3 % | 47,8 | https://epoch.ai/benchmarks |
| 21 | [Llama 3.2 90B](https://quelleia.com/modeles/llama-3-2-90b.md) | Meta AI | non précisée | 80,3 % | 45,6 | https://epoch.ai/benchmarks |
| 22 | [Llama 3.1-70B](https://quelleia.com/modeles/llama-3-1-70b.md) | Meta AI | non précisée | 80,1 % | 45,1 | https://epoch.ai/benchmarks |
| 23 | [Mistral Large 2 (Jul 2024)](https://quelleia.com/modeles/mistral-large-2-jul-2024.md) | Mistral AI | non précisée | 80 % | 44,9 | https://epoch.ai/benchmarks |
| 24 | [Qwen2.5-14B](https://quelleia.com/modeles/qwen2-5-14b.md) | Alibaba | non précisée | 79,9 % | 44,7 | https://epoch.ai/benchmarks |
| 25 | [Gemini 2.0 Flash (Dec 2024)](https://quelleia.com/modeles/gemini-2-0-flash-dec-2024.md) | Google DeepMind | non précisée | 79,7 % | 44,3 | https://epoch.ai/benchmarks |
| 26 | [GPT-4 Turbo (Nov 2023)](https://quelleia.com/modeles/gpt-4-turbo-nov-2023.md) | OpenAI | non précisée | 79,6 % | 44,0 | https://epoch.ai/benchmarks |
| 27 | [Yi-Large](https://quelleia.com/modeles/yi-large.md) | 01.AI | non précisée | 79,3 % | 43,4 | https://epoch.ai/benchmarks |
| 27 | [Llama 3-70B](https://quelleia.com/modeles/llama-3-70b.md) | Meta AI | non précisée | 79,3 % | 43,4 | https://epoch.ai/benchmarks |
| 29 | [Qwen2.5-Coder-32B](https://quelleia.com/modeles/qwen2-5-coder-32b.md) | Alibaba | non précisée | 79,1 % | 43,0 | https://epoch.ai/benchmarks |
| 30 | [Claude 2](https://quelleia.com/modeles/claude-2.md) | Anthropic | non précisée | 78,5 % | 41,7 | https://epoch.ai/benchmarks |
| 31 | [DeepSeek-V2 (MoE-236B, May 2024)](https://quelleia.com/modeles/deepseek-v2-moe-236b-may-2024.md) | DeepSeek | non précisée | 78,4 % | 41,5 | https://epoch.ai/benchmarks |
| 32 | [phi-3-medium 14B](https://quelleia.com/modeles/phi-3-medium-14b.md) | Microsoft | non précisée | 78 % | 40,6 | https://epoch.ai/benchmarks |
| 33 | [Gemini 1.5 Flash (May 2024)](https://quelleia.com/modeles/gemini-1-5-flash-may-2024.md) | Google DeepMind | non précisée | 77,9 % | 40,4 | https://epoch.ai/benchmarks |
| 34 | [Mixtral 8x22B](https://quelleia.com/modeles/mixtral-8x22b.md) | Mistral AI | non précisée | 77,8 % | 40,2 | https://epoch.ai/benchmarks |
| 35 | [Claude 1.3](https://quelleia.com/modeles/claude-1-3.md) | Anthropic | non précisée | 77 % | 38,6 | https://epoch.ai/benchmarks |
| 35 | [Amazon Nova Lite](https://quelleia.com/modeles/amazon-nova-lite.md) | Amazon | non précisée | 77 % | 38,6 | https://epoch.ai/benchmarks |
| 37 | [Yi-34B](https://quelleia.com/modeles/yi-34b.md) | 01.AI | non précisée | 76,3 % | 37,2 | https://epoch.ai/benchmarks |
| 38 | [Claude 3 Sonnet](https://quelleia.com/modeles/claude-3-sonnet.md) | Anthropic | non précisée | 75,9 % | 36,4 | https://epoch.ai/benchmarks |
| 39 | [Gemma 2 27B](https://quelleia.com/modeles/gemma-2-27b.md) | Google DeepMind | non précisée | 75,7 % | 36,0 | https://epoch.ai/benchmarks |
| 39 | [phi-3-small 7.4B](https://quelleia.com/modeles/phi-3-small-7-4b.md) | Microsoft | non précisée | 75,7 % | 36,0 | https://epoch.ai/benchmarks |
| 41 | [Qwen2.5-Coder-14B](https://quelleia.com/modeles/qwen2-5-coder-14b.md) | Alibaba | non précisée | 75,2 % | 35,0 | https://epoch.ai/benchmarks |
| 42 | [Qwen1.5-32B](https://quelleia.com/modeles/qwen1-5-32b.md) | Alibaba | non précisée | 74,4 % | 33,5 | https://epoch.ai/benchmarks |
| 43 | [Claude 3.5 Haiku](https://quelleia.com/modeles/claude-3-5-haiku.md) | Anthropic | non précisée | 74,3 % | 33,3 | https://epoch.ai/benchmarks |
| 44 | [Gemini 1.5 Flash (Sep 2024)](https://quelleia.com/modeles/gemini-1-5-flash-sep-2024.md) | Google DeepMind | non précisée | 73,9 % | 32,5 | https://epoch.ai/benchmarks |
| 45 | [Claude 3 Haiku](https://quelleia.com/modeles/claude-3-haiku.md) | Anthropic | non précisée | 73,8 % | 32,3 | https://epoch.ai/benchmarks |
| 46 | [Claude 2.1](https://quelleia.com/modeles/claude-2-1.md) | Anthropic | non précisée | 73,5 % | 31,8 | https://epoch.ai/benchmarks |
| 47 | [Claude Instant](https://quelleia.com/modeles/claude-instant.md) | Anthropic | non précisée | 73,4 % | 31,6 | https://epoch.ai/benchmarks |
| 48 | [Qwen2.5-7B](https://quelleia.com/modeles/qwen2-5-7b.md) | Alibaba | non précisée | 72,9 % | 30,6 | https://epoch.ai/benchmarks |
| 49 | [Inflection-1](https://quelleia.com/modeles/inflection-1.md) | Inflection AI | non précisée | 72,7 % | 30,3 | https://epoch.ai/benchmarks |
| 50 | [Gemma 2 9B](https://quelleia.com/modeles/gemma-2-9b.md) | Google DeepMind | non précisée | 72,1 % | 29,2 | https://epoch.ai/benchmarks |
| 51 | [GPT-3.5 Turbo (Nov 2023)](https://quelleia.com/modeles/gpt-3-5-turbo-nov-2023.md) | OpenAI | non précisée | 71,4 % | 27,9 | https://epoch.ai/benchmarks |
| 52 | [Amazon Nova Micro](https://quelleia.com/modeles/amazon-nova-micro.md) | Amazon | non précisée | 70,8 % | 26,8 | https://epoch.ai/benchmarks |
| 53 | [Mixtral 8x7B](https://quelleia.com/modeles/mixtral-8x7b.md) | Mistral AI | non précisée | 70,6 % | 26,4 | https://epoch.ai/benchmarks |
| 53 | [Falcon-180B](https://quelleia.com/modeles/falcon-180b.md) | Technology Innovation Institute | non précisée | 70,6 % | 26,4 | https://epoch.ai/benchmarks |
| 55 | [Gemini 1.0 Pro](https://quelleia.com/modeles/gemini-1-0-pro.md) | Google DeepMind | non précisée | 70 % | 25,3 | https://epoch.ai/benchmarks |
| 55 | [davinci-002](https://quelleia.com/modeles/davinci-002.md) | OpenAI | non précisée | 70 % | 25,3 | https://epoch.ai/benchmarks |
| 57 | [Llama 2-70B](https://quelleia.com/modeles/llama-2-70b.md) | Meta AI | non précisée | 69,9 % | 25,2 | https://epoch.ai/benchmarks |
| 58 | [Command R+](https://quelleia.com/modeles/command-r.md) | Cohere | non précisée | 69,4 % | 24,3 | https://epoch.ai/benchmarks |
| 59 | [PaLM (540B)](https://quelleia.com/modeles/palm-540b.md) | Google Research | non précisée | 69,3 % | 24,1 | https://epoch.ai/benchmarks |
| 60 | [GPT-3.5 Turbo (Jun 2023)](https://quelleia.com/modeles/gpt-3-5-turbo-jun-2023.md) | OpenAI | non précisée | 68,9 % | 23,4 | https://epoch.ai/benchmarks |
| 61 | [Mistral Large](https://quelleia.com/modeles/mistral-large.md) | Mistral AI | non précisée | 68,8 % | 23,2 | https://epoch.ai/benchmarks |
| 61 | [Llama 3-8B](https://quelleia.com/modeles/llama-3-8b.md) | Meta AI | non précisée | 68,8 % | 23,2 | https://epoch.ai/benchmarks |
| 61 | [phi-3-mini 3.8B](https://quelleia.com/modeles/phi-3-mini-3-8b.md) | Microsoft | non précisée | 68,8 % | 23,2 | https://epoch.ai/benchmarks |
| 64 | [mistral-small-2402](https://quelleia.com/modeles/mistral-small-2402.md) | Mistral AI | non précisée | 68,7 % | 23,0 | https://epoch.ai/benchmarks |
| 65 | [Stable Beluga 2](https://quelleia.com/modeles/stable-beluga-2.md) | Stability AI | non précisée | 68,6 % | 22,8 | https://epoch.ai/benchmarks |
| 65 | [Qwen1.5-14B](https://quelleia.com/modeles/qwen1-5-14b.md) | Alibaba | non précisée | 68,6 % | 22,8 | https://epoch.ai/benchmarks |
| 67 | [Yi-9B](https://quelleia.com/modeles/yi-9b.md) | 01.AI | non précisée | 68,4 % | 22,5 | https://epoch.ai/benchmarks |
| 68 | [Qwen2.5-Coder (7B)](https://quelleia.com/modeles/qwen2-5-coder-7b.md) | Alibaba | non précisée | 68 % | 21,8 | https://epoch.ai/benchmarks |
| 69 | [Chinchilla](https://quelleia.com/modeles/chinchilla.md) | DeepMind | non précisée | 67,5 % | 20,9 | https://epoch.ai/benchmarks |
| 70 | [GPT-3.5 Turbo (Jan 2024)](https://quelleia.com/modeles/gpt-3-5-turbo-jan-2024.md) | OpenAI | non précisée | 67,3 % | 20,6 | https://epoch.ai/benchmarks |
| 71 | [Qwen-14B](https://quelleia.com/modeles/qwen-14b.md) | Alibaba | non précisée | 66,3 % | 18,8 | https://epoch.ai/benchmarks |
| 72 | [Gemma 7B](https://quelleia.com/modeles/gemma-7b.md) | Google DeepMind | non précisée | 66,1 % | 18,5 | https://epoch.ai/benchmarks |
| 73 | [c4ai-command-r-08-2024](https://quelleia.com/modeles/c4ai-command-r-08-2024.md) | Cohere | non précisée | 65,2 % | 16,9 | https://epoch.ai/benchmarks |
| 74 | [StarCoder 2 15B](https://quelleia.com/modeles/starcoder-2-15b.md) | Hugging Face | non précisée | 64,1 % | 15,0 | https://epoch.ai/benchmarks |
| 75 | [Yi 6B](https://quelleia.com/modeles/yi-6b.md) | 01.AI | non précisée | 64 % | 14,8 | https://epoch.ai/benchmarks |
| 76 | [LLaMA-65B](https://quelleia.com/modeles/llama-65b.md) | Meta AI | non précisée | 63,4 % | 13,8 | https://epoch.ai/benchmarks |
| 77 | [Qwen1.5-7B](https://quelleia.com/modeles/qwen1-5-7b.md) | Alibaba | non précisée | 62,6 % | 12,4 | https://epoch.ai/benchmarks |
| 77 | [Llama 2-34B](https://quelleia.com/modeles/llama-2-34b.md) | Meta AI | non précisée | 62,6 % | 12,4 | https://epoch.ai/benchmarks |
| 79 | [Mistral 7B v0.2](https://quelleia.com/modeles/mistral-7b-v0-2.md) | Mistral AI | non précisée | 62,5 % | 12,2 | https://epoch.ai/benchmarks |
| 79 | [Mistral 7B v0.1](https://quelleia.com/modeles/mistral-7b-v0-1.md) | Mistral AI | non précisée | 62,5 % | 12,2 | https://epoch.ai/benchmarks |
| 81 | [DeepSeek-Coder-V2-Lite-Base](https://quelleia.com/modeles/deepseek-coder-v2-lite-base.md) | DeepSeek | non précisée | 60,5 % | 8,8 | https://epoch.ai/benchmarks |
| 82 | [Gopher (280B)](https://quelleia.com/modeles/gopher-280b.md) | DeepMind | non précisée | 60 % | 7,9 | https://epoch.ai/benchmarks |
| 83 | [Mistral 7B v0.3](https://quelleia.com/modeles/mistral-7b-v0-3.md) | Mistral AI | non précisée | 59,9 % | 7,8 | https://epoch.ai/benchmarks |
| 84 | [Baichuan2-13B](https://quelleia.com/modeles/baichuan2-13b.md) | Baichuan | non précisée | 59,2 % | 6,5 | https://epoch.ai/benchmarks |
| 85 | [LLaMA-33B](https://quelleia.com/modeles/llama-33b.md) | Meta AI | non précisée | 58,7 % | 5,7 | https://epoch.ai/benchmarks |
| 85 | [Nemotron-4 15B](https://quelleia.com/modeles/nemotron-4-15b.md) | NVIDIA | non précisée | 58,7 % | 5,7 | https://epoch.ai/benchmarks |
| 87 | [Falcon 2 11B](https://quelleia.com/modeles/falcon-2-11b.md) | Technology Innovation Institute | non précisée | 58,4 % | 5,2 | https://epoch.ai/benchmarks |
| 87 | [Phi-2](https://quelleia.com/modeles/phi-2.md) | Microsoft | non précisée | 58,4 % | 5,2 | https://epoch.ai/benchmarks |
| 89 | [internlm-chat-20b](https://quelleia.com/modeles/internlm-chat-20b.md) | Shanghai AI Laboratory | non précisée | 57,4 % | 3,4 | https://epoch.ai/benchmarks |
| 90 | [Falcon-40B](https://quelleia.com/modeles/falcon-40b.md) | Technology Innovation Institute | non précisée | 56,9 % | 2,5 | https://epoch.ai/benchmarks |
| 91 | [Llama 3.2 11B](https://quelleia.com/modeles/llama-3-2-11b.md) | Meta AI | non précisée | 56,5 % | 1,8 | https://epoch.ai/benchmarks |
| 92 | [Llama 3.1-8B](https://quelleia.com/modeles/llama-3-1-8b.md) | Meta AI | non précisée | 56,1 % | 1,1 | https://epoch.ai/benchmarks |
| 93 | [Llama 2-13B](https://quelleia.com/modeles/llama-2-13b.md) | Meta AI | non précisée | 55,6 % | 0,2 | https://epoch.ai/benchmarks |
| 94 | [Baichuan2-13B-Chat](https://quelleia.com/modeles/baichuan2-13b-chat.md) | Baichuan AI | non précisée | 55,1 % | -0,7 | https://epoch.ai/benchmarks |
| 95 | [Baichuan 2-7B](https://quelleia.com/modeles/baichuan-2-7b.md) | Baichuan | non précisée | 54,2 % | -2,4 | https://epoch.ai/benchmarks |
| 96 | [PaLM 62B](https://quelleia.com/modeles/palm-62b.md) | Google DeepMind | non précisée | 53,7 % | -3,2 | https://epoch.ai/benchmarks |
| 97 | [Qwen2.5-Coder (1.5B)](https://quelleia.com/modeles/qwen2-5-coder-1-5b.md) | Alibaba | non précisée | 53,6 % | -3,4 | https://epoch.ai/benchmarks |
| 98 | [Baichuan 1-13B](https://quelleia.com/modeles/baichuan-1-13b.md) | Baichuan | non précisée | 51,6 % | -7,1 | https://epoch.ai/benchmarks |
| 99 | [internlm-7b](https://quelleia.com/modeles/internlm-7b.md) | Shanghai AI Laboratory | non précisée | 51 % | -8,2 | https://epoch.ai/benchmarks |
| 100 | [INTELLECT-1](https://quelleia.com/modeles/intellect-1.md) | Prime Intellect | non précisée | 49,9 % | -10,4 | https://epoch.ai/benchmarks |
| 101 | [MPT-30B](https://quelleia.com/modeles/mpt-30b.md) | MosaicML | non précisée | 47,9 % | -14,3 | https://epoch.ai/benchmarks |
| 101 | [chatglm2-6b](https://quelleia.com/modeles/chatglm2-6b.md) | Z.ai (Zhipu AI) | non précisée | 47,9 % | -14,3 | https://epoch.ai/benchmarks |
| 103 | [LLaMA-13B](https://quelleia.com/modeles/llama-13b.md) | Meta AI | non précisée | 47,7 % | -14,7 | https://epoch.ai/benchmarks |
| 104 | [Llama 2-7B](https://quelleia.com/modeles/llama-2-7b.md) | Meta AI | non précisée | 45,8 % | -18,7 | https://epoch.ai/benchmarks |
| 105 | [Qwen-7B](https://quelleia.com/modeles/qwen-7b.md) | Alibaba | non précisée | 45 % | -20,4 | https://epoch.ai/benchmarks |
| 106 | [InstructGPT 175B](https://quelleia.com/modeles/instructgpt-175b.md) | OpenAI | non précisée | 43,9 % | -22,9 | https://epoch.ai/benchmarks |
| 107 | [Baichuan1-7B](https://quelleia.com/modeles/baichuan1-7b.md) | Baichuan | non précisée | 42,3 % | -26,7 | https://epoch.ai/benchmarks |
| 107 | [Gemma 2B](https://quelleia.com/modeles/gemma-2b.md) | Google DeepMind | non précisée | 42,3 % | -26,7 | https://epoch.ai/benchmarks |
| 109 | [Qwen2.5-Coder-0.5B](https://quelleia.com/modeles/qwen2-5-coder-0-5b.md) | Alibaba | non précisée | 42 % | -27,4 | https://epoch.ai/benchmarks |
| 110 | [CodeQwen1.5-7B](https://quelleia.com/modeles/codeqwen1-5-7b.md) | Alibaba | non précisée | 40,5 % | -31,2 | https://epoch.ai/benchmarks |
| 111 | [DeepSeek Coder 33B](https://quelleia.com/modeles/deepseek-coder-33b.md) | DeepSeek | non précisée | 39,4 % | -34,2 | https://epoch.ai/benchmarks |
| 112 | [StarCoder 2 7B](https://quelleia.com/modeles/starcoder-2-7b.md) | Hugging Face | non précisée | 38,8 % | -35,9 | https://epoch.ai/benchmarks |
| 113 | [Phi-1.5](https://quelleia.com/modeles/phi-1-5.md) | Microsoft | non précisée | 37,6 % | -39,4 | https://epoch.ai/benchmarks |
| 114 | [StarCoder 2 3B](https://quelleia.com/modeles/starcoder-2-3b.md) | Hugging Face | non précisée | 36,6 % | -42,6 | https://epoch.ai/benchmarks |
| 115 | [DeepSeek Coder 6.7B](https://quelleia.com/modeles/deepseek-coder-6-7b.md) | DeepSeek | non précisée | 36,4 % | -43,3 | https://epoch.ai/benchmarks |
| 116 | [XGen-7B](https://quelleia.com/modeles/xgen-7b.md) | Salesforce | non précisée | 36,3 % | -43,6 | https://epoch.ai/benchmarks |
| 117 | [LLaMA-7B](https://quelleia.com/modeles/llama-7b.md) | Meta AI | non précisée | 35,6 % | -46,0 | https://epoch.ai/benchmarks |
| 118 | [Falcon-7B](https://quelleia.com/modeles/falcon-7b.md) | Technology Innovation Institute | non précisée | 35 % | -48,2 | https://epoch.ai/benchmarks |
| 119 | [MPT-7B](https://quelleia.com/modeles/mpt-7b.md) | MosaicML | non précisée | 30,8 % | -67,8 | https://epoch.ai/benchmarks |
| 120 | [open_llama_7b](https://quelleia.com/modeles/open-llama-7b.md) |  | non précisée | 29,9 % | -73,7 | https://epoch.ai/benchmarks |
| 121 | [Qwen-1_8B](https://quelleia.com/modeles/qwen-1-8b.md) | Alibaba | non précisée | 28,2 % | -88,2 | https://epoch.ai/benchmarks |
| 122 | [RedPajama-INCITE-7B-Base](https://quelleia.com/modeles/redpajama-incite-7b-base.md) |  | non précisée | 26,3 % | -118,2 | https://epoch.ai/benchmarks |
| 123 | [Cerebras-GPT-13B](https://quelleia.com/modeles/cerebras-gpt-13b.md) | Cerebras Systems | non précisée | 26,2 % | -120,8 | https://epoch.ai/benchmarks |
| 123 | [Dolly 2.0-12b](https://quelleia.com/modeles/dolly-2-0-12b.md) | Databricks | non précisée | 26,2 % | -120,8 | https://epoch.ai/benchmarks |
| 125 | [DeepSeek Coder 1.3B](https://quelleia.com/modeles/deepseek-coder-1-3b.md) | DeepSeek | non précisée | 25,8 % | -134,1 | https://epoch.ai/benchmarks |
| 126 | [GPT-J-6B](https://quelleia.com/modeles/gpt-j-6b.md) | EleutherAI | non précisée | 25,7 % | -136,2 | https://epoch.ai/benchmarks |
| 127 | [opt-13b](https://quelleia.com/modeles/opt-13b.md) | Meta AI | non précisée | 25,1 % | -136,2 | https://epoch.ai/benchmarks |

## En bref

**Que mesure MMLU ?** Des milliers de questions à choix multiples sur 57 matières, du lycée au niveau professionnel : droit, médecine, histoire, physique. C'est un test historique, hors des scores d'aujourd'hui.

**Comment MMLU est-il noté ?** Part de bonnes réponses à quatre choix ; le hasard donne 25 %. Un modèle qui obtient 63 % a un score IA d'environ 12.

**Qui est en tête sur MMLU ?** GPT-4o (Nov 2024) (OpenAI) est en tête de MMLU avec 88,1 %, dans l'édition du 28 septembre 2026. Suivent Claude 3.5 Sonnet (October 2024) (87,3 %) et DeepSeek-V3 (87,2 %). 127 modèles y sont mesurés.

**Quelles sont les limites de MMLU ?** Saturé autour de 90 %, présent dans les données d'entraînement et entaché de quelques questions erronées. Il ne départage plus les modèles récents. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse MMLU dans le score IA ?** MMLU compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

**Qui maintient MMLU ?** Hendrycks et al. (UC Berkeley, 2020). Sa page de référence : github.com/hendrycks/test.

## Les autres tests historiques

- [WinoGrande](https://quelleia.com/benchmarks/winogrande.md) : 77 modèles · hors score, archivé
- [ARC (AI2 Reasoning Challenge)](https://quelleia.com/benchmarks/arc_ai2.md) : 76 modèles · hors score, archivé
- [BoolQ](https://quelleia.com/benchmarks/boolq.md) : 76 modèles · hors score, archivé
- [HellaSwag](https://quelleia.com/benchmarks/hellaswag.md) : 75 modèles · hors score, archivé
- [PIQA](https://quelleia.com/benchmarks/piqa.md) : 59 modèles · hors score, archivé
- [LiveBench](https://quelleia.com/benchmarks/livebench.md) : 48 modèles · hors score, archivé
- [BIG-Bench Hard (BBH)](https://quelleia.com/benchmarks/bbh.md) : 45 modèles · hors score, archivé
- [OpenBookQA](https://quelleia.com/benchmarks/openbookqa.md) : 42 modèles · hors score, archivé
- [TriviaQA](https://quelleia.com/benchmarks/triviaqa.md) : 38 modèles · hors score, archivé
- [LAMBADA](https://quelleia.com/benchmarks/lambada.md) : 26 modèles · hors score, archivé
- [ScienceQA](https://quelleia.com/benchmarks/scienceqa.md) : 23 modèles · hors score, archivé
- [ANLI (Adversarial NLI)](https://quelleia.com/benchmarks/anli.md) : 11 modèles · hors score, archivé
- [SuperGLUE](https://quelleia.com/benchmarks/superglue.md) : 8 modèles · hors score, archivé
- [CommonsenseQA 2.0](https://quelleia.com/benchmarks/csqa2.md) : 6 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
