Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

Test historiqueFiche benchmark · Hendrycks et al. (UC Berkeley, 2020) · github.com

MMLU

Des milliers de questions à choix multiples sur 57 matières, du lycée au niveau professionnel : droit, médecine, histoire, physique.

ARCHIVÉ

À quoi il sert

MMLU est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

Comment c'est noté

Part de bonnes réponses à quatre choix ; le hasard donne 25 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

Ce qu'il ne dit pas

Saturé autour de 90 %, présent dans les données d'entraînement et entaché de quelques questions erronées. Il ne départage plus les modèles récents.

Comment lire le score

127 modèles mesurés · 217 mesures

En tête : GPT-4o (Nov 2024), 88,1 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 63 % a un score IA d'environ 12. Le meilleur, GPT-4o (Nov 2024), atteint 88,1 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
83 %
Score IA 76niveau de Claude Sonnet 4.5
91 %
Score IA 100niveau de Claude Opus 5.5
95 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. MMLU est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-4o (Nov 2024)OpenAINon précisée88,1 %66,1
2Claude 3.5 Sonnet (October 2024)AnthropicNon précisée87,3 %63,6
3DeepSeek-V3DeepSeek · poids ouverts · 2 configurationsNon précisée87,2 %63,3
4Gemini 1.5 Pro (Sept 2024)Google DeepMindNon précisée86,9 %62,4
5Claude 3.5 SonnetAnthropicNon précisée86,5 %61,2
6GPT-4 (Mar 2023)OpenAINon précisée86,4 %60,9
7Llama 3.3 70BMeta AI · poids ouverts · 2 configurationsNon précisée86,3 %60,6
8Gemini 1.5 Pro (May 2024)Google DeepMindNon précisée85,9 %59,5
9Qwen2.5-72BAlibaba · poids ouverts · 3 configurationsNon précisée85,3 %57,8
10Phi-4Microsoft · poids ouvertsNon précisée84,8 %56,5
127 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 127 →Replier le classement ↑
11Claude 3 OpusAnthropicNon précisée84,6 %56,0
12Llama 3.1-405BMeta AI · poids ouverts · 2 configurationsNon précisée84,5 %55,7
13GPT-4o (Aug 2024)OpenAINon précisée84,3 %55,2
14GPT-4o (May 2024)OpenAINon précisée84,2 %54,9
15Gemini 1.5 Pro (Feb 2024)Google DeepMind · 2 configurationsNon précisée82,7 %51,2
16GPT-4 (Jun 2023)OpenAINon précisée82,4 %50,4
16Qwen2-72BAlibaba · poids ouvertsNon précisée82,4 %50,4
18Amazon Nova ProAmazonNon précisée82 %49,5
19GPT-4o miniOpenAI · 2 configurationsNon précisée81,8 %49,0
20GPT-4 Turbo (Apr 2024)OpenAINon précisée81,3 %47,8
21Llama 3.2 90BMeta AI · poids ouvertsNon précisée80,3 %45,6
22Llama 3.1-70BMeta AI · poids ouvertsNon précisée80,1 %45,1
23Mistral Large 2 (Jul 2024)Mistral AINon précisée80 %44,9
24Qwen2.5-14BAlibaba · poids ouvertsNon précisée79,9 %44,7
25Gemini 2.0 Flash (Dec 2024)Google DeepMindNon précisée79,7 %44,3
26GPT-4 Turbo (Nov 2023)OpenAINon précisée79,6 %44,0
27Yi-Large01.AINon précisée79,3 %43,4
27Llama 3-70BMeta AI · poids ouvertsNon précisée79,3 %43,4
29Qwen2.5-Coder-32BAlibaba · poids ouverts · 2 configurationsNon précisée79,1 %43,0
30Claude 2AnthropicNon précisée78,5 %41,7
31DeepSeek-V2 (MoE-236B, May 2024)DeepSeek · poids ouvertsNon précisée78,4 %41,5
32phi-3-medium 14BMicrosoft · poids ouverts · 3 configurationsNon précisée78 %40,6
33Gemini 1.5 Flash (May 2024)Google DeepMind · 2 configurationsNon précisée77,9 %40,4
34Mixtral 8x22BMistral AI · poids ouvertsNon précisée77,8 %40,2
35Claude 1.3AnthropicNon précisée77 %38,6
35Amazon Nova LiteAmazonNon précisée77 %38,6
37Yi-34B01.AI · poids ouverts · 4 configurationsNon précisée76,3 %37,2
38Claude 3 SonnetAnthropicNon précisée75,9 %36,4
39Gemma 2 27BGoogle DeepMindNon précisée75,7 %36,0
39phi-3-small 7.4BMicrosoft · poids ouvertsNon précisée75,7 %36,0
41Qwen2.5-Coder-14BAlibabaNon précisée75,2 %35,0
42Qwen1.5-32BAlibaba · poids ouvertsNon précisée74,4 %33,5
43Claude 3.5 HaikuAnthropicNon précisée74,3 %33,3
44Gemini 1.5 Flash (Sep 2024)Google DeepMindNon précisée73,9 %32,5
45Claude 3 HaikuAnthropicNon précisée73,8 %32,3
46Claude 2.1AnthropicNon précisée73,5 %31,8
47Claude InstantAnthropic · 4 configurationsNon précisée73,4 %31,6
48Qwen2.5-7BAlibaba · poids ouvertsNon précisée72,9 %30,6
49Inflection-1Inflection AINon précisée72,7 %30,3
50Gemma 2 9BGoogle DeepMind · poids ouvertsNon précisée72,1 %29,2
51GPT-3.5 Turbo (Nov 2023)OpenAINon précisée71,4 %27,9
52Amazon Nova MicroAmazonNon précisée70,8 %26,8
53Mixtral 8x7BMistral AI · poids ouverts · 2 configurationsNon précisée70,6 %26,4
53Falcon-180BTechnology Innovation Institute · poids ouvertsNon précisée70,6 %26,4
55Gemini 1.0 ProGoogle DeepMindNon précisée70 %25,3
55davinci-002OpenAINon précisée70 %25,3
57Llama 2-70BMeta AI · poids ouverts · 6 configurationsNon précisée69,9 %25,2
58Command R+Cohere · poids ouvertsNon précisée69,4 %24,3
59PaLM (540B)Google ResearchNon précisée69,3 %24,1
60GPT-3.5 Turbo (Jun 2023)OpenAINon précisée68,9 %23,4
61Mistral LargeMistral AI · poids ouvertsNon précisée68,8 %23,2
61Llama 3-8BMeta AI · poids ouverts · 2 configurationsNon précisée68,8 %23,2
61phi-3-mini 3.8BMicrosoft · poids ouvertsNon précisée68,8 %23,2
64mistral-small-2402Mistral AI · poids ouvertsNon précisée68,7 %23,0
65Stable Beluga 2Stability AI · poids ouvertsNon précisée68,6 %22,8
65Qwen1.5-14BAlibaba · poids ouvertsNon précisée68,6 %22,8
67Yi-9B01.AINon précisée68,4 %22,5
68Qwen2.5-Coder (7B)Alibaba · poids ouvertsNon précisée68 %21,8
69ChinchillaDeepMindNon précisée67,5 %20,9
70GPT-3.5 Turbo (Jan 2024)OpenAINon précisée67,3 %20,6
71Qwen-14BAlibaba · poids ouverts · 4 configurationsNon précisée66,3 %18,8
72Gemma 7BGoogle DeepMind · poids ouverts · 4 configurationsNon précisée66,1 %18,5
73c4ai-command-r-08-2024Cohere · poids ouvertsNon précisée65,2 %16,9
74StarCoder 2 15BHugging Face · poids ouvertsNon précisée64,1 %15,0
75Yi 6B01.AI · poids ouverts · 4 configurationsNon précisée64 %14,8
76LLaMA-65BMeta AI · poids ouverts · 2 configurationsNon précisée63,4 %13,8
77Qwen1.5-7BAlibaba · poids ouvertsNon précisée62,6 %12,4
77Llama 2-34BMeta AI · 3 configurationsNon précisée62,6 %12,4
79Mistral 7B v0.2Mistral AINon précisée62,5 %12,2
79Mistral 7B v0.1Mistral AI · poids ouverts · 4 configurationsNon précisée62,5 %12,2
81DeepSeek-Coder-V2-Lite-BaseDeepSeekNon précisée60,5 %8,8
82Gopher (280B)DeepMind · 2 configurationsNon précisée60 %7,9
83Mistral 7B v0.3Mistral AI · poids ouvertsNon précisée59,9 %7,8
84Baichuan2-13BBaichuan · poids ouverts · 2 configurationsNon précisée59,2 %6,5
85LLaMA-33BMeta AI · poids ouverts · 4 configurationsNon précisée58,7 %5,7
85Nemotron-4 15BNVIDIANon précisée58,7 %5,7
87Falcon 2 11BTechnology Innovation Institute · poids ouvertsNon précisée58,4 %5,2
87Phi-2Microsoft · poids ouverts · 2 configurationsNon précisée58,4 %5,2
89internlm-chat-20bShanghai AI Laboratory · 2 configurationsNon précisée57,4 %3,4
90Falcon-40BTechnology Innovation Institute · poids ouverts · 3 configurationsNon précisée56,9 %2,5
91Llama 3.2 11BMeta AI · poids ouvertsNon précisée56,5 %1,8
92Llama 3.1-8BMeta AI · poids ouvertsNon précisée56,1 %1,1
93Llama 2-13BMeta AI · poids ouverts · 8 configurationsNon précisée55,6 %0,2
94Baichuan2-13B-ChatBaichuan AI · 2 configurationsNon précisée55,1 %-0,7
95Baichuan 2-7BBaichuan · poids ouvertsNon précisée54,2 %-2,4
96PaLM 62BGoogle DeepMindNon précisée53,7 %-3,2
97Qwen2.5-Coder (1.5B)Alibaba · poids ouvertsNon précisée53,6 %-3,4
98Baichuan 1-13BBaichuan · poids ouvertsNon précisée51,6 %-7,1
99internlm-7bShanghai AI LaboratoryNon précisée51 %-8,2
100INTELLECT-1Prime IntellectNon précisée49,9 %-10,4
101MPT-30BMosaicML · poids ouverts · 2 configurationsNon précisée47,9 %-14,3
101chatglm2-6bZ.ai (Zhipu AI)Non précisée47,9 %-14,3
103LLaMA-13BMeta AI · poids ouverts · 4 configurationsNon précisée47,7 %-14,7
104Llama 2-7BMeta AI · poids ouverts · 6 configurationsNon précisée45,8 %-18,7
105Qwen-7BAlibaba · poids ouvertsNon précisée45 %-20,4
106InstructGPT 175BOpenAI · 2 configurationsNon précisée43,9 %-22,9
107Baichuan1-7BBaichuan · poids ouvertsNon précisée42,3 %-26,7
107Gemma 2BGoogle DeepMind · poids ouvertsNon précisée42,3 %-26,7
109Qwen2.5-Coder-0.5BAlibaba · poids ouvertsNon précisée42 %-27,4
110CodeQwen1.5-7BAlibabaNon précisée40,5 %-31,2
111DeepSeek Coder 33BDeepSeek · poids ouvertsNon précisée39,4 %-34,2
112StarCoder 2 7BHugging Face · poids ouvertsNon précisée38,8 %-35,9
113Phi-1.5Microsoft · poids ouvertsNon précisée37,6 %-39,4
114StarCoder 2 3BHugging Face · poids ouvertsNon précisée36,6 %-42,6
115DeepSeek Coder 6.7BDeepSeek · poids ouvertsNon précisée36,4 %-43,3
116XGen-7BSalesforce · poids ouverts · 2 configurationsNon précisée36,3 %-43,6
117LLaMA-7BMeta AI · poids ouverts · 7 configurationsNon précisée35,6 %-46,0
118Falcon-7BTechnology Innovation Institute · poids ouverts · 7 configurationsNon précisée35 %-48,2
119MPT-7BMosaicML · poids ouverts · 6 configurationsNon précisée30,8 %-67,8
120open_llama_7b2 configurationsNon précisée29,9 %-73,7
121Qwen-1_8BAlibabaNon précisée28,2 %-88,2
122RedPajama-INCITE-7B-Base2 configurationsNon précisée26,3 %-118,2
123Cerebras-GPT-13BCerebras Systems · poids ouverts · 2 configurationsNon précisée26,2 %-120,8
123Dolly 2.0-12bDatabricks · poids ouverts · 2 configurationsNon précisée26,2 %-120,8
125DeepSeek Coder 1.3BDeepSeek · poids ouvertsNon précisée25,8 %-134,1
126GPT-J-6BEleutherAI · poids ouverts · 2 configurationsNon précisée25,7 %-136,2
127opt-13bMeta AI · 2 configurationsNon précisée25,1 %-136,2

En bref

Que mesure MMLU ?
Des milliers de questions à choix multiples sur 57 matières, du lycée au niveau professionnel : droit, médecine, histoire, physique. C'est un test historique, hors des scores d'aujourd'hui.
Comment MMLU est-il noté ?
Part de bonnes réponses à quatre choix ; le hasard donne 25 %. Un modèle qui obtient 63 % a un score IA d'environ 12.
Qui est en tête sur MMLU ?
GPT-4o (Nov 2024) (OpenAI) est en tête de MMLU avec 88,1 %, dans l'édition du 28 septembre 2026. Suivent Claude 3.5 Sonnet (October 2024) (87,3 %) et DeepSeek-V3 (87,2 %). 127 modèles y sont mesurés.
Quelles sont les limites de MMLU ?
Saturé autour de 90 %, présent dans les données d'entraînement et entaché de quelques questions erronées. Il ne départage plus les modèles récents. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse MMLU dans le score IA ?
MMLU compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.
Qui maintient MMLU ?
Hendrycks et al. (UC Berkeley, 2020). Sa page de référence : github.com/hendrycks/test.

Les autres tests historiques

Tous les benchmarks →Comment le score IA est calculé →