Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

SciencesFiche benchmark · Epoch AI pour l'évaluation ; questions de Rein et al. (université de New York, 2023) · epoch.ai

GPQA Diamond

Des questions à choix multiples de biologie, chimie et physique, écrites par des docteurs et trop dures pour un non-spécialiste.

À quoi il sert

Sur Quelle IA, GPQA Diamond sert à noter la tâche Sciences et savoir expert : c'est l'un de ses 5 benchmarks. Il départage surtout les modèles dont le score IA approche 61.

Comment c'est noté

Part de bonnes réponses sur 198 questions à quatre choix ; répondre au hasard donne 25 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

Ce qu'il ne dit pas

Les meilleurs modèles atteignent 95 % quand des experts humains font environ 70 % : le test est saturé et ses questions circulent en ligne.

Comment lire le score

208 modèles mesurés · 315 mesures

En tête : GPT-6 Astra, 95,8 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 62 % a un score IA d'environ 61. Le meilleur, GPT-6 Astra, atteint 95,8 %. Le benchmark sera dit saturé quand un modèle atteindra 96,2 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
48 %
Score IA 76niveau de Claude Sonnet 4.5
84 %
Score IA 100niveau de Claude Opus 5.5
97 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

2 %du score général. GPQA Diamond porte 20 % de la tâche Sciences et savoir expert (10 % du score général), que se partagent 5 benchmarks.

En couleur, la tâche Sciences et savoir expert dans le score général. En noir, la part de GPQA Diamond.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-6 AstraOpenAIMaximale95,8 %93,9
2Claude Sonnet 5.5AnthropicMaximale95,6 %93,3
3Gemini 3.8 FlashGoogle DeepMindÉlevée95,4 %92,8
4Gemini 3.7 FlashGoogle DeepMindÉlevée94,8 %91,3
5GPT-5.4 ProOpenAIMaximale94,6 %90,8
6Gemini 3.1 ProGoogle DeepMind · 2 configurationsÉlevée94,4 %90,5
7Gemini 3.6 FlashGoogle DeepMind · 3 configurationsÉlevée94,1 %89,8
8GPT-5.5OpenAI · 3 configurationsMaximale94 %89,5
8Grok 4.6xAI · 2 configurationsÉlevée94 %89,5
10GPT-5.5 ProOpenAIMaximale93,9 %89,3
208 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 208 →Replier le classement ↑
11Claude Opus 5Anthropic · 3 configurationsMaximale93,9 %89,2
12GPT-5.6 SolOpenAI · 3 configurationsMaximale93,5 %88,4
13Grok 4.5xAIÉlevée93,4 %88,3
14GPT-5.6 TerraOpenAI · 3 configurationsMaximale93,3 %88,1
15GPT-5.4OpenAI · 5 configurationsMaximale93,3 %88,1
16Kimi K3Moonshot · poids ouverts · 3 configurationsMaximale93,1 %87,7
17Gemini 3.5 FlashGoogle DeepMind · 3 configurationsÉlevée92,8 %87,1
18Qwen 3.8 MaxAlibabaMaximale92,7 %86,9
19Gemini 3 ProGoogle DeepMindNon précisée92,6 %86,8
20Qwen3.8 Max (0902)AlibabaMaximale92,3 %86,3
21GLM-5.2Z.ai (Zhipu AI) · poids ouverts · 3 configurationsMaximale91,9 %85,5
22DeepSeek V4 Pro 0813DeepSeek · poids ouvertsMaximale91,7 %85,2
23GPT-5.6 LunaOpenAI · 3 configurationsMaximale91,6 %85,1
24GPT-5.2OpenAI · 5 configurationsMaximale91,4 %84,8
25Claude Opus 4.8Anthropic · 3 configurationsMaximale91 %84,2
25DeepSeek V4 Flash 0731DeepSeek · poids ouvertsMaximale91 %84,2
27GLM-5.3Z.ai (Zhipu AI) · poids ouvertsMaximale90,9 %84,1
27Qwen3.7-MaxAlibabaNon précisée90,9 %84,1
27DeepSeek-V4-ProDeepSeek · poids ouverts · 3 configurationsÉlevée90,9 %84,1
27MiniMax-M3MiniMax · poids ouverts · 2 configurationsNon précisée90,9 %84,1
31Kimi K2.6Moonshot · poids ouvertsNon précisée90,8 %83,9
32Claude Opus 5.5AnthropicMaximale90,6 %83,6
33Claude Sonnet 5Anthropic · 2 configurationsMaximale90,5 %83,5
33Claude Opus 4.6Anthropic · 3 configurationsBudget90,5 %83,5
35Claude Opus 4.7Anthropic · 2 configurationsMaximale90,2 %83,0
35GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsMaximale90,2 %83,0
37GLM-5.1Z.ai (Zhipu AI) · poids ouvertsNon précisée89,9 %82,6
38Muse SparkMeta AINon précisée89,8 %82,5
39Gemini 3 FlashGoogle DeepMind · 2 configurationsÉlevée89,4 %82,0
40Grok 4.20xAINon précisée89,3 %81,9
41Grok 4.3 BetaxAIÉlevée88,8 %81,3
42Inkling-SmallThinking Machines · poids ouvertsMaximale88,5 %80,9
43Qwen 3.6 PlusAlibabaNon précisée88,4 %80,7
44InklingThinking Machines · poids ouvertsMaximale88,3 %80,6
45Kimi K2.7 CodeMoonshot · poids ouvertsNon précisée87,9 %80,1
45Qwen3.7-PlusAlibaba · 2 configurationsNon précisée87,9 %80,1
47GLM-5Z.ai (Zhipu AI) · poids ouvertsNon précisée87,8 %80,1
48GPT-5.1OpenAI · 3 configurationsÉlevée87,6 %79,8
49Kimi K2.5Moonshot · poids ouvertsNon précisée87,6 %79,8
50Claude Sonnet 4.6Anthropic · 4 configurationsBudget87,4 %79,6
50Qwen 3.6 Max (Preview)AlibabaNon précisée87,4 %79,6
52Grok 4xAINon précisée87 %79,1
53GPT-5.4 MiniOpenAI · 3 configurationsMaximale86,9 %79,0
54Qwen3.5 397B-A17BAlibaba · poids ouverts · 2 configurationsSans86,4 %78,5
55GPT-5OpenAI · 3 configurationsÉlevée86,2 %78,3
56Claude Opus 4.5Anthropic · 3 configurationsBudget86 %78,1
57Claude Fable 5Anthropic · 3 configurationsMaximale85,9 %77,9
57Qwen3.6 27BAlibaba · poids ouverts · 2 configurationsNon précisée85,9 %77,9
59Nemotron 3 UltraNVIDIA · poids ouvertsNon précisée85,4 %77,4
60Gemini 2.5 Pro (Jun 2025)Google DeepMind · 2 configurationsNon précisée85,3 %77,4
61Qwen 3.5 Plus (hosted 397B-A17B)AlibabaNon précisée84,8 %76,9
61Qwen 3.6 35B-A3BAlibaba · poids ouverts · 2 configurationsSans84,8 %76,9
63Kimi K2 ThinkingMoonshot · poids ouvertsNon précisée84,2 %76,3
64Gemini 2.5 Pro (Mar 2025)Google DeepMindNon précisée83,8 %76,0
65Qwen3.5-35B-A3BAlibaba · poids ouverts · 2 configurationsNon précisée83,5 %75,6
66DeepSeek-V3.2DeepSeek · poids ouverts · 2 configurationsNon précisée83,4 %75,6
67Gemini 3.5 Flash-LiteGoogle DeepMind · 3 configurationsÉlevée83,3 %75,5
67GLM-4.7Z.ai (Zhipu AI) · poids ouvertsNon précisée83,3 %75,5
67Qwen 3.6 FlashAlibabaNon précisée83,3 %75,5
70GPT-5.5 InstantOpenAINon précisée82,5 %74,8
71Claude Sonnet 4.5Anthropic · 4 configurationsBudget82,3 %74,6
71Qwen3.7 FlashAlibaba · 2 configurationsNon précisée82,3 %74,6
71Qwen 3.5 Flash (hosted 35B-A3B)AlibabaNon précisée82,3 %74,6
74o3OpenAI · 3 configurationsÉlevée81,8 %74,2
74Gemini 3.1 Flash-LiteGoogle DeepMind · 3 configurationsÉlevée81,8 %74,2
76Qwen3-235B-A22B-Thinking (Jul 2025)AlibabaNon précisée80,1 %72,7
77Claude 3.7 SonnetAnthropic · 4 configurationsBudget79,7 %72,5
78o4-miniOpenAI · 3 configurationsÉlevée79,6 %72,4
79Claude Sonnet 4Anthropic · 4 configurationsBudget79,2 %72,0
80Qwen3.5-9BAlibaba · poids ouverts · 2 configurationsNon précisée79 %71,9
81GPT-5.4 NanoOpenAI · 3 configurationsÉlevée78,5 %71,5
82Claude Opus 4.1Anthropic · 3 configurationsBudget77,3 %70,6
83o3-miniOpenAI · 3 configurationsÉlevée77 %70,4
84o1OpenAI · 3 configurationsÉlevée76,8 %70,2
85DeepSeek-R1 (May 2025)DeepSeek · poids ouvertsNon précisée76,3 %69,9
86Claude Opus 4Anthropic · 2 configurationsBudget76,3 %69,8
86Grok-3 minixAI · 2 configurationsFaible76,3 %69,8
88Gemma 4 31B ITGoogle DeepMind · poids ouvertsFaible75,8 %69,5
88gpt-oss-120bOpenAI · poids ouvertsÉlevée75,8 %69,5
88Grok 3xAINon précisée75,8 %69,5
91GPT-5 miniOpenAI · 3 configurationsÉlevée75 %68,9
92Gemma 4 26B A4BGoogle DeepMind · poids ouvertsFaible73,2 %67,7
93Qwen3-MaxAlibabaNon précisée72,6 %67,3
94DeepSeek-R1DeepSeek · poids ouvertsNon précisée71,7 %66,7
95seed-oss-36b-instructByteDanceNon précisée71,5 %66,6
96Claude Haiku 4.5Anthropic · 2 configurationsBudget71,2 %66,4
97Qwen3-235B-A22BAlibaba · poids ouvertsNon précisée70,7 %66,0
98Qwen3-30B-A3B-Thinking (Jul 2025)Alibaba · poids ouvertsNon précisée70,1 %65,6
99GPT-5 nanoOpenAI · 4 configurationsÉlevée69,4 %65,2
100GPT-4.5OpenAINon précisée68,7 %64,7
101DeepSeek-V3 (Mar 2025)DeepSeek · poids ouvertsNon précisée67,6 %64,0
102Llama 4 MaverickMeta AI · poids ouvertsNon précisée67 %63,6
103GPT-4.1OpenAINon précisée66,9 %63,6
104Gemini 2.5 Pro (May 2025)Google DeepMindNon précisée66,7 %63,4
105GPT-4.1 miniOpenAINon précisée65,8 %62,9
106Qwen3-32BAlibaba · poids ouverts · 2 configurationsNon précisée65,7 %62,8
107Gemini 2.0 ProGoogle DeepMindNon précisée65,7 %62,8
108QWQ-PlusAlibabaNon précisée65,4 %62,6
109QwQ-32BAlibaba · poids ouvertsNon précisée65,3 %62,6
110DeepSeek-R1-Distill-Qwen-32BDeepSeekNon précisée64,1 %61,8
110Gemini 2.0 Flash (Feb 2025)Google DeepMindNon précisée64,1 %61,8
112Qwen3-14BAlibaba · poids ouverts · 2 configurationsNon précisée63,8 %61,6
113o1-miniOpenAI · 2 configurationsÉlevée62,4 %60,7
114Qwen3-30B-A3BAlibaba · poids ouverts · 2 configurationsNon précisée61,7 %60,3
115gpt-oss-20bOpenAI · poids ouverts · 3 configurationsMoyenne60,8 %59,7
116glm-4.7-flashZ.ai (Zhipu AI) · poids ouvertsNon précisée60,5 %59,6
117Mistral Medium 3Mistral AINon précisée59,5 %59,0
118Gemini 1.5 Pro (Sept 2024)Google DeepMindNon précisée57,2 %57,5
119Gemini 2.0 Flash Thinking (Jan 2025)Google DeepMindNon précisée57,1 %57,4
120Qwen3-8BAlibaba · poids ouverts · 2 configurationsNon précisée56,8 %57,2
121DeepSeek-V3DeepSeek · poids ouvertsNon précisée56,5 %57,0
122Qwen2.5-MaxAlibabaNon précisée56,1 %56,8
123Magistral Small 1.0Mistral AI · poids ouvertsNon précisée56,1 %56,7
123Phi-4Microsoft · poids ouvertsNon précisée56,1 %56,7
125DeepSeek-R1-Distill-Llama-70BDeepSeek · poids ouvertsNon précisée55,7 %56,5
126Qwen3-30B-A3B-Instruct (Jul 2025)Alibaba · poids ouvertsNon précisée55,6 %56,5
127Claude 3.5 Sonnet (October 2024)AnthropicNon précisée55,3 %56,3
128Claude 3.5 SonnetAnthropicNon précisée54 %55,4
129Grok-2 (Dec 2024)xAINon précisée53,8 %55,3
130Qwen3-4BAlibaba · poids ouverts · 2 configurationsNon précisée52,3 %54,3
131Llama 4 ScoutMeta AI · poids ouvertsNon précisée51,8 %53,9
132Mistral Large 2 (Nov 2024)Mistral AI · poids ouvertsNon précisée51,3 %53,6
133Llama 3.1-405BMeta AI · poids ouvertsNon précisée50,9 %53,3
134o1-previewOpenAINon précisée50,3 %52,9
135GPT-4o (Aug 2024)OpenAINon précisée49,2 %52,1
136Qwen2.5-72BAlibaba · poids ouvertsNon précisée49,1 %52,1
137Mistral Small 3.2Mistral AI · poids ouvertsNon précisée49,1 %52,0
138Mistral Large 2 (Jul 2024)Mistral AINon précisée49 %52,0
139GPT-4.1 nanoOpenAINon précisée48,9 %51,9
140GPT-4o (May 2024)OpenAINon précisée48,9 %51,9
141Qwen Plus (Jan 2025)AlibabaNon précisée48,1 %51,3
142GPT-4o (Nov 2024)OpenAINon précisée47,9 %51,2
143Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée47,7 %51,0
144Magistral Small 1.2Mistral AI · poids ouvertsNon précisée47,6 %50,9
145Mistral Small 3.1Mistral AI · 2 configurationsNon précisée47,5 %50,8
146Llama 3.3 70BMeta AI · poids ouvertsNon précisée47,4 %50,8
147Gemini 1.5 Flash (Sep 2024)Google DeepMindNon précisée47,3 %50,7
148Mistral Small 3Mistral AI · 2 configurationsNon précisée47,3 %50,7
149Claude 3 OpusAnthropicNon précisée47,2 %50,6
150GPT-4 Turbo (Apr 2024)OpenAINon précisée46,6 %50,2
151Tulu 3 (Tülu 3) 70BAllen Institute for AI · poids ouvertsNon précisée46,3 %49,9
152Qwen2.5-32BAlibaba · poids ouvertsNon précisée46,1 %49,8
153Gemini 1.5 Pro (May 2024)Google DeepMindNon précisée45,9 %49,6
154qwen3-4b-instruct-2507AlibabaNon précisée45,8 %49,6
155glm-4.7-flash_noneZ.ai (Zhipu AI)Sans45,1 %49,1
156DeepSeek-R1-Distill-Qwen-14BDeepSeekNon précisée44,7 %48,7
157Llama 3.1-70BMeta AI · poids ouvertsNon précisée44,2 %48,3
158WizardLM-2 8x22BMicrosoftNon précisée43,4 %47,7
159GPT-4 Turbo (Nov 2023)OpenAI · 2 configurationsNon précisée42,4 %46,7
160Qwen-TurboAlibabaNon précisée41,8 %46,2
161Llama 3.2 90BMeta AI · poids ouvertsNon précisée41 %45,5
162Qwen2-72BAlibaba · poids ouvertsNon précisée40,8 %45,3
163Claude 3 SonnetAnthropicNon précisée40,6 %45,1
164Llama 3-70BMeta AI · poids ouvertsNon précisée40,6 %45,1
165Gemini 1.5 Flash (May 2024)Google DeepMindNon précisée40,4 %44,9
166Gemma 3 12BGoogle DeepMind · poids ouvertsNon précisée39,5 %44,0
167Mistral LargeMistral AI · poids ouvertsNon précisée38,8 %43,3
168Claude 3.5 HaikuAnthropicNon précisée38,1 %42,6
169Qwen3-1.7BAlibaba · 2 configurationsNon précisée38 %42,5
170GPT-4o miniOpenAINon précisée37,7 %42,2
171Hermes 2 Theta Llama-3 70BNous Research · poids ouvertsNon précisée37,5 %41,9
172Gemma 2 27BGoogle DeepMindNon précisée36,5 %40,7
173Claude 3 HaikuAnthropicNon précisée36,3 %40,5
174GPT-4 (Mar 2023)OpenAINon précisée35,7 %39,8
175Qwen2.5-7BAlibaba · poids ouvertsNon précisée35,5 %39,5
176Claude 2AnthropicNon précisée34,7 %38,4
177Mixtral 8x22BMistral AI · poids ouvertsNon précisée34,1 %37,5
178Gemini 1.0 ProGoogle DeepMindNon précisée34 %37,4
179Eurus-2-7B-PRIMETsinghua University · poids ouvertsNon précisée33,9 %37,3
180DeepSeek-R1-Distill-Qwen-1.5BDeepSeekNon précisée33,6 %36,8
181Gemini 1.5 Flash 8BGoogle DeepMindNon précisée33 %35,8
181Claude 2.1AnthropicNon précisée33 %35,8
183DBRXDatabricks · poids ouvertsNon précisée32,9 %35,7
184Yi-1.5-34B01.AI · poids ouvertsNon précisée32 %34,1
185Qwen1.5-32BAlibaba · poids ouvertsNon précisée30,7 %31,6
186GPT-4 (Jun 2023)OpenAINon précisée30,7 %31,4
187Mixtral 8x7BMistral AI · poids ouverts · 2 configurationsNon précisée30,6 %31,2
188Mistral NeMoMistral AI · poids ouvertsNon précisée29,9 %29,6
189Qwen1.5-72BAlibaba · poids ouvertsNon précisée28,8 %26,5
190granite-4.0-microIBM · poids ouvertsNon précisée28,3 %24,6
191GPT-3.5 Turbo (Nov 2023)OpenAINon précisée28 %23,6
192phi-3-medium 14BMicrosoft · poids ouvertsNon précisée27,6 %21,7
193Gemma 2 9BGoogle DeepMind · poids ouvertsNon précisée27,5 %21,1
194GPT-3.5 Turbo (Jan 2024)OpenAINon précisée27,2 %19,6
195Ministral 8BMistral AI · poids ouvertsNon précisée27,1 %19,4
196Llama 3.1-8BMeta AI · poids ouvertsNon précisée27 %18,3
197Llama 2-70BMeta AI · poids ouvertsNon précisée26,3 %13,7
198Llama 3-8BMeta AI · poids ouvertsNon précisée26,1 %11,1
199Ministral 3BMistral AI · poids ouvertsNon précisée25,3 %6,9
200DeepSeek LLM 67BDeepSeek · poids ouvertsNon précisée24,6 %6,9
201granite-4.0-1bIBMNon précisée24 %6,9
202Llama 3.2 1BMeta AI · poids ouvertsNon précisée23,9 %6,9
203Gemma 3 4BGoogle DeepMind · poids ouvertsNon précisée23,2 %6,9
204Gemma 3 1BGoogle DeepMind · poids ouvertsNon précisée19,9 %6,9
205Mistral 7B v0.3Mistral AI · poids ouverts · 2 configurationsNon précisée15,2 %6,9
206Yi-34B01.AI · poids ouvertsNon précisée14,7 %6,9
207granite-4.0-350mIBMNon précisée11,2 %6,9
208deepseek-r1-0528-qwen3-8bDeepSeek · poids ouvertsNon précisée9,3 %6,9

En bref

Que mesure GPQA Diamond ?
Des questions à choix multiples de biologie, chimie et physique, écrites par des docteurs et trop dures pour un non-spécialiste. Sur Quelle IA, il est rangé dans la tâche Sciences et savoir expert.
Comment GPQA Diamond est-il noté ?
Part de bonnes réponses sur 198 questions à quatre choix ; répondre au hasard donne 25 %. Un modèle qui obtient 62 % a un score IA d'environ 61.
Qui est en tête sur GPQA Diamond ?
GPT-6 Astra (OpenAI) est en tête de GPQA Diamond avec 95,8 %, dans l'édition du 28 septembre 2026. Suivent Claude Sonnet 5.5 (95,6 %) et Gemini 3.8 Flash (95,4 %). 208 modèles y sont mesurés.
Quelles sont les limites de GPQA Diamond ?
Les meilleurs modèles atteignent 95 % quand des experts humains font environ 70 % : le test est saturé et ses questions circulent en ligne. Au 28 septembre 2026, le benchmark est actif.
Combien pèse GPQA Diamond dans le score IA ?
GPQA Diamond compte pour 2 % du score général, dans l'édition du 28 septembre 2026. Il porte 20 % de la tâche Sciences et savoir expert (10 % du score général), que se partagent 5 benchmarks.
Qui maintient GPQA Diamond ?
Epoch AI pour l'évaluation ; questions de Rein et al. (université de New York, 2023). Sa page de référence : epoch.ai/benchmarks/gpqa-diamond.

Les autres benchmarks de la tâche Sciences et savoir expert

Tous les benchmarks →Comment le score IA est calculé →