# GPQA Diamond

> Fiche du benchmark GPQA Diamond sur Quelle IA, édition du 28 septembre 2026. Des questions à choix multiples de biologie, chimie et physique, écrites par des docteurs et trop dures pour un non-spécialiste. En tête au 28 septembre 2026 : GPT-6 Astra (95,8 %). Notation, limites et classement des 208 modèles mesurés.

Page : https://quelleia.com/benchmarks/gpqa_diamond/
Source du benchmark : https://epoch.ai/benchmarks/gpqa-diamond
Mainteneur : Epoch AI pour l'évaluation ; questions de Rein et al. (université de New York, 2023)
Tâche : Sciences et savoir expert
État : actif

## À quoi il sert

Sur Quelle IA, GPQA Diamond sert à noter la tâche Sciences et savoir expert : c'est l'un de ses 5 benchmarks. Il départage surtout les modèles dont le score IA approche 61.

## Comment c'est noté

Part de bonnes réponses sur 198 questions à quatre choix ; répondre au hasard donne 25 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

## Ce qu'il ne dit pas

Les meilleurs modèles atteignent 95 % quand des experts humains font environ 70 % : le test est saturé et ses questions circulent en ligne.

## Qui le tient

Epoch AI pour l'évaluation ; questions de Rein et al. (université de New York, 2023).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 62 % a un score IA d'environ 61. Le meilleur, GPT-6 Astra, atteint 95,8 %. Le benchmark sera dit saturé quand un modèle atteindra 96,2 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 48 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 84 %
- Score IA 100 (niveau de Claude Opus 5.5) : 97 %

## Son poids dans le score IA

2 % du score général. GPQA Diamond porte 20 % de la tâche Sciences et savoir expert (10 % du score général), que se partagent 5 benchmarks.

## Classement (208 modèles mesurés · 315 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | Maximale | 95,8 % | 93,9 | https://epoch.ai/benchmarks |
| 2 | [Claude Sonnet 5.5](https://quelleia.com/modeles/claude-sonnet-5-5.md) | Anthropic | Maximale | 95,6 % | 93,3 | https://epoch.ai/benchmarks |
| 3 | [Gemini 3.8 Flash](https://quelleia.com/modeles/gemini-3-8-flash.md) | Google DeepMind | Élevée | 95,4 % | 92,8 | https://epoch.ai/benchmarks |
| 4 | [Gemini 3.7 Flash](https://quelleia.com/modeles/gemini-3-7-flash.md) | Google DeepMind | Élevée | 94,8 % | 91,3 | https://epoch.ai/benchmarks |
| 5 | [GPT-5.4 Pro](https://quelleia.com/modeles/gpt-5-4-pro.md) | OpenAI | Maximale | 94,6 % | 90,8 | https://epoch.ai/benchmarks |
| 6 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | Élevée | 94,4 % | 90,5 | https://epoch.ai/benchmarks |
| 7 | [Gemini 3.6 Flash](https://quelleia.com/modeles/gemini-3-6-flash.md) | Google DeepMind | Élevée | 94,1 % | 89,8 | https://epoch.ai/benchmarks |
| 8 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Maximale | 94 % | 89,5 | https://epoch.ai/benchmarks |
| 8 | [Grok 4.6](https://quelleia.com/modeles/grok-4-6.md) | xAI | Élevée | 94 % | 89,5 | https://epoch.ai/benchmarks |
| 10 | [GPT-5.5 Pro](https://quelleia.com/modeles/gpt-5-5-pro.md) | OpenAI | Maximale | 93,9 % | 89,3 | https://epoch.ai/benchmarks |
| 11 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | Maximale | 93,9 % | 89,2 | https://epoch.ai/benchmarks |
| 12 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 93,5 % | 88,4 | https://epoch.ai/benchmarks |
| 13 | [Grok 4.5](https://quelleia.com/modeles/grok-4-5.md) | xAI | Élevée | 93,4 % | 88,3 | https://epoch.ai/benchmarks |
| 14 | [GPT-5.6 Terra](https://quelleia.com/modeles/gpt-5-6-terra.md) | OpenAI | Maximale | 93,3 % | 88,1 | https://epoch.ai/benchmarks |
| 15 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Maximale | 93,3 % | 88,1 | https://epoch.ai/benchmarks |
| 16 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | Maximale | 93,1 % | 87,7 | https://epoch.ai/benchmarks |
| 17 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | Élevée | 92,8 % | 87,1 | https://epoch.ai/benchmarks |
| 18 | [Qwen 3.8 Max](https://quelleia.com/modeles/qwen-3-8-max.md) | Alibaba | Maximale | 92,7 % | 86,9 | https://epoch.ai/benchmarks |
| 19 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | non précisée | 92,6 % | 86,8 | https://epoch.ai/benchmarks |
| 20 | [Qwen3.8 Max (0902)](https://quelleia.com/modeles/qwen3-8-max-0902.md) | Alibaba | Maximale | 92,3 % | 86,3 | https://epoch.ai/benchmarks |
| 21 | [GLM-5.2](https://quelleia.com/modeles/glm-5-2.md) | Z.ai (Zhipu AI) | Maximale | 91,9 % | 85,5 | https://epoch.ai/benchmarks |
| 22 | [DeepSeek V4 Pro 0813](https://quelleia.com/modeles/deepseek-v4-pro-0813.md) | DeepSeek | Maximale | 91,7 % | 85,2 | https://epoch.ai/benchmarks |
| 23 | [GPT-5.6 Luna](https://quelleia.com/modeles/gpt-5-6-luna.md) | OpenAI | Maximale | 91,6 % | 85,1 | https://epoch.ai/benchmarks |
| 24 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | Maximale | 91,4 % | 84,8 | https://epoch.ai/benchmarks |
| 25 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Maximale | 91 % | 84,2 | https://epoch.ai/benchmarks |
| 25 | [DeepSeek V4 Flash 0731](https://quelleia.com/modeles/deepseek-v4-flash-0731.md) | DeepSeek | Maximale | 91 % | 84,2 | https://epoch.ai/benchmarks |
| 27 | [GLM-5.3](https://quelleia.com/modeles/glm-5-3.md) | Z.ai (Zhipu AI) | Maximale | 90,9 % | 84,1 | https://epoch.ai/benchmarks |
| 27 | [Qwen3.7-Max](https://quelleia.com/modeles/qwen3-7-max.md) | Alibaba | non précisée | 90,9 % | 84,1 | https://epoch.ai/benchmarks |
| 27 | [DeepSeek-V4-Pro](https://quelleia.com/modeles/deepseek-v4-pro.md) | DeepSeek | Élevée | 90,9 % | 84,1 | https://epoch.ai/benchmarks |
| 27 | [MiniMax-M3](https://quelleia.com/modeles/minimax-m3.md) | MiniMax | non précisée | 90,9 % | 84,1 | https://epoch.ai/benchmarks |
| 31 | [Kimi K2.6](https://quelleia.com/modeles/kimi-k2-6.md) | Moonshot | non précisée | 90,8 % | 83,9 | https://epoch.ai/benchmarks |
| 32 | [Claude Opus 5.5](https://quelleia.com/modeles/claude-opus-5-5.md) | Anthropic | Maximale | 90,6 % | 83,6 | https://epoch.ai/benchmarks |
| 33 | [Claude Sonnet 5](https://quelleia.com/modeles/claude-sonnet-5.md) | Anthropic | Maximale | 90,5 % | 83,5 | https://epoch.ai/benchmarks |
| 33 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | Budget | 90,5 % | 83,5 | https://epoch.ai/benchmarks |
| 35 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | Maximale | 90,2 % | 83,0 | https://epoch.ai/benchmarks |
| 35 | [GLM-5.3-Flash](https://quelleia.com/modeles/glm-5-3-flash.md) | Z.ai (Zhipu AI) | Maximale | 90,2 % | 83,0 | https://epoch.ai/benchmarks |
| 37 | [GLM-5.1](https://quelleia.com/modeles/glm-5-1.md) | Z.ai (Zhipu AI) | non précisée | 89,9 % | 82,6 | https://epoch.ai/benchmarks |
| 38 | [Muse Spark](https://quelleia.com/modeles/muse-spark.md) | Meta AI | non précisée | 89,8 % | 82,5 | https://epoch.ai/benchmarks |
| 39 | [Gemini 3 Flash](https://quelleia.com/modeles/gemini-3-flash.md) | Google DeepMind | Élevée | 89,4 % | 82,0 | https://epoch.ai/benchmarks |
| 40 | [Grok 4.20](https://quelleia.com/modeles/grok-4-20.md) | xAI | non précisée | 89,3 % | 81,9 | https://epoch.ai/benchmarks |
| 41 | [Grok 4.3 Beta](https://quelleia.com/modeles/grok-4-3-beta.md) | xAI | Élevée | 88,8 % | 81,3 | https://epoch.ai/benchmarks |
| 42 | [Inkling-Small](https://quelleia.com/modeles/inkling-small.md) | Thinking Machines | Maximale | 88,5 % | 80,9 | https://epoch.ai/benchmarks |
| 43 | [Qwen 3.6 Plus](https://quelleia.com/modeles/qwen-3-6-plus.md) | Alibaba | non précisée | 88,4 % | 80,7 | https://epoch.ai/benchmarks |
| 44 | [Inkling](https://quelleia.com/modeles/inkling.md) | Thinking Machines | Maximale | 88,3 % | 80,6 | https://epoch.ai/benchmarks |
| 45 | [Kimi K2.7 Code](https://quelleia.com/modeles/kimi-k2-7-code.md) | Moonshot | non précisée | 87,9 % | 80,1 | https://epoch.ai/benchmarks |
| 45 | [Qwen3.7-Plus](https://quelleia.com/modeles/qwen3-7-plus.md) | Alibaba | non précisée | 87,9 % | 80,1 | https://epoch.ai/benchmarks |
| 47 | [GLM-5](https://quelleia.com/modeles/glm-5.md) | Z.ai (Zhipu AI) | non précisée | 87,8 % | 80,1 | https://epoch.ai/benchmarks |
| 48 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | Élevée | 87,6 % | 79,8 | https://epoch.ai/benchmarks |
| 49 | [Kimi K2.5](https://quelleia.com/modeles/kimi-k2-5.md) | Moonshot | non précisée | 87,6 % | 79,8 | https://epoch.ai/benchmarks |
| 50 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | Budget | 87,4 % | 79,6 | https://epoch.ai/benchmarks |
| 50 | [Qwen 3.6 Max (Preview)](https://quelleia.com/modeles/qwen-3-6-max-preview.md) | Alibaba | non précisée | 87,4 % | 79,6 | https://epoch.ai/benchmarks |
| 52 | [Grok 4](https://quelleia.com/modeles/grok-4.md) | xAI | non précisée | 87 % | 79,1 | https://epoch.ai/benchmarks |
| 53 | [GPT-5.4 Mini](https://quelleia.com/modeles/gpt-5-4-mini.md) | OpenAI | Maximale | 86,9 % | 79,0 | https://epoch.ai/benchmarks |
| 54 | [Qwen3.5 397B-A17B](https://quelleia.com/modeles/qwen3-5-397b-a17b.md) | Alibaba | Sans | 86,4 % | 78,5 | https://epoch.ai/benchmarks |
| 55 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Élevée | 86,2 % | 78,3 | https://epoch.ai/benchmarks |
| 56 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | Budget | 86 % | 78,1 | https://epoch.ai/benchmarks |
| 57 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Maximale | 85,9 % | 77,9 | https://epoch.ai/benchmarks |
| 57 | [Qwen3.6 27B](https://quelleia.com/modeles/qwen3-6-27b.md) | Alibaba | non précisée | 85,9 % | 77,9 | https://epoch.ai/benchmarks |
| 59 | [Nemotron 3 Ultra](https://quelleia.com/modeles/nemotron-3-ultra.md) | NVIDIA | non précisée | 85,4 % | 77,4 | https://epoch.ai/benchmarks |
| 60 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 85,3 % | 77,4 | https://epoch.ai/benchmarks |
| 61 | [Qwen 3.5 Plus (hosted 397B-A17B)](https://quelleia.com/modeles/qwen-3-5-plus-hosted-397b-a17b.md) | Alibaba | non précisée | 84,8 % | 76,9 | https://epoch.ai/benchmarks |
| 61 | [Qwen 3.6 35B-A3B](https://quelleia.com/modeles/qwen-3-6-35b-a3b.md) | Alibaba | Sans | 84,8 % | 76,9 | https://epoch.ai/benchmarks |
| 63 | [Kimi K2 Thinking](https://quelleia.com/modeles/kimi-k2-thinking.md) | Moonshot | non précisée | 84,2 % | 76,3 | https://epoch.ai/benchmarks |
| 64 | [Gemini 2.5 Pro (Mar 2025)](https://quelleia.com/modeles/gemini-2-5-pro-mar-2025.md) | Google DeepMind | non précisée | 83,8 % | 76,0 | https://epoch.ai/benchmarks |
| 65 | [Qwen3.5-35B-A3B](https://quelleia.com/modeles/qwen3-5-35b-a3b.md) | Alibaba | non précisée | 83,5 % | 75,6 | https://epoch.ai/benchmarks |
| 66 | [DeepSeek-V3.2](https://quelleia.com/modeles/deepseek-v3-2.md) | DeepSeek | non précisée | 83,4 % | 75,6 | https://epoch.ai/benchmarks |
| 67 | [Gemini 3.5 Flash-Lite](https://quelleia.com/modeles/gemini-3-5-flash-lite.md) | Google DeepMind | Élevée | 83,3 % | 75,5 | https://epoch.ai/benchmarks |
| 67 | [GLM-4.7](https://quelleia.com/modeles/glm-4-7.md) | Z.ai (Zhipu AI) | non précisée | 83,3 % | 75,5 | https://epoch.ai/benchmarks |
| 67 | [Qwen 3.6 Flash](https://quelleia.com/modeles/qwen-3-6-flash.md) | Alibaba | non précisée | 83,3 % | 75,5 | https://epoch.ai/benchmarks |
| 70 | [GPT-5.5 Instant](https://quelleia.com/modeles/gpt-5-5-instant.md) | OpenAI | non précisée | 82,5 % | 74,8 | https://epoch.ai/benchmarks |
| 71 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | Budget | 82,3 % | 74,6 | https://epoch.ai/benchmarks |
| 71 | [Qwen3.7 Flash](https://quelleia.com/modeles/qwen3-7-flash.md) | Alibaba | non précisée | 82,3 % | 74,6 | https://epoch.ai/benchmarks |
| 71 | [Qwen 3.5 Flash (hosted 35B-A3B)](https://quelleia.com/modeles/qwen-3-5-flash-hosted-35b-a3b.md) | Alibaba | non précisée | 82,3 % | 74,6 | https://epoch.ai/benchmarks |
| 74 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Élevée | 81,8 % | 74,2 | https://epoch.ai/benchmarks |
| 74 | [Gemini 3.1 Flash-Lite](https://quelleia.com/modeles/gemini-3-1-flash-lite.md) | Google DeepMind | Élevée | 81,8 % | 74,2 | https://epoch.ai/benchmarks |
| 76 | [Qwen3-235B-A22B-Thinking (Jul 2025)](https://quelleia.com/modeles/qwen3-235b-a22b-thinking-jul-2025.md) | Alibaba | non précisée | 80,1 % | 72,7 | https://epoch.ai/benchmarks |
| 77 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | Budget | 79,7 % | 72,5 | https://epoch.ai/benchmarks |
| 78 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Élevée | 79,6 % | 72,4 | https://epoch.ai/benchmarks |
| 79 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | Budget | 79,2 % | 72,0 | https://epoch.ai/benchmarks |
| 80 | [Qwen3.5-9B](https://quelleia.com/modeles/qwen3-5-9b.md) | Alibaba | non précisée | 79 % | 71,9 | https://epoch.ai/benchmarks |
| 81 | [GPT-5.4 Nano](https://quelleia.com/modeles/gpt-5-4-nano.md) | OpenAI | Élevée | 78,5 % | 71,5 | https://epoch.ai/benchmarks |
| 82 | [Claude Opus 4.1](https://quelleia.com/modeles/claude-opus-4-1.md) | Anthropic | Budget | 77,3 % | 70,6 | https://epoch.ai/benchmarks |
| 83 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Élevée | 77 % | 70,4 | https://epoch.ai/benchmarks |
| 84 | [o1](https://quelleia.com/modeles/o1.md) | OpenAI | Élevée | 76,8 % | 70,2 | https://epoch.ai/benchmarks |
| 85 | [DeepSeek-R1 (May 2025)](https://quelleia.com/modeles/deepseek-r1-may-2025.md) | DeepSeek | non précisée | 76,3 % | 69,9 | https://epoch.ai/benchmarks |
| 86 | [Claude Opus 4](https://quelleia.com/modeles/claude-opus-4.md) | Anthropic | Budget | 76,3 % | 69,8 | https://epoch.ai/benchmarks |
| 86 | [Grok-3 mini](https://quelleia.com/modeles/grok-3-mini.md) | xAI | Faible | 76,3 % | 69,8 | https://epoch.ai/benchmarks |
| 88 | [Gemma 4 31B IT](https://quelleia.com/modeles/gemma-4-31b-it.md) | Google DeepMind | Faible | 75,8 % | 69,5 | https://epoch.ai/benchmarks |
| 88 | [gpt-oss-120b](https://quelleia.com/modeles/gpt-oss-120b.md) | OpenAI | Élevée | 75,8 % | 69,5 | https://epoch.ai/benchmarks |
| 88 | [Grok 3](https://quelleia.com/modeles/grok-3.md) | xAI | non précisée | 75,8 % | 69,5 | https://epoch.ai/benchmarks |
| 91 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | Élevée | 75 % | 68,9 | https://epoch.ai/benchmarks |
| 92 | [Gemma 4 26B A4B](https://quelleia.com/modeles/gemma-4-26b-a4b.md) | Google DeepMind | Faible | 73,2 % | 67,7 | https://epoch.ai/benchmarks |
| 93 | [Qwen3-Max](https://quelleia.com/modeles/qwen3-max.md) | Alibaba | non précisée | 72,6 % | 67,3 | https://epoch.ai/benchmarks |
| 94 | [DeepSeek-R1](https://quelleia.com/modeles/deepseek-r1.md) | DeepSeek | non précisée | 71,7 % | 66,7 | https://epoch.ai/benchmarks |
| 95 | [seed-oss-36b-instruct](https://quelleia.com/modeles/seed-oss-36b-instruct.md) | ByteDance | non précisée | 71,5 % | 66,6 | https://epoch.ai/benchmarks |
| 96 | [Claude Haiku 4.5](https://quelleia.com/modeles/claude-haiku-4-5.md) | Anthropic | Budget | 71,2 % | 66,4 | https://epoch.ai/benchmarks |
| 97 | [Qwen3-235B-A22B](https://quelleia.com/modeles/qwen3-235b-a22b.md) | Alibaba | non précisée | 70,7 % | 66,0 | https://epoch.ai/benchmarks |
| 98 | [Qwen3-30B-A3B-Thinking (Jul 2025)](https://quelleia.com/modeles/qwen3-30b-a3b-thinking-jul-2025.md) | Alibaba | non précisée | 70,1 % | 65,6 | https://epoch.ai/benchmarks |
| 99 | [GPT-5 nano](https://quelleia.com/modeles/gpt-5-nano.md) | OpenAI | Élevée | 69,4 % | 65,2 | https://epoch.ai/benchmarks |
| 100 | [GPT-4.5](https://quelleia.com/modeles/gpt-4-5.md) | OpenAI | non précisée | 68,7 % | 64,7 | https://epoch.ai/benchmarks |
| 101 | [DeepSeek-V3 (Mar 2025)](https://quelleia.com/modeles/deepseek-v3-mar-2025.md) | DeepSeek | non précisée | 67,6 % | 64,0 | https://epoch.ai/benchmarks |
| 102 | [Llama 4 Maverick](https://quelleia.com/modeles/llama-4-maverick.md) | Meta AI | non précisée | 67 % | 63,6 | https://epoch.ai/benchmarks |
| 103 | [GPT-4.1](https://quelleia.com/modeles/gpt-4-1.md) | OpenAI | non précisée | 66,9 % | 63,6 | https://epoch.ai/benchmarks |
| 104 | [Gemini 2.5 Pro (May 2025)](https://quelleia.com/modeles/gemini-2-5-pro-may-2025.md) | Google DeepMind | non précisée | 66,7 % | 63,4 | https://epoch.ai/benchmarks |
| 105 | [GPT-4.1 mini](https://quelleia.com/modeles/gpt-4-1-mini.md) | OpenAI | non précisée | 65,8 % | 62,9 | https://epoch.ai/benchmarks |
| 106 | [Qwen3-32B](https://quelleia.com/modeles/qwen3-32b.md) | Alibaba | non précisée | 65,7 % | 62,8 | https://epoch.ai/benchmarks |
| 107 | [Gemini 2.0 Pro](https://quelleia.com/modeles/gemini-2-0-pro.md) | Google DeepMind | non précisée | 65,7 % | 62,8 | https://epoch.ai/benchmarks |
| 108 | [QWQ-Plus](https://quelleia.com/modeles/qwq-plus.md) | Alibaba | non précisée | 65,4 % | 62,6 | https://epoch.ai/benchmarks |
| 109 | [QwQ-32B](https://quelleia.com/modeles/qwq-32b.md) | Alibaba | non précisée | 65,3 % | 62,6 | https://epoch.ai/benchmarks |
| 110 | [DeepSeek-R1-Distill-Qwen-32B](https://quelleia.com/modeles/deepseek-r1-distill-qwen-32b.md) | DeepSeek | non précisée | 64,1 % | 61,8 | https://epoch.ai/benchmarks |
| 110 | [Gemini 2.0 Flash (Feb 2025)](https://quelleia.com/modeles/gemini-2-0-flash-feb-2025.md) | Google DeepMind | non précisée | 64,1 % | 61,8 | https://epoch.ai/benchmarks |
| 112 | [Qwen3-14B](https://quelleia.com/modeles/qwen3-14b.md) | Alibaba | non précisée | 63,8 % | 61,6 | https://epoch.ai/benchmarks |
| 113 | [o1-mini](https://quelleia.com/modeles/o1-mini.md) | OpenAI | Élevée | 62,4 % | 60,7 | https://epoch.ai/benchmarks |
| 114 | [Qwen3-30B-A3B](https://quelleia.com/modeles/qwen3-30b-a3b.md) | Alibaba | non précisée | 61,7 % | 60,3 | https://epoch.ai/benchmarks |
| 115 | [gpt-oss-20b](https://quelleia.com/modeles/gpt-oss-20b.md) | OpenAI | Moyenne | 60,8 % | 59,7 | https://epoch.ai/benchmarks |
| 116 | [glm-4.7-flash](https://quelleia.com/modeles/glm-4-7-flash.md) | Z.ai (Zhipu AI) | non précisée | 60,5 % | 59,6 | https://epoch.ai/benchmarks |
| 117 | [Mistral Medium 3](https://quelleia.com/modeles/mistral-medium-3.md) | Mistral AI | non précisée | 59,5 % | 59,0 | https://epoch.ai/benchmarks |
| 118 | [Gemini 1.5 Pro (Sept 2024)](https://quelleia.com/modeles/gemini-1-5-pro-sept-2024.md) | Google DeepMind | non précisée | 57,2 % | 57,5 | https://epoch.ai/benchmarks |
| 119 | [Gemini 2.0 Flash Thinking (Jan 2025)](https://quelleia.com/modeles/gemini-2-0-flash-thinking-jan-2025.md) | Google DeepMind | non précisée | 57,1 % | 57,4 | https://epoch.ai/benchmarks |
| 120 | [Qwen3-8B](https://quelleia.com/modeles/qwen3-8b.md) | Alibaba | non précisée | 56,8 % | 57,2 | https://epoch.ai/benchmarks |
| 121 | [DeepSeek-V3](https://quelleia.com/modeles/deepseek-v3.md) | DeepSeek | non précisée | 56,5 % | 57,0 | https://epoch.ai/benchmarks |
| 122 | [Qwen2.5-Max](https://quelleia.com/modeles/qwen2-5-max.md) | Alibaba | non précisée | 56,1 % | 56,8 | https://epoch.ai/benchmarks |
| 123 | [Magistral Small 1.0](https://quelleia.com/modeles/magistral-small-1-0.md) | Mistral AI | non précisée | 56,1 % | 56,7 | https://epoch.ai/benchmarks |
| 123 | [Phi-4](https://quelleia.com/modeles/phi-4.md) | Microsoft | non précisée | 56,1 % | 56,7 | https://epoch.ai/benchmarks |
| 125 | [DeepSeek-R1-Distill-Llama-70B](https://quelleia.com/modeles/deepseek-r1-distill-llama-70b.md) | DeepSeek | non précisée | 55,7 % | 56,5 | https://epoch.ai/benchmarks |
| 126 | [Qwen3-30B-A3B-Instruct (Jul 2025)](https://quelleia.com/modeles/qwen3-30b-a3b-instruct-jul-2025.md) | Alibaba | non précisée | 55,6 % | 56,5 | https://epoch.ai/benchmarks |
| 127 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 55,3 % | 56,3 | https://epoch.ai/benchmarks |
| 128 | [Claude 3.5 Sonnet](https://quelleia.com/modeles/claude-3-5-sonnet.md) | Anthropic | non précisée | 54 % | 55,4 | https://epoch.ai/benchmarks |
| 129 | [Grok-2 (Dec 2024)](https://quelleia.com/modeles/grok-2-dec-2024.md) | xAI | non précisée | 53,8 % | 55,3 | https://epoch.ai/benchmarks |
| 130 | [Qwen3-4B](https://quelleia.com/modeles/qwen3-4b.md) | Alibaba | non précisée | 52,3 % | 54,3 | https://epoch.ai/benchmarks |
| 131 | [Llama 4 Scout](https://quelleia.com/modeles/llama-4-scout.md) | Meta AI | non précisée | 51,8 % | 53,9 | https://epoch.ai/benchmarks |
| 132 | [Mistral Large 2 (Nov 2024)](https://quelleia.com/modeles/mistral-large-2-nov-2024.md) | Mistral AI | non précisée | 51,3 % | 53,6 | https://epoch.ai/benchmarks |
| 133 | [Llama 3.1-405B](https://quelleia.com/modeles/llama-3-1-405b.md) | Meta AI | non précisée | 50,9 % | 53,3 | https://epoch.ai/benchmarks |
| 134 | [o1-preview](https://quelleia.com/modeles/o1-preview.md) | OpenAI | non précisée | 50,3 % | 52,9 | https://epoch.ai/benchmarks |
| 135 | [GPT-4o (Aug 2024)](https://quelleia.com/modeles/gpt-4o-aug-2024.md) | OpenAI | non précisée | 49,2 % | 52,1 | https://epoch.ai/benchmarks |
| 136 | [Qwen2.5-72B](https://quelleia.com/modeles/qwen2-5-72b.md) | Alibaba | non précisée | 49,1 % | 52,1 | https://epoch.ai/benchmarks |
| 137 | [Mistral Small 3.2](https://quelleia.com/modeles/mistral-small-3-2.md) | Mistral AI | non précisée | 49,1 % | 52,0 | https://epoch.ai/benchmarks |
| 138 | [Mistral Large 2 (Jul 2024)](https://quelleia.com/modeles/mistral-large-2-jul-2024.md) | Mistral AI | non précisée | 49 % | 52,0 | https://epoch.ai/benchmarks |
| 139 | [GPT-4.1 nano](https://quelleia.com/modeles/gpt-4-1-nano.md) | OpenAI | non précisée | 48,9 % | 51,9 | https://epoch.ai/benchmarks |
| 140 | [GPT-4o (May 2024)](https://quelleia.com/modeles/gpt-4o-may-2024.md) | OpenAI | non précisée | 48,9 % | 51,9 | https://epoch.ai/benchmarks |
| 141 | [Qwen Plus (Jan 2025)](https://quelleia.com/modeles/qwen-plus-jan-2025.md) | Alibaba | non précisée | 48,1 % | 51,3 | https://epoch.ai/benchmarks |
| 142 | [GPT-4o (Nov 2024)](https://quelleia.com/modeles/gpt-4o-nov-2024.md) | OpenAI | non précisée | 47,9 % | 51,2 | https://epoch.ai/benchmarks |
| 143 | [Gemma 3 27B](https://quelleia.com/modeles/gemma-3-27b.md) | Google DeepMind | non précisée | 47,7 % | 51,0 | https://epoch.ai/benchmarks |
| 144 | [Magistral Small 1.2](https://quelleia.com/modeles/magistral-small-1-2.md) | Mistral AI | non précisée | 47,6 % | 50,9 | https://epoch.ai/benchmarks |
| 145 | [Mistral Small 3.1](https://quelleia.com/modeles/mistral-small-3-1.md) | Mistral AI | non précisée | 47,5 % | 50,8 | https://epoch.ai/benchmarks |
| 146 | [Llama 3.3 70B](https://quelleia.com/modeles/llama-3-3-70b.md) | Meta AI | non précisée | 47,4 % | 50,8 | https://epoch.ai/benchmarks |
| 147 | [Gemini 1.5 Flash (Sep 2024)](https://quelleia.com/modeles/gemini-1-5-flash-sep-2024.md) | Google DeepMind | non précisée | 47,3 % | 50,7 | https://epoch.ai/benchmarks |
| 148 | [Mistral Small 3](https://quelleia.com/modeles/mistral-small-3.md) | Mistral AI | non précisée | 47,3 % | 50,7 | https://epoch.ai/benchmarks |
| 149 | [Claude 3 Opus](https://quelleia.com/modeles/claude-3-opus.md) | Anthropic | non précisée | 47,2 % | 50,6 | https://epoch.ai/benchmarks |
| 150 | [GPT-4 Turbo (Apr 2024)](https://quelleia.com/modeles/gpt-4-turbo-apr-2024.md) | OpenAI | non précisée | 46,6 % | 50,2 | https://epoch.ai/benchmarks |
| 151 | [Tulu 3 (Tülu 3) 70B](https://quelleia.com/modeles/tulu-3-tulu-3-70b.md) | Allen Institute for AI | non précisée | 46,3 % | 49,9 | https://epoch.ai/benchmarks |
| 152 | [Qwen2.5-32B](https://quelleia.com/modeles/qwen2-5-32b.md) | Alibaba | non précisée | 46,1 % | 49,8 | https://epoch.ai/benchmarks |
| 153 | [Gemini 1.5 Pro (May 2024)](https://quelleia.com/modeles/gemini-1-5-pro-may-2024.md) | Google DeepMind | non précisée | 45,9 % | 49,6 | https://epoch.ai/benchmarks |
| 154 | [qwen3-4b-instruct-2507](https://quelleia.com/modeles/qwen3-4b-instruct-2507.md) | Alibaba | non précisée | 45,8 % | 49,6 | https://epoch.ai/benchmarks |
| 155 | [glm-4.7-flash_none](https://quelleia.com/modeles/glm-4-7-flash-none.md) | Z.ai (Zhipu AI) | Sans | 45,1 % | 49,1 | https://epoch.ai/benchmarks |
| 156 | [DeepSeek-R1-Distill-Qwen-14B](https://quelleia.com/modeles/deepseek-r1-distill-qwen-14b.md) | DeepSeek | non précisée | 44,7 % | 48,7 | https://epoch.ai/benchmarks |
| 157 | [Llama 3.1-70B](https://quelleia.com/modeles/llama-3-1-70b.md) | Meta AI | non précisée | 44,2 % | 48,3 | https://epoch.ai/benchmarks |
| 158 | [WizardLM-2 8x22B](https://quelleia.com/modeles/wizardlm-2-8x22b.md) | Microsoft | non précisée | 43,4 % | 47,7 | https://epoch.ai/benchmarks |
| 159 | [GPT-4 Turbo (Nov 2023)](https://quelleia.com/modeles/gpt-4-turbo-nov-2023.md) | OpenAI | non précisée | 42,4 % | 46,7 | https://epoch.ai/benchmarks |
| 160 | [Qwen-Turbo](https://quelleia.com/modeles/qwen-turbo.md) | Alibaba | non précisée | 41,8 % | 46,2 | https://epoch.ai/benchmarks |
| 161 | [Llama 3.2 90B](https://quelleia.com/modeles/llama-3-2-90b.md) | Meta AI | non précisée | 41 % | 45,5 | https://epoch.ai/benchmarks |
| 162 | [Qwen2-72B](https://quelleia.com/modeles/qwen2-72b.md) | Alibaba | non précisée | 40,8 % | 45,3 | https://epoch.ai/benchmarks |
| 163 | [Claude 3 Sonnet](https://quelleia.com/modeles/claude-3-sonnet.md) | Anthropic | non précisée | 40,6 % | 45,1 | https://epoch.ai/benchmarks |
| 164 | [Llama 3-70B](https://quelleia.com/modeles/llama-3-70b.md) | Meta AI | non précisée | 40,6 % | 45,1 | https://epoch.ai/benchmarks |
| 165 | [Gemini 1.5 Flash (May 2024)](https://quelleia.com/modeles/gemini-1-5-flash-may-2024.md) | Google DeepMind | non précisée | 40,4 % | 44,9 | https://epoch.ai/benchmarks |
| 166 | [Gemma 3 12B](https://quelleia.com/modeles/gemma-3-12b.md) | Google DeepMind | non précisée | 39,5 % | 44,0 | https://epoch.ai/benchmarks |
| 167 | [Mistral Large](https://quelleia.com/modeles/mistral-large.md) | Mistral AI | non précisée | 38,8 % | 43,3 | https://epoch.ai/benchmarks |
| 168 | [Claude 3.5 Haiku](https://quelleia.com/modeles/claude-3-5-haiku.md) | Anthropic | non précisée | 38,1 % | 42,6 | https://epoch.ai/benchmarks |
| 169 | [Qwen3-1.7B](https://quelleia.com/modeles/qwen3-1-7b.md) | Alibaba | non précisée | 38 % | 42,5 | https://epoch.ai/benchmarks |
| 170 | [GPT-4o mini](https://quelleia.com/modeles/gpt-4o-mini.md) | OpenAI | non précisée | 37,7 % | 42,2 | https://epoch.ai/benchmarks |
| 171 | [Hermes 2 Theta Llama-3 70B](https://quelleia.com/modeles/hermes-2-theta-llama-3-70b.md) | Nous Research | non précisée | 37,5 % | 41,9 | https://epoch.ai/benchmarks |
| 172 | [Gemma 2 27B](https://quelleia.com/modeles/gemma-2-27b.md) | Google DeepMind | non précisée | 36,5 % | 40,7 | https://epoch.ai/benchmarks |
| 173 | [Claude 3 Haiku](https://quelleia.com/modeles/claude-3-haiku.md) | Anthropic | non précisée | 36,3 % | 40,5 | https://epoch.ai/benchmarks |
| 174 | [GPT-4 (Mar 2023)](https://quelleia.com/modeles/gpt-4-mar-2023.md) | OpenAI | non précisée | 35,7 % | 39,8 | https://epoch.ai/benchmarks |
| 175 | [Qwen2.5-7B](https://quelleia.com/modeles/qwen2-5-7b.md) | Alibaba | non précisée | 35,5 % | 39,5 | https://epoch.ai/benchmarks |
| 176 | [Claude 2](https://quelleia.com/modeles/claude-2.md) | Anthropic | non précisée | 34,7 % | 38,4 | https://epoch.ai/benchmarks |
| 177 | [Mixtral 8x22B](https://quelleia.com/modeles/mixtral-8x22b.md) | Mistral AI | non précisée | 34,1 % | 37,5 | https://epoch.ai/benchmarks |
| 178 | [Gemini 1.0 Pro](https://quelleia.com/modeles/gemini-1-0-pro.md) | Google DeepMind | non précisée | 34 % | 37,4 | https://epoch.ai/benchmarks |
| 179 | [Eurus-2-7B-PRIME](https://quelleia.com/modeles/eurus-2-7b-prime.md) | Tsinghua University | non précisée | 33,9 % | 37,3 | https://epoch.ai/benchmarks |
| 180 | [DeepSeek-R1-Distill-Qwen-1.5B](https://quelleia.com/modeles/deepseek-r1-distill-qwen-1-5b.md) | DeepSeek | non précisée | 33,6 % | 36,8 | https://epoch.ai/benchmarks |
| 181 | [Gemini 1.5 Flash 8B](https://quelleia.com/modeles/gemini-1-5-flash-8b.md) | Google DeepMind | non précisée | 33 % | 35,8 | https://epoch.ai/benchmarks |
| 181 | [Claude 2.1](https://quelleia.com/modeles/claude-2-1.md) | Anthropic | non précisée | 33 % | 35,8 | https://epoch.ai/benchmarks |
| 183 | [DBRX](https://quelleia.com/modeles/dbrx.md) | Databricks | non précisée | 32,9 % | 35,7 | https://epoch.ai/benchmarks |
| 184 | [Yi-1.5-34B](https://quelleia.com/modeles/yi-1-5-34b.md) | 01.AI | non précisée | 32 % | 34,1 | https://epoch.ai/benchmarks |
| 185 | [Qwen1.5-32B](https://quelleia.com/modeles/qwen1-5-32b.md) | Alibaba | non précisée | 30,7 % | 31,6 | https://epoch.ai/benchmarks |
| 186 | [GPT-4 (Jun 2023)](https://quelleia.com/modeles/gpt-4-jun-2023.md) | OpenAI | non précisée | 30,7 % | 31,4 | https://epoch.ai/benchmarks |
| 187 | [Mixtral 8x7B](https://quelleia.com/modeles/mixtral-8x7b.md) | Mistral AI | non précisée | 30,6 % | 31,2 | https://epoch.ai/benchmarks |
| 188 | [Mistral NeMo](https://quelleia.com/modeles/mistral-nemo.md) | Mistral AI | non précisée | 29,9 % | 29,6 | https://epoch.ai/benchmarks |
| 189 | [Qwen1.5-72B](https://quelleia.com/modeles/qwen1-5-72b.md) | Alibaba | non précisée | 28,8 % | 26,5 | https://epoch.ai/benchmarks |
| 190 | [granite-4.0-micro](https://quelleia.com/modeles/granite-4-0-micro.md) | IBM | non précisée | 28,3 % | 24,6 | https://epoch.ai/benchmarks |
| 191 | [GPT-3.5 Turbo (Nov 2023)](https://quelleia.com/modeles/gpt-3-5-turbo-nov-2023.md) | OpenAI | non précisée | 28 % | 23,6 | https://epoch.ai/benchmarks |
| 192 | [phi-3-medium 14B](https://quelleia.com/modeles/phi-3-medium-14b.md) | Microsoft | non précisée | 27,6 % | 21,7 | https://epoch.ai/benchmarks |
| 193 | [Gemma 2 9B](https://quelleia.com/modeles/gemma-2-9b.md) | Google DeepMind | non précisée | 27,5 % | 21,1 | https://epoch.ai/benchmarks |
| 194 | [GPT-3.5 Turbo (Jan 2024)](https://quelleia.com/modeles/gpt-3-5-turbo-jan-2024.md) | OpenAI | non précisée | 27,2 % | 19,6 | https://epoch.ai/benchmarks |
| 195 | [Ministral 8B](https://quelleia.com/modeles/ministral-8b.md) | Mistral AI | non précisée | 27,1 % | 19,4 | https://epoch.ai/benchmarks |
| 196 | [Llama 3.1-8B](https://quelleia.com/modeles/llama-3-1-8b.md) | Meta AI | non précisée | 27 % | 18,3 | https://epoch.ai/benchmarks |
| 197 | [Llama 2-70B](https://quelleia.com/modeles/llama-2-70b.md) | Meta AI | non précisée | 26,3 % | 13,7 | https://epoch.ai/benchmarks |
| 198 | [Llama 3-8B](https://quelleia.com/modeles/llama-3-8b.md) | Meta AI | non précisée | 26,1 % | 11,1 | https://epoch.ai/benchmarks |
| 199 | [Ministral 3B](https://quelleia.com/modeles/ministral-3b.md) | Mistral AI | non précisée | 25,3 % | 6,9 | https://epoch.ai/benchmarks |
| 200 | [DeepSeek LLM 67B](https://quelleia.com/modeles/deepseek-llm-67b.md) | DeepSeek | non précisée | 24,6 % | 6,9 | https://epoch.ai/benchmarks |
| 201 | [granite-4.0-1b](https://quelleia.com/modeles/granite-4-0-1b.md) | IBM | non précisée | 24 % | 6,9 | https://epoch.ai/benchmarks |
| 202 | [Llama 3.2 1B](https://quelleia.com/modeles/llama-3-2-1b.md) | Meta AI | non précisée | 23,9 % | 6,9 | https://epoch.ai/benchmarks |
| 203 | [Gemma 3 4B](https://quelleia.com/modeles/gemma-3-4b.md) | Google DeepMind | non précisée | 23,2 % | 6,9 | https://epoch.ai/benchmarks |
| 204 | [Gemma 3 1B](https://quelleia.com/modeles/gemma-3-1b.md) | Google DeepMind | non précisée | 19,9 % | 6,9 | https://epoch.ai/benchmarks |
| 205 | [Mistral 7B v0.3](https://quelleia.com/modeles/mistral-7b-v0-3.md) | Mistral AI | non précisée | 15,2 % | 6,9 | https://epoch.ai/benchmarks |
| 206 | [Yi-34B](https://quelleia.com/modeles/yi-34b.md) | 01.AI | non précisée | 14,7 % | 6,9 | https://epoch.ai/benchmarks |
| 207 | [granite-4.0-350m](https://quelleia.com/modeles/granite-4-0-350m.md) | IBM | non précisée | 11,2 % | 6,9 | https://epoch.ai/benchmarks |
| 208 | [deepseek-r1-0528-qwen3-8b](https://quelleia.com/modeles/deepseek-r1-0528-qwen3-8b.md) | DeepSeek | non précisée | 9,3 % | 6,9 | https://epoch.ai/benchmarks |

## En bref

**Que mesure GPQA Diamond ?** Des questions à choix multiples de biologie, chimie et physique, écrites par des docteurs et trop dures pour un non-spécialiste. Sur Quelle IA, il est rangé dans la tâche Sciences et savoir expert.

**Comment GPQA Diamond est-il noté ?** Part de bonnes réponses sur 198 questions à quatre choix ; répondre au hasard donne 25 %. Un modèle qui obtient 62 % a un score IA d'environ 61.

**Qui est en tête sur GPQA Diamond ?** GPT-6 Astra (OpenAI) est en tête de GPQA Diamond avec 95,8 %, dans l'édition du 28 septembre 2026. Suivent Claude Sonnet 5.5 (95,6 %) et Gemini 3.8 Flash (95,4 %). 208 modèles y sont mesurés.

**Quelles sont les limites de GPQA Diamond ?** Les meilleurs modèles atteignent 95 % quand des experts humains font environ 70 % : le test est saturé et ses questions circulent en ligne. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse GPQA Diamond dans le score IA ?** GPQA Diamond compte pour 2 % du score général, dans l'édition du 28 septembre 2026. Il porte 20 % de la tâche Sciences et savoir expert (10 % du score général), que se partagent 5 benchmarks.

**Qui maintient GPQA Diamond ?** Epoch AI pour l'évaluation ; questions de Rein et al. (université de New York, 2023). Sa page de référence : epoch.ai/benchmarks/gpqa-diamond.

## Les autres benchmarks de la tâche Sciences et savoir expert

- [Arena, questions d'experts](https://quelleia.com/benchmarks/arena_expert.md) : 263 modèles · 2 % du score
- [CritPt](https://quelleia.com/benchmarks/critpt.md) : 129 modèles · 2 % du score
- [Humanity's Last Exam](https://quelleia.com/benchmarks/hle.md) : 44 modèles · 2 % du score
- [Surface Evolver Bench](https://quelleia.com/benchmarks/surface_evolver_bench.md) : 25 modèles · 2 % du score, saturé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
