# Humanity's Last Exam

> Fiche du benchmark Humanity's Last Exam sur Quelle IA, édition du 28 septembre 2026. 2 500 questions de niveau expert dans plus de cent disciplines, écrites par près de mille chercheurs pour mettre les modèles en échec. En tête au 28 septembre 2026 : GPT-6 Astra (54,8 %). Notation, limites et classement des 44 modèles mesurés.

Page : https://quelleia.com/benchmarks/hle/
Source du benchmark : https://lastexam.ai/
Mainteneur : Center for AI Safety et Scale AI
Tâche : Sciences et savoir expert
État : actif

## À quoi il sert

Sur Quelle IA, Humanity's Last Exam sert à noter la tâche Sciences et savoir expert : c'est l'un de ses 5 benchmarks. Il départage surtout les modèles dont le score IA approche 96.

## Comment c'est noté

Part de réponses exactes ; le classement publie aussi l'erreur de calibration, qui mesure l'excès de confiance du modèle.

Pour le calcul, ce score est ramené entre 0 et 1 : 5 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

## Ce qu'il ne dit pas

Epoch le classe « défectueux » : sur 48 questions vérifiées, 22 avaient un énoncé ou un corrigé fautif, ce qui borne le score atteignable.

## Qui le tient

Center for AI Safety et Scale AI.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 52 % a un score IA d'environ 96. Le meilleur, GPT-6 Astra, atteint 54,8 %. Le benchmark sera dit saturé quand un modèle atteindra 95,2 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 7 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 19 %
- Score IA 100 (niveau de Claude Opus 5.5) : 61 %

## Son poids dans le score IA

2 % du score général. Humanity's Last Exam porte 20 % de la tâche Sciences et savoir expert (10 % du score général), que se partagent 5 benchmarks.

## Classement (44 modèles mesurés · 54 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | non précisée | 54,8 % | 96,7 | https://epoch.ai/benchmarks |
| 2 | [Claude Fable 5.1](https://quelleia.com/modeles/claude-fable-5-1.md) | Anthropic | Maximale | 46,5 % | 92,8 | https://epoch.ai/benchmarks |
| 3 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 46,4 % | 92,8 | https://epoch.ai/benchmarks |
| 4 | [Gemini 3.8 Flash](https://quelleia.com/modeles/gemini-3-8-flash.md) | Google DeepMind | non précisée | 44,5 % | 91,9 | https://epoch.ai/benchmarks |
| 5 | [GPT-5.4 Pro](https://quelleia.com/modeles/gpt-5-4-pro.md) | OpenAI | non précisée | 44,3 % | 91,8 | https://epoch.ai/benchmarks |
| 6 | [Muse Spark](https://quelleia.com/modeles/muse-spark.md) | Meta AI | non précisée | 40,6 % | 89,9 | https://epoch.ai/benchmarks |
| 7 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | non précisée | 37,5 % | 88,4 | https://epoch.ai/benchmarks |
| 8 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Maximale | 36,2 % | 87,7 | https://epoch.ai/benchmarks |
| 9 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | non précisée | 36,2 % | 87,7 | https://epoch.ai/benchmarks |
| 10 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | Maximale | 34,4 % | 86,8 | https://epoch.ai/benchmarks |
| 11 | [GPT-5 Pro](https://quelleia.com/modeles/gpt-5-pro.md) | OpenAI | non précisée | 31,6 % | 85,2 | https://epoch.ai/benchmarks |
| 12 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | non précisée | 27,8 % | 82,9 | https://epoch.ai/benchmarks |
| 13 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | non précisée | 25,3 % | 81,2 | https://epoch.ai/benchmarks |
| 14 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | non précisée | 25,2 % | 81,1 | https://epoch.ai/benchmarks |
| 15 | [Kimi K2.5](https://quelleia.com/modeles/kimi-k2-5.md) | Moonshot | non précisée | 24,4 % | 80,6 | https://epoch.ai/benchmarks |
| 16 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | non précisée | 23,7 % | 80,1 | https://epoch.ai/benchmarks |
| 17 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 21,6 % | 78,5 | https://epoch.ai/benchmarks |
| 18 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Élevée | 20,3 % | 77,4 | https://epoch.ai/benchmarks |
| 19 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | non précisée | 19,4 % | 76,6 | https://epoch.ai/benchmarks |
| 20 | [Gemini 2.5 Pro (Mar 2025)](https://quelleia.com/modeles/gemini-2-5-pro-mar-2025.md) | Google DeepMind | non précisée | 18,2 % | 75,4 | https://epoch.ai/benchmarks |
| 21 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Élevée | 18,1 % | 75,4 | https://epoch.ai/benchmarks |
| 22 | [Gemini 2.5 Pro (May 2025)](https://quelleia.com/modeles/gemini-2-5-pro-may-2025.md) | Google DeepMind | non précisée | 17,8 % | 75,1 | https://epoch.ai/benchmarks |
| 23 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | non précisée | 13,7 % | 70,4 | https://epoch.ai/benchmarks |
| 24 | [Gemini 2.5 Flash (Apr 2025)](https://quelleia.com/modeles/gemini-2-5-flash-apr-2025.md) | Google DeepMind | non précisée | 12,1 % | 67,9 | https://epoch.ai/benchmarks |
| 25 | [Claude Opus 4.1](https://quelleia.com/modeles/claude-opus-4-1.md) | Anthropic | non précisée | 11,5 % | 66,9 | https://epoch.ai/benchmarks |
| 26 | [Gemini 2.5 Flash (May 2025)](https://quelleia.com/modeles/gemini-2-5-flash-may-2025.md) | Google DeepMind | non précisée | 11 % | 65,9 | https://epoch.ai/benchmarks |
| 27 | [Claude Opus 4](https://quelleia.com/modeles/claude-opus-4.md) | Anthropic | non précisée | 10,7 % | 65,4 | https://epoch.ai/benchmarks |
| 28 | [Gemini 3.1 Flash-Lite](https://quelleia.com/modeles/gemini-3-1-flash-lite.md) | Google DeepMind | non précisée | 8,6 % | 60,4 | https://epoch.ai/benchmarks |
| 29 | [GLM-4.5](https://quelleia.com/modeles/glm-4-5.md) | Z.ai (Zhipu AI) | non précisée | 8,3 % | 59,4 | https://epoch.ai/benchmarks |
| 30 | [o1-pro](https://quelleia.com/modeles/o1-pro.md) | OpenAI | non précisée | 8,1 % | 58,7 | https://epoch.ai/benchmarks |
| 30 | [GLM-4.5-Air](https://quelleia.com/modeles/glm-4-5-air.md) | Z.ai (Zhipu AI) | non précisée | 8,1 % | 58,7 | https://epoch.ai/benchmarks |
| 32 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | non précisée | 8 % | 58,4 | https://epoch.ai/benchmarks |
| 33 | [o1](https://quelleia.com/modeles/o1.md) | OpenAI | non précisée | 8 % | 58,1 | https://epoch.ai/benchmarks |
| 34 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | non précisée | 7,8 % | 57,4 | https://epoch.ai/benchmarks |
| 35 | [Gemini 2.0 Flash Thinking (Jan 2025)](https://quelleia.com/modeles/gemini-2-0-flash-thinking-jan-2025.md) | Google DeepMind | non précisée | 6,6 % | 51,4 | https://epoch.ai/benchmarks |
| 36 | [Llama 4 Maverick](https://quelleia.com/modeles/llama-4-maverick.md) | Meta AI | non précisée | 5,7 % | 44,5 | https://epoch.ai/benchmarks |
| 37 | [GPT-4.5](https://quelleia.com/modeles/gpt-4-5.md) | OpenAI | non précisée | 5,4 % | 44,5 | https://epoch.ai/benchmarks |
| 38 | [GPT-4.1](https://quelleia.com/modeles/gpt-4-1.md) | OpenAI | non précisée | 5,4 % | 44,5 | https://epoch.ai/benchmarks |
| 39 | [Gemini 1.5 Pro (Sept 2024)](https://quelleia.com/modeles/gemini-1-5-pro-sept-2024.md) | Google DeepMind | non précisée | 4,6 % | 44,5 | https://epoch.ai/benchmarks |
| 40 | [Mistral Medium 3](https://quelleia.com/modeles/mistral-medium-3.md) | Mistral AI | non précisée | 4,5 % | 44,5 | https://epoch.ai/benchmarks |
| 41 | [Amazon Nova Pro](https://quelleia.com/modeles/amazon-nova-pro.md) | Amazon | non précisée | 4,4 % | 44,5 | https://epoch.ai/benchmarks |
| 42 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 4,1 % | 44,5 | https://epoch.ai/benchmarks |
| 43 | [Amazon Nova Lite](https://quelleia.com/modeles/amazon-nova-lite.md) | Amazon | non précisée | 3,6 % | 44,5 | https://epoch.ai/benchmarks |
| 44 | [GPT-4o (Nov 2024)](https://quelleia.com/modeles/gpt-4o-nov-2024.md) | OpenAI | non précisée | 2,7 % | 44,5 | https://epoch.ai/benchmarks |

## En bref

**Que mesure Humanity's Last Exam ?** 2 500 questions de niveau expert dans plus de cent disciplines, écrites par près de mille chercheurs pour mettre les modèles en échec. Sur Quelle IA, il est rangé dans la tâche Sciences et savoir expert.

**Comment Humanity's Last Exam est-il noté ?** Part de réponses exactes ; le classement publie aussi l'erreur de calibration, qui mesure l'excès de confiance du modèle. Un modèle qui obtient 52 % a un score IA d'environ 96.

**Qui est en tête sur Humanity's Last Exam ?** GPT-6 Astra (OpenAI) est en tête de Humanity's Last Exam avec 54,8 %, dans l'édition du 28 septembre 2026. Suivent Claude Fable 5.1 (46,5 %) et Gemini 3.1 Pro (46,4 %). 44 modèles y sont mesurés.

**Quelles sont les limites de Humanity's Last Exam ?** Epoch le classe « défectueux » : sur 48 questions vérifiées, 22 avaient un énoncé ou un corrigé fautif, ce qui borne le score atteignable. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse Humanity's Last Exam dans le score IA ?** Humanity's Last Exam compte pour 2 % du score général, dans l'édition du 28 septembre 2026. Il porte 20 % de la tâche Sciences et savoir expert (10 % du score général), que se partagent 5 benchmarks.

**Qui maintient Humanity's Last Exam ?** Center for AI Safety et Scale AI. Sa page de référence : lastexam.ai.

## Les autres benchmarks de la tâche Sciences et savoir expert

- [Arena, questions d'experts](https://quelleia.com/benchmarks/arena_expert.md) : 263 modèles · 2 % du score
- [GPQA Diamond](https://quelleia.com/benchmarks/gpqa_diamond.md) : 208 modèles · 2 % du score
- [CritPt](https://quelleia.com/benchmarks/critpt.md) : 129 modèles · 2 % du score
- [Surface Evolver Bench](https://quelleia.com/benchmarks/surface_evolver_bench.md) : 25 modèles · 2 % du score, saturé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
