Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

SciencesFiche benchmark · Center for AI Safety et Scale AI · lastexam.ai

Humanity's Last Exam

2 500 questions de niveau expert dans plus de cent disciplines, écrites par près de mille chercheurs pour mettre les modèles en échec.

À quoi il sert

Sur Quelle IA, Humanity's Last Exam sert à noter la tâche Sciences et savoir expert : c'est l'un de ses 5 benchmarks. Il départage surtout les modèles dont le score IA approche 96.

Comment c'est noté

Part de réponses exactes ; le classement publie aussi l'erreur de calibration, qui mesure l'excès de confiance du modèle.

Pour le calcul, ce score est ramené entre 0 et 1 : 5 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

Ce qu'il ne dit pas

Epoch le classe « défectueux » : sur 48 questions vérifiées, 22 avaient un énoncé ou un corrigé fautif, ce qui borne le score atteignable.

Qui le tient

Center for AI Safety et Scale AI.

lastexam.ai · tâche Sciences · 44 modèles mesurés

Comment lire le score

44 modèles mesurés · 54 mesures

En tête : GPT-6 Astra, 54,8 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 52 % a un score IA d'environ 96. Le meilleur, GPT-6 Astra, atteint 54,8 %. Le benchmark sera dit saturé quand un modèle atteindra 95,2 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
7 %
Score IA 76niveau de Claude Sonnet 4.5
19 %
Score IA 100niveau de Claude Opus 5.5
61 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

2 %du score général. Humanity's Last Exam porte 20 % de la tâche Sciences et savoir expert (10 % du score général), que se partagent 5 benchmarks.

En couleur, la tâche Sciences et savoir expert dans le score général. En noir, la part de Humanity's Last Exam.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-6 AstraOpenAINon précisée54,8 %96,7
2Claude Fable 5.1AnthropicMaximale46,5 %92,8
3Gemini 3.1 ProGoogle DeepMindNon précisée46,4 %92,8
4Gemini 3.8 FlashGoogle DeepMindNon précisée44,5 %91,9
5GPT-5.4 ProOpenAINon précisée44,3 %91,8
6Muse SparkMeta AINon précisée40,6 %89,9
7Gemini 3 ProGoogle DeepMindNon précisée37,5 %88,4
8GPT-5.4OpenAIMaximale36,2 %87,7
9Claude Opus 4.7AnthropicNon précisée36,2 %87,7
10Claude Opus 4.6Anthropic · 2 configurationsMaximale34,4 %86,8
44 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 44 →Replier le classement ↑
11GPT-5 ProOpenAINon précisée31,6 %85,2
12GPT-5.2OpenAINon précisée27,8 %82,9
13GPT-5OpenAI · 2 configurationsNon précisée25,3 %81,2
14Claude Opus 4.5Anthropic · 2 configurationsNon précisée25,2 %81,1
15Kimi K2.5Moonshot · poids ouvertsNon précisée24,4 %80,6
16GPT-5.1OpenAI · 2 configurationsNon précisée23,7 %80,1
17Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée21,6 %78,5
18o3OpenAI · 2 configurationsÉlevée20,3 %77,4
19GPT-5 miniOpenAINon précisée19,4 %76,6
20Gemini 2.5 Pro (Mar 2025)Google DeepMindNon précisée18,2 %75,4
21o4-miniOpenAI · 2 configurationsÉlevée18,1 %75,4
22Gemini 2.5 Pro (May 2025)Google DeepMindNon précisée17,8 %75,1
23Claude Sonnet 4.5Anthropic · 2 configurationsNon précisée13,7 %70,4
24Gemini 2.5 Flash (Apr 2025)Google DeepMindNon précisée12,1 %67,9
25Claude Opus 4.1Anthropic · 2 configurationsNon précisée11,5 %66,9
26Gemini 2.5 Flash (May 2025)Google DeepMindNon précisée11 %65,9
27Claude Opus 4Anthropic · 2 configurationsNon précisée10,7 %65,4
28Gemini 3.1 Flash-LiteGoogle DeepMindNon précisée8,6 %60,4
29GLM-4.5Z.ai (Zhipu AI) · poids ouvertsNon précisée8,3 %59,4
30o1-proOpenAINon précisée8,1 %58,7
30GLM-4.5-AirZ.ai (Zhipu AI) · poids ouvertsNon précisée8,1 %58,7
32Claude 3.7 SonnetAnthropicNon précisée8 %58,4
33o1OpenAINon précisée8 %58,1
34Claude Sonnet 4Anthropic · 2 configurationsNon précisée7,8 %57,4
35Gemini 2.0 Flash Thinking (Jan 2025)Google DeepMindNon précisée6,6 %51,4
36Llama 4 MaverickMeta AI · poids ouvertsNon précisée5,7 %44,5
37GPT-4.5OpenAINon précisée5,4 %44,5
38GPT-4.1OpenAINon précisée5,4 %44,5
39Gemini 1.5 Pro (Sept 2024)Google DeepMindNon précisée4,6 %44,5
40Mistral Medium 3Mistral AINon précisée4,5 %44,5
41Amazon Nova ProAmazonNon précisée4,4 %44,5
42Claude 3.5 Sonnet (October 2024)AnthropicNon précisée4,1 %44,5
43Amazon Nova LiteAmazonNon précisée3,6 %44,5
44GPT-4o (Nov 2024)OpenAINon précisée2,7 %44,5

En bref

Que mesure Humanity's Last Exam ?
2 500 questions de niveau expert dans plus de cent disciplines, écrites par près de mille chercheurs pour mettre les modèles en échec. Sur Quelle IA, il est rangé dans la tâche Sciences et savoir expert.
Comment Humanity's Last Exam est-il noté ?
Part de réponses exactes ; le classement publie aussi l'erreur de calibration, qui mesure l'excès de confiance du modèle. Un modèle qui obtient 52 % a un score IA d'environ 96.
Qui est en tête sur Humanity's Last Exam ?
GPT-6 Astra (OpenAI) est en tête de Humanity's Last Exam avec 54,8 %, dans l'édition du 28 septembre 2026. Suivent Claude Fable 5.1 (46,5 %) et Gemini 3.1 Pro (46,4 %). 44 modèles y sont mesurés.
Quelles sont les limites de Humanity's Last Exam ?
Epoch le classe « défectueux » : sur 48 questions vérifiées, 22 avaient un énoncé ou un corrigé fautif, ce qui borne le score atteignable. Au 28 septembre 2026, le benchmark est actif.
Combien pèse Humanity's Last Exam dans le score IA ?
Humanity's Last Exam compte pour 2 % du score général, dans l'édition du 28 septembre 2026. Il porte 20 % de la tâche Sciences et savoir expert (10 % du score général), que se partagent 5 benchmarks.
Qui maintient Humanity's Last Exam ?
Center for AI Safety et Scale AI. Sa page de référence : lastexam.ai.

Les autres benchmarks de la tâche Sciences et savoir expert

Tous les benchmarks →Comment le score IA est calculé →