Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

AgentsFiche benchmark · OpenAI · evals.openai.com

GDPval

Des tâches réelles de 44 métiers (finance, santé, administration, industrie) dont le livrable est un document, un tableur ou une présentation.

ARCHIVÉ

À quoi il sert

GDPval servait à noter la tâche Agents. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

Comment c'est noté

Part des duels gagnés face au travail d'un professionnel humain, jugés à l'aveugle par des experts du métier.

Ce qu'il ne dit pas

Benchmark conçu et tenu par OpenAI, qui y classe ses propres modèles. Une dizaine de modèles seulement y figurent.

Comment lire le score

11 modèles mesurés

En tête : GPT-5.2, 49,7 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 88. Le meilleur, GPT-5.2, atteint 49,7 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
10 %
Score IA 76niveau de Claude Sonnet 4.5
33 %
Score IA 100niveau de Claude Opus 5.5
67 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. GDPval est archivé et ne compte plus : la tâche Agents (15 % du score général) repose sur 9 autres benchmarks.

En couleur, la tâche Agents dans le score général. GDPval n'y a plus de part.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-5.2OpenAISans49,7 %87,9
2Claude Opus 4.5AnthropicNon précisée45,5 %85,0
3Claude Opus 4.1AnthropicNon précisée43,6 %83,7
4Claude Sonnet 4.5AnthropicNon précisée42,5 %83,0
5Gemini 3 ProGoogle DeepMindNon précisée40,3 %81,5
6GPT-5OpenAIMoyenne34,8 %77,5
7o3OpenAIMoyenne30,8 %74,5
8o4-miniOpenAIÉlevée25,3 %69,9
9Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée23,3 %68,1
10Grok 4xAIÉlevée21,1 %65,9
11 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 11 →Replier le classement ↑
11GPT-4o (Nov 2024)OpenAINon précisée9,9 %51,0

En bref

Que mesure GDPval ?
Des tâches réelles de 44 métiers (finance, santé, administration, industrie) dont le livrable est un document, un tableur ou une présentation. Sur Quelle IA, il est rangé dans la tâche Agents.
Comment GDPval est-il noté ?
Part des duels gagnés face au travail d'un professionnel humain, jugés à l'aveugle par des experts du métier. Un modèle qui obtient 50 % a un score IA d'environ 88.
Qui est en tête sur GDPval ?
GPT-5.2 (OpenAI) est en tête de GDPval avec 49,7 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 4.5 (45,5 %) et Claude Opus 4.1 (43,6 %). 11 modèles y sont mesurés.
Quelles sont les limites de GDPval ?
Benchmark conçu et tenu par OpenAI, qui y classe ses propres modèles. Une dizaine de modèles seulement y figurent. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse GDPval dans le score IA ?
GDPval compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Agents (15 % du score général) repose sur 9 autres benchmarks.
Qui maintient GDPval ?
OpenAI. Sa page de référence : evals.openai.com/gdpval/leaderboard.

Les autres benchmarks de la tâche Agents

Tous les benchmarks →Comment le score IA est calculé →