# GDPval

> Fiche du benchmark GDPval sur Quelle IA, édition du 28 septembre 2026. Des tâches réelles de 44 métiers (finance, santé, administration, industrie) dont le livrable est un document, un tableur ou une présentation. En tête au 28 septembre 2026 : GPT-5.2 (49,7 %). Notation, limites et classement des 11 modèles mesurés.

Page : https://quelleia.com/benchmarks/gdpval/
Source du benchmark : https://evals.openai.com/gdpval/leaderboard
Mainteneur : OpenAI
Tâche : Agents
État : archivé

## À quoi il sert

GDPval servait à noter la tâche Agents. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

## Comment c'est noté

Part des duels gagnés face au travail d'un professionnel humain, jugés à l'aveugle par des experts du métier.

## Ce qu'il ne dit pas

Benchmark conçu et tenu par OpenAI, qui y classe ses propres modèles. Une dizaine de modèles seulement y figurent.

## Qui le tient

OpenAI.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 88. Le meilleur, GPT-5.2, atteint 49,7 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 10 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 33 %
- Score IA 100 (niveau de Claude Opus 5.5) : 67 %

## Son poids dans le score IA

0 % du score général. GDPval est archivé et ne compte plus : la tâche Agents (15 % du score général) repose sur 9 autres benchmarks.

## Classement (11 modèles mesurés, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | Sans | 49,7 % | 87,9 | https://epoch.ai/benchmarks |
| 2 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | non précisée | 45,5 % | 85,0 | https://epoch.ai/benchmarks |
| 3 | [Claude Opus 4.1](https://quelleia.com/modeles/claude-opus-4-1.md) | Anthropic | non précisée | 43,6 % | 83,7 | https://epoch.ai/benchmarks |
| 4 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | non précisée | 42,5 % | 83,0 | https://epoch.ai/benchmarks |
| 5 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | non précisée | 40,3 % | 81,5 | https://epoch.ai/benchmarks |
| 6 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Moyenne | 34,8 % | 77,5 | https://epoch.ai/benchmarks |
| 7 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Moyenne | 30,8 % | 74,5 | https://epoch.ai/benchmarks |
| 8 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Élevée | 25,3 % | 69,9 | https://epoch.ai/benchmarks |
| 9 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 23,3 % | 68,1 | https://epoch.ai/benchmarks |
| 10 | [Grok 4](https://quelleia.com/modeles/grok-4.md) | xAI | Élevée | 21,1 % | 65,9 | https://epoch.ai/benchmarks |
| 11 | [GPT-4o (Nov 2024)](https://quelleia.com/modeles/gpt-4o-nov-2024.md) | OpenAI | non précisée | 9,9 % | 51,0 | https://epoch.ai/benchmarks |

## En bref

**Que mesure GDPval ?** Des tâches réelles de 44 métiers (finance, santé, administration, industrie) dont le livrable est un document, un tableur ou une présentation. Sur Quelle IA, il est rangé dans la tâche Agents.

**Comment GDPval est-il noté ?** Part des duels gagnés face au travail d'un professionnel humain, jugés à l'aveugle par des experts du métier. Un modèle qui obtient 50 % a un score IA d'environ 88.

**Qui est en tête sur GDPval ?** GPT-5.2 (OpenAI) est en tête de GDPval avec 49,7 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 4.5 (45,5 %) et Claude Opus 4.1 (43,6 %). 11 modèles y sont mesurés.

**Quelles sont les limites de GDPval ?** Benchmark conçu et tenu par OpenAI, qui y classe ses propres modèles. Une dizaine de modèles seulement y figurent. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse GDPval dans le score IA ?** GDPval compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Agents (15 % du score général) repose sur 9 autres benchmarks.

**Qui maintient GDPval ?** OpenAI. Sa page de référence : evals.openai.com/gdpval/leaderboard.

## Les autres benchmarks de la tâche Agents

- [Vending-Bench 2](https://quelleia.com/benchmarks/vending_bench_2.md) : 56 modèles · 1,67 % du score
- [METR Time Horizons (taux de réussite)](https://quelleia.com/benchmarks/metr_time_horizons.md) : 41 modèles · 1,67 % du score
- [BALROG](https://quelleia.com/benchmarks/balrog.md) : 37 modèles · 1,67 % du score
- [APEX-Agents](https://quelleia.com/benchmarks/apex_agents.md) : 34 modèles · 1,67 % du score
- [DeepResearch Bench](https://quelleia.com/benchmarks/deepresearch_bench.md) : 24 modèles · 1,67 % du score
- [EBR-bench (Earthborne Rangers)](https://quelleia.com/benchmarks/ebr_bench.md) : 23 modèles · 1,67 % du score
- [Remote Labor Index](https://quelleia.com/benchmarks/remote_labor_index.md) : 13 modèles · 1,67 % du score
- [PostTrainBench](https://quelleia.com/benchmarks/posttrainbench.md) : 11 modèles · 1,67 % du score
- [OSWorld 2.0](https://quelleia.com/benchmarks/osworld_2.md) : 9 modèles · 1,67 % du score
- [TheAgentCompany](https://quelleia.com/benchmarks/the_agent_company.md) : 14 modèles · hors score, archivé
- [OSWorld](https://quelleia.com/benchmarks/osworld.md) : 9 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
