À quoi il sert
GDPval servait à noter la tâche Agents. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
AgentsFiche benchmark · OpenAI · evals.openai.com
Des tâches réelles de 44 métiers (finance, santé, administration, industrie) dont le livrable est un document, un tableur ou une présentation.
GDPval servait à noter la tâche Agents. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
Part des duels gagnés face au travail d'un professionnel humain, jugés à l'aveugle par des experts du métier.
Benchmark conçu et tenu par OpenAI, qui y classe ses propres modèles. Une dizaine de modèles seulement y figurent.
OpenAI.
evals.openai.com/gdpval/leaderboard · tâche Agents · 11 modèles mesurés
En tête : GPT-5.2, 49,7 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 88. Le meilleur, GPT-5.2, atteint 49,7 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. GDPval est archivé et ne compte plus : la tâche Agents (15 % du score général) repose sur 9 autres benchmarks.
En couleur, la tâche Agents dans le score général. GDPval n'y a plus de part.