{"source":"Quelle IA, le classement des modèles de langage","page":"https://quelleia.com/benchmarks/gdpval/","edition":"2026-W40","date":"2026-09-28","echelle":"score_publie est le score de la source, dans son unité. score_0_1 est ce score ramené entre 0 et 1 pour le calcul. niveau_suggere est le score IA que cette seule mesure indique : 100 pour le meilleur modèle au lancement du site, 50 pour GPT-4o de novembre 2024. difficulte est le score IA d'un modèle qui obtient la moitié (score_0_1 = 0,5), pente la raideur de la courbe.","licence":"Réutilisation libre en citant « Quelle IA, quelleia.com » et la date de l'édition. Les mesures renvoient à leurs sources d'origine.","benchmark":{"id":"gdpval","nom":"GDPval","tache":"agents","etat":"archive","echelle":"unite","modeles":11,"poids_general":0,"difficulte":88.1,"pente":0.0595,"en_une_phrase":"Des tâches réelles de 44 métiers (finance, santé, administration, industrie) dont le livrable est un document, un tableur ou une présentation.","notation":"Part des duels gagnés face au travail d'un professionnel humain, jugés à l'aveugle par des experts du métier.","limites":"Benchmark conçu et tenu par OpenAI, qui y classe ses propres modèles. Une dizaine de modèles seulement y figurent.","mainteneur":"OpenAI","url":"https://evals.openai.com/gdpval/leaderboard","verifie":true},"tache":{"id":"agents","nom":"Agents","poids_general":15,"benchmarks_actifs":9},"modeles_mesures":11,"mesures":11,"classement":[{"rang":1,"modele":"gpt-5-2","nom":"GPT-5.2","editeur":"OpenAI","page":"https://quelleia.com/modeles/gpt-5-2/","score_publie":0.497,"score_0_1":0.497,"niveau_suggere":87.9,"reflexion":"sans","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://epoch.ai/benchmarks"},{"rang":2,"modele":"claude-opus-4-5","nom":"Claude Opus 4.5","editeur":"Anthropic","page":"https://quelleia.com/modeles/claude-opus-4-5/","score_publie":0.455,"score_0_1":0.455,"niveau_suggere":85,"reflexion":"inconnue","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://epoch.ai/benchmarks"},{"rang":3,"modele":"claude-opus-4-1","nom":"Claude Opus 4.1","editeur":"Anthropic","page":"https://quelleia.com/modeles/claude-opus-4-1/","score_publie":0.436,"score_0_1":0.436,"niveau_suggere":83.7,"reflexion":"inconnue","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://epoch.ai/benchmarks"},{"rang":4,"modele":"claude-sonnet-4-5","nom":"Claude Sonnet 4.5","editeur":"Anthropic","page":"https://quelleia.com/modeles/claude-sonnet-4-5/","score_publie":0.425,"score_0_1":0.425,"niveau_suggere":83,"reflexion":"inconnue","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://epoch.ai/benchmarks"},{"rang":5,"modele":"gemini-3-pro","nom":"Gemini 3 Pro","editeur":"Google DeepMind","page":"https://quelleia.com/modeles/gemini-3-pro/","score_publie":0.4029999999999999,"score_0_1":0.403,"niveau_suggere":81.5,"reflexion":"inconnue","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://epoch.ai/benchmarks"},{"rang":6,"modele":"gpt-5","nom":"GPT-5","editeur":"OpenAI","page":"https://quelleia.com/modeles/gpt-5/","score_publie":0.348,"score_0_1":0.348,"niveau_suggere":77.5,"reflexion":"moyenne","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://epoch.ai/benchmarks"},{"rang":7,"modele":"o3","nom":"o3","editeur":"OpenAI","page":"https://quelleia.com/modeles/o3/","score_publie":0.308,"score_0_1":0.308,"niveau_suggere":74.5,"reflexion":"moyenne","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://epoch.ai/benchmarks"},{"rang":8,"modele":"o4-mini","nom":"o4-mini","editeur":"OpenAI","page":"https://quelleia.com/modeles/o4-mini/","score_publie":0.253,"score_0_1":0.253,"niveau_suggere":69.9,"reflexion":"elevee","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://epoch.ai/benchmarks"},{"rang":9,"modele":"gemini-2-5-pro-jun-2025","nom":"Gemini 2.5 Pro (Jun 2025)","editeur":"Google DeepMind","page":"https://quelleia.com/modeles/gemini-2-5-pro-jun-2025/","score_publie":0.233,"score_0_1":0.233,"niveau_suggere":68.1,"reflexion":"inconnue","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://epoch.ai/benchmarks"},{"rang":10,"modele":"grok-4","nom":"Grok 4","editeur":"xAI","page":"https://quelleia.com/modeles/grok-4/","score_publie":0.211,"score_0_1":0.211,"niveau_suggere":65.9,"reflexion":"elevee","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://epoch.ai/benchmarks"},{"rang":11,"modele":"gpt-4o-nov-2024","nom":"GPT-4o (Nov 2024)","editeur":"OpenAI","page":"https://quelleia.com/modeles/gpt-4o-nov-2024/","score_publie":0.099,"score_0_1":0.099,"niveau_suggere":51,"reflexion":"inconnue","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://epoch.ai/benchmarks"}]}