Le même modèle, des outils différents
Un modèle d'IA ne code pas seul : un outil le pilote, choisit ce qu'il lui montre et les commandes qu'il peut lancer. Sur Terminal-Bench, un même modèle gagne jusqu'à 21,6 points selon l'outil. Voici ces écarts mesure par mesure, avec leurs limites.
En bref
- Un même modèle change-t-il de score selon l'outil qui le pilote ?
- Oui, et de beaucoup. Sur Terminal-Bench 2.0, 30 modèles ont été mesurés dans au moins deux outils ; le plus grand écart, 21,6 points, concerne Claude Haiku 4.5. L'outil décide de ce que voit le modèle, des commandes qu'il peut lancer et du temps qu'il y passe.
- Quel outil grand public s'en sort le mieux ?
- Aucun n'est en tête partout. Sur un même modèle, les meilleurs scores reviennent souvent à des agents faits pour le classement. Parmi les outils qu'on installe soi-même, 15 ont des mesures : la vue « Par outil » donne leur place modèle par modèle.
- D'où viennent ces mesures ?
- Du classement public de Terminal-Bench, repris par Epoch AI dans ses fichiers « external ». Chaque équipe y soumet sa propre mesure. 7 mesures reprises par Epoch ont depuis quitté le classement officiel : elles sont citées à part.
Comparer
Chaque barre est une mesure publiée du même modèle sur le même benchmark, avec un outil différent. Les outils qu'on installe soi-même sont en jaune. Sous chaque barre figurent la date de sortie du modèle, son niveau de réflexion quand il est connu et la source. Le classement Terminal-Bench ne publie pas la date de la mesure elle-même.
- Outil grand public : un outil qu'on installe et qu'on utilise soi-même
- Outil de banc d'essai : l'agent de référence d'un banc d'essai, fait pour mesurer des modèles
- Agent de recherche : un agent publié par un laboratoire ou une université
- Autre agent : un agent d'une société ou d'un particulier, soumis au classement
Terminal-Bench 2.0
30 modèles mesurés dans au moins deux outils, du plus grand nombre d'outils au plus petit. Classement tenu par Stanford et Laude Institute.
Claude Opus 4.6 sur Terminal-Bench 2.0
10 outils · écart de 18,4 pointsRetirée du classement : ForgeCode, 79,8 %. Les trois lignes de ForgeCode figurent au classement Terminal-Bench 2.0 jusqu'au 13 mai 2026 et n'y sont plus à partir du 19 mai 2026. Le 19 avril 2026, l'équipe du classement écrivait avoir remis à zéro des essais où l'agent de ForgeCode récupérait la solution sur Internet. copie du 13/05/2026 · copie du 19/05/2026 · annonce du classement
GPT-5.3 Codex sur Terminal-Bench 2.0
9 outils · écart de 13,7 pointsRetirée du classement : CodeBrain-1, 70,3 %. Ligne présente jusqu'au 13 mai 2026 ; le 19 mai 2026, le classement montre à sa place CodeBrain-1.5 avec GPT-5.3 Codex, à 75,8 %. copie du 13/05/2026 · copie du 19/05/2026
Claude Opus 4.5 sur Terminal-Bench 2.0
8 outils · écart de 11,5 pointsGemini 3 Pro sur Terminal-Bench 2.0
7 outils · écart de 13,5 pointsClaude Sonnet 4.5 sur Terminal-Bench 2.0
7 outils · écart de 6,5 pointsClaude Haiku 4.5 sur Terminal-Bench 2.0
5 outils · écart de 21,6 pointsGPT-5 nano sur Terminal-Bench 2.0
5 outils · écart de 14,8 pointsGPT-5 mini sur Terminal-Bench 2.0
5 outils · écart de 12,6 pointsGPT-5.5 sur Terminal-Bench 2.0
4 outils · écart de 18,7 pointsGemini 2.5 Pro (Jun 2025) sur Terminal-Bench 2.0
4 outils · écart de 16,2 pointsGPT-5 sur Terminal-Bench 2.0
4 outils · écart de 15,7 pointsGPT-5.2 sur Terminal-Bench 2.0
4 outils · écart de 10,9 pointsClaude Opus 4.1 sur Terminal-Bench 2.0
4 outils · écart de 3,1 pointsGemini 2.5 Flash (Sep 2025) sur Terminal-Bench 2.0
4 outils · écart de 1,7 pointGemini 2.5 Flash (Jun 2025) sur Terminal-Bench 2.0
4 outils · écart de 1,6 pointGPT-5.1-Codex sur Terminal-Bench 2.0
3 outils · écart de 20,9 pointsRetirée du classement : Codex CLI, 57,8 %. Lignes présentes au classement du 26 décembre 2025 au 20 février 2026, absentes à partir du 10 mars 2026. copie du 20/02/2026 · copie du 10/03/2026
Gemini 3.1 Pro sur Terminal-Bench 2.0
3 outils · écart de 20,9 pointsRetirée du classement : ForgeCode, 78,4 %. Les trois lignes de ForgeCode figurent au classement Terminal-Bench 2.0 jusqu'au 13 mai 2026 et n'y sont plus à partir du 19 mai 2026. Le 19 avril 2026, l'équipe du classement écrivait avoir remis à zéro des essais où l'agent de ForgeCode récupérait la solution sur Internet. copie du 13/05/2026 · copie du 19/05/2026 · annonce du classement
Gemini 3 Flash sur Terminal-Bench 2.0
3 outils · écart de 16,9 pointsRetirée du classement : Gemini CLI, 51,0 %. Ligne présente jusqu'au 10 mars 2026, remplacée par la mesure à 47,4 % (ligne du 6 mars 2026), seule restée au classement. copie du 10/03/2026 · copie du 15/03/2026
Grok 4 sur Terminal-Bench 2.0
3 outils · écart de 4,0 pointsQwen3-Coder-480B-A35B sur Terminal-Bench 2.0
3 outils · écart de 3,3 pointsGPT-5-Codex sur Terminal-Bench 2.0
3 outils · écart de 3,0 pointsGPT-5.1-Codex-mini sur Terminal-Bench 2.0
2 outils · écart de 18,4 pointsRetirée du classement : Codex CLI, 43,1 %. Lignes présentes au classement du 26 décembre 2025 au 20 février 2026, absentes à partir du 10 mars 2026. copie du 20/02/2026 · copie du 10/03/2026
grok-code-fast-1 sur Terminal-Bench 2.0
2 outils · écart de 11,7 pointsMiniMax-M2.1 sur Terminal-Bench 2.0
2 outils · écart de 7,4 pointsgpt-oss-120b sur Terminal-Bench 2.0
2 outils · écart de 4,5 pointsMiniMax-M2.7 sur Terminal-Bench 2.0
2 outils · écart de 2,1 pointsKimi K2 (Jul 2025) sur Terminal-Bench 2.0
2 outils · écart de 1,0 pointMiniMax-M2.5 sur Terminal-Bench 2.0
2 outils · écart de 0,4 pointgpt-oss-20b sur Terminal-Bench 2.0
2 outils · écart de 0,3 pointGLM-4.7 sur Terminal-Bench 2.0
2 outils · écart de 0,1 pointPar outil
Ce que chaque outil grand public obtient selon le modèle, sur tous les benchmarks qui le citent. « 2e sur 8 » : sa place parmi les outils qui ont piloté le même modèle sur le même benchmark.
OpenHands
- Claude Opus 4.847,1 %GSO
- Claude Opus 4.744,1 %GSO
- Claude Opus 4.641,2 %GSO
- GPT-5.540,2 %GSO
- Claude Sonnet 537,3 %GSO
- GPT-5.431,4 %GSO
- GPT-5.227,5 %GSO
- Claude Opus 4.526,5 %GSO
- Gemini 3.1 Pro22,6 %GSO
- Gemini 3 Pro18,6 %GSO
- Claude Sonnet 4.514,7 %GSO
- GPT-5.113,7 %GSO
- Gemini 3 Flash9,8 %GSO
- o38,8 %GSO
- GPT-56,9 %GSO
- Claude Opus 46,9 %GSO
- Claude Sonnet 44,9 %GSO
- Qwen3-Coder-480B-A35B4,9 %GSO
- Kimi K2 (Jul 2025)4,9 %GSO
- Claude 3.5 Sonnet (October 2024)4,6 %GSO
- Gemini 2.5 Pro (Jun 2025)3,9 %GSO
- Claude 3.7 Sonnet3,8 %GSO
- o4-mini3,6 %GSO
- GLM-4.5-Air2,9 %GSO
- o3-mini1,3 %GSO
- GPT-4o (Nov 2024)0,0 %GSO
- Claude Opus 4.551,9 %Terminal-Bench 2.0 · 7e sur 8
- GPT-543,8 %Terminal-Bench 2.0 · 2e sur 4
- Claude Sonnet 4.542,6 %Terminal-Bench 2.0 · 5e sur 7
- Claude Opus 4.136,9 %Terminal-Bench 2.0 · 2e sur 4
- GPT-5 mini29,2 %Terminal-Bench 2.0 · 3e sur 5
- Grok 427,2 %Terminal-Bench 2.0 · 1er sur 3
- Kimi K2 (Jul 2025)26,7 %Terminal-Bench 2.0 · 2e sur 2
- Qwen3-Coder-480B-A35B25,4 %Terminal-Bench 2.0 · 2e sur 3
- Gemini 2.5 Pro (Jun 2025)16,4 %Terminal-Bench 2.0 · 4e sur 4
- Gemini 2.5 Flash (Jun 2025)16,4 %Terminal-Bench 2.0 · 3e sur 4
- Gemini 2.5 Flash (Sep 2025)16,4 %Terminal-Bench 2.0 · 3e sur 4
- Claude Haiku 4.513,9 %Terminal-Bench 2.0 · 5e sur 5
- GPT-5 nano9,9 %Terminal-Bench 2.0 · 3e sur 5
Claude Code
- Claude Opus 5.554,6 %FrontierCode
- Claude Fable 553,5 %FrontierCode
- Claude Opus 553,4 %FrontierCode
- Claude Sonnet 5.552,1 %FrontierCode
- Claude Fable 5.150,9 %FrontierCode
- Claude Opus 4.846,5 %FrontierCode
- Claude Sonnet 542,7 %FrontierCode
- Claude Opus 4.738,5 %FrontierCode
- Claude Opus 4.626,6 %FrontierCode
- Claude Sonnet 4.624,3 %FrontierCode
- Claude Fable 541,8 %PostTrainBench
- Claude Opus 535,0 %PostTrainBench
- Claude Opus 4.833,8 %PostTrainBench
- Kimi K332,0 %PostTrainBench
- GLM-5.231,7 %PostTrainBench
- Claude Opus 4.728,6 %PostTrainBench
- Claude Opus 4.658,0 %Terminal-Bench 2.0 · 10e sur 10
- Claude Opus 4.552,1 %Terminal-Bench 2.0 · 6e sur 8
- Claude Sonnet 4.540,1 %Terminal-Bench 2.0 · 7e sur 7
- Claude Opus 4.134,8 %Terminal-Bench 2.0 · 4e sur 4
- Claude Haiku 4.527,5 %Terminal-Bench 2.0 · 4e sur 5
- Claude Opus 5.531,2 %WeirdML v3
- Claude Fable 5.126,0 %WeirdML v3
- Claude Opus 519,0 %WeirdML v3
- Claude Fable 515,5 %WeirdML v3
- Claude Opus 4.56,5 %WeirdML v3
Codex CLI
- GPT-5.541,6 %ExploitBench
- GPT-6 Astra53,3 %FrontierCode
- GPT-6.1 Sol50,2 %FrontierCode
- GPT-6 Sol49,3 %FrontierCode
- GPT-5.6 Sol47,5 %FrontierCode
- GPT-5.543,0 %FrontierCode
- GPT-6 Luna42,4 %FrontierCode
- GPT-5.6 Terra41,3 %FrontierCode
- GPT-5.6 Luna39,8 %FrontierCode
- GPT-5.4 Mini27,0 %FrontierCode
- GPT-5.6 Sol36,2 %PostTrainBench
- GPT-5.527,2 %PostTrainBench
- GPT-5.419,0 %PostTrainBench
- GPT-5.582,2 %Terminal-Bench 2.0 · 3e sur 4
- GPT-5.262,9 %Terminal-Bench 2.0 · 2e sur 4
- GPT-5.1-Codex-Max60,4 %Terminal-Bench 2.0
- GPT-549,6 %Terminal-Bench 2.0 · 1er sur 4
- GPT-5-Codex44,3 %Terminal-Bench 2.0 · 1er sur 3
- GPT-5 mini31,9 %Terminal-Bench 2.0 · 2e sur 5
- GPT-5 nano11,5 %Terminal-Bench 2.0 · 2e sur 5
- GPT-6 Astra42,2 %WeirdML v3
- GPT-6 Sol19,7 %WeirdML v3
- GPT-5.6 Sol15,0 %WeirdML v3
- GPT-6 Luna7,9 %WeirdML v3
- GPT-5.6 Luna5,2 %WeirdML v3
Gemini CLI
- Gemini 3.1 Pro59,4 %Terminal-Bench 2.0 · 3e sur 3
- Gemini 3 Flash47,4 %Terminal-Bench 2.0 · 3e sur 3
- Gemini 2.5 Pro (Jun 2025)19,6 %Terminal-Bench 2.0 · 3e sur 4
- Gemini 2.5 Flash (Jun 2025)15,4 %Terminal-Bench 2.0 · 4e sur 4
- Gemini 2.5 Flash (Sep 2025)15,4 %Terminal-Bench 2.0 · 4e sur 4
- Gemini 3.8 Flash7,4 %WeirdML v3
Droid (Factory)
Xum (ex-Mux)
goose
Letta Code
OpenCode
Cursor CLI
- Composer 2.525,6 %FrontierCode
- Grok 4.523,5 %PostTrainBench
Grok Build
- Grok 4.648,0 %FrontierCode
- Grok 4.542,4 %FrontierCode
Devin
- SWE-250,0 %FrontierCode
Grok CLI
Junie CLI
Kimi Code CLI
- Kimi K37,3 %WeirdML v3
Ce qu'on compare, et ses limites
Ici, un outil est le programme qui pilote le modèle, qu'on appelle harnais dans les bancs d'essai : il lui donne la tâche, exécute ses commandes, lui renvoie le résultat et décide quand s'arrêter. Changer d'outil change ce que le modèle peut faire. Ces chiffres disent ce qu'un outil a obtenu un jour donné avec un modèle donné. Ils ne classent pas les outils.
- Un seul benchmark mesure un même modèle dans plusieurs outils : Terminal-Bench 2.0. Un outil fort en terminal peut l'être moins ailleurs.
- OSWorld n'est pas repris ici. Sur OSWorld, les lignes d'un même modèle diffèrent par le nombre d'étapes autorisées (15, 50 ou 100) avec le même outil : elles ne comparent donc pas des outils.
- Les modèles mesurés ont souvent plusieurs mois. Les outils changent chaque semaine : une mesure ne vaut que pour la version de l'outil soumise ce jour-là.
- Beaucoup d'agents mesurés viennent de laboratoires ou ont été faits pour une démonstration, en visant le classement. Les outils qu'on installe soi-même sont en jaune.
- Chaque équipe lance sa propre mesure, puis la soumet. Le classement Terminal-Bench 2.0 exige au moins cinq essais par tâche, sans toucher aux délais ni aux ressources, et fait relire les soumissions. Il a déjà retiré des agents qui trichaient.
- Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle. Le jour de la mesure n'est pas publié.
- Le plus souvent, il n'existe qu'une mesure par outil et par modèle. Deux soumissions peuvent différer de quelques points sans que l'outil ait changé.
- 7 mesures reprises par Epoch ne figurent plus au classement Terminal-Bench 2.0 (copies d'archive à l'appui) : elles sortent des barres et des rangs, et restent citées sous le graphique concerné. 3 autres n'ont fait que changer de nom au classement.
Sources
Terminal-Bench 2.0
Classement tenu par l'équipe de Terminal-Bench (Stanford et Laude Institute). Les soumissions sont faites par les équipes elles-mêmes, vérifiées par un robot puis relues par les mainteneurs. Données sous licence Apache 2.0 (dépôt des soumissions). Conditions · Règles du classement.
Ces mesures arrivent par les fichiers « external » d'Epoch AI, qui reprennent les classements de leurs auteurs. Epoch précise que ces données gardent la licence de leur source : on vérifie donc chez chaque classement ce qu'on a le droit d'en reprendre. Fichiers d'Epoch AI, édition du 5 octobre 2026. Un registre public range les noms d'outils, souvent écrits de plusieurs façons au classement (règles de fusion, liens déclarés) : 52 écritures ramenées à 44 outils, et 70 doublons de saisie écartés.
Tous les outils →Terminal-Bench 2.0 →Le classement des modèles pour coder →
Cette page existe aussi en texte et en JSON, avec chaque mesure, sa source et les écritures d'origine.