Aller au contenu
L'actu IAEN 4 QUESTIONSTrouver mon modèle
Outils · édition du

Le même modèle, des outils différents

Un modèle d'IA ne code pas seul : un outil le pilote, choisit ce qu'il lui montre et les commandes qu'il peut lancer. Sur Terminal-Bench, un même modèle gagne jusqu'à 21,6 points selon l'outil. Voici ces écarts mesure par mesure, avec leurs limites.

En bref

Un même modèle change-t-il de score selon l'outil qui le pilote ?
Oui, et de beaucoup. Sur Terminal-Bench 2.0, 30 modèles ont été mesurés dans au moins deux outils ; le plus grand écart, 21,6 points, concerne Claude Haiku 4.5. L'outil décide de ce que voit le modèle, des commandes qu'il peut lancer et du temps qu'il y passe.
Quel outil grand public s'en sort le mieux ?
Aucun n'est en tête partout. Sur un même modèle, les meilleurs scores reviennent souvent à des agents faits pour le classement. Parmi les outils qu'on installe soi-même, 15 ont des mesures : la vue « Par outil » donne leur place modèle par modèle.
D'où viennent ces mesures ?
Du classement public de Terminal-Bench, repris par Epoch AI dans ses fichiers « external ». Chaque équipe y soumet sa propre mesure. 7 mesures reprises par Epoch ont depuis quitté le classement officiel : elles sont citées à part.

Comparer

Chaque barre est une mesure publiée du même modèle sur le même benchmark, avec un outil différent. Les outils qu'on installe soi-même sont en jaune. Sous chaque barre figurent la date de sortie du modèle, son niveau de réflexion quand il est connu et la source. Le classement Terminal-Bench ne publie pas la date de la mesure elle-même.

Terminal-Bench 2.0

30 modèles mesurés dans au moins deux outils, du plus grand nombre d'outils au plus petit. Classement tenu par Stanford et Laude Institute.

Claude Opus 4.6 sur Terminal-Bench 2.0

10 outils · écart de 18,4 points
  1. Meta-Harnessagent de recherche76,4 %modèle sorti le 5 février 2026 · source : tbench.ai
  2. Capyautre agent75,3 %modèle sorti le 5 février 2026 · source : tbench.ai
  3. Terminus-KIRAautre agent74,7 %modèle sorti le 5 février 2026 · source : tbench.ai
  4. MAYA-V2autre agent72,1 %modèle sorti le 5 février 2026 · source : tbench.ai
  5. TongAgentsagent de recherche71,9 %modèle sorti le 5 février 2026 · source : tbench.ai
  6. Droid (Factory)outil grand public69,9 %modèle sorti le 5 février 2026 · source : tbench.ai
  7. Cruxautre agent66,9 %modèle sorti le 5 février 2026 · source : tbench.ai
  8. Xum (ex-Mux)outil grand public66,5 %modèle sorti le 5 février 2026 · source : tbench.ai
  9. Terminus 2outil de banc d'essai62,9 %modèle sorti le 5 février 2026 · source : tbench.ai
  10. Claude Codeoutil grand public58,0 %modèle sorti le 5 février 2026 · source : tbench.ai

Retirée du classement : ForgeCode, 79,8 %. Les trois lignes de ForgeCode figurent au classement Terminal-Bench 2.0 jusqu'au 13 mai 2026 et n'y sont plus à partir du 19 mai 2026. Le 19 avril 2026, l'équipe du classement écrivait avoir remis à zéro des essais où l'agent de ForgeCode récupérait la solution sur Internet. copie du 13/05/2026 · copie du 19/05/2026 · annonce du classement

GPT-5.3 Codex sur Terminal-Bench 2.0

9 outils · écart de 13,7 points
  1. SageAgentautre agent78,4 %modèle sorti le 5 février 2026 · source : tbench.ai
  2. Droid (Factory)outil grand public77,3 %modèle sorti le 5 février 2026 · source : tbench.ai
  3. CodeBrain-1.5autre agent75,8 %modèle sorti le 5 février 2026 · source : tbench.ai
  4. Codeliaautre agent75,7 %modèle sorti le 5 février 2026 · source : tbench.ai
  5. Simple Codexautre agent75,1 %modèle sorti le 5 février 2026 · source : tbench.ai
  6. Xum (ex-Mux)outil grand public74,6 %modèle sorti le 5 février 2026 · source : tbench.ai
  7. spoox-o-magent de recherche71,5 %modèle sorti le 5 février 2026 · source : tbench.ai
  8. IndusAGI Coding Agentautre agent69,1 %modèle sorti le 5 février 2026 · source : tbench.ai
  9. Terminus 2outil de banc d'essai64,7 %modèle sorti le 5 février 2026 · source : tbench.ai

Retirée du classement : CodeBrain-1, 70,3 %. Ligne présente jusqu'au 13 mai 2026 ; le 19 mai 2026, le classement montre à sa place CodeBrain-1.5 avec GPT-5.3 Codex, à 75,8 %. copie du 13/05/2026 · copie du 19/05/2026

Claude Opus 4.5 sur Terminal-Bench 2.0

8 outils · écart de 11,5 points
  1. Droid (Factory)outil grand public63,1 %modèle sorti le 24 novembre 2025 · source : tbench.ai
  2. Letta Codeoutil grand public59,1 %modèle sorti le 24 novembre 2025 · budget de réflexion fixé · source : tbench.ai
  3. Xum (ex-Mux)outil grand public58,4 %modèle sorti le 24 novembre 2025 · source : tbench.ai
  4. Terminus 2outil de banc d'essai57,8 %modèle sorti le 24 novembre 2025 · source : tbench.ai
  5. gooseoutil grand public54,3 %modèle sorti le 24 novembre 2025 · source : tbench.ai
  6. Claude Codeoutil grand public52,1 %modèle sorti le 24 novembre 2025 · source : tbench.ai
  7. OpenHandsoutil grand public51,9 %modèle sorti le 24 novembre 2025 · source : tbench.ai
  8. OpenCodeoutil grand public51,7 %modèle sorti le 24 novembre 2025 · source : tbench.ai

Gemini 3 Pro sur Terminal-Bench 2.0

7 outils · écart de 13,5 points
  1. Anteautre agent69,4 %modèle sorti le 18 novembre 2025 · source : tbench.ai
  2. SageAgentautre agent65,2 %modèle sorti le 18 novembre 2025 · source : tbench.ai
  3. CodeBrain-1.5autre agent62,2 %modèle sorti le 18 novembre 2025 · source : tbench.ai
  4. II-Agentautre agent61,8 %modèle sorti le 18 novembre 2025 · source : tbench.ai
  5. Droid (Factory)outil grand public61,1 %modèle sorti le 18 novembre 2025 · source : tbench.ai
  6. Terminus 2outil de banc d'essai56,9 %modèle sorti le 18 novembre 2025 · source : tbench.ai
  7. Letta Codeoutil grand public56,0 %modèle sorti le 18 novembre 2025 · source : tbench.ai

Claude Sonnet 4.5 sur Terminal-Bench 2.0

7 outils · écart de 6,5 points
  1. CAMEL-AIagent de recherche46,5 %modèle sorti le 29 septembre 2025 · source : tbench.ai
  2. gooseoutil grand public43,1 %modèle sorti le 29 septembre 2025 · source : tbench.ai
  3. Terminus 2outil de banc d'essai42,8 %modèle sorti le 29 septembre 2025 · source : tbench.ai
  4. MAYA-V2autre agent42,7 %modèle sorti le 29 septembre 2025 · source : tbench.ai
  5. OpenHandsoutil grand public42,6 %modèle sorti le 29 septembre 2025 · source : tbench.ai
  6. mini-SWE-agentoutil de banc d'essai42,5 %modèle sorti le 29 septembre 2025 · source : tbench.ai
  7. Claude Codeoutil grand public40,1 %modèle sorti le 29 septembre 2025 · source : tbench.ai

Claude Haiku 4.5 sur Terminal-Bench 2.0

5 outils · écart de 21,6 points
  1. gooseoutil grand public35,5 %modèle sorti le 15 octobre 2025 · source : tbench.ai
  2. mini-SWE-agentoutil de banc d'essai29,8 %modèle sorti le 15 octobre 2025 · source : tbench.ai
  3. Terminus 2outil de banc d'essai28,3 %modèle sorti le 15 octobre 2025 · source : tbench.ai
  4. Claude Codeoutil grand public27,5 %modèle sorti le 15 octobre 2025 · source : tbench.ai
  5. OpenHandsoutil grand public13,9 %modèle sorti le 15 octobre 2025 · source : tbench.ai

GPT-5 nano sur Terminal-Bench 2.0

5 outils · écart de 14,8 points
  1. spoox-o-magent de recherche21,8 %modèle sorti le 7 août 2025 · source : tbench.ai
  2. Codex CLIoutil grand public11,5 %modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai
  3. OpenHandsoutil grand public9,9 %modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai
  4. Terminus 2outil de banc d'essai7,9 %modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai
  5. mini-SWE-agentoutil de banc d'essai7,0 %modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai

GPT-5 mini sur Terminal-Bench 2.0

5 outils · écart de 12,6 points
  1. spoox-o-magent de recherche34,8 %modèle sorti le 7 août 2025 · source : tbench.ai
  2. Codex CLIoutil grand public31,9 %modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai
  3. OpenHandsoutil grand public29,2 %modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai
  4. Terminus 2outil de banc d'essai24,0 %modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai
  5. mini-SWE-agentoutil de banc d'essai22,2 %modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai

GPT-5.5 sur Terminal-Bench 2.0

4 outils · écart de 18,7 points
  1. NexAU-AHEautre agent84,7 %modèle sorti le 23 avril 2026 · source : tbench.ai
  2. Capyautre agent83,1 %modèle sorti le 23 avril 2026 · source : tbench.ai
  3. Codex CLIoutil grand public82,2 %modèle sorti le 23 avril 2026 · 1 autre soumission à 82,0 % · source : tbench.ai
  4. clnkrautre agent66,1 %modèle sorti le 23 avril 2026 · source : tbench.ai

Gemini 2.5 Pro (Jun 2025) sur Terminal-Bench 2.0

4 outils · écart de 16,2 points
  1. Terminus 2outil de banc d'essai32,6 %modèle sorti le 17 juin 2025 · source : tbench.ai
  2. mini-SWE-agentoutil de banc d'essai26,1 %modèle sorti le 17 juin 2025 · source : tbench.ai
  3. Gemini CLIoutil grand public19,6 %modèle sorti le 17 juin 2025 · source : tbench.ai
  4. OpenHandsoutil grand public16,4 %modèle sorti le 17 juin 2025 · source : tbench.ai

GPT-5 sur Terminal-Bench 2.0

4 outils · écart de 15,7 points
  1. Codex CLIoutil grand public49,6 %modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai
  2. OpenHandsoutil grand public43,8 %modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai
  3. Terminus 2outil de banc d'essai35,2 %modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai
  4. mini-SWE-agentoutil de banc d'essai33,9 %modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai

GPT-5.2 sur Terminal-Bench 2.0

4 outils · écart de 10,9 points
  1. Droid (Factory)outil grand public64,9 %modèle sorti le 11 décembre 2025 · réflexion moyenne · source : tbench.ai
  2. Codex CLIoutil grand public62,9 %modèle sorti le 11 décembre 2025 · réflexion moyenne · source : tbench.ai
  3. Xum (ex-Mux)outil grand public60,7 %modèle sorti le 11 décembre 2025 · source : tbench.ai
  4. Terminus 2outil de banc d'essai54,0 %modèle sorti le 11 décembre 2025 · source : tbench.ai

Claude Opus 4.1 sur Terminal-Bench 2.0

4 outils · écart de 3,1 points
  1. Terminus 2outil de banc d'essai38,0 %modèle sorti le 5 août 2025 · source : tbench.ai
  2. OpenHandsoutil grand public36,9 %modèle sorti le 5 août 2025 · source : tbench.ai
  3. mini-SWE-agentoutil de banc d'essai35,1 %modèle sorti le 5 août 2025 · source : tbench.ai
  4. Claude Codeoutil grand public34,8 %modèle sorti le 5 août 2025 · source : tbench.ai

Gemini 2.5 Flash (Sep 2025) sur Terminal-Bench 2.0

4 outils · écart de 1,7 point
  1. mini-SWE-agentoutil de banc d'essai17,1 %modèle sorti le 3 novembre 2025 · source : tbench.ai
  2. Terminus 2outil de banc d'essai16,9 %modèle sorti le 31 octobre 2025 · source : tbench.ai
  3. OpenHandsoutil grand public16,4 %modèle sorti le 2 novembre 2025 · source : tbench.ai
  4. Gemini CLIoutil grand public15,4 %modèle sorti le 4 novembre 2025 · source : tbench.ai

Gemini 2.5 Flash (Jun 2025) sur Terminal-Bench 2.0

4 outils · écart de 1,6 point
  1. mini-SWE-agentoutil de banc d'essai17,1 %modèle sorti le 17 juin 2025 · source : tbench.ai
  2. Terminus 2outil de banc d'essai16,9 %modèle sorti le 17 juin 2025 · source : tbench.ai
  3. OpenHandsoutil grand public16,4 %modèle sorti le 17 juin 2025 · source : tbench.ai
  4. Gemini CLIoutil grand public15,4 %modèle sorti le 17 juin 2025 · source : tbench.ai

GPT-5.1-Codex sur Terminal-Bench 2.0

3 outils · écart de 20,9 points
  1. Cruxautre agent57,8 %modèle sorti le 12 novembre 2025 · source : tbench.ai
  2. Letta Codeoutil grand public53,5 %modèle sorti le 12 novembre 2025 · source : tbench.ai
  3. Terminus 2outil de banc d'essai36,9 %modèle sorti le 12 novembre 2025 · source : tbench.ai

Retirée du classement : Codex CLI, 57,8 %. Lignes présentes au classement du 26 décembre 2025 au 20 février 2026, absentes à partir du 10 mars 2026. copie du 20/02/2026 · copie du 10/03/2026

Gemini 3.1 Pro sur Terminal-Bench 2.0

3 outils · écart de 20,9 points
  1. TongAgentsagent de recherche80,2 %modèle sorti le 19 février 2026 · source : tbench.ai
  2. Terminus-KIRAautre agent74,8 %modèle sorti le 19 février 2026 · source : tbench.ai
  3. Gemini CLIoutil grand public59,4 %modèle sorti le 19 février 2026 · source : tbench.ai

Retirée du classement : ForgeCode, 78,4 %. Les trois lignes de ForgeCode figurent au classement Terminal-Bench 2.0 jusqu'au 13 mai 2026 et n'y sont plus à partir du 19 mai 2026. Le 19 avril 2026, l'équipe du classement écrivait avoir remis à zéro des essais où l'agent de ForgeCode récupérait la solution sur Internet. copie du 13/05/2026 · copie du 19/05/2026 · annonce du classement

Gemini 3 Flash sur Terminal-Bench 2.0

3 outils · écart de 16,9 points
  1. Junie CLIoutil grand public64,3 %modèle sorti le 17 décembre 2025 · source : tbench.ai
  2. Terminus 2outil de banc d'essai51,7 %modèle sorti le 17 décembre 2025 · source : tbench.ai
  3. Gemini CLIoutil grand public47,4 %modèle sorti le 17 décembre 2025 · source : tbench.ai

Retirée du classement : Gemini CLI, 51,0 %. Ligne présente jusqu'au 10 mars 2026, remplacée par la mesure à 47,4 % (ligne du 6 mars 2026), seule restée au classement. copie du 10/03/2026 · copie du 15/03/2026

Grok 4 sur Terminal-Bench 2.0

3 outils · écart de 4,0 points
  1. OpenHandsoutil grand public27,2 %modèle sorti le 9 juillet 2025 · source : tbench.ai
  2. mini-SWE-agentoutil de banc d'essai25,4 %modèle sorti le 9 juillet 2025 · source : tbench.ai
  3. Terminus 2outil de banc d'essai23,1 %modèle sorti le 9 juillet 2025 · source : tbench.ai

Qwen3-Coder-480B-A35B sur Terminal-Bench 2.0

3 outils · écart de 3,3 points
  1. Dakou Agentautre agent27,2 %modèle sorti le 22 juillet 2025 · source : tbench.ai
  2. OpenHandsoutil grand public25,4 %modèle sorti le 22 juillet 2025 · source : tbench.ai
  3. Terminus 2outil de banc d'essai23,9 %modèle sorti le 22 juillet 2025 · source : tbench.ai

GPT-5-Codex sur Terminal-Bench 2.0

3 outils · écart de 3,0 points
  1. Codex CLIoutil grand public44,3 %modèle sorti le 15 septembre 2025 · source : tbench.ai
  2. Terminus 2outil de banc d'essai43,4 %modèle sorti le 15 septembre 2025 · source : tbench.ai
  3. mini-SWE-agentoutil de banc d'essai41,3 %modèle sorti le 15 septembre 2025 · source : tbench.ai

GPT-5.1-Codex-mini sur Terminal-Bench 2.0

2 outils · écart de 18,4 points
  1. hookeleautre agent61,6 %modèle sorti le 12 novembre 2025 · source : tbench.ai
  2. Cruxautre agent43,1 %modèle sorti le 12 novembre 2025 · source : tbench.ai

Retirée du classement : Codex CLI, 43,1 %. Lignes présentes au classement du 26 décembre 2025 au 20 février 2026, absentes à partir du 10 mars 2026. copie du 20/02/2026 · copie du 10/03/2026

grok-code-fast-1 sur Terminal-Bench 2.0

2 outils · écart de 11,7 points
  1. mini-SWE-agentoutil de banc d'essai25,8 %modèle sorti le 28 août 2025 · source : tbench.ai
  2. Terminus 2outil de banc d'essai14,2 %modèle sorti le 28 août 2025 · source : tbench.ai

MiniMax-M2.1 sur Terminal-Bench 2.0

2 outils · écart de 7,4 points
  1. Cruxautre agent36,6 %modèle sorti le 23 décembre 2025 · source : tbench.ai
  2. Terminus 2outil de banc d'essai29,2 %modèle sorti le 23 décembre 2025 · source : tbench.ai

gpt-oss-120b sur Terminal-Bench 2.0

2 outils · écart de 4,5 points
  1. Terminus 2outil de banc d'essai18,7 %modèle sorti le 5 août 2025 · source : tbench.ai
  2. mini-SWE-agentoutil de banc d'essai14,2 %modèle sorti le 5 août 2025 · source : tbench.ai

MiniMax-M2.7 sur Terminal-Bench 2.0

2 outils · écart de 2,1 points
  1. IndusAGI Coding Agentautre agent45,1 %modèle sorti le 18 mars 2026 · source : tbench.ai
  2. Harness Agentautre agent42,9 %modèle sorti le 18 mars 2026 · source : tbench.ai

Kimi K2 (Jul 2025) sur Terminal-Bench 2.0

2 outils · écart de 1,0 point
  1. Terminus 2outil de banc d'essai27,8 %modèle sorti le 11 juillet 2025 · source : tbench.ai
  2. OpenHandsoutil grand public26,7 %modèle sorti le 11 juillet 2025 · source : tbench.ai

MiniMax-M2.5 sur Terminal-Bench 2.0

2 outils · écart de 0,4 point
  1. cchuterautre agent42,7 %modèle sorti le 12 février 2026 · source : tbench.ai
  2. Terminus 2outil de banc d'essai42,2 %modèle sorti le 12 février 2026 · source : tbench.ai

gpt-oss-20b sur Terminal-Bench 2.0

2 outils · écart de 0,3 point
  1. mini-SWE-agentoutil de banc d'essai3,4 %modèle sorti le 5 août 2025 · source : tbench.ai
  2. Terminus 2outil de banc d'essai3,1 %modèle sorti le 5 août 2025 · source : tbench.ai

GLM-4.7 sur Terminal-Bench 2.0

2 outils · écart de 0,1 point
  1. Terminus 2outil de banc d'essai33,4 %modèle sorti le 22 décembre 2025 · source : tbench.ai
  2. Cruxautre agent33,3 %modèle sorti le 22 décembre 2025 · source : tbench.ai

Par outil

Ce que chaque outil grand public obtient selon le modèle, sur tous les benchmarks qui le citent. « 2e sur 8 » : sa place parmi les outils qui ont piloté le même modèle sur le même benchmark.

Ce qu'on compare, et ses limites

Ici, un outil est le programme qui pilote le modèle, qu'on appelle harnais dans les bancs d'essai : il lui donne la tâche, exécute ses commandes, lui renvoie le résultat et décide quand s'arrêter. Changer d'outil change ce que le modèle peut faire. Ces chiffres disent ce qu'un outil a obtenu un jour donné avec un modèle donné. Ils ne classent pas les outils.

Sources

Ces mesures arrivent par les fichiers « external » d'Epoch AI, qui reprennent les classements de leurs auteurs. Epoch précise que ces données gardent la licence de leur source : on vérifie donc chez chaque classement ce qu'on a le droit d'en reprendre. Fichiers d'Epoch AI, édition du 5 octobre 2026. Un registre public range les noms d'outils, souvent écrits de plusieurs façons au classement (règles de fusion, liens déclarés) : 52 écritures ramenées à 44 outils, et 70 doublons de saisie écartés.

Tous les outils →Terminal-Bench 2.0 →Le classement des modèles pour coder →

Cette page existe aussi en texte et en JSON, avec chaque mesure, sa source et les écritures d'origine.