# Le même modèle, des outils différents

Édition du 5 octobre 2026. Page : https://quelleia.com/outils/harnais/

Un modèle d'IA ne code pas seul : un outil le pilote, choisit ce qu'il lui montre et les commandes qu'il peut lancer. Sur Terminal-Bench, un même modèle gagne jusqu'à 21,6 points selon l'outil. Voici ces écarts mesure par mesure, avec leurs limites.

## Ce qu'on compare, et ses limites

- Un seul benchmark mesure un même modèle dans plusieurs outils : Terminal-Bench 2.0. Un outil fort en terminal peut l'être moins ailleurs.
- OSWorld n'est pas repris ici. Sur OSWorld, les lignes d'un même modèle diffèrent par le nombre d'étapes autorisées (15, 50 ou 100) avec le même outil : elles ne comparent donc pas des outils.
- Les modèles mesurés ont souvent plusieurs mois. Les outils changent chaque semaine : une mesure ne vaut que pour la version de l'outil soumise ce jour-là.
- Beaucoup d'agents mesurés viennent de laboratoires ou ont été faits pour une démonstration, en visant le classement. Les outils qu'on installe soi-même sont en jaune.
- Chaque équipe lance sa propre mesure, puis la soumet. Le classement Terminal-Bench 2.0 exige au moins cinq essais par tâche, sans toucher aux délais ni aux ressources, et fait relire les soumissions. Il a déjà retiré des agents qui trichaient.
- Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle. Le jour de la mesure n'est pas publié.
- Le plus souvent, il n'existe qu'une mesure par outil et par modèle. Deux soumissions peuvent différer de quelques points sans que l'outil ait changé.
- 7 mesures reprises par Epoch ne figurent plus au classement Terminal-Bench 2.0 : elles sortent des barres et des rangs, et restent citées sous le couple concerné.

## Terminal-Bench 2.0

30 modèles. Fiche du benchmark : https://quelleia.com/benchmarks/terminal_bench/

### Terminal-Bench 2.0 · Claude Opus 4.6

10 outils, écart de 18,4 points. Fiche du modèle : https://quelleia.com/modeles/claude-opus-4-6/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [Meta-Harness](https://quelleia.com/outils/meta-harness/) | agent de recherche | 76,4 % | modèle sorti le 5 février 2026 · source : tbench.ai |
| [Capy](https://quelleia.com/outils/capy/) | autre agent | 75,3 % | modèle sorti le 5 février 2026 · source : tbench.ai |
| [Terminus-KIRA](https://quelleia.com/outils/terminus-kira/) | autre agent | 74,7 % | modèle sorti le 5 février 2026 · source : tbench.ai |
| [MAYA-V2](https://quelleia.com/outils/maya-v2/) | autre agent | 72,1 % | modèle sorti le 5 février 2026 · source : tbench.ai |
| [TongAgents](https://quelleia.com/outils/tongagents/) | agent de recherche | 71,9 % | modèle sorti le 5 février 2026 · source : tbench.ai |
| [Droid (Factory)](https://quelleia.com/outils/factory-droid/) | outil grand public | 69,9 % | modèle sorti le 5 février 2026 · source : tbench.ai |
| [Crux](https://quelleia.com/outils/crux/) | autre agent | 66,9 % | modèle sorti le 5 février 2026 · source : tbench.ai |
| [Xum (ex-Mux)](https://quelleia.com/outils/mux/) | outil grand public | 66,5 % | modèle sorti le 5 février 2026 · source : tbench.ai |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 62,9 % | modèle sorti le 5 février 2026 · source : tbench.ai |
| [Claude Code](https://quelleia.com/outils/claude-code/) | outil grand public | 58,0 % | modèle sorti le 5 février 2026 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

Retirée du classement : ForgeCode, 79,8 %. Les trois lignes de ForgeCode figurent au classement Terminal-Bench 2.0 jusqu'au 13 mai 2026 et n'y sont plus à partir du 19 mai 2026. Le 19 avril 2026, l'équipe du classement écrivait avoir remis à zéro des essais où l'agent de ForgeCode récupérait la solution sur Internet. (https://web.archive.org/web/20260513024259/https://www.tbench.ai/leaderboard/terminal-bench/2.0 ; https://web.archive.org/web/20260519111531/https://www.tbench.ai/leaderboard/terminal-bench/2.0 ; https://www.tbench.ai/news/leaderboard-integrity-update)

### Terminal-Bench 2.0 · GPT-5.3 Codex

9 outils, écart de 13,7 points. Fiche du modèle : https://quelleia.com/modeles/gpt-5-3-codex/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [SageAgent](https://quelleia.com/outils/sageagent/) | autre agent | 78,4 % | modèle sorti le 5 février 2026 · source : tbench.ai |
| [Droid (Factory)](https://quelleia.com/outils/factory-droid/) | outil grand public | 77,3 % | modèle sorti le 5 février 2026 · source : tbench.ai |
| [CodeBrain-1.5](https://quelleia.com/outils/codebrain-1-5/) | autre agent | 75,8 % | modèle sorti le 5 février 2026 · source : tbench.ai |
| [Codelia](https://quelleia.com/outils/codelia/) | autre agent | 75,7 % | modèle sorti le 5 février 2026 · source : tbench.ai |
| [Simple Codex](https://quelleia.com/outils/simple-codex/) | autre agent | 75,1 % | modèle sorti le 5 février 2026 · source : tbench.ai |
| [Xum (ex-Mux)](https://quelleia.com/outils/mux/) | outil grand public | 74,6 % | modèle sorti le 5 février 2026 · source : tbench.ai |
| [spoox-o-m](https://quelleia.com/outils/spoox-o-m/) | agent de recherche | 71,5 % | modèle sorti le 5 février 2026 · source : tbench.ai |
| [IndusAGI Coding Agent](https://quelleia.com/outils/indusagi/) | autre agent | 69,1 % | modèle sorti le 5 février 2026 · source : tbench.ai |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 64,7 % | modèle sorti le 5 février 2026 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

Retirée du classement : CodeBrain-1, 70,3 %. Ligne présente jusqu'au 13 mai 2026 ; le 19 mai 2026, le classement montre à sa place CodeBrain-1.5 avec GPT-5.3 Codex, à 75,8 %. (https://web.archive.org/web/20260513024259/https://www.tbench.ai/leaderboard/terminal-bench/2.0 ; https://web.archive.org/web/20260519111531/https://www.tbench.ai/leaderboard/terminal-bench/2.0)

### Terminal-Bench 2.0 · Claude Opus 4.5

8 outils, écart de 11,5 points. Fiche du modèle : https://quelleia.com/modeles/claude-opus-4-5/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [Droid (Factory)](https://quelleia.com/outils/factory-droid/) | outil grand public | 63,1 % | modèle sorti le 24 novembre 2025 · source : tbench.ai |
| [Letta Code](https://quelleia.com/outils/letta-code/) | outil grand public | 59,1 % | modèle sorti le 24 novembre 2025 · budget de réflexion fixé · source : tbench.ai |
| [Xum (ex-Mux)](https://quelleia.com/outils/mux/) | outil grand public | 58,4 % | modèle sorti le 24 novembre 2025 · source : tbench.ai |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 57,8 % | modèle sorti le 24 novembre 2025 · source : tbench.ai |
| [goose](https://quelleia.com/outils/goose/) | outil grand public | 54,3 % | modèle sorti le 24 novembre 2025 · source : tbench.ai |
| [Claude Code](https://quelleia.com/outils/claude-code/) | outil grand public | 52,1 % | modèle sorti le 24 novembre 2025 · source : tbench.ai |
| [OpenHands](https://quelleia.com/outils/openhands/) | outil grand public | 51,9 % | modèle sorti le 24 novembre 2025 · source : tbench.ai |
| [OpenCode](https://quelleia.com/outils/opencode/) | outil grand public | 51,7 % | modèle sorti le 24 novembre 2025 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · Gemini 3 Pro

7 outils, écart de 13,5 points. Fiche du modèle : https://quelleia.com/modeles/gemini-3-pro/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [Ante](https://quelleia.com/outils/ante/) | autre agent | 69,4 % | modèle sorti le 18 novembre 2025 · source : tbench.ai |
| [SageAgent](https://quelleia.com/outils/sageagent/) | autre agent | 65,2 % | modèle sorti le 18 novembre 2025 · source : tbench.ai |
| [CodeBrain-1.5](https://quelleia.com/outils/codebrain-1-5/) | autre agent | 62,2 % | modèle sorti le 18 novembre 2025 · source : tbench.ai |
| [II-Agent](https://quelleia.com/outils/ii-agent/) | autre agent | 61,8 % | modèle sorti le 18 novembre 2025 · source : tbench.ai |
| [Droid (Factory)](https://quelleia.com/outils/factory-droid/) | outil grand public | 61,1 % | modèle sorti le 18 novembre 2025 · source : tbench.ai |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 56,9 % | modèle sorti le 18 novembre 2025 · source : tbench.ai |
| [Letta Code](https://quelleia.com/outils/letta-code/) | outil grand public | 56,0 % | modèle sorti le 18 novembre 2025 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · Claude Sonnet 4.5

7 outils, écart de 6,5 points. Fiche du modèle : https://quelleia.com/modeles/claude-sonnet-4-5/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [CAMEL-AI](https://quelleia.com/outils/camel-ai/) | agent de recherche | 46,5 % | modèle sorti le 29 septembre 2025 · source : tbench.ai |
| [goose](https://quelleia.com/outils/goose/) | outil grand public | 43,1 % | modèle sorti le 29 septembre 2025 · source : tbench.ai |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 42,8 % | modèle sorti le 29 septembre 2025 · source : tbench.ai |
| [MAYA-V2](https://quelleia.com/outils/maya-v2/) | autre agent | 42,7 % | modèle sorti le 29 septembre 2025 · source : tbench.ai |
| [OpenHands](https://quelleia.com/outils/openhands/) | outil grand public | 42,6 % | modèle sorti le 29 septembre 2025 · source : tbench.ai |
| [mini-SWE-agent](https://quelleia.com/outils/mini-swe-agent/) | outil de banc d'essai | 42,5 % | modèle sorti le 29 septembre 2025 · source : tbench.ai |
| [Claude Code](https://quelleia.com/outils/claude-code/) | outil grand public | 40,1 % | modèle sorti le 29 septembre 2025 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · Claude Haiku 4.5

5 outils, écart de 21,6 points. Fiche du modèle : https://quelleia.com/modeles/claude-haiku-4-5/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [goose](https://quelleia.com/outils/goose/) | outil grand public | 35,5 % | modèle sorti le 15 octobre 2025 · source : tbench.ai |
| [mini-SWE-agent](https://quelleia.com/outils/mini-swe-agent/) | outil de banc d'essai | 29,8 % | modèle sorti le 15 octobre 2025 · source : tbench.ai |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 28,3 % | modèle sorti le 15 octobre 2025 · source : tbench.ai |
| [Claude Code](https://quelleia.com/outils/claude-code/) | outil grand public | 27,5 % | modèle sorti le 15 octobre 2025 · source : tbench.ai |
| [OpenHands](https://quelleia.com/outils/openhands/) | outil grand public | 13,9 % | modèle sorti le 15 octobre 2025 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · GPT-5 nano

5 outils, écart de 14,8 points. Fiche du modèle : https://quelleia.com/modeles/gpt-5-nano/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [spoox-o-m](https://quelleia.com/outils/spoox-o-m/) | agent de recherche | 21,8 % | modèle sorti le 7 août 2025 · source : tbench.ai |
| [Codex CLI](https://quelleia.com/outils/codex/) | outil grand public | 11,5 % | modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai |
| [OpenHands](https://quelleia.com/outils/openhands/) | outil grand public | 9,9 % | modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 7,9 % | modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai |
| [mini-SWE-agent](https://quelleia.com/outils/mini-swe-agent/) | outil de banc d'essai | 7,0 % | modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · GPT-5 mini

5 outils, écart de 12,6 points. Fiche du modèle : https://quelleia.com/modeles/gpt-5-mini/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [spoox-o-m](https://quelleia.com/outils/spoox-o-m/) | agent de recherche | 34,8 % | modèle sorti le 7 août 2025 · source : tbench.ai |
| [Codex CLI](https://quelleia.com/outils/codex/) | outil grand public | 31,9 % | modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai |
| [OpenHands](https://quelleia.com/outils/openhands/) | outil grand public | 29,2 % | modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 24,0 % | modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai |
| [mini-SWE-agent](https://quelleia.com/outils/mini-swe-agent/) | outil de banc d'essai | 22,2 % | modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · GPT-5.5

4 outils, écart de 18,7 points. Fiche du modèle : https://quelleia.com/modeles/gpt-5-5/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [NexAU-AHE](https://quelleia.com/outils/nexau-ahe/) | autre agent | 84,7 % | modèle sorti le 23 avril 2026 · source : tbench.ai |
| [Capy](https://quelleia.com/outils/capy/) | autre agent | 83,1 % | modèle sorti le 23 avril 2026 · source : tbench.ai |
| [Codex CLI](https://quelleia.com/outils/codex/) | outil grand public | 82,2 % | modèle sorti le 23 avril 2026 · 1 autre soumission à 82,0 % · source : tbench.ai |
| [clnkr](https://quelleia.com/outils/clnkr/) | autre agent | 66,1 % | modèle sorti le 23 avril 2026 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · Gemini 2.5 Pro (Jun 2025)

4 outils, écart de 16,2 points. Fiche du modèle : https://quelleia.com/modeles/gemini-2-5-pro-jun-2025/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 32,6 % | modèle sorti le 17 juin 2025 · source : tbench.ai |
| [mini-SWE-agent](https://quelleia.com/outils/mini-swe-agent/) | outil de banc d'essai | 26,1 % | modèle sorti le 17 juin 2025 · source : tbench.ai |
| [Gemini CLI](https://quelleia.com/outils/gemini-cli/) | outil grand public | 19,6 % | modèle sorti le 17 juin 2025 · source : tbench.ai |
| [OpenHands](https://quelleia.com/outils/openhands/) | outil grand public | 16,4 % | modèle sorti le 17 juin 2025 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · GPT-5

4 outils, écart de 15,7 points. Fiche du modèle : https://quelleia.com/modeles/gpt-5/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [Codex CLI](https://quelleia.com/outils/codex/) | outil grand public | 49,6 % | modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai |
| [OpenHands](https://quelleia.com/outils/openhands/) | outil grand public | 43,8 % | modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 35,2 % | modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai |
| [mini-SWE-agent](https://quelleia.com/outils/mini-swe-agent/) | outil de banc d'essai | 33,9 % | modèle sorti le 7 août 2025 · réflexion moyenne · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · GPT-5.2

4 outils, écart de 10,9 points. Fiche du modèle : https://quelleia.com/modeles/gpt-5-2/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [Droid (Factory)](https://quelleia.com/outils/factory-droid/) | outil grand public | 64,9 % | modèle sorti le 11 décembre 2025 · réflexion moyenne · source : tbench.ai |
| [Codex CLI](https://quelleia.com/outils/codex/) | outil grand public | 62,9 % | modèle sorti le 11 décembre 2025 · réflexion moyenne · source : tbench.ai |
| [Xum (ex-Mux)](https://quelleia.com/outils/mux/) | outil grand public | 60,7 % | modèle sorti le 11 décembre 2025 · source : tbench.ai |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 54,0 % | modèle sorti le 11 décembre 2025 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · Claude Opus 4.1

4 outils, écart de 3,1 points. Fiche du modèle : https://quelleia.com/modeles/claude-opus-4-1/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 38,0 % | modèle sorti le 5 août 2025 · source : tbench.ai |
| [OpenHands](https://quelleia.com/outils/openhands/) | outil grand public | 36,9 % | modèle sorti le 5 août 2025 · source : tbench.ai |
| [mini-SWE-agent](https://quelleia.com/outils/mini-swe-agent/) | outil de banc d'essai | 35,1 % | modèle sorti le 5 août 2025 · source : tbench.ai |
| [Claude Code](https://quelleia.com/outils/claude-code/) | outil grand public | 34,8 % | modèle sorti le 5 août 2025 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · Gemini 2.5 Flash (Sep 2025)

4 outils, écart de 1,7 point. Fiche du modèle : https://quelleia.com/modeles/gemini-2-5-flash-sep-2025/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [mini-SWE-agent](https://quelleia.com/outils/mini-swe-agent/) | outil de banc d'essai | 17,1 % | modèle sorti le 3 novembre 2025 · source : tbench.ai |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 16,9 % | modèle sorti le 31 octobre 2025 · source : tbench.ai |
| [OpenHands](https://quelleia.com/outils/openhands/) | outil grand public | 16,4 % | modèle sorti le 2 novembre 2025 · source : tbench.ai |
| [Gemini CLI](https://quelleia.com/outils/gemini-cli/) | outil grand public | 15,4 % | modèle sorti le 4 novembre 2025 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · Gemini 2.5 Flash (Jun 2025)

4 outils, écart de 1,6 point. Fiche du modèle : https://quelleia.com/modeles/gemini-2-5-flash-jun-2025/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [mini-SWE-agent](https://quelleia.com/outils/mini-swe-agent/) | outil de banc d'essai | 17,1 % | modèle sorti le 17 juin 2025 · source : tbench.ai |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 16,9 % | modèle sorti le 17 juin 2025 · source : tbench.ai |
| [OpenHands](https://quelleia.com/outils/openhands/) | outil grand public | 16,4 % | modèle sorti le 17 juin 2025 · source : tbench.ai |
| [Gemini CLI](https://quelleia.com/outils/gemini-cli/) | outil grand public | 15,4 % | modèle sorti le 17 juin 2025 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · GPT-5.1-Codex

3 outils, écart de 20,9 points. Fiche du modèle : https://quelleia.com/modeles/gpt-5-1-codex/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [Crux](https://quelleia.com/outils/crux/) | autre agent | 57,8 % | modèle sorti le 12 novembre 2025 · source : tbench.ai |
| [Letta Code](https://quelleia.com/outils/letta-code/) | outil grand public | 53,5 % | modèle sorti le 12 novembre 2025 · source : tbench.ai |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 36,9 % | modèle sorti le 12 novembre 2025 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

Retirée du classement : Codex CLI, 57,8 %. Lignes présentes au classement du 26 décembre 2025 au 20 février 2026, absentes à partir du 10 mars 2026. (https://web.archive.org/web/20260220180020/https://www.tbench.ai/leaderboard/terminal-bench/2.0 ; https://web.archive.org/web/20260310094521/https://www.tbench.ai/leaderboard/terminal-bench/2.0)

### Terminal-Bench 2.0 · Gemini 3.1 Pro

3 outils, écart de 20,9 points. Fiche du modèle : https://quelleia.com/modeles/gemini-3-1-pro/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [TongAgents](https://quelleia.com/outils/tongagents/) | agent de recherche | 80,2 % | modèle sorti le 19 février 2026 · source : tbench.ai |
| [Terminus-KIRA](https://quelleia.com/outils/terminus-kira/) | autre agent | 74,8 % | modèle sorti le 19 février 2026 · source : tbench.ai |
| [Gemini CLI](https://quelleia.com/outils/gemini-cli/) | outil grand public | 59,4 % | modèle sorti le 19 février 2026 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

Retirée du classement : ForgeCode, 78,4 %. Les trois lignes de ForgeCode figurent au classement Terminal-Bench 2.0 jusqu'au 13 mai 2026 et n'y sont plus à partir du 19 mai 2026. Le 19 avril 2026, l'équipe du classement écrivait avoir remis à zéro des essais où l'agent de ForgeCode récupérait la solution sur Internet. (https://web.archive.org/web/20260513024259/https://www.tbench.ai/leaderboard/terminal-bench/2.0 ; https://web.archive.org/web/20260519111531/https://www.tbench.ai/leaderboard/terminal-bench/2.0 ; https://www.tbench.ai/news/leaderboard-integrity-update)

### Terminal-Bench 2.0 · Gemini 3 Flash

3 outils, écart de 16,9 points. Fiche du modèle : https://quelleia.com/modeles/gemini-3-flash/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [Junie CLI](https://quelleia.com/outils/junie/) | outil grand public | 64,3 % | modèle sorti le 17 décembre 2025 · source : tbench.ai |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 51,7 % | modèle sorti le 17 décembre 2025 · source : tbench.ai |
| [Gemini CLI](https://quelleia.com/outils/gemini-cli/) | outil grand public | 47,4 % | modèle sorti le 17 décembre 2025 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

Retirée du classement : Gemini CLI, 51,0 %. Ligne présente jusqu'au 10 mars 2026, remplacée par la mesure à 47,4 % (ligne du 6 mars 2026), seule restée au classement. (https://web.archive.org/web/20260310094521/https://www.tbench.ai/leaderboard/terminal-bench/2.0 ; https://web.archive.org/web/20260315050912/https://www.tbench.ai/leaderboard/terminal-bench/2.0)

### Terminal-Bench 2.0 · Grok 4

3 outils, écart de 4,0 points. Fiche du modèle : https://quelleia.com/modeles/grok-4/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [OpenHands](https://quelleia.com/outils/openhands/) | outil grand public | 27,2 % | modèle sorti le 9 juillet 2025 · source : tbench.ai |
| [mini-SWE-agent](https://quelleia.com/outils/mini-swe-agent/) | outil de banc d'essai | 25,4 % | modèle sorti le 9 juillet 2025 · source : tbench.ai |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 23,1 % | modèle sorti le 9 juillet 2025 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · Qwen3-Coder-480B-A35B

3 outils, écart de 3,3 points. Fiche du modèle : https://quelleia.com/modeles/qwen3-coder-480b-a35b/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [Dakou Agent](https://quelleia.com/outils/dakou-agent/) | autre agent | 27,2 % | modèle sorti le 22 juillet 2025 · source : tbench.ai |
| [OpenHands](https://quelleia.com/outils/openhands/) | outil grand public | 25,4 % | modèle sorti le 22 juillet 2025 · source : tbench.ai |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 23,9 % | modèle sorti le 22 juillet 2025 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · GPT-5-Codex

3 outils, écart de 3,0 points. Fiche du modèle : https://quelleia.com/modeles/gpt-5-codex/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [Codex CLI](https://quelleia.com/outils/codex/) | outil grand public | 44,3 % | modèle sorti le 15 septembre 2025 · source : tbench.ai |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 43,4 % | modèle sorti le 15 septembre 2025 · source : tbench.ai |
| [mini-SWE-agent](https://quelleia.com/outils/mini-swe-agent/) | outil de banc d'essai | 41,3 % | modèle sorti le 15 septembre 2025 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · GPT-5.1-Codex-mini

2 outils, écart de 18,4 points. Fiche du modèle : https://quelleia.com/modeles/gpt-5-1-codex-mini/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [hookele](https://quelleia.com/outils/hookele/) | autre agent | 61,6 % | modèle sorti le 12 novembre 2025 · source : tbench.ai |
| [Crux](https://quelleia.com/outils/crux/) | autre agent | 43,1 % | modèle sorti le 12 novembre 2025 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

Retirée du classement : Codex CLI, 43,1 %. Lignes présentes au classement du 26 décembre 2025 au 20 février 2026, absentes à partir du 10 mars 2026. (https://web.archive.org/web/20260220180020/https://www.tbench.ai/leaderboard/terminal-bench/2.0 ; https://web.archive.org/web/20260310094521/https://www.tbench.ai/leaderboard/terminal-bench/2.0)

### Terminal-Bench 2.0 · grok-code-fast-1

2 outils, écart de 11,7 points. Fiche du modèle : https://quelleia.com/modeles/grok-code-fast-1/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [mini-SWE-agent](https://quelleia.com/outils/mini-swe-agent/) | outil de banc d'essai | 25,8 % | modèle sorti le 28 août 2025 · source : tbench.ai |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 14,2 % | modèle sorti le 28 août 2025 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · MiniMax-M2.1

2 outils, écart de 7,4 points. Fiche du modèle : https://quelleia.com/modeles/minimax-m2-1/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [Crux](https://quelleia.com/outils/crux/) | autre agent | 36,6 % | modèle sorti le 23 décembre 2025 · source : tbench.ai |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 29,2 % | modèle sorti le 23 décembre 2025 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · gpt-oss-120b

2 outils, écart de 4,5 points. Fiche du modèle : https://quelleia.com/modeles/gpt-oss-120b/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 18,7 % | modèle sorti le 5 août 2025 · source : tbench.ai |
| [mini-SWE-agent](https://quelleia.com/outils/mini-swe-agent/) | outil de banc d'essai | 14,2 % | modèle sorti le 5 août 2025 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · MiniMax-M2.7

2 outils, écart de 2,1 points. Fiche du modèle : https://quelleia.com/modeles/minimax-m2-7/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [IndusAGI Coding Agent](https://quelleia.com/outils/indusagi/) | autre agent | 45,1 % | modèle sorti le 18 mars 2026 · source : tbench.ai |
| [Harness Agent](https://quelleia.com/outils/harness-agent/) | autre agent | 42,9 % | modèle sorti le 18 mars 2026 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · Kimi K2 (Jul 2025)

2 outils, écart de 1,0 point. Fiche du modèle : https://quelleia.com/modeles/kimi-k2-jul-2025/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 27,8 % | modèle sorti le 11 juillet 2025 · source : tbench.ai |
| [OpenHands](https://quelleia.com/outils/openhands/) | outil grand public | 26,7 % | modèle sorti le 11 juillet 2025 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · MiniMax-M2.5

2 outils, écart de 0,4 point. Fiche du modèle : https://quelleia.com/modeles/minimax-m2-5/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [cchuter](https://quelleia.com/outils/cchuter/) | autre agent | 42,7 % | modèle sorti le 12 février 2026 · source : tbench.ai |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 42,2 % | modèle sorti le 12 février 2026 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · gpt-oss-20b

2 outils, écart de 0,3 point. Fiche du modèle : https://quelleia.com/modeles/gpt-oss-20b/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [mini-SWE-agent](https://quelleia.com/outils/mini-swe-agent/) | outil de banc d'essai | 3,4 % | modèle sorti le 5 août 2025 · source : tbench.ai |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 3,1 % | modèle sorti le 5 août 2025 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

### Terminal-Bench 2.0 · GLM-4.7

2 outils, écart de 0,1 point. Fiche du modèle : https://quelleia.com/modeles/glm-4-7/

| Outil | Type | Score | Détail |
| --- | --- | ---: | --- |
| [Terminus 2](https://quelleia.com/outils/terminus-2/) | outil de banc d'essai | 33,4 % | modèle sorti le 22 décembre 2025 · source : tbench.ai |
| [Crux](https://quelleia.com/outils/crux/) | autre agent | 33,3 % | modèle sorti le 22 décembre 2025 · source : tbench.ai |

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

## Par outil

### OpenHands (https://quelleia.com/outils/openhands/)

- GSO · Claude Opus 4.8 : 47,1 %
- GSO · Claude Opus 4.7 : 44,1 %
- GSO · Claude Opus 4.6 : 41,2 %
- GSO · GPT-5.5 : 40,2 %
- GSO · Claude Sonnet 5 : 37,3 %
- GSO · GPT-5.4 : 31,4 %
- GSO · GPT-5.2 : 27,5 %
- GSO · Claude Opus 4.5 : 26,5 %
- GSO · Gemini 3.1 Pro : 22,6 %
- GSO · Gemini 3 Pro : 18,6 %
- GSO · Claude Sonnet 4.5 : 14,7 %
- GSO · GPT-5.1 : 13,7 %
- GSO · Gemini 3 Flash : 9,8 %
- GSO · o3 : 8,8 %
- GSO · GPT-5 : 6,9 %
- GSO · Claude Opus 4 : 6,9 %
- GSO · Claude Sonnet 4 : 4,9 %
- GSO · Qwen3-Coder-480B-A35B : 4,9 %
- GSO · Kimi K2 (Jul 2025) : 4,9 %
- GSO · Claude 3.5 Sonnet (October 2024) : 4,6 %
- GSO · Gemini 2.5 Pro (Jun 2025) : 3,9 %
- GSO · Claude 3.7 Sonnet : 3,8 %
- GSO · o4-mini : 3,6 %
- GSO · GLM-4.5-Air : 2,9 %
- GSO · o3-mini : 1,3 %
- GSO · GPT-4o (Nov 2024) : 0,0 %
- Terminal-Bench 2.0 · Claude Opus 4.5 : 51,9 % (7e sur 8 outils)
- Terminal-Bench 2.0 · GPT-5 : 43,8 % (2e sur 4 outils)
- Terminal-Bench 2.0 · Claude Sonnet 4.5 : 42,6 % (5e sur 7 outils)
- Terminal-Bench 2.0 · Claude Opus 4.1 : 36,9 % (2e sur 4 outils)
- Terminal-Bench 2.0 · GPT-5 mini : 29,2 % (3e sur 5 outils)
- Terminal-Bench 2.0 · Grok 4 : 27,2 % (1er sur 3 outils)
- Terminal-Bench 2.0 · Kimi K2 (Jul 2025) : 26,7 % (2e sur 2 outils)
- Terminal-Bench 2.0 · Qwen3-Coder-480B-A35B : 25,4 % (2e sur 3 outils)
- Terminal-Bench 2.0 · Gemini 2.5 Pro (Jun 2025) : 16,4 % (4e sur 4 outils)
- Terminal-Bench 2.0 · Gemini 2.5 Flash (Jun 2025) : 16,4 % (3e sur 4 outils)
- Terminal-Bench 2.0 · Gemini 2.5 Flash (Sep 2025) : 16,4 % (3e sur 4 outils)
- Terminal-Bench 2.0 · Claude Haiku 4.5 : 13,9 % (5e sur 5 outils)
- Terminal-Bench 2.0 · GPT-5 nano : 9,9 % (3e sur 5 outils)

### Claude Code (https://quelleia.com/outils/claude-code/)

- FrontierCode · Claude Opus 5.5 : 54,6 %
- FrontierCode · Claude Fable 5 : 53,5 %
- FrontierCode · Claude Opus 5 : 53,4 %
- FrontierCode · Claude Sonnet 5.5 : 52,1 %
- FrontierCode · Claude Fable 5.1 : 50,9 %
- FrontierCode · Claude Opus 4.8 : 46,5 %
- FrontierCode · Claude Sonnet 5 : 42,7 %
- FrontierCode · Claude Opus 4.7 : 38,5 %
- FrontierCode · Claude Opus 4.6 : 26,6 %
- FrontierCode · Claude Sonnet 4.6 : 24,3 %
- PostTrainBench · Claude Fable 5 : 41,8 %
- PostTrainBench · Claude Opus 5 : 35,0 %
- PostTrainBench · Claude Opus 4.8 : 33,8 %
- PostTrainBench · Kimi K3 : 32,0 %
- PostTrainBench · GLM-5.2 : 31,7 %
- PostTrainBench · Claude Opus 4.7 : 28,6 %
- Terminal-Bench 2.0 · Claude Opus 4.6 : 58,0 % (10e sur 10 outils)
- Terminal-Bench 2.0 · Claude Opus 4.5 : 52,1 % (6e sur 8 outils)
- Terminal-Bench 2.0 · Claude Sonnet 4.5 : 40,1 % (7e sur 7 outils)
- Terminal-Bench 2.0 · Claude Opus 4.1 : 34,8 % (4e sur 4 outils)
- Terminal-Bench 2.0 · Claude Haiku 4.5 : 27,5 % (4e sur 5 outils)
- WeirdML v3 · Claude Opus 5.5 : 31,2 %
- WeirdML v3 · Claude Fable 5.1 : 26,0 %
- WeirdML v3 · Claude Opus 5 : 19,0 %
- WeirdML v3 · Claude Fable 5 : 15,5 %
- WeirdML v3 · Claude Opus 4.5 : 6,5 %

### Codex CLI (https://quelleia.com/outils/codex/)

- ExploitBench · GPT-5.5 : 41,6 %
- FrontierCode · GPT-6 Astra : 53,3 %
- FrontierCode · GPT-6.1 Sol : 50,2 %
- FrontierCode · GPT-6 Sol : 49,3 %
- FrontierCode · GPT-5.6 Sol : 47,5 %
- FrontierCode · GPT-5.5 : 43,0 %
- FrontierCode · GPT-6 Luna : 42,4 %
- FrontierCode · GPT-5.6 Terra : 41,3 %
- FrontierCode · GPT-5.6 Luna : 39,8 %
- FrontierCode · GPT-5.4 Mini : 27,0 %
- PostTrainBench · GPT-5.6 Sol : 36,2 %
- PostTrainBench · GPT-5.5 : 27,2 %
- PostTrainBench · GPT-5.4 : 19,0 %
- Terminal-Bench 2.0 · GPT-5.5 : 82,2 % (3e sur 4 outils)
- Terminal-Bench 2.0 · GPT-5.2 : 62,9 % (2e sur 4 outils)
- Terminal-Bench 2.0 · GPT-5.1-Codex-Max : 60,4 %
- Terminal-Bench 2.0 · GPT-5 : 49,6 % (1er sur 4 outils)
- Terminal-Bench 2.0 · GPT-5-Codex : 44,3 % (1er sur 3 outils)
- Terminal-Bench 2.0 · GPT-5 mini : 31,9 % (2e sur 5 outils)
- Terminal-Bench 2.0 · GPT-5 nano : 11,5 % (2e sur 5 outils)
- WeirdML v3 · GPT-6 Astra : 42,2 %
- WeirdML v3 · GPT-6 Sol : 19,7 %
- WeirdML v3 · GPT-5.6 Sol : 15,0 %
- WeirdML v3 · GPT-6 Luna : 7,9 %
- WeirdML v3 · GPT-5.6 Luna : 5,2 %

### Gemini CLI (https://quelleia.com/outils/gemini-cli/)

- Terminal-Bench 2.0 · Gemini 3.1 Pro : 59,4 % (3e sur 3 outils)
- Terminal-Bench 2.0 · Gemini 3 Flash : 47,4 % (3e sur 3 outils)
- Terminal-Bench 2.0 · Gemini 2.5 Pro (Jun 2025) : 19,6 % (3e sur 4 outils)
- Terminal-Bench 2.0 · Gemini 2.5 Flash (Jun 2025) : 15,4 % (4e sur 4 outils)
- Terminal-Bench 2.0 · Gemini 2.5 Flash (Sep 2025) : 15,4 % (4e sur 4 outils)
- WeirdML v3 · Gemini 3.8 Flash : 7,4 %

### Droid (Factory) (https://quelleia.com/outils/factory-droid/)

- Terminal-Bench 2.0 · GPT-5.3 Codex : 77,3 % (2e sur 9 outils)
- Terminal-Bench 2.0 · Claude Opus 4.6 : 69,9 % (6e sur 10 outils)
- Terminal-Bench 2.0 · GPT-5.2 : 64,9 % (1er sur 4 outils)
- Terminal-Bench 2.0 · Claude Opus 4.5 : 63,1 % (1er sur 8 outils)
- Terminal-Bench 2.0 · Gemini 3 Pro : 61,1 % (5e sur 7 outils)

### Xum (ex-Mux) (https://quelleia.com/outils/mux/)

- Terminal-Bench 2.0 · GPT-5.3 Codex : 74,6 % (6e sur 9 outils)
- Terminal-Bench 2.0 · Claude Opus 4.6 : 66,5 % (8e sur 10 outils)
- Terminal-Bench 2.0 · GPT-5.2 : 60,7 % (3e sur 4 outils)
- Terminal-Bench 2.0 · Claude Opus 4.5 : 58,4 % (3e sur 8 outils)

### goose (https://quelleia.com/outils/goose/)

- Terminal-Bench 2.0 · Claude Opus 4.5 : 54,3 % (5e sur 8 outils)
- Terminal-Bench 2.0 · Claude Sonnet 4.5 : 43,1 % (2e sur 7 outils)
- Terminal-Bench 2.0 · Claude Haiku 4.5 : 35,5 % (1er sur 5 outils)

### Letta Code (https://quelleia.com/outils/letta-code/)

- Terminal-Bench 2.0 · Claude Opus 4.5 : 59,1 % (2e sur 8 outils)
- Terminal-Bench 2.0 · Gemini 3 Pro : 56,0 % (7e sur 7 outils)
- Terminal-Bench 2.0 · GPT-5.1-Codex : 53,5 % (2e sur 3 outils)

### OpenCode (https://quelleia.com/outils/opencode/)

- PostTrainBench · Gemini 3.1 Pro : 22,0 %
- Terminal-Bench 2.0 · Claude Opus 4.5 : 51,7 % (8e sur 8 outils)
- WeirdML v3 · DeepSeek V4.1 Flash : 5,9 %

### Cursor CLI (https://quelleia.com/outils/cursor/)

- FrontierCode · Composer 2.5 : 25,6 %
- PostTrainBench · Grok 4.5 : 23,5 %

### Grok Build (https://quelleia.com/outils/grok-build/)

- FrontierCode · Grok 4.6 : 48,0 %
- FrontierCode · Grok 4.5 : 42,4 %

### Devin (https://quelleia.com/outils/devin/)

- FrontierCode · SWE-2 : 50,0 %

### Grok CLI (https://quelleia.com/outils/grok-cli/)

- Terminal-Bench 2.0 · Grok 4.20 : 57,3 %

### Junie CLI (https://quelleia.com/outils/junie/)

- Terminal-Bench 2.0 · Gemini 3 Flash : 64,3 % (1er sur 3 outils)

### Kimi Code CLI (https://quelleia.com/outils/kimi-code/)

- WeirdML v3 · Kimi K3 : 7,3 %

## Sources

- Terminal-Bench 2.0 (https://www.tbench.ai/leaderboard/terminal-bench/2.0) : Classement tenu par l'équipe de Terminal-Bench (Stanford et Laude Institute). Les soumissions sont faites par les équipes elles-mêmes, vérifiées par un robot puis relues par les mainteneurs. Données sous licence Apache 2.0 (dépôt des soumissions). Conditions : https://huggingface.co/datasets/harborframework/terminal-bench-2-leaderboard

Ces mesures arrivent par les fichiers « external » d'Epoch AI, qui reprennent les classements de leurs auteurs. Epoch précise que ces données gardent la licence de leur source : on vérifie donc chez chaque classement ce qu'on a le droit d'en reprendre.
