# Terminal-Bench 2.0

> Fiche du benchmark Terminal-Bench 2.0 sur Quelle IA, édition du 28 septembre 2026. Mener à bien des tâches dans un terminal : comprendre le système, utiliser les programmes disponibles, enchaîner les commandes jusqu'au résultat. En tête au 28 septembre 2026 : GPT-5.5 (84,7 %). Notation, limites et classement des 45 modèles mesurés.

Page : https://quelleia.com/benchmarks/terminal_bench/
Source du benchmark : https://www.tbench.ai/
Mainteneur : Stanford et Laude Institute
Tâche : Code
État : actif

## À quoi il sert

Sur Quelle IA, Terminal-Bench 2.0 sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 78.

## Comment c'est noté

Part de tâches réussies, en moyenne sur plusieurs passages ; chaque ligne associe un modèle et un harnais (Claude Code, Codex CLI, Terminus).

## Ce qu'il ne dit pas

Le harnais compte autant que le modèle : un même modèle change de score selon l'agent qui le pilote. Les données suivent la version 2.0, déjà remplacée sur le site officiel.

## Qui le tient

Stanford et Laude Institute.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 78. Le meilleur, GPT-5.5, atteint 84,7 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 3 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 45 %
- Score IA 100 (niveau de Claude Opus 5.5) : 94 %

## Son poids dans le score IA

1,15 % du score général. Terminal-Bench 2.0 porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

## Classement (45 modèles mesurés · 202 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | non précisée | 84,7 % | 91,9 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 2 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | non précisée | 81,8 % | 90,2 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 3 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | non précisée | 80,2 % | 89,4 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 3 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 80,2 % | 89,4 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 5 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | non précisée | 79,8 % | 89,2 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 6 | [GPT-5.3 Codex](https://quelleia.com/modeles/gpt-5-3-codex.md) | OpenAI | non précisée | 78,4 % | 88,5 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 7 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | non précisée | 69,4 % | 84,7 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 8 | [GPT-5.2 Codex](https://quelleia.com/modeles/gpt-5-2-codex.md) | OpenAI | non précisée | 66,5 % | 83,6 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 9 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | non précisée | 64,9 % | 83,1 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 10 | [Gemini 3 Flash](https://quelleia.com/modeles/gemini-3-flash.md) | Google DeepMind | non précisée | 64,3 % | 82,8 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 11 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | non précisée | 63,1 % | 82,4 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 12 | [GPT-5.1-Codex-mini](https://quelleia.com/modeles/gpt-5-1-codex-mini.md) | OpenAI | non précisée | 61,6 % | 81,9 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 13 | [GPT-5.1-Codex-Max](https://quelleia.com/modeles/gpt-5-1-codex-max.md) | OpenAI | non précisée | 60,4 % | 81,5 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 14 | [GPT-5.1-Codex](https://quelleia.com/modeles/gpt-5-1-codex.md) | OpenAI | non précisée | 57,8 % | 80,6 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 15 | [Grok 4.20](https://quelleia.com/modeles/grok-4-20.md) | xAI | non précisée | 57,3 % | 80,5 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 16 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | non précisée | 53,4 % | 79,2 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 17 | [GLM-5](https://quelleia.com/modeles/glm-5.md) | Z.ai (Zhipu AI) | non précisée | 52,4 % | 78,9 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 18 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | non précisée | 49,6 % | 78,0 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 19 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | Moyenne | 47,6 % | 77,3 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 20 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | non précisée | 46,5 % | 77,0 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 21 | [MiniMax-M2.7](https://quelleia.com/modeles/minimax-m2-7.md) | MiniMax | non précisée | 45,1 % | 76,5 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 22 | [GPT-5-Codex](https://quelleia.com/modeles/gpt-5-codex.md) | OpenAI | non précisée | 44,3 % | 76,3 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 23 | [Kimi K2.5](https://quelleia.com/modeles/kimi-k2-5.md) | Moonshot | non précisée | 43,2 % | 75,9 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 24 | [MiniMax-M2.5](https://quelleia.com/modeles/minimax-m2-5.md) | MiniMax | non précisée | 42,7 % | 75,7 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 25 | [DeepSeek-V3.2](https://quelleia.com/modeles/deepseek-v3-2.md) | DeepSeek | non précisée | 39,6 % | 74,7 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 26 | [Claude Opus 4.1](https://quelleia.com/modeles/claude-opus-4-1.md) | Anthropic | non précisée | 38 % | 74,2 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 27 | [MiniMax-M2.1](https://quelleia.com/modeles/minimax-m2-1.md) | MiniMax | non précisée | 36,6 % | 73,7 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 28 | [Kimi K2 Thinking](https://quelleia.com/modeles/kimi-k2-thinking.md) | Moonshot | non précisée | 35,7 % | 73,4 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 29 | [Claude Haiku 4.5](https://quelleia.com/modeles/claude-haiku-4-5.md) | Anthropic | non précisée | 35,5 % | 73,3 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 30 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | non précisée | 34,8 % | 73,0 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 31 | [GLM-4.7](https://quelleia.com/modeles/glm-4-7.md) | Z.ai (Zhipu AI) | non précisée | 33,4 % | 72,5 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 32 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 32,6 % | 72,3 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 33 | [MiniMax-M2](https://quelleia.com/modeles/minimax-m2.md) | MiniMax | non précisée | 30 % | 71,3 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 34 | [Kimi K2 (Jul 2025)](https://quelleia.com/modeles/kimi-k2-jul-2025.md) | Moonshot | non précisée | 27,8 % | 70,4 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 35 | [Grok 4](https://quelleia.com/modeles/grok-4.md) | xAI | non précisée | 27,2 % | 70,2 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 36 | [Qwen3-Coder-480B-A35B](https://quelleia.com/modeles/qwen3-coder-480b-a35b.md) | Alibaba | non précisée | 27,2 % | 70,2 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 37 | [grok-code-fast-1](https://quelleia.com/modeles/grok-code-fast-1.md) | xAI | non précisée | 25,8 % | 69,6 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 38 | [GLM-4.6](https://quelleia.com/modeles/glm-4-6.md) | Z.ai (Zhipu AI) | non précisée | 24,5 % | 69,0 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 39 | [Qwen 3.6 35B-A3B](https://quelleia.com/modeles/qwen-3-6-35b-a3b.md) | Alibaba | non précisée | 23 % | 68,4 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 40 | [GPT-5 nano](https://quelleia.com/modeles/gpt-5-nano.md) | OpenAI | non précisée | 21,8 % | 67,8 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 41 | [gpt-oss-120b](https://quelleia.com/modeles/gpt-oss-120b.md) | OpenAI | non précisée | 18,7 % | 66,3 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 42 | [Gemini 2.5 Flash (Sep 2025)](https://quelleia.com/modeles/gemini-2-5-flash-sep-2025.md) | Google DeepMind | non précisée | 17,1 % | 65,4 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 43 | [Gemini 2.5 Flash (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-flash-jun-2025.md) | Google DeepMind | non précisée | 17,1 % | 65,4 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 44 | [Qwen3.5-9B](https://quelleia.com/modeles/qwen3-5-9b.md) | Alibaba | non précisée | 9,2 % | 59,7 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| 45 | [gpt-oss-20b](https://quelleia.com/modeles/gpt-oss-20b.md) | OpenAI | non précisée | 3,4 % | 51,2 | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |

## En bref

**Que mesure Terminal-Bench 2.0 ?** Mener à bien des tâches dans un terminal : comprendre le système, utiliser les programmes disponibles, enchaîner les commandes jusqu'au résultat. Sur Quelle IA, il est rangé dans la tâche Code.

**Comment Terminal-Bench 2.0 est-il noté ?** Part de tâches réussies, en moyenne sur plusieurs passages ; chaque ligne associe un modèle et un harnais (Claude Code, Codex CLI, Terminus). Un modèle qui obtient 50 % a un score IA d'environ 78.

**Qui est en tête sur Terminal-Bench 2.0 ?** GPT-5.5 (OpenAI) est en tête de Terminal-Bench 2.0 avec 84,7 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.4 (81,8 %) et Claude Opus 4.7 (80,2 %). 45 modèles y sont mesurés.

**Quelles sont les limites de Terminal-Bench 2.0 ?** Le harnais compte autant que le modèle : un même modèle change de score selon l'agent qui le pilote. Les données suivent la version 2.0, déjà remplacée sur le site officiel. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse Terminal-Bench 2.0 dans le score IA ?** Terminal-Bench 2.0 compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

**Qui maintient Terminal-Bench 2.0 ?** Stanford et Laude Institute. Sa page de référence : tbench.ai.

## Les autres benchmarks de la tâche Code

- [Arena, questions de code](https://quelleia.com/benchmarks/arena_code.md) : 275 modèles · 1,15 % du score
- [WeirdML (v2)](https://quelleia.com/benchmarks/weirdml.md) : 129 modèles · 1,15 % du score
- [SciCode](https://quelleia.com/benchmarks/scicode.md) : 120 modèles · 1,15 % du score
- [FrontierCode](https://quelleia.com/benchmarks/frontiercode.md) : 37 modèles · 1,15 % du score
- [SWE-bench Verified](https://quelleia.com/benchmarks/swe_bench_verified.md) : 32 modèles · 1,15 % du score
- [DeepSWE](https://quelleia.com/benchmarks/deepswe.md) : 26 modèles · 1,15 % du score
- [GSO](https://quelleia.com/benchmarks/gso_bench.md) : 26 modèles · 1,15 % du score
- [GBAEval](https://quelleia.com/benchmarks/gbaeval.md) : 23 modèles · 1,15 % du score
- [FrontierSWE](https://quelleia.com/benchmarks/frontierswe.md) : 16 modèles · 1,15 % du score
- [CursorBench](https://quelleia.com/benchmarks/cursorbench.md) : 13 modèles · 1,15 % du score
- [WeirdML v3](https://quelleia.com/benchmarks/weirdml_v3.md) : 11 modèles · 1,15 % du score
- [MirrorCode](https://quelleia.com/benchmarks/mirrorcode.md) : 9 modèles · 1,15 % du score
- [Aider Polyglot](https://quelleia.com/benchmarks/aider_polyglot.md) : 54 modèles · hors score, archivé
- [LiveBench, code](https://quelleia.com/benchmarks/livebench_code.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
