Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

CodeFiche benchmark · Stanford et Laude Institute · tbench.ai

Terminal-Bench 2.0

Mener à bien des tâches dans un terminal : comprendre le système, utiliser les programmes disponibles, enchaîner les commandes jusqu'au résultat.

À quoi il sert

Sur Quelle IA, Terminal-Bench 2.0 sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 78.

Comment c'est noté

Part de tâches réussies, en moyenne sur plusieurs passages ; chaque ligne associe un modèle et un harnais (Claude Code, Codex CLI, Terminus).

Ce qu'il ne dit pas

Le harnais compte autant que le modèle : un même modèle change de score selon l'agent qui le pilote. Les données suivent la version 2.0, déjà remplacée sur le site officiel.

Qui le tient

Stanford et Laude Institute.

tbench.ai · tâche Code · 45 modèles mesurés

Comment lire le score

45 modèles mesurés · 202 mesures

En tête : GPT-5.5, 84,7 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 78. Le meilleur, GPT-5.5, atteint 84,7 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
3 %
Score IA 76niveau de Claude Sonnet 4.5
45 %
Score IA 100niveau de Claude Opus 5.5
94 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,15 %du score général. Terminal-Bench 2.0 porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

En couleur, la tâche Code dans le score général. En noir, la part de Terminal-Bench 2.0.

Le classement du benchmark

Scores relevés auprès de 2 sources · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-5.5OpenAI · 5 configurationsNon précisée · NexAU-AHE84,7 %91,9
2GPT-5.4OpenAINon précisée · ForgeCode81,8 %90,2
3Claude Opus 4.7AnthropicNon précisée · WOZCODE80,2 %89,4
3Gemini 3.1 ProGoogle DeepMind · 5 configurationsNon précisée · TongAgents80,2 %89,4
5Claude Opus 4.6Anthropic · 12 configurationsNon précisée · ForgeCode79,8 %89,2
6GPT-5.3 CodexOpenAI · 10 configurationsNon précisée · SageAgent78,4 %88,5
7Gemini 3 ProGoogle DeepMind · 8 configurationsNon précisée · Ante69,4 %84,7
8GPT-5.2 CodexOpenAINon précisée · Deep Agents66,5 %83,6
9GPT-5.2OpenAI · 6 configurationsNon précisée · Droid64,9 %83,1
10Gemini 3 FlashGoogle DeepMind · 4 configurationsNon précisée · Junie CLI64,3 %82,8
45 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 45 →Replier le classement ↑
11Claude Opus 4.5Anthropic · 10 configurationsNon précisée · Droid63,1 %82,4
12GPT-5.1-Codex-miniOpenAI · 3 configurationsNon précisée · hookele61,6 %81,9
13GPT-5.1-Codex-MaxOpenAINon précisée · Codex CLI60,4 %81,5
14GPT-5.1-CodexOpenAI · 5 configurationsNon précisée · Codex CLI57,8 %80,6
15Grok 4.20xAI · 2 configurationsNon précisée · Grok CLI57,3 %80,5
16Claude Sonnet 4.6Anthropic · 2 configurationsNon précisée · Simplai Agent53,4 %79,2
17GLM-5Z.ai (Zhipu AI) · poids ouvertsNon précisée · Terminus 252,4 %78,9
18GPT-5OpenAI · 8 configurationsNon précisée · Codex CLI49,6 %78,0
19GPT-5.1OpenAI · 3 configurationsMoyenne · Terminus 247,6 %77,3
20Claude Sonnet 4.5Anthropic · 12 configurationsNon précisée · CAMEL-AI46,5 %77,0
21MiniMax-M2.7MiniMax · poids ouverts · 2 configurationsNon précisée · IndusAGI Coding Agent45,1 %76,5
22GPT-5-CodexOpenAI · 6 configurationsNon précisée · Codex CLI44,3 %76,3
23Kimi K2.5Moonshot · poids ouvertsNon précisée · Terminus 243,2 %75,9
24MiniMax-M2.5MiniMax · poids ouverts · 2 configurationsNon précisée · cchuter42,7 %75,7
25DeepSeek-V3.2DeepSeek · poids ouvertsNon précisée · Terminus 239,6 %74,7
26Claude Opus 4.1Anthropic · 8 configurationsNon précisée · Terminus 238 %74,2
27MiniMax-M2.1MiniMax · poids ouverts · 2 configurationsNon précisée · Crux36,6 %73,7
28Kimi K2 ThinkingMoonshot · poids ouverts · 2 configurationsNon précisée · Terminus 235,7 %73,4
29Claude Haiku 4.5Anthropic · 9 configurationsNon précisée · Goose35,5 %73,3
30GPT-5 miniOpenAI · 10 configurationsNon précisée · spoox-o-m34,8 %73,0
31GLM-4.7Z.ai (Zhipu AI) · poids ouverts · 2 configurationsNon précisée · Terminus 233,4 %72,5
32Gemini 2.5 Pro (Jun 2025)Google DeepMind · 8 configurationsNon précisée · Terminus 232,6 %72,3
33MiniMax-M2MiniMax · poids ouvertsNon précisée · Terminus 230 %71,3
34Kimi K2 (Jul 2025)Moonshot · 4 configurationsNon précisée · Terminus 227,8 %70,4
35Grok 4xAI · 6 configurationsNon précisée · OpenHands27,2 %70,2
36Qwen3-Coder-480B-A35BAlibaba · poids ouverts · 5 configurationsNon précisée · Dakou Agent27,2 %70,2
37grok-code-fast-1xAI · 4 configurationsNon précisée · mini-SWE-agent25,8 %69,6
38GLM-4.6Z.ai (Zhipu AI) · poids ouverts · 2 configurationsNon précisée · Terminus 224,5 %69,0
39Qwen 3.6 35B-A3BAlibaba · poids ouvertsNon précisée · little-coder23 %68,4
40GPT-5 nanoOpenAI · 9 configurationsNon précisée · spoox-o-m21,8 %67,8
41gpt-oss-120bOpenAI · poids ouverts · 4 configurationsNon précisée · Terminus 218,7 %66,3
42Gemini 2.5 Flash (Sep 2025)Google DeepMind · 4 configurationsNon précisée · mini-SWE-agent17,1 %65,4
43Gemini 2.5 Flash (Jun 2025)Google DeepMind · 4 configurationsNon précisée · mini-SWE-agent17,1 %65,4
44Qwen3.5-9BAlibaba · poids ouvertsNon précisée · little-coder9,2 %59,7
45gpt-oss-20bOpenAI · poids ouverts · 4 configurationsNon précisée · mini-SWE-agent3,4 %51,2

En bref

Que mesure Terminal-Bench 2.0 ?
Mener à bien des tâches dans un terminal : comprendre le système, utiliser les programmes disponibles, enchaîner les commandes jusqu'au résultat. Sur Quelle IA, il est rangé dans la tâche Code.
Comment Terminal-Bench 2.0 est-il noté ?
Part de tâches réussies, en moyenne sur plusieurs passages ; chaque ligne associe un modèle et un harnais (Claude Code, Codex CLI, Terminus). Un modèle qui obtient 50 % a un score IA d'environ 78.
Qui est en tête sur Terminal-Bench 2.0 ?
GPT-5.5 (OpenAI) est en tête de Terminal-Bench 2.0 avec 84,7 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.4 (81,8 %) et Claude Opus 4.7 (80,2 %). 45 modèles y sont mesurés.
Quelles sont les limites de Terminal-Bench 2.0 ?
Le harnais compte autant que le modèle : un même modèle change de score selon l'agent qui le pilote. Les données suivent la version 2.0, déjà remplacée sur le site officiel. Au 28 septembre 2026, le benchmark est actif.
Combien pèse Terminal-Bench 2.0 dans le score IA ?
Terminal-Bench 2.0 compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
Qui maintient Terminal-Bench 2.0 ?
Stanford et Laude Institute. Sa page de référence : tbench.ai.

Les autres benchmarks de la tâche Code

Tous les benchmarks →Comment le score IA est calculé →