À quoi il sert
Sur Quelle IA, Terminal-Bench 2.0 sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 78.
Sur Quelle IA, Terminal-Bench 2.0 sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 78.
Part de tâches réussies, en moyenne sur plusieurs passages ; chaque ligne associe un modèle et un harnais (Claude Code, Codex CLI, Terminus).
Le harnais compte autant que le modèle : un même modèle change de score selon l'agent qui le pilote. Les données suivent la version 2.0, déjà remplacée sur le site officiel.
En tête : GPT-5.5, 84,7 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 78. Le meilleur, GPT-5.5, atteint 84,7 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,15 %du score général. Terminal-Bench 2.0 porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
En couleur, la tâche Code dans le score général. En noir, la part de Terminal-Bench 2.0.