Terminus 2
Terminus 2 est l'agent de référence de Harbor, l'outil d'évaluation des créateurs de Terminal-Bench : il sert à mesurer des modèles sur des tâches en terminal.
En bref
- Ce que c'est
- Terminus 2 est l'agent de référence de Harbor, l'outil d'évaluation des créateurs de Terminal-Bench : il sert à mesurer des modèles sur des tâches en terminal. Conçu pour ne favoriser aucun modèle, il n'a qu'un outil, une session de terminal tmux où il tape des touches, et ne demande jamais l'avis de l'utilisateur. On le lance avec
harbor run --agent terminus-2pour faire passer un banc d'essai à un modèle. Ses auteurs le présentent comme un instrument de mesure scientifique et le déconseillent hors d'un environnement isolé. - Éditeur
- Harbor (créateurs de Terminal-Bench, avec Stanford et le Laude Institute)
- Prix
- gratuità l'usage
- Licence
- open source (Apache-2.0)
- Systèmes
- non précisé
- Formes
- ligne de commande, bibliothèque pour développeurs (SDK), version web
Site officiel de Terminus 2Fiche relevée le sur les pages officielles.
Installer
Tous systèmes (uv)
uv tool install harborTous systèmes (pip)
pip install harborTous systèmes : Terminus 2 est livré avec Harbor : rien d'autre à installer. Par défaut, Harbor fait tourner les agents dans Docker, qu'il faut donc avoir installé. Il peut aussi passer par un bac à sable dans le nuage (Modal, Daytona…), avec le paquet supplémentaire correspondant, par exemple pip install "harbor[modal]".
Paquets vérifiés sur leur registre : harbor (pip).
Démarrer
Lancer une tâche avec l'option --agent terminus-2, en donnant le modèle et le dossier des tâches.
harbor run \
--agent terminus-2 \
--model openai/gpt-5 \
--path examples/tasks/ \
--task-name hello-worldChoisir le modèle
Le modèle se donne avec --model (ou -m), au format fournisseur/modèle. Pour un serveur compatible (vLLM par exemple), l'option api_base de la configuration de l'agent indique l'adresse.
harbor run --agent terminus-2 --model <fournisseur/modèle>D'après la documentation officielle (docs.harborframework.com), lue le . Les commandes sont recopiées telles quelles.
Ce qu'il sait faire
- Un seul outil, tmux
- L'agent envoie des frappes dans une session tmux : il peut faire défiler la sortie, naviguer dans des menus, ouvrir d'autres shells et piloter n'importe quel programme en terminal. harborframework.com
- Exécution hors du conteneur
- La logique de l'agent tourne dans un processus Python séparé du conteneur Docker de la tâche. Il peut ainsi se connecter à des environnements distants. tbench.ai
- Autonomie complète
- Il ne pose jamais de question et mène la tâche jusqu'au bout seul ; ses auteurs le réservent aux environnements isolés. tbench.ai
- Résumé du contexte
- Quand sa mémoire de travail (le contexte) se remplit, trois sous-agents résument l'historique, posent des questions sur ce qui manque et y répondent. L'agent reprend ensuite avec ce contexte compressé. harborframework.com
- Trajectoires et entraînement
- Il enregistre le détail de chaque exécution (sa trajectoire) au format ATIF de Harbor. Il peut aussi recueillir les identifiants de jetons et leurs probabilités (logprobs), utiles pour l'apprentissage par renforcement ou pour constituer des jeux d'affinage supervisé (SFT). harborframework.com
- Skills et serveurs MCP
- Dans Harbor, une tâche peut fournir à Terminus 2 des serveurs MCP et des skills (procédures réutilisables). MCP est le protocole standard pour brancher des outils et des sources de données à un agent. docs.harborframework.com
Les façons de l'utiliser
Sur téléphone
Au 3 octobre 2026, l'éditeur ne documente ni application mobile ni pilotage depuis un téléphone.
Prix et licence
Gratuit et open source (Apache 2.0). Les appels aux modèles se paient au fournisseur choisi, avec sa propre clé d'API. Pour les exécutions hébergées sur Harbor Hub, il faut demander un accès ; aucun tarif n'est publié.
Prix relevés le sur docs.harborframework.com, dans la devise de la page.
Licence
Open source, licence Apache-2.0. Terminus 2 fait partie du dépôt de Harbor (src/harbor/agents/terminus_2), sous licence Apache 2.0. github.com
Modèles
Par LiteLLM, il accepte pratiquement tout modèle accessible par API ou hébergé en local. Un serveur comme vLLM se branche avec l'option api_base. tbench.ai
- Clé d'API personnelle
- oui
- Modèles locaux
- oui
Résultats mesurés
Des classements publics ont mesuré des modèles pilotés par Terminus 2. Un même modèle n'obtient pas le même score d'un outil à l'autre : comparez avec les autres outils sur Le même modèle, des outils différents.
- Terminal-Bench 2.0 · GPT-5.3 Codex64,7 %9e sur 9 outils
- Terminal-Bench 2.0 · Claude Opus 4.662,9 %9e sur 10 outils
- Terminal-Bench 2.0 · Claude Opus 4.557,8 %4e sur 8 outils
- Terminal-Bench 2.0 · Gemini 3 Pro56,9 %6e sur 7 outils
- Terminal-Bench 2.0 · GPT-5.254,0 %4e sur 4 outils
- Terminal-Bench 2.0 · GLM-552,4 %
- Terminal-Bench 2.0 · Gemini 3 Flash51,7 %2e sur 3 outils
- Terminal-Bench 2.0 · GPT-5.147,6 %
- Terminal-Bench 2.0 · GPT-5-Codex43,4 %2e sur 3 outils
- Terminal-Bench 2.0 · Kimi K2.543,2 %
- Terminal-Bench 2.0 · Claude Sonnet 4.542,8 %3e sur 7 outils
- Terminal-Bench 2.0 · MiniMax-M2.542,2 %2e sur 2 outils
- Terminal-Bench 2.0 · DeepSeek-V3.239,6 %
- Terminal-Bench 2.0 · Claude Opus 4.138,0 %1er sur 4 outils
- Terminal-Bench 2.0 · GPT-5.1-Codex36,9 %3e sur 3 outils
- Terminal-Bench 2.0 · Kimi K2 Thinking35,7 %
- Terminal-Bench 2.0 · GPT-535,2 %3e sur 4 outils
- Terminal-Bench 2.0 · GLM-4.733,4 %1er sur 2 outils
- Terminal-Bench 2.0 · Gemini 2.5 Pro (Jun 2025)32,6 %1er sur 4 outils
- Terminal-Bench 2.0 · MiniMax-M230,0 %
- Terminal-Bench 2.0 · MiniMax-M2.129,2 %2e sur 2 outils
- Terminal-Bench 2.0 · Claude Haiku 4.528,3 %3e sur 5 outils
- Terminal-Bench 2.0 · Kimi K2 (Jul 2025)27,8 %1er sur 2 outils
- Terminal-Bench 2.0 · GLM-4.624,5 %
- Terminal-Bench 2.0 · GPT-5 mini24,0 %4e sur 5 outils
- Terminal-Bench 2.0 · Qwen3-Coder-480B-A35B23,9 %3e sur 3 outils
- Terminal-Bench 2.0 · Grok 423,1 %3e sur 3 outils
- Terminal-Bench 2.0 · gpt-oss-120b18,7 %1er sur 2 outils
- Terminal-Bench 2.0 · Gemini 2.5 Flash (Sep 2025)16,9 %2e sur 4 outils
- Terminal-Bench 2.0 · Gemini 2.5 Flash (Jun 2025)16,9 %2e sur 4 outils
- Terminal-Bench 2.0 · grok-code-fast-114,2 %2e sur 2 outils
- Terminal-Bench 2.0 · GPT-5 nano7,9 %4e sur 5 outils
- Terminal-Bench 2.0 · gpt-oss-20b3,1 %2e sur 2 outils
GPT-5.3 Codex sur Terminal-Bench 2.0
9 outils · écart de 13,7 pointsRetirée du classement : CodeBrain-1, 70,3 %. Ligne présente jusqu'au 13 mai 2026 ; le 19 mai 2026, le classement montre à sa place CodeBrain-1.5 avec GPT-5.3 Codex, à 75,8 %. copie du 13/05/2026 · copie du 19/05/2026
Claude Opus 4.6 sur Terminal-Bench 2.0
10 outils · écart de 18,4 pointsRetirée du classement : ForgeCode, 79,8 %. Les trois lignes de ForgeCode figurent au classement Terminal-Bench 2.0 jusqu'au 13 mai 2026 et n'y sont plus à partir du 19 mai 2026. Le 19 avril 2026, l'équipe du classement écrivait avoir remis à zéro des essais où l'agent de ForgeCode récupérait la solution sur Internet. copie du 13/05/2026 · copie du 19/05/2026 · annonce du classement
Claude Opus 4.5 sur Terminal-Bench 2.0
8 outils · écart de 11,5 pointsLe classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.
Sources
Fiche relevée le sur 7 pages officielles. Une information que nous n'avons pas pu vérifier n'est jamais présentée comme un fait.
- www.tbench.ai/news/terminus
- harborframework.com/docs/terminus-2
- docs.harborframework.com/getting-started/installation
- pypi.org/project/harbor/
- docs.harborframework.com/core-concepts/agents/pre-integrated-agents
- github.com/harbor-framework/harbor/blob/main/LICENSE
- docs.harborframework.com/core-concepts/hosted-harbor/index
Ce que nous n'avons pas pu vérifier (5)
- La documentation ne liste pas les systèmes pris en charge. Elle exige Docker (ou un bac à sable dans le nuage), et PyPI indique Python 3.12 ou plus.
- Aucune page n'indique le pays de l'éditeur.
- La page de documentation dédiée, https://harborframework.com/docs/terminus-2, redirige vers un fichier du dépôt figé à une ancienne version (commit 26106c6). La documentation actuelle (docs.harborframework.com) ne cite Terminus 2 que dans la liste des agents intégrés.
- La date de sortie de Terminus 2 et ses différences avec la première version de Terminus restent introuvables.
- Harbor Hub n'a pas de prix publié.
Tous les outils →Le même modèle, des outils différents →Les abonnements d'IA →Signaler une erreur →