Aller au contenu
L'actu IAEN 4 QUESTIONSTrouver mon modèle
Outils · outil de banc d'essai

Terminus 2

Terminus 2 est l'agent de référence de Harbor, l'outil d'évaluation des créateurs de Terminal-Bench : il sert à mesurer des modèles sur des tâches en terminal.

En bref

Ce que c'est
Terminus 2 est l'agent de référence de Harbor, l'outil d'évaluation des créateurs de Terminal-Bench : il sert à mesurer des modèles sur des tâches en terminal. Conçu pour ne favoriser aucun modèle, il n'a qu'un outil, une session de terminal tmux où il tape des touches, et ne demande jamais l'avis de l'utilisateur. On le lance avec harbor run --agent terminus-2 pour faire passer un banc d'essai à un modèle. Ses auteurs le présentent comme un instrument de mesure scientifique et le déconseillent hors d'un environnement isolé.
Éditeur
Harbor (créateurs de Terminal-Bench, avec Stanford et le Laude Institute)
Prix
gratuità l'usage
Licence
open source (Apache-2.0)
Systèmes
non précisé
Formes
ligne de commande, bibliothèque pour développeurs (SDK), version web

Site officiel de Terminus 2Fiche relevée le sur les pages officielles.

Installer

Tous systèmes (uv)

uv tool install harbor

Tous systèmes (pip)

pip install harbor

Tous systèmes : Terminus 2 est livré avec Harbor : rien d'autre à installer. Par défaut, Harbor fait tourner les agents dans Docker, qu'il faut donc avoir installé. Il peut aussi passer par un bac à sable dans le nuage (Modal, Daytona…), avec le paquet supplémentaire correspondant, par exemple pip install "harbor[modal]".

Paquets vérifiés sur leur registre : harbor (pip).

Démarrer

Lancer une tâche avec l'option --agent terminus-2, en donnant le modèle et le dossier des tâches.

harbor run \
  --agent terminus-2 \
  --model openai/gpt-5 \
  --path examples/tasks/ \
  --task-name hello-world

Choisir le modèle

Le modèle se donne avec --model (ou -m), au format fournisseur/modèle. Pour un serveur compatible (vLLM par exemple), l'option api_base de la configuration de l'agent indique l'adresse.

harbor run --agent terminus-2 --model <fournisseur/modèle>

D'après la documentation officielle (docs.harborframework.com), lue le . Les commandes sont recopiées telles quelles.

Ce qu'il sait faire

Un seul outil, tmux
L'agent envoie des frappes dans une session tmux : il peut faire défiler la sortie, naviguer dans des menus, ouvrir d'autres shells et piloter n'importe quel programme en terminal. harborframework.com
Exécution hors du conteneur
La logique de l'agent tourne dans un processus Python séparé du conteneur Docker de la tâche. Il peut ainsi se connecter à des environnements distants. tbench.ai
Autonomie complète
Il ne pose jamais de question et mène la tâche jusqu'au bout seul ; ses auteurs le réservent aux environnements isolés. tbench.ai
Résumé du contexte
Quand sa mémoire de travail (le contexte) se remplit, trois sous-agents résument l'historique, posent des questions sur ce qui manque et y répondent. L'agent reprend ensuite avec ce contexte compressé. harborframework.com
Trajectoires et entraînement
Il enregistre le détail de chaque exécution (sa trajectoire) au format ATIF de Harbor. Il peut aussi recueillir les identifiants de jetons et leurs probabilités (logprobs), utiles pour l'apprentissage par renforcement ou pour constituer des jeux d'affinage supervisé (SFT). harborframework.com
Skills et serveurs MCP
Dans Harbor, une tâche peut fournir à Terminus 2 des serveurs MCP et des skills (procédures réutilisables). MCP est le protocole standard pour brancher des outils et des sources de données à un agent. docs.harborframework.com

Les façons de l'utiliser

Sur téléphone

Au 3 octobre 2026, l'éditeur ne documente ni application mobile ni pilotage depuis un téléphone.

Prix et licence

Gratuit et open source (Apache 2.0). Les appels aux modèles se paient au fournisseur choisi, avec sa propre clé d'API. Pour les exécutions hébergées sur Harbor Hub, il faut demander un accès ; aucun tarif n'est publié.

Prix relevés le sur docs.harborframework.com, dans la devise de la page.

Licence

Open source, licence Apache-2.0. Terminus 2 fait partie du dépôt de Harbor (src/harbor/agents/terminus_2), sous licence Apache 2.0. github.com

Modèles

Par LiteLLM, il accepte pratiquement tout modèle accessible par API ou hébergé en local. Un serveur comme vLLM se branche avec l'option api_base. tbench.ai

Clé d'API personnelle
oui
Modèles locaux
oui

Résultats mesurés

Des classements publics ont mesuré des modèles pilotés par Terminus 2. Un même modèle n'obtient pas le même score d'un outil à l'autre : comparez avec les autres outils sur Le même modèle, des outils différents.

GPT-5.3 Codex sur Terminal-Bench 2.0

9 outils · écart de 13,7 points
  1. SageAgentautre agent78,4 %modèle sorti le 5 février 2026 · source : tbench.ai
  2. Droid (Factory)outil grand public77,3 %modèle sorti le 5 février 2026 · source : tbench.ai
  3. CodeBrain-1.5autre agent75,8 %modèle sorti le 5 février 2026 · source : tbench.ai
  4. Codeliaautre agent75,7 %modèle sorti le 5 février 2026 · source : tbench.ai
  5. Simple Codexautre agent75,1 %modèle sorti le 5 février 2026 · source : tbench.ai
  6. Xum (ex-Mux)outil grand public74,6 %modèle sorti le 5 février 2026 · source : tbench.ai
  7. spoox-o-magent de recherche71,5 %modèle sorti le 5 février 2026 · source : tbench.ai
  8. IndusAGI Coding Agentautre agent69,1 %modèle sorti le 5 février 2026 · source : tbench.ai
  9. Terminus 2outil de banc d'essai64,7 %modèle sorti le 5 février 2026 · source : tbench.ai

Retirée du classement : CodeBrain-1, 70,3 %. Ligne présente jusqu'au 13 mai 2026 ; le 19 mai 2026, le classement montre à sa place CodeBrain-1.5 avec GPT-5.3 Codex, à 75,8 %. copie du 13/05/2026 · copie du 19/05/2026

Claude Opus 4.6 sur Terminal-Bench 2.0

10 outils · écart de 18,4 points
  1. Meta-Harnessagent de recherche76,4 %modèle sorti le 5 février 2026 · source : tbench.ai
  2. Capyautre agent75,3 %modèle sorti le 5 février 2026 · source : tbench.ai
  3. Terminus-KIRAautre agent74,7 %modèle sorti le 5 février 2026 · source : tbench.ai
  4. MAYA-V2autre agent72,1 %modèle sorti le 5 février 2026 · source : tbench.ai
  5. TongAgentsagent de recherche71,9 %modèle sorti le 5 février 2026 · source : tbench.ai
  6. Droid (Factory)outil grand public69,9 %modèle sorti le 5 février 2026 · source : tbench.ai
  7. Cruxautre agent66,9 %modèle sorti le 5 février 2026 · source : tbench.ai
  8. Xum (ex-Mux)outil grand public66,5 %modèle sorti le 5 février 2026 · source : tbench.ai
  9. Terminus 2outil de banc d'essai62,9 %modèle sorti le 5 février 2026 · source : tbench.ai
  10. Claude Codeoutil grand public58,0 %modèle sorti le 5 février 2026 · source : tbench.ai

Retirée du classement : ForgeCode, 79,8 %. Les trois lignes de ForgeCode figurent au classement Terminal-Bench 2.0 jusqu'au 13 mai 2026 et n'y sont plus à partir du 19 mai 2026. Le 19 avril 2026, l'équipe du classement écrivait avoir remis à zéro des essais où l'agent de ForgeCode récupérait la solution sur Internet. copie du 13/05/2026 · copie du 19/05/2026 · annonce du classement

Claude Opus 4.5 sur Terminal-Bench 2.0

8 outils · écart de 11,5 points
  1. Droid (Factory)outil grand public63,1 %modèle sorti le 24 novembre 2025 · source : tbench.ai
  2. Letta Codeoutil grand public59,1 %modèle sorti le 24 novembre 2025 · budget de réflexion fixé · source : tbench.ai
  3. Xum (ex-Mux)outil grand public58,4 %modèle sorti le 24 novembre 2025 · source : tbench.ai
  4. Terminus 2outil de banc d'essai57,8 %modèle sorti le 24 novembre 2025 · source : tbench.ai
  5. gooseoutil grand public54,3 %modèle sorti le 24 novembre 2025 · source : tbench.ai
  6. Claude Codeoutil grand public52,1 %modèle sorti le 24 novembre 2025 · source : tbench.ai
  7. OpenHandsoutil grand public51,9 %modèle sorti le 24 novembre 2025 · source : tbench.ai
  8. OpenCodeoutil grand public51,7 %modèle sorti le 24 novembre 2025 · source : tbench.ai

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

Les 26 comparaisons sur le comparateur →

Sources

Fiche relevée le sur 7 pages officielles. Une information que nous n'avons pas pu vérifier n'est jamais présentée comme un fait.

Ce que nous n'avons pas pu vérifier (5)
  • La documentation ne liste pas les systèmes pris en charge. Elle exige Docker (ou un bac à sable dans le nuage), et PyPI indique Python 3.12 ou plus.
  • Aucune page n'indique le pays de l'éditeur.
  • La page de documentation dédiée, https://harborframework.com/docs/terminus-2, redirige vers un fichier du dépôt figé à une ancienne version (commit 26106c6). La documentation actuelle (docs.harborframework.com) ne cite Terminus 2 que dans la liste des agents intégrés.
  • La date de sortie de Terminus 2 et ses différences avec la première version de Terminus restent introuvables.
  • Harbor Hub n'a pas de prix publié.

Tous les outils →Le même modèle, des outils différents →Les abonnements d'IA →Signaler une erreur →

Cette fiche existe aussi en texte et en JSON.