# Terminus 2

Outil de banc d'essai. Fiche relevée le 3 octobre 2026 sur les pages officielles. Page : https://quelleia.com/outils/terminus-2/

## En bref

Terminus 2 est l'agent de référence de Harbor, l'outil d'évaluation des créateurs de Terminal-Bench : il sert à mesurer des modèles sur des tâches en terminal. Conçu pour ne favoriser aucun modèle, il n'a qu'un outil, une session de terminal tmux où il tape des touches, et ne demande jamais l'avis de l'utilisateur. On le lance avec `harbor run --agent terminus-2` pour faire passer un banc d'essai à un modèle. Ses auteurs le présentent comme un instrument de mesure scientifique et le déconseillent hors d'un environnement isolé.

- Éditeur : Harbor (créateurs de Terminal-Bench, avec Stanford et le Laude Institute)
- Prix : gratuit, à l'usage
- Licence : open source (Apache-2.0)
- Systèmes : non précisé
- Formes : ligne de commande, bibliothèque pour développeurs (SDK), version web
- Site officiel : https://harborframework.com

## Installer

### Tous systèmes (uv)

```
uv tool install harbor
```

### Tous systèmes (pip)

```
pip install harbor
```

### Tous systèmes

Terminus 2 est livré avec Harbor : rien d'autre à installer. Par défaut, Harbor fait tourner les agents dans Docker, qu'il faut donc avoir installé. Il peut aussi passer par un bac à sable dans le nuage (Modal, Daytona…), avec le paquet supplémentaire correspondant, par exemple `pip install "harbor[modal]"`.

### Démarrer

Lancer une tâche avec l'option `--agent terminus-2`, en donnant le modèle et le dossier des tâches.
```
harbor run \
  --agent terminus-2 \
  --model openai/gpt-5 \
  --path examples/tasks/ \
  --task-name hello-world
```

### Choisir le modèle

Le modèle se donne avec `--model` (ou `-m`), au format fournisseur/modèle. Pour un serveur compatible (vLLM par exemple), l'option `api_base` de la configuration de l'agent indique l'adresse.
```
harbor run --agent terminus-2 --model <fournisseur/modèle>
```

Source : https://docs.harborframework.com/getting-started/installation (lue le 3 octobre 2026).

## Ce qu'il sait faire

- **Un seul outil, tmux** : L'agent envoie des frappes dans une session tmux : il peut faire défiler la sortie, naviguer dans des menus, ouvrir d'autres shells et piloter n'importe quel programme en terminal. (https://harborframework.com/docs/terminus-2)
- **Exécution hors du conteneur** : La logique de l'agent tourne dans un processus Python séparé du conteneur Docker de la tâche. Il peut ainsi se connecter à des environnements distants. (https://www.tbench.ai/news/terminus)
- **Autonomie complète** : Il ne pose jamais de question et mène la tâche jusqu'au bout seul ; ses auteurs le réservent aux environnements isolés. (https://www.tbench.ai/news/terminus)
- **Résumé du contexte** : Quand sa mémoire de travail (le contexte) se remplit, trois sous-agents résument l'historique, posent des questions sur ce qui manque et y répondent. L'agent reprend ensuite avec ce contexte compressé. (https://harborframework.com/docs/terminus-2)
- **Trajectoires et entraînement** : Il enregistre le détail de chaque exécution (sa trajectoire) au format ATIF de Harbor. Il peut aussi recueillir les identifiants de jetons et leurs probabilités (logprobs), utiles pour l'apprentissage par renforcement ou pour constituer des jeux d'affinage supervisé (SFT). (https://harborframework.com/docs/terminus-2)
- **Skills et serveurs MCP** : Dans Harbor, une tâche peut fournir à Terminus 2 des serveurs MCP et des skills (procédures réutilisables). MCP est le protocole standard pour brancher des outils et des sources de données à un agent. (https://docs.harborframework.com/core-concepts/agents/pre-integrated-agents)

Les façons de l'utiliser :

- Ligne de commande : agent `terminus-2` de la commande `harbor run` (https://docs.harborframework.com/core-concepts/agents/pre-integrated-agents)
- Bibliothèque pour développeurs (SDK) : classe Python `Terminus2` et configuration d'agent dans la bibliothèque `harbor` (https://harborframework.com/docs/terminus-2)
- Version web : lancement d'exécutions hébergées sur Harbor Hub (accès sur demande) (https://docs.harborframework.com/core-concepts/hosted-harbor/index)

## Sur téléphone

Au 3 octobre 2026, l'éditeur ne documente ni application mobile ni pilotage depuis un téléphone.

## Prix et licence

Gratuit et open source (Apache 2.0). Les appels aux modèles se paient au fournisseur choisi, avec sa propre clé d'API. Pour les exécutions hébergées sur Harbor Hub, il faut demander un accès ; aucun tarif n'est publié. (relevé le 3 octobre 2026, https://docs.harborframework.com/core-concepts/hosted-harbor/index)

Licence : Open source, licence Apache-2.0. Terminus 2 fait partie du dépôt de Harbor (src/harbor/agents/terminus_2), sous licence Apache 2.0. (https://github.com/harbor-framework/harbor/blob/main/LICENSE)

## Modèles

Par LiteLLM, il accepte pratiquement tout modèle accessible par API ou hébergé en local. Un serveur comme vLLM se branche avec l'option `api_base`.

- Clé d'API personnelle : oui
- Modèles locaux : oui

Avec un modèle local : Servir un modèle local avec Ollama, sur une API compatible OpenAI et Anthropic que la plupart des agents de code savent appeler. Ollama & les modèles locaux (https://minilabai.com/guides/ollama-modeles-locaux/), guide du même auteur que QUELLE IA.

## Résultats mesurés

Comparaison avec les autres outils : https://quelleia.com/outils/harnais/

- Terminal-Bench 2.0 · GPT-5.3 Codex : 64,7 % (9e sur 9 outils)
- Terminal-Bench 2.0 · Claude Opus 4.6 : 62,9 % (9e sur 10 outils)
- Terminal-Bench 2.0 · Claude Opus 4.5 : 57,8 % (4e sur 8 outils)
- Terminal-Bench 2.0 · Gemini 3 Pro : 56,9 % (6e sur 7 outils)
- Terminal-Bench 2.0 · GPT-5.2 : 54 % (4e sur 4 outils)
- Terminal-Bench 2.0 · GLM-5 : 52,4 %
- Terminal-Bench 2.0 · Gemini 3 Flash : 51,7 % (2e sur 3 outils)
- Terminal-Bench 2.0 · GPT-5.1 : 47,6 %
- Terminal-Bench 2.0 · GPT-5-Codex : 43,4 % (2e sur 3 outils)
- Terminal-Bench 2.0 · Kimi K2.5 : 43,2 %
- Terminal-Bench 2.0 · Claude Sonnet 4.5 : 42,8 % (3e sur 7 outils)
- Terminal-Bench 2.0 · MiniMax-M2.5 : 42,2 % (2e sur 2 outils)
- Terminal-Bench 2.0 · DeepSeek-V3.2 : 39,6 %
- Terminal-Bench 2.0 · Claude Opus 4.1 : 38 % (1er sur 4 outils)
- Terminal-Bench 2.0 · GPT-5.1-Codex : 36,9 % (3e sur 3 outils)
- Terminal-Bench 2.0 · Kimi K2 Thinking : 35,7 %
- Terminal-Bench 2.0 · GPT-5 : 35,2 % (3e sur 4 outils)
- Terminal-Bench 2.0 · GLM-4.7 : 33,4 % (1er sur 2 outils)
- Terminal-Bench 2.0 · Gemini 2.5 Pro (Jun 2025) : 32,6 % (1er sur 4 outils)
- Terminal-Bench 2.0 · MiniMax-M2 : 30 %
- Terminal-Bench 2.0 · MiniMax-M2.1 : 29,2 % (2e sur 2 outils)
- Terminal-Bench 2.0 · Claude Haiku 4.5 : 28,3 % (3e sur 5 outils)
- Terminal-Bench 2.0 · Kimi K2 (Jul 2025) : 27,8 % (1er sur 2 outils)
- Terminal-Bench 2.0 · GLM-4.6 : 24,5 %
- Terminal-Bench 2.0 · GPT-5 mini : 24 % (4e sur 5 outils)
- Terminal-Bench 2.0 · Qwen3-Coder-480B-A35B : 23,9 % (3e sur 3 outils)
- Terminal-Bench 2.0 · Grok 4 : 23,1 % (3e sur 3 outils)
- Terminal-Bench 2.0 · gpt-oss-120b : 18,7 % (1er sur 2 outils)
- Terminal-Bench 2.0 · Gemini 2.5 Flash (Sep 2025) : 16,9 % (2e sur 4 outils)
- Terminal-Bench 2.0 · Gemini 2.5 Flash (Jun 2025) : 16,9 % (2e sur 4 outils)
- Terminal-Bench 2.0 · grok-code-fast-1 : 14,2 % (2e sur 2 outils)
- Terminal-Bench 2.0 · GPT-5 nano : 7,9 % (4e sur 5 outils)
- Terminal-Bench 2.0 · gpt-oss-20b : 3,1 % (2e sur 2 outils)

## Sources

- https://www.tbench.ai/news/terminus
- https://harborframework.com/docs/terminus-2
- https://docs.harborframework.com/getting-started/installation
- https://pypi.org/project/harbor/
- https://docs.harborframework.com/core-concepts/agents/pre-integrated-agents
- https://github.com/harbor-framework/harbor/blob/main/LICENSE
- https://docs.harborframework.com/core-concepts/hosted-harbor/index

Non vérifié :

- La documentation ne liste pas les systèmes pris en charge. Elle exige Docker (ou un bac à sable dans le nuage), et PyPI indique Python 3.12 ou plus.
- Aucune page n'indique le pays de l'éditeur.
- La page de documentation dédiée, https://harborframework.com/docs/terminus-2, redirige vers un fichier du dépôt figé à une ancienne version (commit 26106c6). La documentation actuelle (docs.harborframework.com) ne cite Terminus 2 que dans la liste des agents intégrés.
- La date de sortie de Terminus 2 et ses différences avec la première version de Terminus restent introuvables.
- Harbor Hub n'a pas de prix publié.
