# Crux

Agent de classement. Agent soumis au classement Terminal-Bench 2.0 par Roam. Page : https://quelleia.com/outils/crux/

- Type : autre agent (un agent d'une société ou d'un particulier, soumis au classement)
- Soumis par : Roam
- Lien déclaré à la soumission : https://github.com/0xDarkMatter/crux-agent

## Résultats mesurés

- Terminal-Bench 2.0 · Claude Opus 4.6 : 66,9 % (7e sur 10 outils, −3 points par rapport à Droid (Factory)), comparer : https://quelleia.com/outils/harnais/?benchmark=terminal_bench&modele=claude-opus-4-6#terminal_bench--claude-opus-4-6
- Terminal-Bench 2.0 · GPT-5.1-Codex : 57,8 % (1er sur 3 outils, +4,3 points par rapport à Letta Code), comparer : https://quelleia.com/outils/harnais/?benchmark=terminal_bench&modele=gpt-5-1-codex#terminal_bench--gpt-5-1-codex
- Terminal-Bench 2.0 · GPT-5.1-Codex-mini : 43,1 % (2e sur 2 outils), comparer : https://quelleia.com/outils/harnais/?benchmark=terminal_bench&modele=gpt-5-1-codex-mini#terminal_bench--gpt-5-1-codex-mini
- Terminal-Bench 2.0 · MiniMax-M2.1 : 36,6 % (1er sur 2 outils), comparer : https://quelleia.com/outils/harnais/?benchmark=terminal_bench&modele=minimax-m2-1#terminal_bench--minimax-m2-1
- Terminal-Bench 2.0 · GLM-4.7 : 33,3 % (2e sur 2 outils), comparer : https://quelleia.com/outils/harnais/?benchmark=terminal_bench&modele=glm-4-7#terminal_bench--glm-4-7

## Ce qu'on ne sait pas

- Comment l'installer, ce qu'il coûte, sur quels systèmes il tourne : sa soumission au classement ne le dit pas, et nous n'avons rien relevé d'autre.
- Nous n'avons pas relevé la licence de son dépôt.

## Sources

- https://huggingface.co/datasets/harborframework/terminal-bench-2-leaderboard/blob/main/submissions/terminal-bench/2.0/Crux__Claude-Opus-4.6/metadata.yaml
- https://www.tbench.ai/leaderboard/terminal-bench/2.0
