spoox-o-m
Agent soumis au classement Terminal-Bench 2.0 par TUM.
En bref
- Type
- Agent de recherche : un agent publié par un laboratoire ou une université.
- Soumis par
- TUM
- Lien déclaré
- github.com/plaume8/spoox
Résultats mesurés
Chaque ligne est une mesure publiée par le classement. On y lit la place de spoox-o-m parmi les outils qui ont piloté le même modèle, et son écart avec le meilleur outil grand public sur ce modèle.
- Terminal-Bench 2.0 · GPT-5.3 Codex71,5 %7e sur 9 outils · −5,8 points par rapport à Droid (Factory)Comparer sur ce modèle
- Terminal-Bench 2.0 · GPT-5 mini34,8 %1er sur 5 outils · +3 points par rapport à Codex CLIComparer sur ce modèle
- Terminal-Bench 2.0 · GPT-5 nano21,8 %1er sur 5 outils · +10,3 points par rapport à Codex CLIComparer sur ce modèle
Ce qu'on ne sait pas
- Comment l'installer, ce qu'il coûte, sur quels systèmes il tourne : sa soumission au classement ne le dit pas, et nous n'avons rien relevé d'autre.
- Nous n'avons pas relevé la licence de son dépôt.
Sources
- huggingface.co/datasets/harborframework/terminal-bench-2-leaderboard/blob/main/submissions/terminal-bench/2.0/spoox-o-m__GPT-5.3-Codex/metadata.yaml
- www.tbench.ai/leaderboard/terminal-bench/2.0
Tous les agents de classement →Le même modèle, des outils différents →Signaler une erreur →