{
 "id": "crux",
 "nom": "Crux",
 "url": "https://quelleia.com/outils/crux/",
 "categorie": "agent_classement",
 "type": "autre",
 "type_nom": "autre agent",
 "soumis_par": "Roam",
 "lien_declare": "https://github.com/0xDarkMatter/crux-agent",
 "lien_source": "https://huggingface.co/datasets/harborframework/terminal-bench-2-leaderboard/blob/main/submissions/terminal-bench/2.0/Crux__Claude-Opus-4.6/metadata.yaml",
 "depot": "https://github.com/0xDarkMatter/crux-agent",
 "note": null,
 "ecritures": [
  "Crux"
 ],
 "resultats_mesures": [
  {
   "benchmark": "terminal_bench",
   "modele": "claude-opus-4-6",
   "valeur": 66.87,
   "unite": "%",
   "sortie_modele": "2026-02-05",
   "source": "https://www.tbench.ai/leaderboard/terminal-bench/2.0",
   "rang": 7,
   "sur": 10,
   "meilleur_outil_grand_public": {
    "nom": "Droid (Factory)",
    "valeur": 69.89
   },
   "ecart_avec_cet_outil": -3.01,
   "comparateur": "https://quelleia.com/outils/harnais/?benchmark=terminal_bench&modele=claude-opus-4-6#terminal_bench--claude-opus-4-6"
  },
  {
   "benchmark": "terminal_bench",
   "modele": "gpt-5-1-codex",
   "valeur": 57.75,
   "unite": "%",
   "sortie_modele": "2025-11-12",
   "source": "https://www.tbench.ai/leaderboard/terminal-bench/2.0",
   "rang": 1,
   "sur": 3,
   "meilleur_outil_grand_public": {
    "nom": "Letta Code",
    "valeur": 53.48
   },
   "ecart_avec_cet_outil": 4.27,
   "comparateur": "https://quelleia.com/outils/harnais/?benchmark=terminal_bench&modele=gpt-5-1-codex#terminal_bench--gpt-5-1-codex"
  },
  {
   "benchmark": "terminal_bench",
   "modele": "gpt-5-1-codex-mini",
   "valeur": 43.15,
   "unite": "%",
   "sortie_modele": "2025-11-12",
   "source": "https://www.tbench.ai/leaderboard/terminal-bench/2.0",
   "rang": 2,
   "sur": 2,
   "meilleur_outil_grand_public": null,
   "ecart_avec_cet_outil": null,
   "comparateur": "https://quelleia.com/outils/harnais/?benchmark=terminal_bench&modele=gpt-5-1-codex-mini#terminal_bench--gpt-5-1-codex-mini"
  },
  {
   "benchmark": "terminal_bench",
   "modele": "minimax-m2-1",
   "valeur": 36.63,
   "unite": "%",
   "sortie_modele": "2025-12-23",
   "source": "https://www.tbench.ai/leaderboard/terminal-bench/2.0",
   "rang": 1,
   "sur": 2,
   "meilleur_outil_grand_public": null,
   "ecart_avec_cet_outil": null,
   "comparateur": "https://quelleia.com/outils/harnais/?benchmark=terminal_bench&modele=minimax-m2-1#terminal_bench--minimax-m2-1"
  },
  {
   "benchmark": "terminal_bench",
   "modele": "glm-4-7",
   "valeur": 33.26,
   "unite": "%",
   "sortie_modele": "2025-12-22",
   "source": "https://www.tbench.ai/leaderboard/terminal-bench/2.0",
   "rang": 2,
   "sur": 2,
   "meilleur_outil_grand_public": null,
   "ecart_avec_cet_outil": null,
   "comparateur": "https://quelleia.com/outils/harnais/?benchmark=terminal_bench&modele=glm-4-7#terminal_bench--glm-4-7"
  }
 ],
 "retirees": [],
 "ce_qu_on_ne_sait_pas": [
  "Comment l'installer, ce qu'il coûte, sur quels systèmes il tourne : sa soumission au classement ne le dit pas, et nous n'avons rien relevé d'autre.",
  "Nous n'avons pas relevé la licence de son dépôt."
 ],
 "sources": [
  "https://huggingface.co/datasets/harborframework/terminal-bench-2-leaderboard/blob/main/submissions/terminal-bench/2.0/Crux__Claude-Opus-4.6/metadata.yaml",
  "https://www.tbench.ai/leaderboard/terminal-bench/2.0"
 ]
}