{
 "source": "Quelle IA",
 "site": "https://quelleia.com/",
 "edition": "2026-W40",
 "date": "2026-09-28",
 "citation": "Source : Quelle IA, édition du 28 septembre 2026, quelleia.com",
 "methode": "0.1",
 "benchmarks": [
  {
   "id": "aider_polyglot",
   "nom": "Aider Polyglot",
   "tache": "code",
   "etat": "archive",
   "echelle": "pourcent",
   "modeles": 54,
   "poids_general": 0,
   "difficulte": 65,
   "pente": 0.1238,
   "en_une_phrase": "225 exercices de programmation difficiles d'Exercism, en six langages, à résoudre en modifiant directement les fichiers.",
   "notation": "Pourcentage d'exercices dont tous les tests passent après deux tentatives, la seconde avec le retour des tests.",
   "limites": "Exercices publics et courts, loin d'un vrai projet. Les meilleurs scores approchent 90 % et les données d'Epoch s'arrêtent fin 2025.",
   "mainteneur": "Aider (Paul Gauthier)",
   "url": "https://aider.chat/docs/leaderboards/",
   "verifie": true
  },
  {
   "id": "anli",
   "nom": "ANLI (Adversarial NLI)",
   "tache": "autre",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 11,
   "poids_general": 0,
   "difficulte": 46.4,
   "pente": 0.0458,
   "en_une_phrase": "Dire si une phrase découle d'une autre, la contredit ou ne permet pas de conclure, sur des exemples écrits pour piéger les modèles.",
   "notation": "Part de bonnes réponses parmi trois choix ; le hasard donne 33 %.",
   "limites": "Test de 2019. Les résultats viennent d'articles aux réglages variés et ne concernent que d'anciens modèles.",
   "mainteneur": "Facebook AI Research (Nie et al., 2019)",
   "url": "https://github.com/facebookresearch/anli",
   "verifie": true
  },
  {
   "id": "apex_agents",
   "nom": "APEX-Agents",
   "tache": "agents",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 34,
   "poids_general": 1.67,
   "difficulte": 87.9,
   "pente": 0.0842,
   "en_une_phrase": "480 missions de banque d'affaires, de conseil et de droit des sociétés, à mener dans des outils de bureau : tableurs, présentations, messagerie.",
   "notation": "Part de missions où tous les critères de la grille sont remplis dès le premier essai, selon un modèle correcteur.",
   "limites": "La correction est confiée à une IA. Le classement est tenu par Mercor, l'entreprise privée qui a conçu les missions.",
   "mainteneur": "Mercor",
   "url": "https://www.mercor.com/blog/introducing-apex-agents/",
   "verifie": true
  },
  {
   "id": "arc_agi",
   "nom": "ARC-AGI-1",
   "tache": "raisonnement",
   "etat": "sature",
   "echelle": "unite",
   "modeles": 82,
   "poids_general": 1.67,
   "difficulte": 74,
   "pente": 0.1698,
   "en_une_phrase": "Des puzzles de grilles colorées : déduire une règle à partir de quelques exemples et l'appliquer à une nouvelle grille.",
   "notation": "Part de puzzles résolus exactement sur le jeu semi-privé de l'ARC Prize (100 tâches).",
   "limites": "Facile pour un humain et désormais presque résolu : les meilleurs systèmes dépassent 95 %, parfois au prix de dizaines de dollars par puzzle.",
   "mainteneur": "ARC Prize Foundation (test créé par François Chollet en 2019)",
   "url": "https://arcprize.org/arc-agi/1/",
   "verifie": true
  },
  {
   "id": "arc_agi_2",
   "nom": "ARC-AGI-2",
   "tache": "raisonnement",
   "etat": "sature",
   "echelle": "unite",
   "modeles": 80,
   "poids_general": 1.67,
   "difficulte": 85,
   "pente": 0.2262,
   "en_une_phrase": "Des puzzles de grilles plus durs que ceux d'ARC-AGI-1, où chaque règle combine plusieurs idées ; des humains ont résolu chacun d'eux.",
   "notation": "Part de puzzles résolus sur le jeu semi-privé (120 tâches), avec deux essais par grille.",
   "limites": "Conçu pour résister à la force brute, il est pourtant presque résolu en 2026 : 95 % pour le meilleur système, souvent à un coût élevé par puzzle.",
   "mainteneur": "ARC Prize Foundation",
   "url": "https://arcprize.org/leaderboard",
   "verifie": true
  },
  {
   "id": "arc_ai2",
   "nom": "ARC (AI2 Reasoning Challenge)",
   "tache": "autre",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 76,
   "poids_general": 0,
   "difficulte": 2,
   "pente": 0.0385,
   "en_une_phrase": "Des questions de sciences de niveau école et collège, à choix multiples, choisies pour résister à une simple recherche de mots-clés.",
   "notation": "Part de bonnes réponses sur la partie difficile du jeu (Challenge) ; le hasard donne 25 %.",
   "limites": "Test de 2018, saturé par les modèles récents. À ne pas confondre avec ARC-AGI, qui porte sur des puzzles de grilles.",
   "mainteneur": "Allen Institute for AI",
   "url": "https://allenai.org/data/arc",
   "verifie": true
  },
  {
   "id": "arena_code",
   "nom": "Arena, questions de code",
   "tache": "code",
   "etat": "actif",
   "echelle": "elo",
   "modeles": 275,
   "poids_general": 1.15,
   "difficulte": 70,
   "pente": 0.0263,
   "en_une_phrase": "Les duels à l'aveugle d'Arena sur des questions de programmation.",
   "notation": "Un score Elo calculé sur les seuls duels portant sur du code.",
   "limites": "Le votant juge une réponse à l'œil, sans exécuter le code.",
   "mainteneur": "Arena (ex LMArena)",
   "url": "https://arena.ai/leaderboard",
   "verifie": true
  },
  {
   "id": "arena_ecriture",
   "nom": "Arena, écriture créative",
   "tache": "ecriture",
   "etat": "actif",
   "echelle": "elo",
   "modeles": 276,
   "poids_general": 5,
   "difficulte": 70.1,
   "pente": 0.0255,
   "en_une_phrase": "Les duels à l'aveugle d'Arena sur des demandes d'écriture : récits, poèmes, dialogues.",
   "notation": "Un score Elo calculé sur les seuls duels d'écriture créative.",
   "limites": "Questions surtout en anglais. Mesure le goût des votants.",
   "mainteneur": "Arena (ex LMArena)",
   "url": "https://arena.ai/leaderboard",
   "verifie": true
  },
  {
   "id": "arena_expert",
   "nom": "Arena, questions d'experts",
   "tache": "sciences",
   "etat": "actif",
   "echelle": "elo",
   "modeles": 263,
   "poids_general": 2,
   "difficulte": 70.5,
   "pente": 0.0302,
   "en_une_phrase": "Les duels à l'aveugle d'Arena sur des questions de niveau expert.",
   "notation": "Un score Elo calculé sur les duels classés comme experts par Arena.",
   "limites": "La catégorie est attribuée automatiquement aux questions.",
   "mainteneur": "Arena (ex LMArena)",
   "url": "https://arena.ai/leaderboard",
   "verifie": true
  },
  {
   "id": "arena_francais",
   "nom": "Arena, questions en français",
   "tache": "francais",
   "etat": "actif",
   "echelle": "elo",
   "modeles": 224,
   "poids_general": 2.5,
   "difficulte": 70.9,
   "pente": 0.0269,
   "en_une_phrase": "Les duels à l'aveugle d'Arena, restreints aux questions posées en français.",
   "notation": "Un score Elo calculé sur les seuls duels en français.",
   "limites": "Moins de votes que le classement général, donc des marges plus larges. Mesure une préférence.",
   "mainteneur": "Arena (ex LMArena)",
   "url": "https://arena.ai/leaderboard/text/french",
   "verifie": true
  },
  {
   "id": "arena_maths",
   "nom": "Arena, questions de maths",
   "tache": "maths",
   "etat": "actif",
   "echelle": "elo",
   "modeles": 269,
   "poids_general": 1.25,
   "difficulte": 70.2,
   "pente": 0.028,
   "en_une_phrase": "Les duels à l'aveugle d'Arena sur des questions de mathématiques.",
   "notation": "Un score Elo calculé sur les seuls duels de mathématiques.",
   "limites": "Le votant ne vérifie pas toujours la justesse du résultat.",
   "mainteneur": "Arena (ex LMArena)",
   "url": "https://arena.ai/leaderboard",
   "verifie": true
  },
  {
   "id": "arena_texte",
   "nom": "Arena, texte",
   "tache": "usage",
   "etat": "actif",
   "echelle": "elo",
   "modeles": 277,
   "poids_general": 10,
   "difficulte": 69.9,
   "pente": 0.0249,
   "en_une_phrase": "Des internautes posent leur question à deux modèles anonymes et votent pour la meilleure réponse.",
   "notation": "Un score Elo calculé sur des millions de duels : plus il est haut, plus le modèle gagne souvent.",
   "limites": "Mesure une préférence, qui récompense aussi le style et la longueur des réponses. Arena corrige cet effet, sans l'annuler.",
   "mainteneur": "Arena (ex LMArena)",
   "url": "https://arena.ai/leaderboard",
   "verifie": true
  },
  {
   "id": "arena_vision",
   "nom": "Arena, vision",
   "tache": "vision",
   "etat": "actif",
   "echelle": "elo",
   "modeles": 121,
   "poids_general": 1.67,
   "difficulte": 75.4,
   "pente": 0.0245,
   "en_une_phrase": "Des duels à l'aveugle où la question porte sur une image fournie par l'internaute.",
   "notation": "Un score Elo calculé sur les duels avec image.",
   "limites": "Porte sur des images du quotidien. La précision sur des documents techniques n'est pas mesurée.",
   "mainteneur": "Arena (ex LMArena)",
   "url": "https://arena.ai/leaderboard",
   "verifie": true
  },
  {
   "id": "arena_webdev",
   "nom": "Code Arena, WebDev",
   "tache": "web",
   "etat": "actif",
   "echelle": "elo",
   "modeles": 114,
   "poids_general": 5,
   "difficulte": 79.9,
   "pente": 0.0844,
   "en_une_phrase": "Deux modèles construisent le même site ou la même application web, l'internaute vote pour le meilleur résultat.",
   "notation": "Un score Elo calculé sur des duels où le résultat s'affiche et s'utilise.",
   "limites": "Juge le rendu et l'usage immédiat. La qualité du code et sa maintenance ne sont pas évaluées.",
   "mainteneur": "Arena (ex LMArena)",
   "url": "https://arena.ai/leaderboard/code/webdev",
   "verifie": true
  },
  {
   "id": "balrog",
   "nom": "BALROG",
   "tache": "agents",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 37,
   "poids_general": 1.67,
   "difficulte": 85.1,
   "pente": 0.0372,
   "en_une_phrase": "Jouer à six jeux, du simple BabyAI au redoutable NetHack, qui demandent d'explorer, de planifier et de tenir sur la durée.",
   "notation": "Progression moyenne dans les six jeux, de 0 à 1, calculée sur plusieurs parties par jeu.",
   "limites": "La moyenne cache de grands écarts : les modèles terminent les jeux simples mais avancent à peine dans NetHack.",
   "mainteneur": "Équipe BALROG (auteurs de l'article de 2024)",
   "url": "https://balrogai.com/",
   "verifie": true
  },
  {
   "id": "bbh",
   "nom": "BIG-Bench Hard (BBH)",
   "tache": "autre",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 45,
   "poids_general": 0,
   "difficulte": 18.7,
   "pente": 0.0409,
   "en_une_phrase": "23 exercices de logique et de raisonnement en plusieurs étapes, retenus en 2022 parce que les modèles y échouaient.",
   "notation": "Moyenne des bonnes réponses sur l'ensemble des exercices.",
   "limites": "Jeu public de 2022, largement vu à l'entraînement et saturé. Les scores viennent d'articles aux réglages variés.",
   "mainteneur": "Suzgun et al. (Google Research et Stanford), à partir de BIG-bench",
   "url": "https://github.com/suzgunmirac/BIG-Bench-Hard",
   "verifie": true
  },
  {
   "id": "blueprint_bench_2",
   "nom": "Blueprint-Bench 2",
   "tache": "vision",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 26,
   "poids_general": 1.67,
   "difficulte": 99.1,
   "pente": 0.1132,
   "en_une_phrase": "Dessiner le plan en 2D d'un appartement à partir d'une vingtaine de photos : pièces, portes, tailles relatives.",
   "notation": "Ressemblance entre le plan produit et le vrai, ramenée de 0 (hasard) à 1 (plan parfait) ; calcul automatique, sans IA correctrice.",
   "limites": "Une cinquantaine d'appartements seulement. Les humains testés obtiennent environ 0,59 et le meilleur modèle 0,50.",
   "mainteneur": "Andon Labs",
   "url": "https://andonlabs.com/evals/blueprint-bench-2",
   "verifie": true
  },
  {
   "id": "boolq",
   "nom": "BoolQ",
   "tache": "autre",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 76,
   "poids_general": 0,
   "difficulte": -22.1,
   "pente": 0.0226,
   "en_une_phrase": "Répondre par oui ou par non à une vraie question d'internaute, à partir d'un court passage de texte.",
   "notation": "Part de bonnes réponses ; le hasard donne 50 %.",
   "limites": "Test de 2019 saturé. Avec deux réponses possibles, les écarts entre modèles sont minces.",
   "mainteneur": "Google AI Language (Clark et al., 2019)",
   "url": "https://github.com/google-research-datasets/boolean-questions",
   "verifie": true
  },
  {
   "id": "cadeval",
   "nom": "CadEval",
   "tache": "vision",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 15,
   "poids_general": 0,
   "difficulte": 66.5,
   "pente": 0.0672,
   "en_une_phrase": "Écrire le code OpenSCAD d'une pièce en 3D décrite en texte, de la plus simple à celle qui enchaîne cinq opérations.",
   "notation": "Part de pièces dont le rendu 3D colle au modèle de référence : volume, dimensions et écart de surface inférieur à 1 mm.",
   "limites": "Petit jeu de tâches tenu par une seule personne et figé en avril 2025. L'auteur estime qu'environ 5 % des pièces justes sont refusées à tort.",
   "mainteneur": "Will Patrick",
   "url": "https://willpatrick.xyz/technology/2025/04/23/teaching-llms-how-to-solid-model.html",
   "verifie": true
  },
  {
   "id": "chess_puzzles",
   "nom": "Chess Puzzles",
   "tache": "raisonnement",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 136,
   "poids_general": 1.67,
   "difficulte": 94.5,
   "pente": 0.098,
   "en_une_phrase": "100 positions d'échecs inédites où il faut trouver le seul meilleur coup, celui que donne le moteur Stockfish.",
   "notation": "Part de positions où le coup proposé est exactement le bon.",
   "limites": "Epoch le dit lui-même : bien jouer aux échecs a peu de portée pratique. Le test renseigne sur la planification et la lecture d'une position, rien de plus.",
   "mainteneur": "Epoch AI",
   "url": "https://epoch.ai/benchmarks/chess-puzzles",
   "verifie": true
  },
  {
   "id": "cl_bench",
   "nom": "CL-bench",
   "tache": "donnees",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 20,
   "poids_general": 0,
   "difficulte": 124.5,
   "pente": 0.033,
   "en_une_phrase": "Apprendre un savoir nouveau fourni dans la consigne (un droit fictif, les règles d'un jeu inventé) et l'appliquer aussitôt.",
   "notation": "Part des 1 899 tâches où la réponse satisfait tous les critères de la grille.",
   "limites": "Notation en tout ou rien : une réponse presque juste vaut zéro, d'où des scores bas, 28 % au mieux.",
   "mainteneur": "Tencent Hunyuan et université Fudan",
   "url": "https://www.clbench.com/",
   "verifie": true
  },
  {
   "id": "cl_bench_life",
   "nom": "CL-bench Life",
   "tache": "donnees",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 14,
   "poids_general": 0,
   "difficulte": 112.8,
   "pente": 0.0593,
   "en_une_phrase": "Raisonner à partir de traces désordonnées de la vie courante : conversations, notes éparses, historiques d'activité.",
   "notation": "Part des 405 tâches où la réponse satisfait tous les critères de la grille.",
   "limites": "Notation en tout ou rien, scores très bas (22 % au mieux) et peu de modèles testés.",
   "mainteneur": "Tencent Hunyuan et université Fudan",
   "url": "https://www.clbench.com/",
   "verifie": true
  },
  {
   "id": "comparia",
   "nom": "compar:IA",
   "tache": "francais",
   "etat": "actif",
   "echelle": "elo",
   "modeles": 114,
   "poids_general": 2.5,
   "difficulte": 73.5,
   "pente": 0.0132,
   "en_une_phrase": "L'arène publique du ministère de la Culture : deux modèles anonymes répondent, l'internaute vote, presque toujours en français.",
   "notation": "Un score Elo calculé sur les duels, avec sa marge. Environ neuf questions sur dix sont en français.",
   "limites": "Moins de duels par modèle que sur Arena, donc des marges larges. Peu de modèles très récents.",
   "mainteneur": "Ministère de la Culture, beta.gouv.fr",
   "url": "https://comparia.beta.gouv.fr",
   "verifie": true
  },
  {
   "id": "critpt",
   "nom": "CritPt",
   "tache": "sciences",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 129,
   "poids_general": 2,
   "difficulte": 103.1,
   "pente": 0.1098,
   "en_une_phrase": "71 défis de physique de niveau recherche, comparables à un premier projet de thèse, écrits par plus de 50 physiciens.",
   "notation": "Part de défis résolus ; les réponses (nombres, formules, fonctions Python) sont vérifiées automatiquement.",
   "limites": "Scores très bas, 32 % au mieux. Les résultats sont mesurés par Artificial Analysis, dans ses propres conditions.",
   "mainteneur": "Collectif de physiciens mené par le laboratoire d'Argonne et l'université de l'Illinois ; classement Artificial Analysis",
   "url": "https://artificialanalysis.ai/evaluations/critpt",
   "verifie": true
  },
  {
   "id": "csqa2",
   "nom": "CommonsenseQA 2.0",
   "tache": "autre",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 6,
   "poids_general": 0,
   "difficulte": 60.5,
   "pente": 0.059,
   "en_une_phrase": "Des affirmations de bon sens sur les objets, les situations sociales et les causes, à juger vraies ou fausses.",
   "notation": "Part de bonnes réponses ; le hasard donne 50 %.",
   "limites": "Dix résultats seulement, tous sur d'anciens modèles. Inutile pour comparer les assistants actuels.",
   "mainteneur": "Allen Institute for AI et université de Tel-Aviv (Talmor et al., 2021)",
   "url": "https://allenai.github.io/csqa2/",
   "verifie": true
  },
  {
   "id": "cursorbench",
   "nom": "CursorBench",
   "tache": "code",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 13,
   "poids_general": 1.15,
   "difficulte": 96.3,
   "pente": 0.0608,
   "en_une_phrase": "Des tâches tirées de vraies sessions de l'éditeur Cursor : comprendre un dépôt, trouver un bug, modifier plusieurs fichiers, relire du code.",
   "notation": "Score de justesse de 0 à 1, publié avec le coût, les jetons et le nombre d'étapes par tâche.",
   "limites": "Jeu privé tenu par Cursor, qui vend l'éditeur : personne d'autre ne peut refaire la mesure. Les scores de la version 4.0 ne se comparent pas aux précédentes.",
   "mainteneur": "Cursor",
   "url": "https://cursor.com/cursorbench",
   "verifie": true
  },
  {
   "id": "cybench",
   "nom": "Cybench",
   "tache": "securite",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 21,
   "poids_general": 0,
   "difficulte": 74.7,
   "pente": 0.1565,
   "en_une_phrase": "40 épreuves de piratage tirées de compétitions professionnelles : cryptographie, failles web, rétro-ingénierie, analyse de traces.",
   "notation": "Part d'épreuves résolues sans aucune indication intermédiaire (mode « unguided »).",
   "limites": "Une partie des chiffres vient des fiches des éditeurs, avec leurs propres harnais. Le meilleur modèle dépasse 90 % et les épreuves sont publiques.",
   "mainteneur": "Université Stanford",
   "url": "https://cybench.github.io/",
   "verifie": true
  },
  {
   "id": "deepresearch_bench",
   "nom": "DeepResearch Bench",
   "tache": "agents",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 24,
   "poids_general": 1.67,
   "difficulte": 92.6,
   "pente": 0.0113,
   "en_une_phrase": "91 tâches de recherche sur le web : trouver un chiffre, compiler un jeu de données, vérifier une affirmation, retrouver une source.",
   "notation": "Note moyenne de 0 à 1, selon la tâche (précision, rappel ou réponse juste), sur une copie figée du web et 50 actions au plus.",
   "limites": "Les écarts entre modèles sont faibles, de 0,35 à 0,55. Le web figé ne reflète pas une recherche en conditions réelles.",
   "mainteneur": "FutureSearch",
   "url": "https://evals.futuresearch.ai/",
   "verifie": true
  },
  {
   "id": "deepswe",
   "nom": "DeepSWE",
   "tache": "code",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 26,
   "poids_general": 1.15,
   "difficulte": 86.5,
   "pente": 0.1313,
   "en_une_phrase": "113 tâches de développement longues et inédites, dans 91 dépôts open source actifs et cinq langages.",
   "notation": "Part d'essais réussis selon un vérificateur écrit à la main, sur quatre passages avec le harnais mini-SWE-agent.",
   "limites": "Epoch le classe « défectueux » : au moins 23 tâches sur 113 échouent à cause du vérificateur lui-même, ce qui pénalise des solutions correctes.",
   "mainteneur": "Datacurve",
   "url": "https://deepswe.datacurve.ai/",
   "verifie": true
  },
  {
   "id": "dtbench",
   "nom": "DTBench",
   "tache": "raisonnement",
   "etat": "sature",
   "echelle": "unite",
   "modeles": 168,
   "poids_general": 1.67,
   "difficulte": 62.1,
   "pente": 0.0706,
   "en_une_phrase": "407 questions de théorie de la décision sur des dilemmes de type Newcomb, où le choix d'un agent renseigne sur celui de ses semblables.",
   "notation": "Part de bonnes réponses ; le hasard donne 40 %.",
   "limites": "Domaine très étroit, et les meilleurs modèles frôlent 99 %. Les questions d'opinion du jeu sont exclues du score.",
   "mainteneur": "Redwood Research",
   "url": "https://conceptualreasoning.ai/dtbench",
   "verifie": true
  },
  {
   "id": "ebr_bench",
   "nom": "EBR-bench (Earthborne Rangers)",
   "tache": "agents",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 23,
   "poids_general": 1.67,
   "difficulte": 95.3,
   "pente": 0.1895,
   "en_une_phrase": "Le modèle rejoue dix fois un jeu de société complexe, Earthborne Rangers, pour voir s'il s'améliore avec l'expérience.",
   "notation": "Part des 21 objectifs atteints lors des deux dernières parties, après huit parties d'apprentissage ; la meilleure des deux est retenue.",
   "limites": "Seuls les cinq premiers jours de la campagne sont joués, sur 20 à 25. Le résultat dépend du harnais et de la façon dont l'historique des parties est résumé.",
   "mainteneur": "Epoch AI",
   "url": "https://epoch.ai/benchmarks/ebr-bench",
   "verifie": true
  },
  {
   "id": "enigmaeval",
   "nom": "EnigmaEval",
   "tache": "raisonnement",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 41,
   "poids_general": 1.67,
   "difficulte": 101.1,
   "pente": 0.0983,
   "en_une_phrase": "1 184 énigmes de chasses aux énigmes, du niveau débutant au MIT Mystery Hunt, mêlant texte et images et exigeant de longues déductions.",
   "notation": "Part d'énigmes dont la réponse finale est exactement la bonne.",
   "limites": "Les énigmes viennent de concours publics, d'où un risque de fuite que le classement signale lui-même. Scores bas, 39 % au mieux.",
   "mainteneur": "Scale AI, avec le Center for AI Safety et le MIT",
   "url": "https://labs.scale.com/leaderboard/enigma_eval",
   "verifie": true
  },
  {
   "id": "euroeval_allocine",
   "nom": "EuroEval, Allociné (sentiment)",
   "tache": "francais",
   "etat": "sature",
   "echelle": "pourcent",
   "modeles": 134,
   "poids_general": 0.62,
   "difficulte": -82.8,
   "pente": 0.0209,
   "en_une_phrase": "Le modèle dit si une critique de film en français est positive ou négative.",
   "notation": "Un score d'accord avec la bonne réponse, de 0 à 100.",
   "limites": "Épreuve facile : presque tous les modèles récents dépassent 90.",
   "mainteneur": "EuroEval",
   "url": "https://euroeval.com/leaderboards/Monolingual/french/",
   "verifie": false
  },
  {
   "id": "euroeval_eltec",
   "nom": "EuroEval, ELTeC (noms propres)",
   "tache": "francais",
   "etat": "actif",
   "echelle": "pourcent",
   "modeles": 134,
   "poids_general": 0.62,
   "difficulte": 13.4,
   "pente": 0.0128,
   "en_une_phrase": "Le modèle repère les personnes, les lieux et les organisations dans un texte en français.",
   "notation": "Un score de 0 à 100 qui combine les entités trouvées et les entités manquées.",
   "limites": "Tâche d'extraction, éloignée de l'usage courant d'un assistant.",
   "mainteneur": "EuroEval",
   "url": "https://euroeval.com/leaderboards/Monolingual/french/",
   "verifie": false
  },
  {
   "id": "euroeval_fquad",
   "nom": "EuroEval, FQuAD (compréhension)",
   "tache": "francais",
   "etat": "actif",
   "echelle": "pourcent",
   "modeles": 134,
   "poids_general": 0.62,
   "difficulte": -32.1,
   "pente": 0.0083,
   "en_une_phrase": "Le modèle lit un texte en français et répond à une question dont la réponse s'y trouve.",
   "notation": "La part de mots communs entre sa réponse et la réponse attendue.",
   "limites": "Une réponse juste mais formulée autrement perd des points.",
   "mainteneur": "EuroEval",
   "url": "https://euroeval.com/leaderboards/Monolingual/french/",
   "verifie": false
  },
  {
   "id": "euroeval_hellaswag_fr",
   "nom": "EuroEval, HellaSwag (bon sens)",
   "tache": "francais",
   "etat": "actif",
   "echelle": "pourcent",
   "modeles": 134,
   "poids_general": 0.62,
   "difficulte": 37.9,
   "pente": 0.0305,
   "en_une_phrase": "Le modèle choisit la suite la plus plausible d'une situation décrite en français.",
   "notation": "La part de bonnes réponses, corrigée du hasard.",
   "limites": "Épreuve traduite de l'anglais, proche de la saturation pour les meilleurs modèles.",
   "mainteneur": "EuroEval",
   "url": "https://euroeval.com/leaderboards/Monolingual/french/",
   "verifie": false
  },
  {
   "id": "euroeval_include_fr",
   "nom": "EuroEval, INCLUDE (connaissances)",
   "tache": "francais",
   "etat": "actif",
   "echelle": "pourcent",
   "modeles": 64,
   "poids_general": 0.62,
   "difficulte": 41,
   "pente": 0.0277,
   "en_une_phrase": "Des questions à choix multiples de connaissances, posées en français.",
   "notation": "La part de bonnes réponses, corrigée du hasard.",
   "limites": "Mesure ce que le modèle sait, en français. Sa rédaction n'est pas évaluée.",
   "mainteneur": "EuroEval",
   "url": "https://euroeval.com/leaderboards/Monolingual/french/",
   "verifie": false
  },
  {
   "id": "euroeval_multiloko_fr",
   "nom": "EuroEval, MultiLoKo (connaissances locales)",
   "tache": "francais",
   "etat": "actif",
   "echelle": "pourcent",
   "modeles": 64,
   "poids_general": 0.62,
   "difficulte": 79.4,
   "pente": 0.0569,
   "en_une_phrase": "Des questions de culture propre aux pays francophones, posées en français.",
   "notation": "La part de réponses exactes.",
   "limites": "Peu de modèles mesurés. Exige la réponse exacte, au mot près.",
   "mainteneur": "EuroEval",
   "url": "https://euroeval.com/leaderboards/Monolingual/french/",
   "verifie": false
  },
  {
   "id": "euroeval_orange_sum",
   "nom": "EuroEval, OrangeSum (résumé)",
   "tache": "francais",
   "etat": "actif",
   "echelle": "pourcent",
   "modeles": 69,
   "poids_general": 0.62,
   "difficulte": 353.8,
   "pente": 0.0018,
   "en_une_phrase": "Le modèle résume un article de presse en français.",
   "notation": "La proximité entre son résumé et un résumé de référence, mesurée automatiquement.",
   "limites": "Un bon résumé différent de la référence est mal noté. Les écarts entre modèles sont faibles.",
   "mainteneur": "EuroEval",
   "url": "https://euroeval.com/leaderboards/Monolingual/french/",
   "verifie": false
  },
  {
   "id": "euroeval_scala_fr",
   "nom": "EuroEval, ScaLA (grammaire)",
   "tache": "francais",
   "etat": "actif",
   "echelle": "pourcent",
   "modeles": 136,
   "poids_general": 0.62,
   "difficulte": 66.9,
   "pente": 0.019,
   "en_une_phrase": "Le modèle doit dire si une phrase française est correcte ou si elle a été abîmée.",
   "notation": "Un score d'accord avec la bonne réponse, de 0 à 100, corrigé du hasard.",
   "limites": "Juge la détection des fautes. La qualité de ce que le modèle écrit lui-même n'est pas notée.",
   "mainteneur": "EuroEval",
   "url": "https://euroeval.com/leaderboards/Monolingual/french/",
   "verifie": false
  },
  {
   "id": "exploitbench",
   "nom": "ExploitBench",
   "tache": "securite",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 9,
   "poids_general": 0,
   "difficulte": 95.3,
   "pente": 0.1041,
   "en_une_phrase": "Exploiter de vraies failles déjà corrigées du moteur JavaScript de Chrome, de l'accès au code vulnérable jusqu'à l'exécution de code arbitraire.",
   "notation": "Part moyenne des 16 jalons atteints sur 41 failles, avec plusieurs essais par faille.",
   "limites": "Un seul logiciel cible, le moteur V8. Peu de modèles testés, certains en préversion, et les failles sont déjà documentées publiquement.",
   "mainteneur": "Université Carnegie Mellon",
   "url": "https://exploitbench.ai/",
   "verifie": true
  },
  {
   "id": "fiction_livebench",
   "nom": "Fiction.LiveBench",
   "tache": "donnees",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 57,
   "poids_general": 0,
   "difficulte": 59,
   "pente": 0.0846,
   "en_une_phrase": "Répondre à des questions sur de longues histoires : qui sait quoi, dans quel ordre, ce qui est sous-entendu.",
   "notation": "Part de bonnes réponses quand l'histoire fait environ 16 000 jetons ; le classement d'origine teste aussi des longueurs jusqu'à 192 000 jetons.",
   "limites": "Seulement 36 questions sur 30 histoires. La longueur retenue ici, 16 000 jetons, est courte face aux contextes des modèles actuels.",
   "mainteneur": "Fiction.live",
   "url": "https://fiction.live/stories/Fiction-liveBench-Mar-14-2025/oQdzQvKHw8JyXbN87/home",
   "verifie": true
  },
  {
   "id": "forecastbench",
   "nom": "ForecastBench",
   "tache": "raisonnement",
   "etat": "actif",
   "echelle": "pourcent",
   "modeles": 77,
   "poids_general": 1.67,
   "difficulte": 193.1,
   "pente": 0.0119,
   "en_une_phrase": "Prédire des événements à venir (marchés de prédiction, indicateurs économiques, conflits) en donnant une probabilité.",
   "notation": "Indice de Brier ajusté à la difficulté, de 0 à 100 : 100 pour des prévisions parfaites, 50 pour une réponse sans information.",
   "limites": "Aucune fuite possible puisque la réponse n'existe pas encore, mais les écarts sont minces (de 50 à 63) et il faut attendre l'issue des questions.",
   "mainteneur": "Forecasting Research Institute",
   "url": "https://www.forecastbench.org/",
   "verifie": true
  },
  {
   "id": "frontiercode",
   "nom": "FrontierCode",
   "tache": "code",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 37,
   "poids_general": 1.15,
   "difficulte": 94.7,
   "pente": 0.0903,
   "en_une_phrase": "Produire, pour un vrai ticket d'un projet open source, un correctif assez propre pour être accepté par les responsables du projet.",
   "notation": "Note moyenne sur cinq essais selon une grille pondérée, sur les 100 tâches les plus dures ; un seul critère bloquant manqué donne zéro.",
   "limites": "Classement tenu par Cognition, éditeur de l'agent Devin, qui y figure. Le score retenu est celui du meilleur réglage de chaque modèle, avec des harnais différents.",
   "mainteneur": "Cognition",
   "url": "https://cognition.com/frontiercode",
   "verifie": true
  },
  {
   "id": "frontiermath",
   "nom": "FrontierMath, paliers 1 à 3 (version 2025)",
   "tache": "maths",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 70,
   "poids_general": 1.25,
   "difficulte": 80.2,
   "pente": 0.1654,
   "en_une_phrase": "Environ 300 problèmes de mathématiques inédits, écrits par des mathématiciens, qui demandent chacun plusieurs heures à un spécialiste.",
   "notation": "Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé.",
   "limites": "Version remplacée en juin 2026 : plus de quatre énoncés sur dix ont dû être corrigés, et Epoch estime le score maximal à 57 %. OpenAI a financé le jeu et en détient une partie.",
   "mainteneur": "Epoch AI",
   "url": "https://epoch.ai/benchmarks/frontiermath",
   "verifie": true
  },
  {
   "id": "frontiermath_erdos",
   "nom": "FrontierMath Erdős",
   "tache": "maths",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 5,
   "poids_general": 1.25,
   "difficulte": 179.6,
   "pente": 0.0575,
   "en_une_phrase": "68 conjectures de Paul Erdős que personne n'a résolues, à démontrer ou à réfuter par une preuve formelle en Lean.",
   "notation": "Part des 68 conjectures résolues, la preuve étant vérifiée par la machine ; budget de 300 dollars et 72 heures par problème.",
   "limites": "Presque tous les scores sont à zéro : le test guette une percée et ne classe pas encore les modèles. Une conjecture résolue peut ensuite fuiter dans les données d'entraînement.",
   "mainteneur": "Epoch AI, avec le site ErdősProblems.com de Thomas Bloom",
   "url": "https://epoch.ai/benchmarks/frontiermath-erdos",
   "verifie": true
  },
  {
   "id": "frontiermath_tier_4",
   "nom": "FrontierMath, palier 4 (version 2025)",
   "tache": "maths",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 55,
   "poids_general": 1.25,
   "difficulte": 90.1,
   "pente": 0.1906,
   "en_une_phrase": "Une cinquantaine de problèmes de niveau recherche, les plus durs de FrontierMath, qui peuvent occuper un mathématicien plusieurs jours.",
   "notation": "Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé.",
   "limites": "Version remplacée en juin 2026 après correction de 12 énoncés et retrait de 7 autres ; Epoch estime le score maximal à 60 %. OpenAI a financé le jeu et en détient une partie.",
   "mainteneur": "Epoch AI",
   "url": "https://epoch.ai/benchmarks/frontiermath",
   "verifie": true
  },
  {
   "id": "frontiermath_tier_4_v2",
   "nom": "FrontierMath, palier 4 (v2)",
   "tache": "maths",
   "etat": "sature",
   "echelle": "unite",
   "modeles": 59,
   "poids_general": 1.25,
   "difficulte": 90.3,
   "pente": 0.232,
   "en_une_phrase": "43 problèmes de niveau recherche, corrigés en 2026, qui peuvent occuper un mathématicien professionnel plusieurs jours.",
   "notation": "Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé.",
   "limites": "Avec 43 problèmes, chacun pèse plus de deux points, et le meilleur modèle frôle déjà le maximum. OpenAI a financé le jeu et en détient une partie.",
   "mainteneur": "Epoch AI",
   "url": "https://epoch.ai/benchmarks/frontiermath",
   "verifie": true
  },
  {
   "id": "frontiermath_tiers_1_3_v2",
   "nom": "FrontierMath, paliers 1 à 3 (v2)",
   "tache": "maths",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 77,
   "poids_general": 1.25,
   "difficulte": 81.8,
   "pente": 0.1307,
   "en_une_phrase": "295 problèmes de mathématiques inédits et corrigés en 2026, du niveau licence avancée à celui d'un chercheur.",
   "notation": "Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé.",
   "limites": "Le jeu est privé, donc peu exposé aux fuites, mais OpenAI l'a financé et a accès à une partie des problèmes. Les meilleurs modèles dépassent déjà 90 %.",
   "mainteneur": "Epoch AI",
   "url": "https://epoch.ai/benchmarks/frontiermath",
   "verifie": true
  },
  {
   "id": "frontierswe",
   "nom": "FrontierSWE",
   "tache": "code",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 16,
   "poids_general": 1.15,
   "difficulte": 96,
   "pente": 0.1732,
   "en_une_phrase": "34 chantiers logiciels de très longue haleine : réécrire git en Zig, décoder la parole dans des signaux cérébraux, entraîner un modèle météo.",
   "notation": "Note moyenne sur cinq essais par tâche, avec un budget de 20 heures par essai, dans le harnais maison « proximus ».",
   "limites": "34 tâches seulement et un coût élevé, jusqu'à 1 000 dollars en moyenne par tâche. Un seul harnais est utilisé, celui de l'éditeur du benchmark.",
   "mainteneur": "Proximal",
   "url": "https://www.frontierswe.com/",
   "verifie": true
  },
  {
   "id": "furniture_assembly",
   "nom": "Furniture Assembly",
   "tache": "vision",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 28,
   "poids_general": 1.67,
   "difficulte": 96.5,
   "pente": 0.325,
   "en_une_phrase": "Regarder la photo d'un meuble IKEA monté et dire, notice à l'appui, si le montage est correct et à quelle étape s'est glissée l'erreur.",
   "notation": "Part de bonnes réponses sur 60 photos de trois meubles ; la description de l'erreur est jugée avec indulgence par un modèle correcteur.",
   "limites": "Trois meubles et 60 photos seulement. Répondre au hasard donne déjà environ 30 %, et les modèles sans vision sont exclus.",
   "mainteneur": "Epoch AI",
   "url": "https://epoch.ai/benchmarks/furniture-assembly",
   "verifie": true
  },
  {
   "id": "gbaeval",
   "nom": "GBAEval",
   "tache": "code",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 23,
   "poids_general": 1.15,
   "difficulte": 89.9,
   "pente": 0.2963,
   "en_une_phrase": "Écrire de zéro, en 24 heures au plus, un émulateur de Game Boy Advance en Rust et WebAssembly.",
   "notation": "Score global de 0 à 1 : l'émulateur est comparé à l'émulateur de référence Mesen2 sur l'image, le comportement matériel et le son.",
   "limites": "Une seule tâche, très particulière, et des émulateurs open source existent dans les données d'entraînement. Le site ne dit pas clairement qui tient le benchmark.",
   "mainteneur": "Équipe GBAEval (gbaeval.com)",
   "url": "https://gbaeval.com/",
   "verifie": true
  },
  {
   "id": "gdp_pdf",
   "nom": "GDP.pdf",
   "tache": "donnees",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 30,
   "poids_general": 0,
   "difficulte": 108.8,
   "pente": 0.0697,
   "en_une_phrase": "100 questions sur de vrais documents PDF professionnels (finance, santé, droit, ingénierie) : tableaux, schémas, formulaires, clauses de contrat.",
   "notation": "Part de questions où la réponse remplit tous les critères d'une grille propre à chaque tâche.",
   "limites": "Scores bas en tout ou rien, 31 % au mieux. Le classement est tenu par Surge AI, fournisseur de données pour les laboratoires d'IA.",
   "mainteneur": "Surge AI",
   "url": "https://surgehq.ai/leaderboards/gdp-pdf",
   "verifie": true
  },
  {
   "id": "gdpval",
   "nom": "GDPval",
   "tache": "agents",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 11,
   "poids_general": 0,
   "difficulte": 88.1,
   "pente": 0.0595,
   "en_une_phrase": "Des tâches réelles de 44 métiers (finance, santé, administration, industrie) dont le livrable est un document, un tableur ou une présentation.",
   "notation": "Part des duels gagnés face au travail d'un professionnel humain, jugés à l'aveugle par des experts du métier.",
   "limites": "Benchmark conçu et tenu par OpenAI, qui y classe ses propres modèles. Une dizaine de modèles seulement y figurent.",
   "mainteneur": "OpenAI",
   "url": "https://evals.openai.com/gdpval/leaderboard",
   "verifie": true
  },
  {
   "id": "geobench",
   "nom": "GeoBench",
   "tache": "vision",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 27,
   "poids_general": 0,
   "difficulte": 38,
   "pente": 0.0261,
   "en_une_phrase": "Deviner où une photo de rue a été prise, comme au jeu GeoGuessr, à partir des panneaux, de la végétation ou de l'architecture.",
   "notation": "Part de photos dont le pays est correctement identifié sur la carte principale du classement (ACW).",
   "limites": "Projet personnel. Le score retenu ne regarde que le pays trouvé, alors que le classement mesure aussi la distance au bon endroit.",
   "mainteneur": "ccmdi (projet personnel)",
   "url": "https://geobench.org/",
   "verifie": true
  },
  {
   "id": "gpqa_diamond",
   "nom": "GPQA Diamond",
   "tache": "sciences",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 208,
   "poids_general": 2,
   "difficulte": 60.8,
   "pente": 0.0852,
   "en_une_phrase": "Des questions à choix multiples de biologie, chimie et physique, écrites par des docteurs et trop dures pour un non-spécialiste.",
   "notation": "Part de bonnes réponses sur 198 questions à quatre choix ; répondre au hasard donne 25 %.",
   "limites": "Les meilleurs modèles atteignent 95 % quand des experts humains font environ 70 % : le test est saturé et ses questions circulent en ligne.",
   "mainteneur": "Epoch AI pour l'évaluation ; questions de Rein et al. (université de New York, 2023)",
   "url": "https://epoch.ai/benchmarks/gpqa-diamond",
   "verifie": true
  },
  {
   "id": "gsm8k",
   "nom": "GSM8K",
   "tache": "maths",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 82,
   "poids_general": 0,
   "difficulte": 2.7,
   "pente": 0.0479,
   "en_une_phrase": "Des problèmes d'arithmétique de niveau école et collège, rédigés en langage courant, à résoudre en quelques étapes de calcul.",
   "notation": "Part de réponses numériques exactement justes.",
   "limites": "Saturé et très présent dans les données d'entraînement. Il ne sert plus qu'à situer d'anciens modèles.",
   "mainteneur": "OpenAI (Cobbe et al., 2021)",
   "url": "https://github.com/openai/grade-school-math",
   "verifie": true
  },
  {
   "id": "gso_bench",
   "nom": "GSO",
   "tache": "code",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 26,
   "poids_general": 1.15,
   "difficulte": 92.9,
   "pente": 0.1403,
   "en_une_phrase": "Accélérer un vrai logiciel open source : le modèle reçoit le code et un test de performance, et doit égaler l'optimisation d'un expert.",
   "notation": "Part des 102 tâches où un seul essai atteint au moins 95 % du gain de vitesse humain tout en passant les tests (OPT@1).",
   "limites": "Un seul harnais, OpenHands, est utilisé. Certains gains venaient de tricheries sur les tests, d'où un second score corrigé, publié à part depuis fin 2025.",
   "mainteneur": "UC Berkeley",
   "url": "https://gso-bench.github.io/",
   "verifie": true
  },
  {
   "id": "hellaswag",
   "nom": "HellaSwag",
   "tache": "autre",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 75,
   "poids_general": 0,
   "difficulte": -54.7,
   "pente": 0.0156,
   "en_une_phrase": "Choisir la suite la plus plausible d'une courte scène du quotidien parmi quatre propositions, dont trois pièges écrits par une machine.",
   "notation": "Part de bonnes réponses ; le hasard donne 25 %.",
   "limites": "Test de 2019, saturé et largement présent dans les données d'entraînement. Il ne dit rien des modèles actuels.",
   "mainteneur": "Zellers et al. (université de Washington et Allen Institute for AI)",
   "url": "https://rowanzellers.com/hellaswag/",
   "verifie": true
  },
  {
   "id": "hle",
   "nom": "Humanity's Last Exam",
   "tache": "sciences",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 44,
   "poids_general": 2,
   "difficulte": 95.6,
   "pente": 0.09,
   "en_une_phrase": "2 500 questions de niveau expert dans plus de cent disciplines, écrites par près de mille chercheurs pour mettre les modèles en échec.",
   "notation": "Part de réponses exactes ; le classement publie aussi l'erreur de calibration, qui mesure l'excès de confiance du modèle.",
   "limites": "Epoch le classe « défectueux » : sur 48 questions vérifiées, 22 avaient un énoncé ou un corrigé fautif, ce qui borne le score atteignable.",
   "mainteneur": "Center for AI Safety et Scale AI",
   "url": "https://lastexam.ai/",
   "verifie": true
  },
  {
   "id": "lambada",
   "nom": "LAMBADA",
   "tache": "autre",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 26,
   "poids_general": 0,
   "difficulte": -111.4,
   "pente": 0.0096,
   "en_une_phrase": "Deviner le dernier mot d'un passage de roman, ce qui exige d'avoir suivi tout le paragraphe.",
   "notation": "Part de mots exactement retrouvés.",
   "limites": "Test de 2016, pensé pour les modèles d'avant ChatGPT. Les scores viennent d'articles anciens aux réglages variés.",
   "mainteneur": "Paperno et al. (université de Trente, 2016)",
   "url": "https://arxiv.org/abs/1606.06031",
   "verifie": true
  },
  {
   "id": "lech_mazur_writing",
   "nom": "Lech Mazur Writing",
   "tache": "ecriture",
   "etat": "archive",
   "echelle": "autre",
   "modeles": 44,
   "poids_general": 0,
   "difficulte": 19.7,
   "pente": 0.0268,
   "en_une_phrase": "Écrire de courtes nouvelles de 400 à 500 mots qui intègrent dix éléments imposés : personnage, objet, lieu, époque, ton.",
   "notation": "Note moyenne sur 10 donnée par sept modèles correcteurs selon une grille de 16 questions, sur 500 nouvelles.",
   "limites": "Ce sont des IA qui notent des IA, en anglais. Le classement est figé à sa version d'août 2025, les suivantes ayant changé de barème.",
   "mainteneur": "Lech Mazur (projet personnel)",
   "url": "https://github.com/lechmazur/writing",
   "verifie": true
  },
  {
   "id": "livebench",
   "nom": "LiveBench",
   "tache": "autre",
   "etat": "archive",
   "echelle": "pourcent",
   "modeles": 48,
   "poids_general": 0,
   "difficulte": 51.1,
   "pente": 0.0595,
   "en_une_phrase": "Un test généraliste aux questions renouvelées régulièrement : raisonnement, code, maths, analyse de données, langue et respect des consignes.",
   "notation": "Moyenne sur 100 des catégories ; chaque question a une réponse objective, corrigée automatiquement sans IA correctrice.",
   "limites": "Les données d'Epoch sont figées sur le jeu de questions de novembre 2024 et ne contiennent aucun modèle sorti après novembre 2025.",
   "mainteneur": "Équipe LiveBench (White et al., Abacus.AI)",
   "url": "https://livebench.ai/",
   "verifie": true
  },
  {
   "id": "livebench_code",
   "nom": "LiveBench, code",
   "tache": "code",
   "etat": "archive",
   "echelle": "pourcent",
   "modeles": 48,
   "poids_general": 0,
   "difficulte": 53.8,
   "pente": 0.0711,
   "en_une_phrase": "Des exercices de programmation récents, tirés de concours publiés après la sortie des modèles.",
   "notation": "La part d'exercices dont le code passe les tests.",
   "limites": "Des exercices courts, éloignés du travail sur un vrai projet. Dernière édition en juin 2026.",
   "mainteneur": "LiveBench (Abacus.AI, NYU et coauteurs)",
   "url": "https://livebench.ai",
   "verifie": true
  },
  {
   "id": "livebench_maths",
   "nom": "LiveBench, mathématiques",
   "tache": "maths",
   "etat": "archive",
   "echelle": "pourcent",
   "modeles": 48,
   "poids_general": 0,
   "difficulte": 51.4,
   "pente": 0.0832,
   "en_une_phrase": "Des problèmes de mathématiques récents, de niveau concours et olympiades.",
   "notation": "La part de bonnes réponses, vérifiée automatiquement.",
   "limites": "Juge la réponse finale, sans regarder la démonstration. Dernière édition en juin 2026.",
   "mainteneur": "LiveBench (Abacus.AI, NYU et coauteurs)",
   "url": "https://livebench.ai",
   "verifie": true
  },
  {
   "id": "livebench_raisonnement",
   "nom": "LiveBench, raisonnement",
   "tache": "raisonnement",
   "etat": "archive",
   "echelle": "pourcent",
   "modeles": 48,
   "poids_general": 0,
   "difficulte": 51.8,
   "pente": 0.0866,
   "en_une_phrase": "Des énigmes logiques et des déductions dont les questions sont renouvelées régulièrement.",
   "notation": "La part de bonnes réponses, vérifiée automatiquement, sans juge humain ni modèle juge.",
   "limites": "Les questions récentes ne sont pas publiées. Dernière édition en juin 2026.",
   "mainteneur": "LiveBench (Abacus.AI, NYU et coauteurs)",
   "url": "https://livebench.ai",
   "verifie": true
  },
  {
   "id": "lmca",
   "nom": "LMCA",
   "tache": "raisonnement",
   "etat": "actif",
   "echelle": "autre",
   "modeles": 130,
   "poids_general": 1.67,
   "difficulte": 82.1,
   "pente": 0.0603,
   "en_une_phrase": "Juger la qualité d'arguments en philosophie, en théorie de la décision et en sûreté de l'IA, comme le ferait un expert.",
   "notation": "Corrélation entre les notes du modèle et celles des experts, multipliée par 100 ; les auteurs situent le plafond vers 85.",
   "limites": "Le jeu de données est privé et les notes d'experts gardent une part de subjectivité, si bien qu'un score de 100 est hors d'atteinte.",
   "mainteneur": "Redwood Research",
   "url": "https://conceptualreasoning.ai/lmca",
   "verifie": true
  },
  {
   "id": "math_level_5",
   "nom": "MATH Level 5",
   "tache": "maths",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 94,
   "poids_general": 0,
   "difficulte": 49.1,
   "pente": 0.1256,
   "en_une_phrase": "Les 1 324 problèmes les plus durs du jeu MATH, tirés de concours de lycée américains comme l'AMC et l'AIME.",
   "notation": "Part de réponses finales justes ; l'équivalence avec la solution attendue est jugée par un modèle correcteur.",
   "limites": "Jeu public depuis 2021, donc probablement vu à l'entraînement. Les meilleurs modèles dépassent 98 % : le test ne départage plus le haut du classement.",
   "mainteneur": "Epoch AI pour l'évaluation ; jeu MATH de Hendrycks et al. (2021)",
   "url": "https://epoch.ai/benchmarks/math-level-5",
   "verifie": true
  },
  {
   "id": "metr_time_horizons",
   "nom": "METR Time Horizons (taux de réussite)",
   "tache": "agents",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 41,
   "poids_general": 1.67,
   "difficulte": 62,
   "pente": 0.0448,
   "en_une_phrase": "Des tâches de logiciel, d'apprentissage automatique et de cybersécurité, dont on connaît la durée pour un professionnel humain.",
   "notation": "Score moyen de réussite, de 0 à 1, sur l'ensemble des tâches de METR ; c'est la valeur qu'Epoch retient pour son indice.",
   "limites": "Ce score moyen est moins parlant que l'horizon en minutes publié par METR. Les tâches sont propres et bien définies, loin du désordre d'un vrai poste.",
   "mainteneur": "METR",
   "url": "https://metr.org/time-horizons/",
   "verifie": true
  },
  {
   "id": "mindcube",
   "nom": "MindCube",
   "tache": "vision",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 5,
   "poids_general": 0,
   "difficulte": 74.1,
   "pente": 0.011,
   "en_une_phrase": "Reconstituer mentalement une scène à partir de quelques photos prises sous des angles différents, et dire ce qu'on verrait en se déplaçant.",
   "notation": "Part de bonnes réponses à choix multiples sur plus de 21 000 questions ; les humains font environ 95 %.",
   "limites": "Cinq modèles seulement dans les données d'Epoch, aucun sorti après mai 2025. Rien sur les modèles récents.",
   "mainteneur": "Chercheurs de Northwestern, Stanford, NYU et de l'université de Washington",
   "url": "https://mind-cube.github.io/",
   "verifie": true
  },
  {
   "id": "mirrorcode",
   "nom": "MirrorCode",
   "tache": "code",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 9,
   "poids_general": 1.15,
   "difficulte": 96,
   "pente": 0.224,
   "en_une_phrase": "Réécrire de zéro un programme complet (utilitaire Unix, interpréteur, compresseur) sans voir son code, en reproduisant exactement son comportement.",
   "notation": "Part des programmes reproduits à l'identique, tous les tests passés, sur 30 tâches avec trois essais chacune.",
   "limites": "Les programmes d'origine sont publics et ont pu être vus à l'entraînement. Le budget accordé est énorme : jusqu'à 10 milliards de jetons et 7 jours par tâche.",
   "mainteneur": "Epoch AI et METR",
   "url": "https://epoch.ai/benchmarks/mirrorcode",
   "verifie": true
  },
  {
   "id": "mmlu",
   "nom": "MMLU",
   "tache": "autre",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 127,
   "poids_general": 0,
   "difficulte": 12.2,
   "pente": 0.031,
   "en_une_phrase": "Des milliers de questions à choix multiples sur 57 matières, du lycée au niveau professionnel : droit, médecine, histoire, physique.",
   "notation": "Part de bonnes réponses à quatre choix ; le hasard donne 25 %.",
   "limites": "Saturé autour de 90 %, présent dans les données d'entraînement et entaché de quelques questions erronées. Il ne départage plus les modèles récents.",
   "mainteneur": "Hendrycks et al. (UC Berkeley, 2020)",
   "url": "https://github.com/hendrycks/test",
   "verifie": true
  },
  {
   "id": "mystery_game_puzzles",
   "nom": "Mystery Game Puzzles",
   "tache": "raisonnement",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 69,
   "poids_general": 1.67,
   "difficulte": 94.9,
   "pente": 0.1577,
   "en_une_phrase": "100 positions d'un jeu dont Epoch tait le nom, décrites en texte, où le modèle doit trouver le meilleur coup.",
   "notation": "Part de positions où le coup soumis correspond à la solution ; un coup invalide compte comme faux.",
   "limites": "Ni le nom du jeu, ni les consignes, ni les transcriptions ne sont publiés. Cela limite les fuites mais empêche toute vérification extérieure.",
   "mainteneur": "Epoch AI",
   "url": "https://epoch.ai/benchmarks/mystery-game-puzzles",
   "verifie": true
  },
  {
   "id": "openbookqa",
   "nom": "OpenBookQA",
   "tache": "autre",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 42,
   "poids_general": 0,
   "difficulte": 1.2,
   "pente": 0.0336,
   "en_une_phrase": "Des questions de sciences élémentaires qui demandent de combiner un fait du cours avec du bon sens.",
   "notation": "Part de bonnes réponses à quatre choix ; le hasard donne 25 %.",
   "limites": "Test de 2018, aujourd'hui saturé. Les scores viennent d'articles aux réglages variés.",
   "mainteneur": "Allen Institute for AI",
   "url": "https://allenai.org/data/open-book-qa",
   "verifie": true
  },
  {
   "id": "osworld",
   "nom": "OSWorld",
   "tache": "agents",
   "etat": "archive",
   "echelle": "pourcent",
   "modeles": 9,
   "poids_general": 0,
   "difficulte": 75.4,
   "pente": 0.099,
   "en_une_phrase": "Accomplir des tâches sur un vrai ordinateur : manipuler des fichiers, régler une application, enchaîner plusieurs logiciels.",
   "notation": "Pourcentage des 369 tâches réussies, vérifié par script sur l'état final de la machine.",
   "limites": "Le score dépend beaucoup du harnais et du nombre d'étapes autorisées. Les meilleurs agents rejoignent le niveau humain mesuré, environ 72 %.",
   "mainteneur": "XLANG Lab (université de Hong Kong)",
   "url": "https://os-world.github.io/",
   "verifie": true
  },
  {
   "id": "osworld_2",
   "nom": "OSWorld 2.0",
   "tache": "agents",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 9,
   "poids_general": 1.67,
   "difficulte": 101,
   "pente": 0.1457,
   "en_une_phrase": "108 longues tâches sur un vrai ordinateur, dans des logiciels professionnels, qui prennent environ une heure et demie à une personne compétente.",
   "notation": "Part de tâches entièrement réussies avec un budget de 500 étapes ; un score partiel compte les points de contrôle validés.",
   "limites": "Scores bas en tout ou rien, 31 % au mieux. Les résultats dépendent du réglage des outils et du niveau de réflexion choisi.",
   "mainteneur": "XLANG Lab (université de Hong Kong)",
   "url": "https://osworld-v2.xlang.ai/",
   "verifie": true
  },
  {
   "id": "otis_mock_aime_2024_2025",
   "nom": "OTIS Mock AIME 2024-2025",
   "tache": "maths",
   "etat": "sature",
   "echelle": "unite",
   "modeles": 190,
   "poids_general": 1.25,
   "difficulte": 62.4,
   "pente": 0.1462,
   "en_une_phrase": "45 problèmes de concours de mathématiques, plus durs que MATH Level 5, dont la réponse est un entier entre 0 et 999.",
   "notation": "Part de réponses exactes sur les 45 problèmes, tirés de trois examens blancs.",
   "limites": "Avec 45 problèmes, un seul pèse plus de deux points. Plusieurs modèles atteignent 100 % et les énoncés sont publics.",
   "mainteneur": "Epoch AI ; problèmes écrits par des élèves du programme OTIS",
   "url": "https://epoch.ai/benchmarks/otis-mock-aime-2024-2025",
   "verifie": true
  },
  {
   "id": "piqa",
   "nom": "PIQA",
   "tache": "autre",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 59,
   "poids_general": 0,
   "difficulte": -53.5,
   "pente": 0.0087,
   "en_une_phrase": "Choisir, entre deux façons de faire, celle qui marche dans le monde physique pour un problème de tous les jours.",
   "notation": "Part de bonnes réponses entre deux choix ; le hasard donne 50 %.",
   "limites": "Test de 2019 saturé. Avec deux choix seulement, le hasard pèse lourd et les écarts entre modèles sont faibles.",
   "mainteneur": "Bisk et al. (2019)",
   "url": "https://arxiv.org/abs/1911.11641",
   "verifie": true
  },
  {
   "id": "posttrainbench",
   "nom": "PostTrainBench",
   "tache": "agents",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 11,
   "poids_general": 1.67,
   "difficulte": 104.8,
   "pente": 0.0578,
   "en_une_phrase": "Un agent dispose de dix heures et d'une carte graphique pour améliorer un petit modèle de langage en l'entraînant.",
   "notation": "Moyenne pondérée des résultats obtenus sur quatre petits modèles et sept tests (maths, code, santé, appel d'outils).",
   "limites": "Les auteurs ont relevé des tricheries d'agents : copie d'un modèle déjà entraîné, données fabriquées à partir des questions du test.",
   "mainteneur": "Institut ELLIS de Tübingen, Institut Max-Planck pour les systèmes intelligents et université de Tübingen",
   "url": "https://posttrainbench.com/",
   "verifie": true
  },
  {
   "id": "proofbench",
   "nom": "ProofBench",
   "tache": "maths",
   "etat": "sature",
   "echelle": "unite",
   "modeles": 70,
   "poids_general": 1.25,
   "difficulte": 87.9,
   "pente": 0.2574,
   "en_une_phrase": "Démontrer des théorèmes de niveau licence avancée et master dans le langage formel Lean 4, avec une preuve vérifiée par la machine.",
   "notation": "Part de théorèmes dont la preuve est acceptée par Lean, sur 100 problèmes privés, avec 40 tours d'échange au plus.",
   "limites": "Trois modèles atteignent 100 % : le test est saturé. Le fichier mêle des scores d'avant et d'après la correction d'août 2026, non comparables entre eux.",
   "mainteneur": "Vals AI",
   "url": "https://www.vals.ai/benchmarks/proof_bench",
   "verifie": true
  },
  {
   "id": "remote_labor_index",
   "nom": "Remote Labor Index",
   "tache": "agents",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 13,
   "poids_general": 1.67,
   "difficulte": 107.9,
   "pente": 0.1478,
   "en_une_phrase": "240 vraies missions de freelance (développement, design, architecture, analyse de données, animation vidéo) à livrer de bout en bout.",
   "notation": "Part de missions dont le livrable serait accepté par un client, au niveau attendu d'un professionnel payé.",
   "limites": "Scores très bas, 21 % au mieux, donc peu de nuances entre modèles. Une quinzaine de modèles seulement.",
   "mainteneur": "Center for AI Safety et Scale AI",
   "url": "https://www.remotelabor.ai/",
   "verifie": true
  },
  {
   "id": "scicode",
   "nom": "SciCode",
   "tache": "code",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 120,
   "poids_general": 1.15,
   "difficulte": 83.2,
   "pente": 0.034,
   "en_une_phrase": "Traduire un savoir scientifique en code Python : des problèmes de recherche en physique, chimie, biologie et mathématiques, découpés en étapes.",
   "notation": "Part des sous-problèmes dont le code passe les tests.",
   "limites": "Le score par sous-problème est plus flatteur que la réussite d'un problème entier. Les chiffres sont mesurés par Artificial Analysis, dans ses propres conditions.",
   "mainteneur": "Équipe SciCode (collectif de scientifiques) ; mesures d'Artificial Analysis",
   "url": "https://scicode-bench.github.io/",
   "verifie": true
  },
  {
   "id": "scienceqa",
   "nom": "ScienceQA",
   "tache": "autre",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 23,
   "poids_general": 0,
   "difficulte": 4.3,
   "pente": 0.0455,
   "en_une_phrase": "Des questions de sciences de niveau école et collège, à choix multiples, souvent accompagnées d'une image ou d'un schéma.",
   "notation": "Part de bonnes réponses à choix multiples.",
   "limites": "La plupart des résultats concernent des modèles de recherche entraînés spécialement sur ce jeu, peu comparables aux assistants grand public.",
   "mainteneur": "Lu et al. (2022)",
   "url": "https://scienceqa.github.io/",
   "verifie": true
  },
  {
   "id": "simplebench",
   "nom": "SimpleBench",
   "tache": "raisonnement",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 82,
   "poids_general": 1.67,
   "difficulte": 82.2,
   "pente": 0.0714,
   "en_une_phrase": "213 questions pièges de bon sens, sur l'espace, le temps et les relations sociales, qu'un adulte réussit dans 84 % des cas.",
   "notation": "Part de bonnes réponses à six choix, en moyenne sur cinq passages ; le hasard donne 17 %.",
   "limites": "L'essentiel des questions est privé, ce qui limite les fuites mais interdit toute vérification. Les meilleurs modèles rejoignent le niveau humain mesuré.",
   "mainteneur": "Équipe SimpleBench (chaîne YouTube AI Explained)",
   "url": "https://simple-bench.com/",
   "verifie": true
  },
  {
   "id": "simpleqa_verified",
   "nom": "SimpleQA Verified",
   "tache": "donnees",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 73,
   "poids_general": 0,
   "difficulte": 87.4,
   "pente": 0.062,
   "en_une_phrase": "1 000 questions factuelles courtes et précises (politique, sciences, arts, sport, géographie) pour voir si le modèle sait ou invente.",
   "notation": "Part de réponses jugées correctes par un modèle correcteur, qui distingue aussi les erreurs et les refus de répondre.",
   "limites": "Le score global traite un refus prudent comme une erreur, alors que la tendance à s'abstenir varie beaucoup d'un modèle à l'autre.",
   "mainteneur": "Google DeepMind pour le jeu de questions ; Epoch AI pour l'évaluation",
   "url": "https://epoch.ai/benchmarks/simpleqa-verified",
   "verifie": true
  },
  {
   "id": "spatialviz_bench",
   "nom": "SpatialViz-Bench",
   "tache": "vision",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 8,
   "poids_general": 0,
   "difficulte": 108.1,
   "pente": 0.0119,
   "en_une_phrase": "1 180 questions de visualisation dans l'espace : rotation mentale, pliage, coupe d'objets, mécanismes en mouvement.",
   "notation": "Part de bonnes réponses à choix multiples ; les humains font environ 82 %.",
   "limites": "Huit modèles seulement, recopiés de l'article d'origine de 2025, sans mise à jour depuis.",
   "mainteneur": "Auteurs de l'article SpatialViz-Bench (2025)",
   "url": "https://arxiv.org/abs/2507.07610",
   "verifie": true
  },
  {
   "id": "superglue",
   "nom": "SuperGLUE",
   "tache": "autre",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 8,
   "poids_general": 0,
   "difficulte": -40.9,
   "pente": 0.024,
   "en_une_phrase": "Huit exercices de compréhension de texte en anglais : répondre par oui ou non, trouver à quoi renvoie un pronom, relier cause et effet.",
   "notation": "Score global qui résume les résultats des huit exercices.",
   "limites": "Test de 2019, vite dépassé par les modèles. Seuls une dizaine d'anciens modèles y figurent.",
   "mainteneur": "Wang et al. (2019)",
   "url": "https://super.gluebenchmark.com/",
   "verifie": true
  },
  {
   "id": "surface_evolver_bench",
   "nom": "Surface Evolver Bench",
   "tache": "sciences",
   "etat": "sature",
   "echelle": "unite",
   "modeles": 25,
   "poids_general": 2,
   "difficulte": 80.7,
   "pente": 0.1157,
   "en_une_phrase": "Écrire les fichiers d'entrée du logiciel de physique Surface Evolver pour simuler des surfaces liquides : gouttes, angles de contact, gravité.",
   "notation": "Note moyenne avec points partiels sur 16 tâches : fichier valide, simulation qui tourne, grandeurs physiques conformes à la référence.",
   "limites": "Seulement 16 tâches, un seul passage par tâche et un projet tenu par une seule personne : les petits écarts ne sont pas significatifs.",
   "mainteneur": "Yann Henon (projet personnel)",
   "url": "https://yhenon.github.io/surface-evolver-llm-eval/",
   "verifie": true
  },
  {
   "id": "swe_bench_verified",
   "nom": "SWE-bench Verified",
   "tache": "code",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 32,
   "poids_general": 1.15,
   "difficulte": 62.2,
   "pente": 0.0535,
   "en_une_phrase": "Corriger de vrais bugs signalés sur GitHub dans des projets Python connus, puis faire passer les tests du projet.",
   "notation": "Part des 484 tickets résolus, c'est-à-dire dont les tests passent, dans le harnais d'Epoch (terminal et éditeur de fichiers).",
   "limites": "Les dépôts sont publics et anciens, donc en partie mémorisés. Epoch estime que 5 à 10 % des tickets sont ambigus, et le harnais d'un éditeur peut donner d'autres chiffres.",
   "mainteneur": "Epoch AI pour l'évaluation ; sélection validée par OpenAI à partir de SWE-bench",
   "url": "https://epoch.ai/benchmarks/swe-bench-verified",
   "verifie": true
  },
  {
   "id": "terminal_bench",
   "nom": "Terminal-Bench 2.0",
   "tache": "code",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 45,
   "poids_general": 1.15,
   "difficulte": 78.1,
   "pente": 0.1242,
   "en_une_phrase": "Mener à bien des tâches dans un terminal : comprendre le système, utiliser les programmes disponibles, enchaîner les commandes jusqu'au résultat.",
   "notation": "Part de tâches réussies, en moyenne sur plusieurs passages ; chaque ligne associe un modèle et un harnais (Claude Code, Codex CLI, Terminus).",
   "limites": "Le harnais compte autant que le modèle : un même modèle change de score selon l'agent qui le pilote. Les données suivent la version 2.0, déjà remplacée sur le site officiel.",
   "mainteneur": "Stanford et Laude Institute",
   "url": "https://www.tbench.ai/",
   "verifie": true
  },
  {
   "id": "the_agent_company",
   "nom": "TheAgentCompany",
   "tache": "agents",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 14,
   "poids_general": 0,
   "difficulte": 76.3,
   "pente": 0.1024,
   "en_une_phrase": "175 tâches de bureau dans une fausse entreprise de logiciel : coder, gérer un projet, traiter des dossiers de RH ou de finance.",
   "notation": "Part de tâches entièrement accomplies ; un second score accorde des points partiels par étape franchie.",
   "limites": "Peu de modèles testés, et aucun sorti après septembre 2025 dans les données d'Epoch.",
   "mainteneur": "Université Carnegie Mellon",
   "url": "https://the-agent-company.com/",
   "verifie": true
  },
  {
   "id": "triviaqa",
   "nom": "TriviaQA",
   "tache": "autre",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 38,
   "poids_general": 0,
   "difficulte": -88.5,
   "pente": 0.0109,
   "en_une_phrase": "Des questions de culture générale écrites par des amateurs de quiz, à réponse courte.",
   "notation": "Part de réponses exactement identiques à la réponse attendue.",
   "limites": "Test de 2017, largement mémorisé par les modèles. Les résultats viennent d'articles aux réglages variés.",
   "mainteneur": "Joshi et al. (université de Washington, 2017)",
   "url": "https://nlp.cs.washington.edu/triviaqa/",
   "verifie": true
  },
  {
   "id": "vending_bench_2",
   "nom": "Vending-Bench 2",
   "tache": "agents",
   "etat": "actif",
   "echelle": "dollars",
   "modeles": 56,
   "poids_general": 1.67,
   "difficulte": 87.5,
   "pente": 0.0389,
   "en_une_phrase": "Gérer seul un distributeur automatique simulé pendant un an : stocks, prix, négociation avec les fournisseurs, imprévus.",
   "notation": "Solde du compte en dollars à la fin de l'année simulée, en moyenne sur cinq parties.",
   "limites": "Un seul scénario simulé. Andon Labs estime qu'une bonne stratégie humaine atteindrait environ 63 000 dollars, quatre fois le meilleur modèle.",
   "mainteneur": "Andon Labs",
   "url": "https://andonlabs.com/evals/vending-bench-2",
   "verifie": true
  },
  {
   "id": "videomme",
   "nom": "Video-MME",
   "tache": "vision",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 50,
   "poids_general": 0,
   "difficulte": 38.9,
   "pente": 0.0293,
   "en_une_phrase": "2 700 questions à choix multiples sur 900 vidéos, de moins de deux minutes à une heure.",
   "notation": "Part de bonnes réponses sans les sous-titres ; le hasard donne 25 %.",
   "limites": "Beaucoup de lignes concernent des modèles de recherche, et le nombre d'images transmises varie d'un modèle à l'autre. Aucun modèle sorti après juin 2025.",
   "mainteneur": "Équipe Video-MME (auteurs de l'article de 2024)",
   "url": "https://video-mme.github.io/home_page.html#leaderboard",
   "verifie": true
  },
  {
   "id": "vpct",
   "nom": "VPCT (Visual Physics Comprehension Test)",
   "tache": "vision",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 28,
   "poids_general": 0,
   "difficulte": 81.4,
   "pente": 0.2425,
   "en_une_phrase": "100 schémas où une bille roule sur des rampes : prédire dans lequel des trois seaux elle va tomber.",
   "notation": "Part de bonnes réponses ; le hasard donne 33 %, les trois humains testés ont fait 100 %.",
   "limites": "Tâche unique et très étroite, tenue par une seule personne. Elle teste l'intuition physique sur un schéma, rien d'autre.",
   "mainteneur": "Chase Brower (projet personnel)",
   "url": "https://cbrower.dev/vpct",
   "verifie": true
  },
  {
   "id": "weirdml",
   "nom": "WeirdML (v2)",
   "tache": "code",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 129,
   "poids_general": 1.15,
   "difficulte": 74.6,
   "pente": 0.0591,
   "en_une_phrase": "Écrire du code PyTorch pour des problèmes d'apprentissage automatique inhabituels : reconnaître des formes, classer des chiffres, prédire l'issue de parties d'échecs.",
   "notation": "Précision moyenne obtenue par le code du modèle, exécuté dans un environnement isolé, avec cinq tentatives par tâche.",
   "limites": "Version remplacée en septembre 2026 par un nouveau jeu de tâches. Ses scores ne se comparent pas à ceux de WeirdML v3.",
   "mainteneur": "Håvard Tveit Ihle",
   "url": "https://htihle.github.io/weirdml.html",
   "verifie": true
  },
  {
   "id": "weirdml_v3",
   "nom": "WeirdML v3",
   "tache": "code",
   "etat": "actif",
   "echelle": "unite",
   "modeles": 11,
   "poids_general": 1.15,
   "difficulte": 102.6,
   "pente": 0.1953,
   "en_une_phrase": "11 problèmes d'apprentissage automatique et d'analyse de données inhabituels : l'agent explore des données inconnues et construit un programme qui les traite.",
   "notation": "Score de 0 à 1 qui récompense à la fois le résultat final et la rapidité à l'atteindre, mesurée en jetons consommés.",
   "limites": "Onze modèles seulement à ce stade. Les scores ne se comparent pas à ceux de WeirdML v2, et le harnais (Claude Code, Codex CLI) varie selon le modèle.",
   "mainteneur": "Håvard Tveit Ihle",
   "url": "https://htihle.github.io/weirdml.html",
   "verifie": true
  },
  {
   "id": "winogrande",
   "nom": "WinoGrande",
   "tache": "autre",
   "etat": "archive",
   "echelle": "unite",
   "modeles": 77,
   "poids_general": 0,
   "difficulte": 9.1,
   "pente": 0.0198,
   "en_une_phrase": "Trouver à quoi renvoie un pronom ambigu dans une phrase, ce qui demande du bon sens et une connaissance du monde.",
   "notation": "Part de bonnes réponses entre deux choix ; le hasard donne 50 %.",
   "limites": "Test de 2019 saturé. Les scores viennent d'articles aux réglages variés.",
   "mainteneur": "Allen Institute for AI (Sakaguchi et al., 2019)",
   "url": "https://winogrande.allenai.org/",
   "verifie": true
  }
 ]
}
