98 benchmarks
Un benchmarkBenchmarkUne série d'épreuves identiques pour tous les modèles, qui donne un score comparable. actif mesure encore les modèles récents. SaturéSaturationUn benchmark est saturé quand les meilleurs modèles y obtiennent presque le maximum., il ne départage plus les meilleurs. ArchivéArchivéUn benchmark est archivé quand il n'a plus mesuré de modèle récent depuis six mois. Il sort du calcul du score., il sort du calcul du score.
| En une phrase | État | |||
|---|---|---|---|---|
| Chess Puzzlesepoch.ai | 100 positions d'échecs inédites où il faut trouver le seul meilleur coup, celui que donne le moteur Stockfish. | 136 modèles | Actif | |
| LMCAconceptualreasoning.ai | Juger la qualité d'arguments en philosophie, en théorie de la décision et en sûreté de l'IA, comme le ferait un expert. | 130 modèles | Actif | |
| SimpleBenchsimple-bench.com | 213 questions pièges de bon sens, sur l'espace, le temps et les relations sociales, qu'un adulte réussit dans 84 % des cas. | 82 modèles | Actif | |
| ForecastBenchforecastbench.org | Prédire des événements à venir (marchés de prédiction, indicateurs économiques, conflits) en donnant une probabilité. | 77 modèles | Actif | |
| Mystery Game Puzzlesepoch.ai | 100 positions d'un jeu dont Epoch tait le nom, décrites en texte, où le modèle doit trouver le meilleur coup. | 69 modèles | Actif | |
| EnigmaEvallabs.scale.com | 1 184 énigmes de chasses aux énigmes, du niveau débutant au MIT Mystery Hunt, mêlant texte et images et exigeant de longues déductions. | 41 modèles | Actif | |
| DTBenchconceptualreasoning.ai | 407 questions de théorie de la décision sur des dilemmes de type Newcomb, où le choix d'un agent renseigne sur celui de ses semblables. | 168 modèles | Saturé | |
| ARC-AGI-1arcprize.org | Des puzzles de grilles colorées : déduire une règle à partir de quelques exemples et l'appliquer à une nouvelle grille. | 82 modèles | Saturé | |
| ARC-AGI-2arcprize.org | Des puzzles de grilles plus durs que ceux d'ARC-AGI-1, où chaque règle combine plusieurs idées ; des humains ont résolu chacun d'eux. | 80 modèles | Saturé | |
| LiveBench, raisonnementlivebench.ai | Des énigmes logiques et des déductions dont les questions sont renouvelées régulièrement. | 48 modèles | Archivé | |
| Arena, questions de codearena.ai | Les duels à l'aveugle d'Arena sur des questions de programmation. | 275 modèles | Actif | |
| WeirdML (v2)htihle.github.io | Écrire du code PyTorch pour des problèmes d'apprentissage automatique inhabituels : reconnaître des formes, classer des chiffres, prédire l'issue de parties d'échecs. | 129 modèles | Actif | |
| SciCodescicode-bench.github.io | Traduire un savoir scientifique en code Python : des problèmes de recherche en physique, chimie, biologie et mathématiques, découpés en étapes. | 120 modèles | Actif | |
| Terminal-Bench 2.0tbench.ai | Mener à bien des tâches dans un terminal : comprendre le système, utiliser les programmes disponibles, enchaîner les commandes jusqu'au résultat. | 45 modèles | Actif | |
| FrontierCodecognition.com | Produire, pour un vrai ticket d'un projet open source, un correctif assez propre pour être accepté par les responsables du projet. | 37 modèles | Actif | |
| SWE-bench Verifiedepoch.ai | Corriger de vrais bugs signalés sur GitHub dans des projets Python connus, puis faire passer les tests du projet. | 32 modèles | Actif | |
| DeepSWEdeepswe.datacurve.ai | 113 tâches de développement longues et inédites, dans 91 dépôts open source actifs et cinq langages. | 26 modèles | Actif | |
| GSOgso-bench.github.io | Accélérer un vrai logiciel open source : le modèle reçoit le code et un test de performance, et doit égaler l'optimisation d'un expert. | 26 modèles | Actif | |
| GBAEvalgbaeval.com | Écrire de zéro, en 24 heures au plus, un émulateur de Game Boy Advance en Rust et WebAssembly. | 23 modèles | Actif | |
| FrontierSWEfrontierswe.com | 34 chantiers logiciels de très longue haleine : réécrire git en Zig, décoder la parole dans des signaux cérébraux, entraîner un modèle météo. | 16 modèles | Actif | |
| CursorBenchcursor.com | Des tâches tirées de vraies sessions de l'éditeur Cursor : comprendre un dépôt, trouver un bug, modifier plusieurs fichiers, relire du code. | 13 modèles | Actif | |
| WeirdML v3htihle.github.io | 11 problèmes d'apprentissage automatique et d'analyse de données inhabituels : l'agent explore des données inconnues et construit un programme qui les traite. | 11 modèles | Actif | |
| MirrorCodeepoch.ai | Réécrire de zéro un programme complet (utilitaire Unix, interpréteur, compresseur) sans voir son code, en reproduisant exactement son comportement. | 9 modèles | Actif | |
| Aider Polyglotaider.chat | 225 exercices de programmation difficiles d'Exercism, en six langages, à résoudre en modifiant directement les fichiers. | 54 modèles | Archivé | |
| LiveBench, codelivebench.ai | Des exercices de programmation récents, tirés de concours publiés après la sortie des modèles. | 48 modèles | Archivé | |
| Vending-Bench 2andonlabs.com | Gérer seul un distributeur automatique simulé pendant un an : stocks, prix, négociation avec les fournisseurs, imprévus. | 56 modèles | Actif | |
| METR Time Horizons (taux de réussite)metr.org | Des tâches de logiciel, d'apprentissage automatique et de cybersécurité, dont on connaît la durée pour un professionnel humain. | 41 modèles | Actif | |
| BALROGbalrogai.com | Jouer à six jeux, du simple BabyAI au redoutable NetHack, qui demandent d'explorer, de planifier et de tenir sur la durée. | 37 modèles | Actif | |
| APEX-Agentsmercor.com | 480 missions de banque d'affaires, de conseil et de droit des sociétés, à mener dans des outils de bureau : tableurs, présentations, messagerie. | 34 modèles | Actif | |
| DeepResearch Benchevals.futuresearch.ai | 91 tâches de recherche sur le web : trouver un chiffre, compiler un jeu de données, vérifier une affirmation, retrouver une source. | 24 modèles | Actif | |
| EBR-bench (Earthborne Rangers)epoch.ai | Le modèle rejoue dix fois un jeu de société complexe, Earthborne Rangers, pour voir s'il s'améliore avec l'expérience. | 23 modèles | Actif | |
| Remote Labor Indexremotelabor.ai | 240 vraies missions de freelance (développement, design, architecture, analyse de données, animation vidéo) à livrer de bout en bout. | 13 modèles | Actif | |
| PostTrainBenchposttrainbench.com | Un agent dispose de dix heures et d'une carte graphique pour améliorer un petit modèle de langage en l'entraînant. | 11 modèles | Actif | |
| OSWorld 2.0osworld-v2.xlang.ai | 108 longues tâches sur un vrai ordinateur, dans des logiciels professionnels, qui prennent environ une heure et demie à une personne compétente. | 9 modèles | Actif | |
| TheAgentCompanythe-agent-company.com | 175 tâches de bureau dans une fausse entreprise de logiciel : coder, gérer un projet, traiter des dossiers de RH ou de finance. | 14 modèles | Archivé | |
| GDPvalevals.openai.com | Des tâches réelles de 44 métiers (finance, santé, administration, industrie) dont le livrable est un document, un tableur ou une présentation. | 11 modèles | Archivé | |
| OSWorldos-world.github.io | Accomplir des tâches sur un vrai ordinateur : manipuler des fichiers, régler une application, enchaîner plusieurs logiciels. | 9 modèles | Archivé | |
| Arena, textearena.ai | Des internautes posent leur question à deux modèles anonymes et votent pour la meilleure réponse. | 277 modèles | Actif | |
| Arena, questions de mathsarena.ai | Les duels à l'aveugle d'Arena sur des questions de mathématiques. | 269 modèles | Actif | |
| FrontierMath, paliers 1 à 3 (v2)epoch.ai | 295 problèmes de mathématiques inédits et corrigés en 2026, du niveau licence avancée à celui d'un chercheur. | 77 modèles | Actif | |
| FrontierMath, paliers 1 à 3 (version 2025)epoch.ai | Environ 300 problèmes de mathématiques inédits, écrits par des mathématiciens, qui demandent chacun plusieurs heures à un spécialiste. | 70 modèles | Actif | |
| FrontierMath, palier 4 (version 2025)epoch.ai | Une cinquantaine de problèmes de niveau recherche, les plus durs de FrontierMath, qui peuvent occuper un mathématicien plusieurs jours. | 55 modèles | Actif | |
| FrontierMath Erdősepoch.ai | 68 conjectures de Paul Erdős que personne n'a résolues, à démontrer ou à réfuter par une preuve formelle en Lean. | 5 modèles | Actif | |
| OTIS Mock AIME 2024-2025epoch.ai | 45 problèmes de concours de mathématiques, plus durs que MATH Level 5, dont la réponse est un entier entre 0 et 999. | 190 modèles | Saturé | |
| ProofBenchvals.ai | Démontrer des théorèmes de niveau licence avancée et master dans le langage formel Lean 4, avec une preuve vérifiée par la machine. | 70 modèles | Saturé | |
| FrontierMath, palier 4 (v2)epoch.ai | 43 problèmes de niveau recherche, corrigés en 2026, qui peuvent occuper un mathématicien professionnel plusieurs jours. | 59 modèles | Saturé | |
| MATH Level 5epoch.ai | Les 1 324 problèmes les plus durs du jeu MATH, tirés de concours de lycée américains comme l'AMC et l'AIME. | 94 modèles | Archivé | |
| GSM8Kgithub.com | Des problèmes d'arithmétique de niveau école et collège, rédigés en langage courant, à résoudre en quelques étapes de calcul. | 82 modèles | Archivé | |
| LiveBench, mathématiqueslivebench.ai | Des problèmes de mathématiques récents, de niveau concours et olympiades. | 48 modèles | Archivé | |
| Arena, questions d'expertsarena.ai | Les duels à l'aveugle d'Arena sur des questions de niveau expert. | 263 modèles | Actif | |
| GPQA Diamondepoch.ai | Des questions à choix multiples de biologie, chimie et physique, écrites par des docteurs et trop dures pour un non-spécialiste. | 208 modèles | Actif | |
| CritPtartificialanalysis.ai | 71 défis de physique de niveau recherche, comparables à un premier projet de thèse, écrits par plus de 50 physiciens. | 129 modèles | Actif | |
| Humanity's Last Examlastexam.ai | 2 500 questions de niveau expert dans plus de cent disciplines, écrites par près de mille chercheurs pour mettre les modèles en échec. | 44 modèles | Actif | |
| Surface Evolver Benchyhenon.github.io | Écrire les fichiers d'entrée du logiciel de physique Surface Evolver pour simuler des surfaces liquides : gouttes, angles de contact, gravité. | 25 modèles | Saturé | |
| Arena, questions en françaisarena.ai | Les duels à l'aveugle d'Arena, restreints aux questions posées en français. | 224 modèles | Actif | |
| EuroEval, ScaLA (grammaire)euroeval.com | Le modèle doit dire si une phrase française est correcte ou si elle a été abîmée. | 136 modèles | Actif | |
| EuroEval, ELTeC (noms propres)euroeval.com | Le modèle repère les personnes, les lieux et les organisations dans un texte en français. | 134 modèles | Actif | |
| EuroEval, FQuAD (compréhension)euroeval.com | Le modèle lit un texte en français et répond à une question dont la réponse s'y trouve. | 134 modèles | Actif | |
| EuroEval, HellaSwag (bon sens)euroeval.com | Le modèle choisit la suite la plus plausible d'une situation décrite en français. | 134 modèles | Actif | |
| compar:IAcomparia.beta.gouv.fr | L'arène publique du ministère de la Culture : deux modèles anonymes répondent, l'internaute vote, presque toujours en français. | 114 modèles | Actif | |
| EuroEval, OrangeSum (résumé)euroeval.com | Le modèle résume un article de presse en français. | 69 modèles | Actif | |
| EuroEval, INCLUDE (connaissances)euroeval.com | Des questions à choix multiples de connaissances, posées en français. | 64 modèles | Actif | |
| EuroEval, MultiLoKo (connaissances locales)euroeval.com | Des questions de culture propre aux pays francophones, posées en français. | 64 modèles | Actif | |
| EuroEval, Allociné (sentiment)euroeval.com | Le modèle dit si une critique de film en français est positive ou négative. | 134 modèles | Saturé | |
| Arena, visionarena.ai | Des duels à l'aveugle où la question porte sur une image fournie par l'internaute. | 121 modèles | Actif | |
| Furniture Assemblyepoch.ai | Regarder la photo d'un meuble IKEA monté et dire, notice à l'appui, si le montage est correct et à quelle étape s'est glissée l'erreur. | 28 modèles | Actif | |
| Blueprint-Bench 2andonlabs.com | Dessiner le plan en 2D d'un appartement à partir d'une vingtaine de photos : pièces, portes, tailles relatives. | 26 modèles | Actif | |
| Video-MMEvideo-mme.github.io | 2 700 questions à choix multiples sur 900 vidéos, de moins de deux minutes à une heure. | 50 modèles | Archivé | |
| VPCT (Visual Physics Comprehension Test)cbrower.dev | 100 schémas où une bille roule sur des rampes : prédire dans lequel des trois seaux elle va tomber. | 28 modèles | Archivé | |
| GeoBenchgeobench.org | Deviner où une photo de rue a été prise, comme au jeu GeoGuessr, à partir des panneaux, de la végétation ou de l'architecture. | 27 modèles | Archivé | |
| CadEvalwillpatrick.xyz | Écrire le code OpenSCAD d'une pièce en 3D décrite en texte, de la plus simple à celle qui enchaîne cinq opérations. | 15 modèles | Archivé | |
| SpatialViz-Bencharxiv.org | 1 180 questions de visualisation dans l'espace : rotation mentale, pliage, coupe d'objets, mécanismes en mouvement. | 8 modèles | Archivé | |
| MindCubemind-cube.github.io | Reconstituer mentalement une scène à partir de quelques photos prises sous des angles différents, et dire ce qu'on verrait en se déplaçant. | 5 modèles | Archivé | |
| Arena, écriture créativearena.ai | Les duels à l'aveugle d'Arena sur des demandes d'écriture : récits, poèmes, dialogues. | 276 modèles | Actif | |
| Lech Mazur Writinggithub.com | Écrire de courtes nouvelles de 400 à 500 mots qui intègrent dix éléments imposés : personnage, objet, lieu, époque, ton. | 44 modèles | Archivé | |
| Code Arena, WebDevarena.ai | Deux modèles construisent le même site ou la même application web, l'internaute vote pour le meilleur résultat. | 114 modèles | Actif | |
| SimpleQA Verifiedepoch.ai | 1 000 questions factuelles courtes et précises (politique, sciences, arts, sport, géographie) pour voir si le modèle sait ou invente. | 73 modèles | Actif | |
| GDP.pdfsurgehq.ai | 100 questions sur de vrais documents PDF professionnels (finance, santé, droit, ingénierie) : tableaux, schémas, formulaires, clauses de contrat. | 30 modèles | Actif | |
| CL-benchclbench.com | Apprendre un savoir nouveau fourni dans la consigne (un droit fictif, les règles d'un jeu inventé) et l'appliquer aussitôt. | 20 modèles | Actif | |
| CL-bench Lifeclbench.com | Raisonner à partir de traces désordonnées de la vie courante : conversations, notes éparses, historiques d'activité. | 14 modèles | Actif | |
| Fiction.LiveBenchfiction.live | Répondre à des questions sur de longues histoires : qui sait quoi, dans quel ordre, ce qui est sous-entendu. | 57 modèles | Archivé | |
| ExploitBenchexploitbench.ai | Exploiter de vraies failles déjà corrigées du moteur JavaScript de Chrome, de l'accès au code vulnérable jusqu'à l'exécution de code arbitraire. | 9 modèles | Actif | |
| Cybenchcybench.github.io | 40 épreuves de piratage tirées de compétitions professionnelles : cryptographie, failles web, rétro-ingénierie, analyse de traces. | 21 modèles | Archivé | |
| MMLUgithub.com | Des milliers de questions à choix multiples sur 57 matières, du lycée au niveau professionnel : droit, médecine, histoire, physique. | 127 modèles | Archivé | |
| WinoGrandewinogrande.allenai.org | Trouver à quoi renvoie un pronom ambigu dans une phrase, ce qui demande du bon sens et une connaissance du monde. | 77 modèles | Archivé | |
| ARC (AI2 Reasoning Challenge)allenai.org | Des questions de sciences de niveau école et collège, à choix multiples, choisies pour résister à une simple recherche de mots-clés. | 76 modèles | Archivé | |
| BoolQgithub.com | Répondre par oui ou par non à une vraie question d'internaute, à partir d'un court passage de texte. | 76 modèles | Archivé | |
| HellaSwagrowanzellers.com | Choisir la suite la plus plausible d'une courte scène du quotidien parmi quatre propositions, dont trois pièges écrits par une machine. | 75 modèles | Archivé | |
| PIQAarxiv.org | Choisir, entre deux façons de faire, celle qui marche dans le monde physique pour un problème de tous les jours. | 59 modèles | Archivé | |
| LiveBenchlivebench.ai | Un test généraliste aux questions renouvelées régulièrement : raisonnement, code, maths, analyse de données, langue et respect des consignes. | 48 modèles | Archivé | |
| BIG-Bench Hard (BBH)github.com | 23 exercices de logique et de raisonnement en plusieurs étapes, retenus en 2022 parce que les modèles y échouaient. | 45 modèles | Archivé | |
| OpenBookQAallenai.org | Des questions de sciences élémentaires qui demandent de combiner un fait du cours avec du bon sens. | 42 modèles | Archivé | |
| TriviaQAnlp.cs.washington.edu | Des questions de culture générale écrites par des amateurs de quiz, à réponse courte. | 38 modèles | Archivé | |
| LAMBADAarxiv.org | Deviner le dernier mot d'un passage de roman, ce qui exige d'avoir suivi tout le paragraphe. | 26 modèles | Archivé | |
| ScienceQAscienceqa.github.io | Des questions de sciences de niveau école et collège, à choix multiples, souvent accompagnées d'une image ou d'un schéma. | 23 modèles | Archivé | |
| ANLI (Adversarial NLI)github.com | Dire si une phrase découle d'une autre, la contredit ou ne permet pas de conclure, sur des exemples écrits pour piéger les modèles. | 11 modèles | Archivé | |
| SuperGLUEsuper.gluebenchmark.com | Huit exercices de compréhension de texte en anglais : répondre par oui ou non, trouver à quoi renvoie un pronom, relier cause et effet. | 8 modèles | Archivé | |
| CommonsenseQA 2.0allenai.github.io | Des affirmations de bon sens sur les objets, les situations sociales et les causes, à juger vraies ou fausses. | 6 modèles | Archivé |
Aucun benchmark ne correspond à ces filtres.
98 benchmarks affichés sur 98 · triés par tâche, puis par état