Aller au contenu
EN 4 QUESTIONSTrouver mon modèle
Catalogue des benchmarks

98 benchmarks

Un benchmarkBenchmarkUne série d'épreuves identiques pour tous les modèles, qui donne un score comparable. actif mesure encore les modèles récents. SaturéSaturationUn benchmark est saturé quand les meilleurs modèles y obtiennent presque le maximum., il ne départage plus les meilleurs. ArchivéArchivéUn benchmark est archivé quand il n'a plus mesuré de modèle récent depuis six mois. Il sort du calcul du score., il sort du calcul du score.

Les 98 benchmarks suivis par Quelle IA, édition du 28 septembre 2026
En une phraseÉtat
Chess Puzzlesepoch.ai100 positions d'échecs inédites où il faut trouver le seul meilleur coup, celui que donne le moteur Stockfish.136 modèlesActif
LMCAconceptualreasoning.aiJuger la qualité d'arguments en philosophie, en théorie de la décision et en sûreté de l'IA, comme le ferait un expert.130 modèlesActif
SimpleBenchsimple-bench.com213 questions pièges de bon sens, sur l'espace, le temps et les relations sociales, qu'un adulte réussit dans 84 % des cas.82 modèlesActif
ForecastBenchforecastbench.orgPrédire des événements à venir (marchés de prédiction, indicateurs économiques, conflits) en donnant une probabilité.77 modèlesActif
Mystery Game Puzzlesepoch.ai100 positions d'un jeu dont Epoch tait le nom, décrites en texte, où le modèle doit trouver le meilleur coup.69 modèlesActif
EnigmaEvallabs.scale.com1 184 énigmes de chasses aux énigmes, du niveau débutant au MIT Mystery Hunt, mêlant texte et images et exigeant de longues déductions.41 modèlesActif
DTBenchconceptualreasoning.ai407 questions de théorie de la décision sur des dilemmes de type Newcomb, où le choix d'un agent renseigne sur celui de ses semblables.168 modèlesSaturé
ARC-AGI-1arcprize.orgDes puzzles de grilles colorées : déduire une règle à partir de quelques exemples et l'appliquer à une nouvelle grille.82 modèlesSaturé
ARC-AGI-2arcprize.orgDes puzzles de grilles plus durs que ceux d'ARC-AGI-1, où chaque règle combine plusieurs idées ; des humains ont résolu chacun d'eux.80 modèlesSaturé
LiveBench, raisonnementlivebench.aiDes énigmes logiques et des déductions dont les questions sont renouvelées régulièrement.48 modèlesArchivé
Arena, questions de codearena.aiLes duels à l'aveugle d'Arena sur des questions de programmation.275 modèlesActif
WeirdML (v2)htihle.github.ioÉcrire du code PyTorch pour des problèmes d'apprentissage automatique inhabituels : reconnaître des formes, classer des chiffres, prédire l'issue de parties d'échecs.129 modèlesActif
SciCodescicode-bench.github.ioTraduire un savoir scientifique en code Python : des problèmes de recherche en physique, chimie, biologie et mathématiques, découpés en étapes.120 modèlesActif
Terminal-Bench 2.0tbench.aiMener à bien des tâches dans un terminal : comprendre le système, utiliser les programmes disponibles, enchaîner les commandes jusqu'au résultat.45 modèlesActif
FrontierCodecognition.comProduire, pour un vrai ticket d'un projet open source, un correctif assez propre pour être accepté par les responsables du projet.37 modèlesActif
SWE-bench Verifiedepoch.aiCorriger de vrais bugs signalés sur GitHub dans des projets Python connus, puis faire passer les tests du projet.32 modèlesActif
DeepSWEdeepswe.datacurve.ai113 tâches de développement longues et inédites, dans 91 dépôts open source actifs et cinq langages.26 modèlesActif
GSOgso-bench.github.ioAccélérer un vrai logiciel open source : le modèle reçoit le code et un test de performance, et doit égaler l'optimisation d'un expert.26 modèlesActif
GBAEvalgbaeval.comÉcrire de zéro, en 24 heures au plus, un émulateur de Game Boy Advance en Rust et WebAssembly.23 modèlesActif
FrontierSWEfrontierswe.com34 chantiers logiciels de très longue haleine : réécrire git en Zig, décoder la parole dans des signaux cérébraux, entraîner un modèle météo.16 modèlesActif
CursorBenchcursor.comDes tâches tirées de vraies sessions de l'éditeur Cursor : comprendre un dépôt, trouver un bug, modifier plusieurs fichiers, relire du code.13 modèlesActif
WeirdML v3htihle.github.io11 problèmes d'apprentissage automatique et d'analyse de données inhabituels : l'agent explore des données inconnues et construit un programme qui les traite.11 modèlesActif
MirrorCodeepoch.aiRéécrire de zéro un programme complet (utilitaire Unix, interpréteur, compresseur) sans voir son code, en reproduisant exactement son comportement.9 modèlesActif
Aider Polyglotaider.chat225 exercices de programmation difficiles d'Exercism, en six langages, à résoudre en modifiant directement les fichiers.54 modèlesArchivé
LiveBench, codelivebench.aiDes exercices de programmation récents, tirés de concours publiés après la sortie des modèles.48 modèlesArchivé
Vending-Bench 2andonlabs.comGérer seul un distributeur automatique simulé pendant un an : stocks, prix, négociation avec les fournisseurs, imprévus.56 modèlesActif
METR Time Horizons (taux de réussite)metr.orgDes tâches de logiciel, d'apprentissage automatique et de cybersécurité, dont on connaît la durée pour un professionnel humain.41 modèlesActif
BALROGbalrogai.comJouer à six jeux, du simple BabyAI au redoutable NetHack, qui demandent d'explorer, de planifier et de tenir sur la durée.37 modèlesActif
APEX-Agentsmercor.com480 missions de banque d'affaires, de conseil et de droit des sociétés, à mener dans des outils de bureau : tableurs, présentations, messagerie.34 modèlesActif
DeepResearch Benchevals.futuresearch.ai91 tâches de recherche sur le web : trouver un chiffre, compiler un jeu de données, vérifier une affirmation, retrouver une source.24 modèlesActif
EBR-bench (Earthborne Rangers)epoch.aiLe modèle rejoue dix fois un jeu de société complexe, Earthborne Rangers, pour voir s'il s'améliore avec l'expérience.23 modèlesActif
Remote Labor Indexremotelabor.ai240 vraies missions de freelance (développement, design, architecture, analyse de données, animation vidéo) à livrer de bout en bout.13 modèlesActif
PostTrainBenchposttrainbench.comUn agent dispose de dix heures et d'une carte graphique pour améliorer un petit modèle de langage en l'entraînant.11 modèlesActif
OSWorld 2.0osworld-v2.xlang.ai108 longues tâches sur un vrai ordinateur, dans des logiciels professionnels, qui prennent environ une heure et demie à une personne compétente.9 modèlesActif
TheAgentCompanythe-agent-company.com175 tâches de bureau dans une fausse entreprise de logiciel : coder, gérer un projet, traiter des dossiers de RH ou de finance.14 modèlesArchivé
GDPvalevals.openai.comDes tâches réelles de 44 métiers (finance, santé, administration, industrie) dont le livrable est un document, un tableur ou une présentation.11 modèlesArchivé
OSWorldos-world.github.ioAccomplir des tâches sur un vrai ordinateur : manipuler des fichiers, régler une application, enchaîner plusieurs logiciels.9 modèlesArchivé
Arena, textearena.aiDes internautes posent leur question à deux modèles anonymes et votent pour la meilleure réponse.277 modèlesActif
Arena, questions de mathsarena.aiLes duels à l'aveugle d'Arena sur des questions de mathématiques.269 modèlesActif
FrontierMath, paliers 1 à 3 (v2)epoch.ai295 problèmes de mathématiques inédits et corrigés en 2026, du niveau licence avancée à celui d'un chercheur.77 modèlesActif
FrontierMath, paliers 1 à 3 (version 2025)epoch.aiEnviron 300 problèmes de mathématiques inédits, écrits par des mathématiciens, qui demandent chacun plusieurs heures à un spécialiste.70 modèlesActif
FrontierMath, palier 4 (version 2025)epoch.aiUne cinquantaine de problèmes de niveau recherche, les plus durs de FrontierMath, qui peuvent occuper un mathématicien plusieurs jours.55 modèlesActif
FrontierMath Erdősepoch.ai68 conjectures de Paul Erdős que personne n'a résolues, à démontrer ou à réfuter par une preuve formelle en Lean.5 modèlesActif
OTIS Mock AIME 2024-2025epoch.ai45 problèmes de concours de mathématiques, plus durs que MATH Level 5, dont la réponse est un entier entre 0 et 999.190 modèlesSaturé
ProofBenchvals.aiDémontrer des théorèmes de niveau licence avancée et master dans le langage formel Lean 4, avec une preuve vérifiée par la machine.70 modèlesSaturé
FrontierMath, palier 4 (v2)epoch.ai43 problèmes de niveau recherche, corrigés en 2026, qui peuvent occuper un mathématicien professionnel plusieurs jours.59 modèlesSaturé
MATH Level 5epoch.aiLes 1 324 problèmes les plus durs du jeu MATH, tirés de concours de lycée américains comme l'AMC et l'AIME.94 modèlesArchivé
GSM8Kgithub.comDes problèmes d'arithmétique de niveau école et collège, rédigés en langage courant, à résoudre en quelques étapes de calcul.82 modèlesArchivé
LiveBench, mathématiqueslivebench.aiDes problèmes de mathématiques récents, de niveau concours et olympiades.48 modèlesArchivé
Arena, questions d'expertsarena.aiLes duels à l'aveugle d'Arena sur des questions de niveau expert.263 modèlesActif
GPQA Diamondepoch.aiDes questions à choix multiples de biologie, chimie et physique, écrites par des docteurs et trop dures pour un non-spécialiste.208 modèlesActif
CritPtartificialanalysis.ai71 défis de physique de niveau recherche, comparables à un premier projet de thèse, écrits par plus de 50 physiciens.129 modèlesActif
Humanity's Last Examlastexam.ai2 500 questions de niveau expert dans plus de cent disciplines, écrites par près de mille chercheurs pour mettre les modèles en échec.44 modèlesActif
Surface Evolver Benchyhenon.github.ioÉcrire les fichiers d'entrée du logiciel de physique Surface Evolver pour simuler des surfaces liquides : gouttes, angles de contact, gravité.25 modèlesSaturé
Arena, questions en françaisarena.aiLes duels à l'aveugle d'Arena, restreints aux questions posées en français.224 modèlesActif
EuroEval, ScaLA (grammaire)euroeval.comLe modèle doit dire si une phrase française est correcte ou si elle a été abîmée.136 modèlesActif
EuroEval, ELTeC (noms propres)euroeval.comLe modèle repère les personnes, les lieux et les organisations dans un texte en français.134 modèlesActif
EuroEval, FQuAD (compréhension)euroeval.comLe modèle lit un texte en français et répond à une question dont la réponse s'y trouve.134 modèlesActif
EuroEval, HellaSwag (bon sens)euroeval.comLe modèle choisit la suite la plus plausible d'une situation décrite en français.134 modèlesActif
compar:IAcomparia.beta.gouv.frL'arène publique du ministère de la Culture : deux modèles anonymes répondent, l'internaute vote, presque toujours en français.114 modèlesActif
EuroEval, OrangeSum (résumé)euroeval.comLe modèle résume un article de presse en français.69 modèlesActif
EuroEval, INCLUDE (connaissances)euroeval.comDes questions à choix multiples de connaissances, posées en français.64 modèlesActif
EuroEval, MultiLoKo (connaissances locales)euroeval.comDes questions de culture propre aux pays francophones, posées en français.64 modèlesActif
EuroEval, Allociné (sentiment)euroeval.comLe modèle dit si une critique de film en français est positive ou négative.134 modèlesSaturé
Arena, visionarena.aiDes duels à l'aveugle où la question porte sur une image fournie par l'internaute.121 modèlesActif
Furniture Assemblyepoch.aiRegarder la photo d'un meuble IKEA monté et dire, notice à l'appui, si le montage est correct et à quelle étape s'est glissée l'erreur.28 modèlesActif
Blueprint-Bench 2andonlabs.comDessiner le plan en 2D d'un appartement à partir d'une vingtaine de photos : pièces, portes, tailles relatives.26 modèlesActif
Video-MMEvideo-mme.github.io2 700 questions à choix multiples sur 900 vidéos, de moins de deux minutes à une heure.50 modèlesArchivé
VPCT (Visual Physics Comprehension Test)cbrower.dev100 schémas où une bille roule sur des rampes : prédire dans lequel des trois seaux elle va tomber.28 modèlesArchivé
GeoBenchgeobench.orgDeviner où une photo de rue a été prise, comme au jeu GeoGuessr, à partir des panneaux, de la végétation ou de l'architecture.27 modèlesArchivé
CadEvalwillpatrick.xyzÉcrire le code OpenSCAD d'une pièce en 3D décrite en texte, de la plus simple à celle qui enchaîne cinq opérations.15 modèlesArchivé
SpatialViz-Bencharxiv.org1 180 questions de visualisation dans l'espace : rotation mentale, pliage, coupe d'objets, mécanismes en mouvement.8 modèlesArchivé
MindCubemind-cube.github.ioReconstituer mentalement une scène à partir de quelques photos prises sous des angles différents, et dire ce qu'on verrait en se déplaçant.5 modèlesArchivé
Arena, écriture créativearena.aiLes duels à l'aveugle d'Arena sur des demandes d'écriture : récits, poèmes, dialogues.276 modèlesActif
Lech Mazur Writinggithub.comÉcrire de courtes nouvelles de 400 à 500 mots qui intègrent dix éléments imposés : personnage, objet, lieu, époque, ton.44 modèlesArchivé
Code Arena, WebDevarena.aiDeux modèles construisent le même site ou la même application web, l'internaute vote pour le meilleur résultat.114 modèlesActif
SimpleQA Verifiedepoch.ai1 000 questions factuelles courtes et précises (politique, sciences, arts, sport, géographie) pour voir si le modèle sait ou invente.73 modèlesActif
GDP.pdfsurgehq.ai100 questions sur de vrais documents PDF professionnels (finance, santé, droit, ingénierie) : tableaux, schémas, formulaires, clauses de contrat.30 modèlesActif
CL-benchclbench.comApprendre un savoir nouveau fourni dans la consigne (un droit fictif, les règles d'un jeu inventé) et l'appliquer aussitôt.20 modèlesActif
CL-bench Lifeclbench.comRaisonner à partir de traces désordonnées de la vie courante : conversations, notes éparses, historiques d'activité.14 modèlesActif
Fiction.LiveBenchfiction.liveRépondre à des questions sur de longues histoires : qui sait quoi, dans quel ordre, ce qui est sous-entendu.57 modèlesArchivé
ExploitBenchexploitbench.aiExploiter de vraies failles déjà corrigées du moteur JavaScript de Chrome, de l'accès au code vulnérable jusqu'à l'exécution de code arbitraire.9 modèlesActif
Cybenchcybench.github.io40 épreuves de piratage tirées de compétitions professionnelles : cryptographie, failles web, rétro-ingénierie, analyse de traces.21 modèlesArchivé
MMLUgithub.comDes milliers de questions à choix multiples sur 57 matières, du lycée au niveau professionnel : droit, médecine, histoire, physique.127 modèlesArchivé
WinoGrandewinogrande.allenai.orgTrouver à quoi renvoie un pronom ambigu dans une phrase, ce qui demande du bon sens et une connaissance du monde.77 modèlesArchivé
ARC (AI2 Reasoning Challenge)allenai.orgDes questions de sciences de niveau école et collège, à choix multiples, choisies pour résister à une simple recherche de mots-clés.76 modèlesArchivé
BoolQgithub.comRépondre par oui ou par non à une vraie question d'internaute, à partir d'un court passage de texte.76 modèlesArchivé
HellaSwagrowanzellers.comChoisir la suite la plus plausible d'une courte scène du quotidien parmi quatre propositions, dont trois pièges écrits par une machine.75 modèlesArchivé
PIQAarxiv.orgChoisir, entre deux façons de faire, celle qui marche dans le monde physique pour un problème de tous les jours.59 modèlesArchivé
LiveBenchlivebench.aiUn test généraliste aux questions renouvelées régulièrement : raisonnement, code, maths, analyse de données, langue et respect des consignes.48 modèlesArchivé
BIG-Bench Hard (BBH)github.com23 exercices de logique et de raisonnement en plusieurs étapes, retenus en 2022 parce que les modèles y échouaient.45 modèlesArchivé
OpenBookQAallenai.orgDes questions de sciences élémentaires qui demandent de combiner un fait du cours avec du bon sens.42 modèlesArchivé
TriviaQAnlp.cs.washington.eduDes questions de culture générale écrites par des amateurs de quiz, à réponse courte.38 modèlesArchivé
LAMBADAarxiv.orgDeviner le dernier mot d'un passage de roman, ce qui exige d'avoir suivi tout le paragraphe.26 modèlesArchivé
ScienceQAscienceqa.github.ioDes questions de sciences de niveau école et collège, à choix multiples, souvent accompagnées d'une image ou d'un schéma.23 modèlesArchivé
ANLI (Adversarial NLI)github.comDire si une phrase découle d'une autre, la contredit ou ne permet pas de conclure, sur des exemples écrits pour piéger les modèles.11 modèlesArchivé
SuperGLUEsuper.gluebenchmark.comHuit exercices de compréhension de texte en anglais : répondre par oui ou non, trouver à quoi renvoie un pronom, relier cause et effet.8 modèlesArchivé
CommonsenseQA 2.0allenai.github.ioDes affirmations de bon sens sur les objets, les situations sociales et les causes, à juger vraies ou fausses.6 modèlesArchivé

98 benchmarks affichés sur 98 · triés par tâche, puis par état

Télécharger la liste en CSV →Comment un benchmark entre dans le score →Les mots du classement →