Aller au contenu
EN 4 QUESTIONSTrouver mon modèle
Glossaire · 22 termes

Les mots du classement

Benchmark

Une série d'épreuves identiques pour tous les modèles, qui donne un score comparable.

ExempleLe plus suivi des 98 benchmarks du site, Arena, texte, a mesuré 277 modèles.

Les 98 benchmarks→

Score IA

L'estimation du niveau d'un modèle, calculée à partir de tous les benchmarks où il a été mesuré.

ExempleIl vaut 100 pour Claude Opus 5.5, le meilleur modèle au lancement du site, et 50 pour GPT-4o (Nov 2024). Une absence de mesure ne vaut jamais zéro.

Comment lire un score→

Marge d'erreur

L'intervalle où le vrai niveau du modèle a neuf chances sur dix de se trouver.

ExempleClaude Opus 5.5 obtient 99,9, avec une marge de 98,6 à 101,2.

Couverture

La part des tâches sur lesquelles le modèle a été mesuré.

ExempleClaude Sonnet 5.5 est mesuré sur 7 des 10 tâches, qui pèsent 75 % du score général.

Réflexion

Le temps de calcul que le modèle prend pour raisonner avant de répondre. Plus il réfléchit, mieux il répond et plus il coûte.

ExempleClaude Opus 5.5 se règle sur cinq niveaux de réflexion, de « faible » à « maximale ».

Harnais

L'outil qui entoure le modèle et lui donne des moyens d'agir, comme lire des fichiers ou lancer des commandes.

ExempleLes plus utilisés dans les mesures de cette édition : mini-SWE-agent, OpenHands et Terminus 2.

Poids ouverts

Le modèle se télécharge et peut tourner sur votre propre machine. À poids fermés, il ne s'utilise que par le service de son éditeur.

Exemple120 des 246 modèles classés ont des poids ouverts. Le mieux classé est MiMo-V2.6-Pro, au rang 13.

Les modèles ouverts→

Version allégée

Une copie compressée du modèle, qui tient dans moins de mémoire au prix d'une légère perte de qualité.

ExempleDeepSeek V4.1 Flash pèse 1 269,6 Go en version complète et 380,9 Go en version allégée à 4 bits.

Les modèles locaux→

Mémoire utile

La part de la mémoire d'une machine qu'un modèle peut vraiment occuper, une fois servis le système et l'affichage. C'est elle qui décide de ce qui tient.

ExempleSur une carte graphique de 16 Go, nous comptons 14,0 Go utiles ; sur un Mac de 24 Go, 17,8 Go.

Sur ma machine→

Mémoire unifiée

Une seule mémoire partagée par le processeur et le processeur graphique, comme sur un Mac ou un DGX Spark. Il y en a beaucoup, mais elle est plus lente que la mémoire d'une carte graphique.

ExempleUn Mac de 24 Go en compte 17,8 Go utiles, un DGX Spark 112,0 Go.

À mémoire égale→

Jeton

Le morceau de mot que le modèle lit et écrit. Les prix se comptent par million de jetons.

ExempleClaude Opus 5.5 coûte 4,00 € par million de jetons lus et 20,0 € par million de jetons écrits.

Fenêtre de contexte

La quantité de texte que le modèle peut garder en tête pendant une conversation.

ExempleClaude Opus 5.5 garde 1 000 000 jetons en tête, soit environ 750 000 mots.

Elo

Un score issu de duels, comme aux échecs. Battre un modèle fort rapporte plus que battre un modèle faible.

Exemple9 benchmarks du site notent en Elo, dont Arena, texte.

Saturation

Un benchmark est saturé quand les meilleurs modèles y obtiennent presque le maximum.

Exemple8 benchmarks sont saturés dans cette édition, dont OTIS Mock AIME 2024-2025, où le meilleur modèle atteint 100 %. Les meilleurs ne s'y départagent plus.

Contamination

Les questions d'un test ont circulé, et un modèle a pu les apprendre par cœur.

ExempleSur TriviaQA, la fiche du benchmark le signale : « Test de 2017, largement mémorisé par les modèles ».

Agent

Un modèle qui enchaîne seul plusieurs actions pour mener une tâche à bien.

ExempleLa tâche Agents repose sur 9 benchmarks actifs, dont Vending-Bench 2.

Le classement des agents→

Étalonnage

Le calcul de la difficulté de chaque benchmark, qui permet de comparer des tests différents.

ExemplePour Claude Opus 5.5, 31,2 % sur WeirdML v3 suggère un niveau de 98,6, quand 100 % sur OTIS Mock AIME 2024-2025, plus facile, suggère 93,8.

La démarche→

Ex æquo

Deux modèles sont ex æquo quand leurs marges d'erreur se recouvrent. L'écart entre eux est trop petit pour les départager.

ExempleClaude Opus 5.5, GPT-6 Astra et Claude Sonnet 5.5 partagent la première place de cette édition.

Le classement général→

Provisoire

Un score est provisoire tant qu'il repose sur trop peu de mesures pour donner un rang : moins de 4 mesures, moins de 50 % du poids des tâches couvert, ou moins de 2 sources indépendantes.

Exemple194 des 592 modèles notés ont un score provisoire dans cette édition.

Score historique

Le score d'un ancien modèle que plus aucun benchmark actif ne mesure. Il reste affiché pour mémoire, sans rang.

Exemple152 modèles ont un score historique dans cette édition, dont InstructGPT 175B.

Archivé

Un benchmark est archivé quand il n'a plus mesuré de modèle récent depuis six mois. Il sort du calcul du score.

Exemple33 benchmarks sur 98 sont archivés, dont MMLU.

Niveau suggéré

Le score IA qu'une mesure donnerait au modèle si elle était seule, compte tenu de la difficulté du benchmark. Le score général fait la synthèse de tous ces niveaux.

ExemplePour Claude Opus 5.5, 91,2 % sur FrontierMath, paliers 1 à 3 (v2) suggère un niveau de 99,7. Son score général est de 99,9.

Ces mots reviennent dans tout le site. Là où l'un d'eux apparaît surligné, sa définition s'ouvre sur place.

Comprendre la démarche →Les 98 benchmarks →