Aller au contenu
EN 4 QUESTIONSTrouver mon modèle
La démarche · méthode version 0.1

Comment on fabrique un score

Nous ne mesurons rien nous-mêmes. Nous réunissons les classements publics, nous les relions et nous les expliquons. Pour le montrer, suivonsSuivons un modèle réel du début à la fin : Qwen 3.8 27B.

Chapitre 1 · L'objectif

Aider à choisir un modèle

Un benchmark ne regarde qu'un aspect : du code, des maths, des duels de préférence. Un modèle excellent sur l'un peut être moyen sur l'autre. Le score IA réunit toutes ces mesures en une estimation, avec sa marge.

Qwen 3.8 27B, benchmark par benchmark

Quatre échelles différentes : impossible de les additionner telles quelles.

Chapitre 2 · La collecte

Sept sources, chaque semaine

Chaque semaine, le site relève les classements publiés par sept sources. 11 682 mesures entrent dans l'édition du 28 septembre 2026. Pour Qwen 3.8 27B, on en retient 23.

Quand une source tombe en panne ou change sa page, la dernière valeur connue reste affichée, avec sa date et la mention « non mis à jour depuis le ».

Quatre sources apportent les mesures, deux complètent les fiches : prix, contexte, liens.

Artificial Analysis, à part du score. Artificial Analysis évalue les modèles d'IA de son côté et publie son propre indice, avec des mesures de vitesse et des prix. Avec son accord, donné le 1er octobre 2026, Quelle IA relève ces résultats chaque lundi et les montre sur la fiche de chaque modèle concerné, avec la mention « Source : Artificial Analysis » et un lien vers leur page. Ils ne comptent pas dans le score IA et ne servent à aucun classement du site.

Chapitre 3 · L'appariement

Un modèle, plusieurs noms

Chaque classement écrit les noms à sa façon. Le site les réconcilie, puis distingue les configurations : niveau de réflexion, harnais.

Sur 11 682 mesures lues, 9 684 sont rattachées à un modèle. Le calcul en garde 6 934 : la meilleure configuration de chaque modèle sur chaque benchmark.

Claude Opus 5.54 configurations : réflexion élevée, maximale, avec Claude Code, avec proximus

Chapitre 4 · Le calcul

Quatre étapes, un score

  1. Étape 1 · Même échelle

    Chaque benchmark a son unité : pourcentage, Elo, note sur 10. On les ramène à une seule échelle, où 50 vaut GPT-4o de novembre 2024 et 100 le meilleur modèle au lancement.

  2. Étape 2 · Absences

    Un modèle absent d'un benchmark n'y reçoit pas zéro. Le score s'appuie sur les benchmarks où il est mesuré, en tenant compte de la difficulté de chacun.

  3. Étape 3 · Fraîcheur

    Un benchmark actif pèse pleinement. Un benchmark saturé compte encore, mais il départage mal les meilleurs. Un benchmark archivé sort du calcul.

  4. Étape 4 · Marge

    Moins un modèle est mesuré, plus sa marge est large. Deux modèles dont les marges se recouvrent sont ex æquo.

Pour Qwen 3.8 27B : ce que suggère chaque mesure8 des 23 mesures

Les mesures ne disent pas toutes la même chose : ici, de 63,6 (EuroEval Allociné, saturé, pastille en pointillé) à 123,8 (EuroEval ELTeC). Le score retient 82,4, de 77,5 à 87,3. Agents n'est pas mesuré : cette tâche ne compte pas, elle ne vaut jamais zéro.

Chapitre 5 · La preuve

On cache, on devine, on compare

On masque des scores connus, puis on demande à la méthode de les retrouver. Elle se trompe de 6,9 points en moyenne. Une simple moyenne se trompe de 23.

Autre contrôle : sur les données d'Epoch AI, le classement obtenu suit celui de leur indice ECI, avec une corrélation de rang de 0,9999.

  • Méthode Quelle IA6,9
  • Modèle additif9,8
  • Simple moyenne23
Erreur moyenne sur des résultats masqués, en points sur 100 au benchmark. Plus court, c'est mieux. Banc du 30 septembre 2026.

Chapitre 6 · Les limites

Ce que le site ne sait pas

  • Les benchmarks mesurent la version complète d'un modèle. La version allégée qui tourne sur un PC fait un peu moins bien.
  • Une mesure reprise d'un classement tiers ou d'une annonce d'éditeur compte aujourd'hui autant qu'une mesure indépendante. Chacune renvoie à sa source, pour en juger.
  • Données et Sécurité n'ont pas encore de sources assez solides : ce sont des dossiers, sans score.
  • Aucune publicité ni partenariat dans les classements. Chaque chiffre renvoie à sa source.
Signaler une erreur

Journal de la méthode

  1. V 0.1

    . Première version : dix tâches pondérées 15, 15, 15, 10, 10, 10, 10, 5, 5, 5. Ancrage : 50 pour GPT-4o de novembre 2024, 100 pour le meilleur modèle au lancement. Intervalle à 90 %.

Chaque changement de formule sera daté et justifié ici, et marqué d'une rupture sur les courbes.

Mode d'emploi · Lire un score

Comment lire un score

Un score ne se lit jamais seul. Voici celui de Qwen 3.8 27B dans l'édition du , avec tout ce qui l'accompagne.

Qwen 3.8 27B
1Que veut dire le score ?
Le score IA est une estimation du niveau d'un modèle, toutes tâches confondues. L'échelle est fixée une fois pour toutes : 100 est le score qu'obtenait Claude Opus 5.5, le meilleur modèle au lancement du site, le 28 septembre 2026, et 50 celui de GPT-4o de novembre 2024. Un modèle plus fort que le meilleur du lancement dépasse 100.
2Que veut dire la marge ?
La marge est l'intervalle dans lequel le score se trouve, avec une confiance de 90 %. Elle réunit deux incertitudes : ce que le score deviendrait avec un autre tirage des benchmarks du modèle, et le bruit de mesure. Moins un modèle est mesuré, plus elle est large. Pour Qwen 3.8 27B : 82,4, de 77,5 à 87,3.
3Que veut dire ex æquo ?
Deux modèles dont les marges se recouvrent sont ex æquo : l'écart entre leurs scores est plus petit que l'incertitude. Le classement les range par groupes, et un groupe réunit les modèles dont la marge recouvre celle de son premier. Qwen 3.8 27B est 49e sur 246, dans le groupe 7, qui compte 16 modèles.
4Que mesure la couverture ?
La couverture est la part du poids des tâches où le modèle a au moins une mesure. Les dix tâches pèsent, sur 100 : raisonnement 15, code 15, agents 15, usage 10, maths 10, sciences 10, français 10, vision 5, écriture 5, web 5. Qwen 3.8 27B couvre 85 % de ce poids avec 23 mesures : il lui manque agents.
5Pourquoi un modèle est-il provisoire ?
Un score est provisoire quand il repose sur trop peu de choses : moins de quatre mesures, moins de 50 % du poids des tâches couvert, ou moins de deux sources indépendantes. Le modèle garde son score et sa marge, mais il n'a pas de rang. Dans l'édition du 28 septembre 2026, 246 modèles sont classés sur 592 ; les 346 autres sont provisoires ou historiques.

En bref

Comment le score IA est-il calculé ?
Chaque semaine, Quelle IA relève les classements publics de quatre sources (Epoch AI, Arena, compar:IA et EuroEval). Tous les benchmarks sont étalonnés ensemble : chacun reçoit une difficulté et une pente sur une échelle commune, selon la même famille de méthode que l'indice ECI d'Epoch AI. Le score d'un modèle est le niveau qui explique le mieux ses propres mesures, et seulement elles : une absence de mesure ne vaut jamais zéro. L'édition du 28 septembre 2026 note 592 modèles à partir de 98 benchmarks.
D'où viennent les données ?
De sept sources publiques, relevées chaque semaine. Quatre apportent les mesures : Epoch AI, Arena, compar:IA et EuroEval. Deux complètent les fiches des modèles (prix, contexte, liens) : models.dev et OpenRouter. Quelle IA ne mesure rien lui-même. L'édition du 28 septembre 2026 lit 11 682 mesures et en retient 6 934.
La méthode a-t-elle été vérifiée ?
Oui, de deux façons, le 30 septembre 2026. Sur des résultats de benchmarks masqués puis devinés, elle se trompe de 6,9 points sur 100 en moyenne, contre 9,8 pour un modèle additif et 23 pour la simple moyenne du modèle. Et sur les données d'Epoch AI, son classement suit celui de l'indice ECI, avec une corrélation de rang de 0,9999.
Un modèle tout juste sorti est-il pénalisé ?
Très peu. Un modèle de tête qui vient de sortir, encore peu mesuré, est sous-estimé de 0,3 à 1 point, moins que sa marge. Un modèle que personne n'a encore mesuré n'a pas de score : il est listé en attente, comme 8 modèles de cette édition.

Pour aller plus loin : le classement, les benchmarks et leurs sources, le glossaire, les données et exports, ou cette page en texte.