# La démarche : comment on fabrique un score

> Sept sources publiques, 98 benchmarks, 592 modèles : comment Quelle IA collecte les classements, calcule le score IA et sa marge, et ce qu'il ne sait pas encore. Édition du 28 septembre 2026.

Page : https://quelleia.com/demarche/
Auteur : Ulrich Rozier (https://ulrichrozier.com). Méthode version 0.1, mise à jour avec l'édition du 28 septembre 2026.

Quelle IA ne mesure rien lui-même. Le site réunit les classements publics, les relie et les explique. Pour le montrer, la page suit un modèle réel du début à la fin : [Qwen 3.8 27B](https://quelleia.com/modeles/qwen-3-8-27b.md).

## L'édition en chiffres

- 7 sources
- 98 benchmarks
- 11 682 mesures
- 592 modèles
- 6 934 mesures retenues pour le calcul, 246 modèles classés, 60 benchmarks qui comptent dans le score

## 1. L'objectif : aider à choisir un modèle

Un benchmark ne regarde qu'un aspect : du code, des maths, des duels de préférence. Un modèle excellent sur l'un peut être moyen sur l'autre. Le score IA réunit toutes ces mesures en une estimation, avec sa marge.

Qwen 3.8 27B, benchmark par benchmark :

- Code Arena, WebDev : 1 590,4 Elo
- EuroEval, Allociné : 95,5 %
- DTBench : 88 %
- EuroEval, FQuAD : 69,6 %

Quatre échelles différentes : impossible de les additionner telles quelles.

## 2. La collecte : sept sources, chaque semaine

Chaque semaine, le site relève les classements publiés par sept sources. 11 682 mesures entrent dans l'édition du 28 septembre 2026. Pour Qwen 3.8 27B, on en retient 23.

| Source | Ce qu'elle apporte | Mesures rattachées à un modèle | État | Adresse |
| --- | --- | --- | --- | --- |
| Epoch AI | Benchmarks d'évaluation | 6 259 | à jour | https://epoch.ai/benchmarks |
| Arena | Duels à l'aveugle | 2 094 | à jour | https://arena.ai/leaderboard |
| compar:IA | Arène publique en français | 117 | à jour | https://comparia.beta.gouv.fr |
| EuroEval | Tests en français | 1 214 | à jour | https://euroeval.com |
| models.dev | Prix, contexte et réflexion des modèles | fiches des modèles | à jour | https://models.dev |
| OpenRouter | Modèles accessibles par API | fiches des modèles | à jour | https://openrouter.ai/models |
| Arena, images et vidéo | Fiches des modèles | fiches des modèles | à jour | https://arena.ai/leaderboard/text-to-image |

Quatre sources apportent les mesures, deux complètent les fiches : prix, contexte, liens.

**[Artificial Analysis](https://artificialanalysis.ai/), à part du score.** Artificial Analysis évalue les modèles d'IA de son côté et publie son propre indice, avec des mesures de vitesse et des prix. Avec son accord, donné le 1er octobre 2026, Quelle IA relève ces résultats chaque lundi et les montre sur la fiche de chaque modèle concerné, avec la mention « Source : Artificial Analysis » et un lien vers leur page. Ils ne comptent pas dans le score IA et ne servent à aucun classement du site.

Quand une source tombe en panne ou change sa page, la dernière valeur connue reste affichée, avec sa date et la mention « non mis à jour depuis le ».

## 3. L'appariement : un modèle, plusieurs noms

Chaque classement écrit les noms à sa façon. Le site les réconcilie, puis distingue les configurations : niveau de réflexion, harnais.

Exemple : `claude-opus-5.5-high`, `claude-opus-5-5_max`, `anthropic/claude-opus-5.5` désignent un seul modèle, Claude Opus 5.5 (4 configurations : réflexion élevée, maximale, avec Claude Code, avec proximus).

Sur 11 682 mesures lues, 9 684 sont rattachées à un modèle. Le calcul en garde 6 934 : la meilleure configuration de chaque modèle sur chaque benchmark.

## 4. Le calcul : quatre étapes, un score

1. **Même échelle.** Chaque benchmark a son unité : pourcentage, Elo, note sur 10. On les ramène à une seule échelle, où 50 vaut GPT-4o de novembre 2024 et 100 le meilleur modèle au lancement.
2. **Absences.** Un modèle absent d'un benchmark n'y reçoit pas zéro. Le score s'appuie sur les benchmarks où il est mesuré, en tenant compte de la difficulté de chacun.
3. **Fraîcheur.** Un benchmark actif pèse pleinement. Un benchmark saturé compte encore, mais il départage mal les meilleurs. Un benchmark archivé sort du calcul.
4. **Marge.** Moins un modèle est mesuré, plus sa marge est large. Deux modèles dont les marges se recouvrent sont ex æquo.

En pratique, le calcul se fait en deux temps. D'abord, tous les benchmarks sont étalonnés ensemble : chacun reçoit une difficulté et une pente sur une échelle commune, de sorte que le résultat publié s'explique par l'écart entre le niveau du modèle et la difficulté du benchmark. C'est la même famille de méthode que l'indice ECI d'Epoch AI. Ensuite, chaque modèle est noté sur ses seules mesures : son score est le niveau qui les explique le mieux.

### Pour Qwen 3.8 27B : ce que suggère chaque mesure

8 des 23 mesures, du niveau suggéré le plus bas au plus haut :

| Benchmark | Tâche | État | Niveau suggéré |
| --- | --- | --- | --- |
| EuroEval, Allociné | Français | saturé | 63,6 |
| EuroEval, FQuAD | Français | actif | 67,9 |
| EuroEval, INCLUDE | Français | actif | 80,3 |
| DTBench | Raisonnement | saturé | 81,8 |
| EuroEval, HellaSwag | Français | actif | 82,1 |
| Code Arena, WebDev | Web | actif | 90,2 |
| EuroEval, ScaLA | Français | actif | 108,3 |
| EuroEval, ELTeC | Français | actif | 123,8 |

Les mesures ne disent pas toutes la même chose : ici, de 63,6 (EuroEval Allociné, saturé, pastille en pointillé) à 123,8 (EuroEval ELTeC). Le score retient 82,4, de 77,5 à 87,3. Agents n'est pas mesuré : cette tâche ne compte pas, elle ne vaut jamais zéro.

## 5. La preuve : on cache, on devine, on compare

On masque des scores connus, puis on demande à la méthode de les retrouver. Elle se trompe de 6,9 points en moyenne. Une simple moyenne se trompe de 23.

Erreur moyenne sur des résultats masqués, en points sur 100 au benchmark (banc du 30 septembre 2026) :

- Méthode Quelle IA : 6,9
- Modèle additif : 9,8
- Simple moyenne : 23

Autre contrôle : sur les données d'Epoch AI, le classement obtenu suit celui de leur indice ECI, avec une corrélation de rang de 0,9999.

## 6. Les limites : ce que le site ne sait pas

- Les benchmarks mesurent la version complète d'un modèle. La version allégée qui tourne sur un PC fait un peu moins bien.
- Une mesure reprise d'un classement tiers ou d'une annonce d'éditeur compte aujourd'hui autant qu'une mesure indépendante. Chacune renvoie à sa source, pour en juger.
- Données et Sécurité n'ont pas encore de sources assez solides : ce sont des dossiers, sans score.
- Aucune publicité ni partenariat dans les classements. Chaque chiffre renvoie à sa source.

## Journal de la méthode

- **Version 0.1, 28 septembre 2026.** Première version : dix tâches pondérées 15, 15, 15, 10, 10, 10, 10, 5, 5, 5. Ancrage : 50 pour GPT-4o de novembre 2024, 100 pour le meilleur modèle au lancement. Intervalle à 90 %.

Chaque changement de formule sera daté et justifié ici, et marqué d'une rupture sur les courbes.

## Comment lire un score

Exemple : Qwen 3.8 27B obtient 82,4, avec une marge de 77,5 à 87,3. Rang 49, groupe 7. Couverture 85 %, 23 mesures.

**Que veut dire le score ?** Le score IA est une estimation du niveau d'un modèle, toutes tâches confondues. L'échelle est fixée une fois pour toutes : 100 est le score qu'obtenait Claude Opus 5.5, le meilleur modèle au lancement du site, le 28 septembre 2026, et 50 celui de GPT-4o de novembre 2024. Un modèle plus fort que le meilleur du lancement dépasse 100.

**Que veut dire la marge ?** La marge est l'intervalle dans lequel le score se trouve, avec une confiance de 90 %. Elle réunit deux incertitudes : ce que le score deviendrait avec un autre tirage des benchmarks du modèle, et le bruit de mesure. Moins un modèle est mesuré, plus elle est large. Pour Qwen 3.8 27B : 82,4, de 77,5 à 87,3.

**Que veut dire ex æquo ?** Deux modèles dont les marges se recouvrent sont ex æquo : l'écart entre leurs scores est plus petit que l'incertitude. Le classement les range par groupes, et un groupe réunit les modèles dont la marge recouvre celle de son premier. Qwen 3.8 27B est 49e sur 246, dans le groupe 7, qui compte 16 modèles.

**Que mesure la couverture ?** La couverture est la part du poids des tâches où le modèle a au moins une mesure. Les dix tâches pèsent, sur 100 : raisonnement 15, code 15, agents 15, usage 10, maths 10, sciences 10, français 10, vision 5, écriture 5, web 5. Qwen 3.8 27B couvre 85 % de ce poids avec 23 mesures : il lui manque agents.

**Pourquoi un modèle est-il provisoire ?** Un score est provisoire quand il repose sur trop peu de choses : moins de quatre mesures, moins de 50 % du poids des tâches couvert, ou moins de deux sources indépendantes. Le modèle garde son score et sa marge, mais il n'a pas de rang. Dans l'édition du 28 septembre 2026, 246 modèles sont classés sur 592 ; les 346 autres sont provisoires ou historiques.

### Poids des tâches dans le score général

| Tâche | Poids |
| --- | --- |
| Raisonnement | 15 % |
| Code | 15 % |
| Agents | 15 % |
| Usage courant | 10 % |
| Mathématiques | 10 % |
| Sciences et savoir expert | 10 % |
| Français | 10 % |
| Vision et multimodal | 5 % |
| Écriture | 5 % |
| Web et interfaces | 5 % |

## En bref

**Comment le score IA est-il calculé ?** Chaque semaine, Quelle IA relève les classements publics de quatre sources (Epoch AI, Arena, compar:IA et EuroEval). Tous les benchmarks sont étalonnés ensemble : chacun reçoit une difficulté et une pente sur une échelle commune, selon la même famille de méthode que l'indice ECI d'Epoch AI. Le score d'un modèle est le niveau qui explique le mieux ses propres mesures, et seulement elles : une absence de mesure ne vaut jamais zéro. L'édition du 28 septembre 2026 note 592 modèles à partir de 98 benchmarks.

**D'où viennent les données ?** De sept sources publiques, relevées chaque semaine. Quatre apportent les mesures : Epoch AI, Arena, compar:IA et EuroEval. Deux complètent les fiches des modèles (prix, contexte, liens) : models.dev et OpenRouter. Quelle IA ne mesure rien lui-même. L'édition du 28 septembre 2026 lit 11 682 mesures et en retient 6 934.

**La méthode a-t-elle été vérifiée ?** Oui, de deux façons, le 30 septembre 2026. Sur des résultats de benchmarks masqués puis devinés, elle se trompe de 6,9 points sur 100 en moyenne, contre 9,8 pour un modèle additif et 23 pour la simple moyenne du modèle. Et sur les données d'Epoch AI, son classement suit celui de l'indice ECI, avec une corrélation de rang de 0,9999.

**Un modèle tout juste sorti est-il pénalisé ?** Très peu. Un modèle de tête qui vient de sortir, encore peu mesuré, est sous-estimé de 0,3 à 1 point, moins que sa marge. Un modèle que personne n'a encore mesuré n'a pas de score : il est listé en attente, comme 8 modèles de cette édition.

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
