Aller au contenu
EN 4 QUESTIONSTrouver mon modèle
Mon classement

Réglez vos priorités

Le classement par défaut est un choix éditorial. Déplacez les curseurs : le classement se recalcule à vue.

Poids des tâches

15
15
15
10
10
10
10
5
5
5

Votre classement

RÉSULTAT APPROCHÉ
RangModèleScoreÉcart au rang du site
1Claude Opus 5.5100,5Même rang qu'au classement du site
2GPT-6 Astra99,0Même rang qu'au classement du site
3Claude Sonnet 5.5mesuré sur 75 % du poids98,3Même rang qu'au classement du site
4Claude Fable 5.196,6Même rang qu'au classement du site
5Claude Fable 594,92 rangs de mieux qu'au classement du site
6Claude Opus 594,81 rang de moins qu'au classement du site
7GPT-5.6 Sol94,11 rang de mieux qu'au classement du site
8GPT-6 Solmesuré sur 85 % du poids91,72 rangs de moins qu'au classement du site
9GPT-5.591,42 rangs de mieux qu'au classement du site
10Gemini 3.7 Flash91,36 rangs de mieux qu'au classement du site

Calcul approché : moyenne pondérée des scores par tâche mesurés. La dernière colonne compare au rang du site. La barre va de 70 à 110. Un pourcentage après un nom : la part du poids choisi où le modèle est mesuré.

246 modèles classés, 30 écartés : mesurés sur moins de 50 % du poids choisi.

Comment c'est calculé

Votre score est la moyenne des scores par tâche du modèle, pondérée par vos curseurs, sur les seules tâches où il est mesuré. Avec les poids du site, il approche le score IAScore IAL'estimation du niveau d'un modèle, calculée à partir de tous les benchmarks où il a été mesuré. général sans lui être égal : 0,9 point d'écart en moyenne, 4,9 au plus. Avec une couvertureCouvertureLa part des tâches sur lesquelles le modèle a été mesuré. de moins de 50 % du poids choisi, un modèle est écarté : son score serait provisoireProvisoireUn score est provisoire tant qu'il repose sur trop peu de mesures pour donner un rang : moins de 4 mesures, moins de 50 % du poids des tâches couvert, ou moins de 2 sources indépendantes..

En bref

Comment classer les modèles de langage selon mes besoins ?
Donnez à chacune des dix tâches un poids de 0 à 30 : raisonnement, code, agents, usage, maths, sciences, français, vision, écriture et web. Le score de chaque modèle est la moyenne de ses scores par tâche, pondérée par vos poids, et le classement se réordonne aussitôt. Avec les poids du site (raisonnement 15, code 15, agents 15, usage 10, maths 10, sciences 10, français 10, vision 5, écriture 5, web 5), dans l'édition du 28 septembre 2026, Claude Opus 5.5 arrive premier avec 100,5, devant GPT-6 Astra (99,0) et Claude Sonnet 5.5 (98,3). Avec le préréglage « Je code » (code 30, agents 20, raisonnement 10, web 10), Claude Opus 5.5 est premier avec 100,5. Avec le préréglage « J'écris en français » (français 30, écriture 20, usage 10), Claude Opus 5.5 est premier avec 104,1.
Pourquoi mon classement diffère-t-il du classement général ?
Le score IA du classement général est une estimation conjointe : toutes les mesures d'un modèle sont lues ensemble, en tenant compte de la difficulté de chaque benchmark. Ici, le score est une moyenne pondérée des scores par tâche, plus simple et donc approchée. Avec les poids du site, il approche le score général sans lui être égal : sur les 246 modèles classés de l'édition du 28 septembre 2026, l'écart est de 0,9 point en moyenne et de 4,9 points au plus (GPT-5 mini), et 8 des 10 premiers sont les mêmes. La dernière colonne du tableau donne l'écart de rang avec le classement du site.
Pourquoi certains modèles sortent-ils de mon classement ?
Un modèle n'est noté que sur les tâches où il est mesuré : une absence ne vaut jamais zéro. S'il est mesuré sur moins de 50 % du poids que vous avez choisi, son score reposerait sur trop peu de choses et il est écarté, comme le site tient pour provisoire un modèle qui couvre moins de 50 % du poids de ses tâches. Dans l'édition du 28 septembre 2026, 276 modèles peuvent entrer dans votre classement : les 246 classés du site et 30 autres, assez mesurés mais sur des tâches qui pèsent trop peu dans les poids du site. Les modèles qui ont moins de quatre mesures ou moins de deux sources indépendantes restent provisoires quels que soient les poids, et les scores historiques n'entrent pas.

Voir aussi : le classement général avec ses marges d'erreur, le calcul du score général, Trouver mon modèle en quatre questions et le comparateur pour mettre deux modèles côte à côte.