- 1Que veut dire le score ?
- Le score IA est une estimation du niveau d'un modèle, toutes tâches confondues. L'échelle est fixée une fois pour toutes : 100 est le score qu'obtenait Claude Opus 5.5, le meilleur modèle au lancement du site, le 28 septembre 2026, et 50 celui de GPT-4o de novembre 2024. Un modèle plus fort que le meilleur du lancement dépasse 100.
- 2Que veut dire la marge ?
- La marge est l'intervalle dans lequel le score se trouve, avec une confiance de 90 %. Elle réunit deux incertitudes : ce que le score deviendrait avec un autre tirage des benchmarks du modèle, et le bruit de mesure. Moins un modèle est mesuré, plus elle est large. Pour Qwen 3.8 27B : 82,4, de 77,5 à 87,3.
- 3Que veut dire ex æquo ?
- Deux modèles dont les marges se recouvrent sont ex æquo : l'écart entre leurs scores est plus petit que l'incertitude. Le classement les range par groupes, et un groupe réunit les modèles dont la marge recouvre celle de son premier. Qwen 3.8 27B est 49e sur 246, dans le groupe 7, qui compte 16 modèles.
- 4Que mesure la couverture ?
- La couverture est la part du poids des tâches où le modèle a au moins une mesure. Les dix tâches pèsent, sur 100 : raisonnement 15, code 15, agents 15, usage 10, maths 10, sciences 10, français 10, vision 5, écriture 5, web 5. Qwen 3.8 27B couvre 85 % de ce poids avec 23 mesures : il lui manque agents.
- 5Pourquoi un modèle est-il provisoire ?
- Un score est provisoire quand il repose sur trop peu de choses : moins de quatre mesures, moins de 50 % du poids des tâches couvert, ou moins de deux sources indépendantes. Le modèle garde son score et sa marge, mais il n'a pas de rang. Dans l'édition du 28 septembre 2026, 246 modèles sont classés sur 592 ; les 346 autres sont provisoires ou historiques.