À quoi il sert
Sur Quelle IA, compar:IA sert à noter la tâche Français : c'est l'un de ses 10 benchmarks. Il départage surtout les modèles dont le score IA approche 74.
FrançaisFiche benchmark · Ministère de la Culture, beta.gouv.fr · comparia.beta.gouv.fr
L'arène publique du ministère de la Culture : deux modèles anonymes répondent, l'internaute vote, presque toujours en français.
Sur Quelle IA, compar:IA sert à noter la tâche Français : c'est l'un de ses 10 benchmarks. Il départage surtout les modèles dont le score IA approche 74.
Un score Elo calculé sur les duels, avec sa marge. Environ neuf questions sur dix sont en français.
Pour le calcul, un Elo devient une probabilité de victoire face à un niveau de référence, ici 1 025 Elo. Un écart de 100 points donne environ 64 % de chances de l'emporter.
Moins de duels par modèle que sur Arena, donc des marges larges. Peu de modèles très récents.
Ministère de la Culture, beta.gouv.fr.
comparia.beta.gouv.fr · tâche Français · 114 modèles mesurés
En tête : Claude Opus 5.5, 1 210,0 Elo
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 1 025 Elo a un score IA d'environ 74. Le meilleur, Claude Opus 5.5, atteint 1 210,0 Elo.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
2,5 %du score général. compar:IA porte 25 % de la tâche Français (10 % du score général), que se partagent 10 benchmarks.
En couleur, la tâche Français dans le score général. En noir, la part de compar:IA.