À quoi il sert
Sur Quelle IA, Arena, questions en français sert à noter la tâche Français : c'est l'un de ses 10 benchmarks. Il départage surtout les modèles dont le score IA approche 71.
Sur Quelle IA, Arena, questions en français sert à noter la tâche Français : c'est l'un de ses 10 benchmarks. Il départage surtout les modèles dont le score IA approche 71.
Un score Elo calculé sur les seuls duels en français.
Pour le calcul, un Elo devient une probabilité de victoire face à un niveau de référence, ici 1 426 Elo. Un écart de 100 points donne environ 64 % de chances de l'emporter.
Moins de votes que le classement général, donc des marges plus larges. Mesure une préférence.
Arena (ex LMArena).
arena.ai/leaderboard/text/french · tâche Français · 224 modèles mesurés
En tête : Muse Spark 1.3, 1 536,6 Elo
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 1 426 Elo a un score IA d'environ 71. Le meilleur, Muse Spark 1.3, atteint 1 536,6 Elo.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
2,5 %du score général. Arena, questions en français porte 25 % de la tâche Français (10 % du score général), que se partagent 10 benchmarks.
En couleur, la tâche Français dans le score général. En noir, la part d'Arena, questions en français.