À quoi il sert
Sur Quelle IA, Arena, questions de code sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 70.
Sur Quelle IA, Arena, questions de code sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 70.
Un score Elo calculé sur les seuls duels portant sur du code.
Pour le calcul, un Elo devient une probabilité de victoire face à un niveau de référence, ici 1 447 Elo. Un écart de 100 points donne environ 64 % de chances de l'emporter.
Le votant juge une réponse à l'œil, sans exécuter le code.
Arena (ex LMArena).
arena.ai/leaderboard · tâche Code · 275 modèles mesurés
En tête : Gemini 4 Argon, 1 559,1 Elo
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 1 447 Elo a un score IA d'environ 70. Le meilleur, Gemini 4 Argon, atteint 1 559,1 Elo.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,15 %du score général. Arena, questions de code porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
En couleur, la tâche Code dans le score général. En noir, la part d'Arena, questions de code.