À quoi il sert
Sur Quelle IA, Code Arena, WebDev sert à noter la tâche Web et interfaces : c'est son seul benchmark. Il départage surtout les modèles dont le score IA approche 80.
Sur Quelle IA, Code Arena, WebDev sert à noter la tâche Web et interfaces : c'est son seul benchmark. Il départage surtout les modèles dont le score IA approche 80.
Un score Elo calculé sur des duels où le résultat s'affiche et s'utilise.
Pour le calcul, un Elo devient une probabilité de victoire face à un niveau de référence, ici 1 440 Elo. Un écart de 100 points donne environ 64 % de chances de l'emporter.
Juge le rendu et l'usage immédiat. La qualité du code et sa maintenance ne sont pas évaluées.
Arena (ex LMArena).
arena.ai/leaderboard/code/webdev · tâche Web · 114 modèles mesurés
En tête : Claude Opus 5.5, 1 817,8 Elo
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 1 440 Elo a un score IA d'environ 80. Le meilleur, Claude Opus 5.5, atteint 1 817,8 Elo.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
5 %du score général. Code Arena, WebDev est le seul benchmark de la tâche Web et interfaces (5 % du score général) : il en porte tout le poids.
En couleur, la tâche Web et interfaces dans le score général. En noir, la part de Code Arena, WebDev.
Aller plus loinTous les benchmarks →Comment le score IA est calculé →