Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

WebFiche benchmark · Arena (ex LMArena) · arena.ai

Code Arena, WebDev

Deux modèles construisent le même site ou la même application web, l'internaute vote pour le meilleur résultat.

À quoi il sert

Sur Quelle IA, Code Arena, WebDev sert à noter la tâche Web et interfaces : c'est son seul benchmark. Il départage surtout les modèles dont le score IA approche 80.

Comment c'est noté

Un score Elo calculé sur des duels où le résultat s'affiche et s'utilise.

Pour le calcul, un Elo devient une probabilité de victoire face à un niveau de référence, ici 1 440 Elo. Un écart de 100 points donne environ 64 % de chances de l'emporter.

Ce qu'il ne dit pas

Juge le rendu et l'usage immédiat. La qualité du code et sa maintenance ne sont pas évaluées.

Comment lire le score

114 modèles mesurés · 135 mesures

En tête : Claude Opus 5.5, 1 817,8 Elo

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 1 440 Elo a un score IA d'environ 80. Le meilleur, Claude Opus 5.5, atteint 1 817,8 Elo.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
1 018 Elo
Score IA 76niveau de Claude Sonnet 4.5
1 388 Elo
Score IA 100niveau de Claude Opus 5.5
1 733 Elo

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

5 %du score général. Code Arena, WebDev est le seul benchmark de la tâche Web et interfaces (5 % du score général) : il en porte tout le poids.

En couleur, la tâche Web et interfaces dans le score général. En noir, la part de Code Arena, WebDev.

Le classement du benchmark

Scores relevés sur arena.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Opus 5.5AnthropicMaximale1 817,8 Elo105,7
2GPT-6 AstraOpenAIMaximale1 789,1 Elo103,8
3GPT-6.1 SolOpenAIMaximale1 758,7 Elo101,7
4Claude Fable 5.1AnthropicMaximale1 750,7 Elo101,1
5Claude Sonnet 5.5AnthropicÉlevée1 708,7 Elo98,3
6Claude Opus 5Anthropic · 2 configurationsMaximale1 693,7 Elo97,3
7GPT-6 SolOpenAIMaximale1 689,3 Elo97,0
8Gemini 4 ArgonGoogle DeepMindÉlevée1 679,0 Elo96,3
9Qwen3.8 Max (0902)Alibaba · 2 configurationsMaximale1 671,2 Elo95,7
10Kimi K3Moonshot · poids ouvertsMaximale1 657,8 Elo94,8
114 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 114 →Replier le classement ↑
11Muse Spark 1.3Meta AI · 2 configurationsMaximale1 655,4 Elo94,6
12Qwen3.8 Flash NextAlibaba · poids ouvertsNon précisée1 637,8 Elo93,4
13Grok 4.7xAIMaximale1 636,3 Elo93,3
14Tencent Hy4 previewTencent · poids ouvertsNon précisée1 633,2 Elo93,1
15Claude Fable 5AnthropicÉlevée1 625,6 Elo92,6
16GLM-5.3Z.ai (Zhipu AI) · poids ouvertsMaximale1 622,0 Elo92,4
17Grok 4.6xAIÉlevée1 620,1 Elo92,2
18DeepSeek V4.1 FlashDeepSeek · poids ouvertsMaximale1 620,0 Elo92,2
19GPT-5.6 SolOpenAIMaximale1 619,3 Elo92,2
20MiMo-V2.6-ProXiaomi · poids ouvertsNon précisée1 618,5 Elo92,1
21GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsNon précisée1 614,8 Elo91,9
22GLM-5.2Z.ai (Zhipu AI) · poids ouvertsMaximale1 604,6 Elo91,2
23Gemini 3.7 FlashGoogle DeepMindÉlevée1 592,2 Elo90,3
24Qwen 3.8 27BAlibaba · poids ouvertsNon précisée1 590,4 Elo90,2
25Gemini 3.8 FlashGoogle DeepMindÉlevée1 582,7 Elo89,7
26DeepSeek-V4-ProDeepSeek · poids ouverts · 3 configurationsÉlevée1 582,3 Elo89,7
27GPT-6 LunaOpenAIMaximale1 581,9 Elo89,6
28DeepSeek-V4-FlashDeepSeek · poids ouverts · 2 configurationsÉlevée1 581,0 Elo89,6
29Step 5 PreviewStepFunÉlevée1 569,6 Elo88,8
30Claude Opus 4.7Anthropic · 2 configurationsÉlevée1 557,2 Elo88,0
31Claude Opus 4.8Anthropic · 2 configurationsÉlevée1 556,0 Elo87,9
32Grok 4.5xAINon précisée1 552,0 Elo87,6
33Claude Opus 4.6Anthropic · 2 configurationsÉlevée1 546,1 Elo87,2
34Muse Spark 1.1Meta AINon précisée1 541,9 Elo86,9
35Claude Sonnet 5AnthropicÉlevée1 539,5 Elo86,7
36Gemini 3.6 FlashGoogle DeepMindÉlevée1 536,3 Elo86,5
37Muse Spark 1.2Meta AINon précisée1 531,8 Elo86,2
38Claude Sonnet 4.6AnthropicNon précisée1 521,6 Elo85,5
39GPT-5.6 TerraOpenAIMaximale1 519,5 Elo85,4
40GPT-5.6 LunaOpenAIMaximale1 517,9 Elo85,3
41Qwen3.7-MaxAlibabaMaximale1 514,9 Elo85,1
42GPT-5.5OpenAI · 3 configurationsMaximale1 512,1 Elo84,9
43Kimi K2.6Moonshot · poids ouvertsNon précisée1 508,7 Elo84,6
44GLM-5.1Z.ai (Zhipu AI) · poids ouvertsNon précisée1 508,5 Elo84,6
45Hy3Tencent · poids ouvertsNon précisée1 508,1 Elo84,6
46Gemini 3.5 FlashGoogle DeepMind · 2 configurationsÉlevée1 499,1 Elo84,0
47Claude Opus 4.5Anthropic · 2 configurationsÉlevée1 493,4 Elo83,6
48MiniMax-M3MiniMax · poids ouvertsNon précisée1 482,4 Elo82,8
49Qwen 3.6 Max (Preview)AlibabaMaximale1 481,8 Elo82,8
50MiMo-V2.5-ProXiaomi · poids ouvertsNon précisée1 476,9 Elo82,5
51Kimi K2.7 CodeMoonshot · poids ouvertsNon précisée1 472,9 Elo82,2
52GPT-5.4OpenAI · 3 configurationsÉlevée1 465,3 Elo81,7
53Qwen 3.6 PlusAlibabaNon précisée1 460,6 Elo81,4
54Gemini 3.1 ProGoogle DeepMindNon précisée1 446,2 Elo80,4
55Gemini 3.5 Flash-LiteGoogle DeepMindNon précisée1 439,7 Elo79,9
56Gemini 3 ProGoogle DeepMindNon précisée1 438,9 Elo79,9
57Gemini 3 FlashGoogle DeepMind · 2 configurationsNon précisée1 438,7 Elo79,9
58MiMo-V2.5Xiaomi · poids ouvertsNon précisée1 437,7 Elo79,8
59Kimi K2.5Moonshot · poids ouvertsÉlevée1 435,8 Elo79,7
60GLM-4.7Z.ai (Zhipu AI) · poids ouvertsNon précisée1 434,5 Elo79,6
61GLM-5Z.ai (Zhipu AI) · poids ouvertsNon précisée1 434,0 Elo79,5
62MiMo-V2-ProXiaomiNon précisée1 432,9 Elo79,5
63GPT-5OpenAIMoyenne1 417,1 Elo78,4
64GPT-5.2OpenAINon précisée1 415,5 Elo78,3
65InklingThinking Machines · poids ouvertsNon précisée1 412,0 Elo78,0
66Inkling-SmallThinking Machines · poids ouvertsNon précisée1 408,3 Elo77,8
67GPT-5.3 CodexOpenAI · 2 configurationsNon précisée1 408,1 Elo77,8
68Kimi K2.5 InstantMoonshot · poids ouvertsNon précisée1 403,6 Elo77,5
69GLM-5V-TurboZ.ai (Zhipu AI)Non précisée1 399,8 Elo77,2
70Qwen3.5 397B-A17BAlibaba · poids ouvertsNon précisée1 399,6 Elo77,2
71MiniMax-M2.7MiniMax · poids ouvertsNon précisée1 397,1 Elo77,0
72GPT-5.4 MiniOpenAIÉlevée1 396,9 Elo77,0
73GPT-5.1OpenAI · 2 configurationsMoyenne1 394,7 Elo76,9
74Claude Sonnet 4.5Anthropic · 2 configurationsÉlevée1 393,1 Elo76,8
75Claude Opus 4.1AnthropicNon précisée1 389,7 Elo76,5
76MiniMax-M2.5MiniMax · poids ouvertsNon précisée1 386,3 Elo76,3
77MiniMax-M2.1MiniMax · poids ouvertsNon précisée1 384,0 Elo76,1
78Grok 4.20 Beta (0309)xAIÉlevée1 374,1 Elo75,5
79Solar Pro 4UpstageNon précisée1 370,3 Elo75,2
80Gemma 4 31B ITGoogle DeepMind · poids ouvertsNon précisée1 364,7 Elo74,8
81DeepSeek-V3.2DeepSeek · poids ouverts · 2 configurationsÉlevée1 361,6 Elo74,6
82Qwen3.5-122B-A10BAlibaba · poids ouvertsNon précisée1 359,8 Elo74,5
83Gemma 4 26B A4BGoogle DeepMind · poids ouvertsNon précisée1 358,5 Elo74,4
84Qwen3.5-27BAlibaba · poids ouvertsNon précisée1 357,4 Elo74,3
85Grok 4.3 BetaxAINon précisée1 356,6 Elo74,3
86Hunyuan Hy3 PreviewTencent · poids ouvertsNon précisée1 355,8 Elo74,2
87Muse Glimmer 30BMeta AI · poids ouvertsNon précisée1 354,8 Elo74,1
88Laguna M.1Poolside · poids ouvertsNon précisée1 347,9 Elo73,7
89GLM-4.6Z.ai (Zhipu AI) · poids ouvertsNon précisée1 339,5 Elo73,1
90GPT-5.2 CodexOpenAINon précisée1 339,1 Elo73,1
91GPT-5.1-CodexOpenAINon précisée1 336,7 Elo72,9
92MiMo-V2-FlashXiaomi · poids ouverts · 2 configurationsNon précisée1 329,6 Elo72,4
93Claude Haiku 4.5AnthropicNon précisée1 329,4 Elo72,4
94Kimi K2 ThinkingMoonshot · poids ouvertsNon précisée1 321,4 Elo71,9
95Laguna XS.2Poolside · poids ouvertsNon précisée1 301,8 Elo70,5
96MiniMax-M2MiniMax · poids ouvertsNon précisée1 296,7 Elo70,2
97Qwen3-Coder-480B-A35BAlibaba · poids ouvertsNon précisée1 274,3 Elo68,7
98DeepSeek-V3.2-ExpDeepSeekNon précisée1 271,9 Elo68,5
99Mistral Medium 3.5Mistral AI · poids ouvertsNon précisée1 263,1 Elo67,9
100Gemini 3.1 Flash-LiteGoogle DeepMindNon précisée1 255,9 Elo67,4
101Qwen3.5-35B-A3BAlibaba · poids ouvertsNon précisée1 253,5 Elo67,2
102GPT-5.1-Codex-miniOpenAINon précisée1 243,6 Elo66,6
103Qwen 3.5 Flash (hosted 35B-A3B)AlibabaNon précisée1 243,2 Elo66,5
104Grok 4.1 FastxAIÉlevée1 241,4 Elo66,4
105Trinity Large ThinkingArcee AI · poids ouvertsÉlevée1 237,6 Elo66,2
106Mistral Large 3Mistral AI · poids ouvertsNon précisée1 229,8 Elo65,6
107Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée1 226,8 Elo65,4
108Grok 4.1xAIÉlevée1 213,8 Elo64,5
109Devstral 2Mistral AI · poids ouvertsNon précisée1 196,1 Elo63,3
110Granite 4.1 8BIBM · poids ouvertsNon précisée1 190,8 Elo63,0
111Mercury 2Inception LabsNon précisée1 170,0 Elo61,5
112grok-code-fast-1xAINon précisée1 167,0 Elo61,3
113Grok 4 FastxAIÉlevée1 159,5 Elo60,8
114Devstral Medium 1.0Mistral AIMoyenne1 075,9 Elo55,1

En bref

Que mesure Code Arena, WebDev ?
Deux modèles construisent le même site ou la même application web, l'internaute vote pour le meilleur résultat. Sur Quelle IA, il est rangé dans la tâche Web et interfaces.
Comment Code Arena, WebDev est-il noté ?
Un score Elo calculé sur des duels où le résultat s'affiche et s'utilise. Un modèle qui obtient 1 440 Elo a un score IA d'environ 80.
Qui est en tête sur Code Arena, WebDev ?
Claude Opus 5.5 (Anthropic) est en tête de Code Arena, WebDev avec 1 817,8 Elo, dans l'édition du 28 septembre 2026. Suivent GPT-6 Astra (1 789,1 Elo) et GPT-6.1 Sol (1 758,7 Elo). 114 modèles y sont mesurés.
Quelles sont les limites de Code Arena, WebDev ?
Juge le rendu et l'usage immédiat. La qualité du code et sa maintenance ne sont pas évaluées. Au 28 septembre 2026, le benchmark est actif.
Combien pèse Code Arena, WebDev dans le score IA ?
Code Arena, WebDev compte pour 5 % du score général, dans l'édition du 28 septembre 2026. Il est le seul benchmark de la tâche Web et interfaces (5 % du score général) : il en porte tout le poids.
Qui maintient Code Arena, WebDev ?
Arena (ex LMArena). Sa page de référence : arena.ai/leaderboard/code/webdev.

Aller plus loinTous les benchmarks →Comment le score IA est calculé →