Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

VisionFiche benchmark · Arena (ex LMArena) · arena.ai

Arena, vision

Des duels à l'aveugle où la question porte sur une image fournie par l'internaute.

À quoi il sert

Sur Quelle IA, Arena, vision sert à noter la tâche Vision et multimodal : c'est l'un de ses 3 benchmarks. Il départage surtout les modèles dont le score IA approche 75.

Comment c'est noté

Un score Elo calculé sur les duels avec image.

Pour le calcul, un Elo devient une probabilité de victoire face à un niveau de référence, ici 1 226 Elo. Un écart de 100 points donne environ 64 % de chances de l'emporter.

Ce qu'il ne dit pas

Porte sur des images du quotidien. La précision sur des documents techniques n'est pas mesurée.

Comment lire le score

121 modèles mesurés · 136 mesures

En tête : Claude Fable 5, 1 310,1 Elo

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 1 226 Elo a un score IA d'environ 75. Le meilleur, Claude Fable 5, atteint 1 310,1 Elo.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
1 123 Elo
Score IA 76niveau de Claude Sonnet 4.5
1 230 Elo
Score IA 100niveau de Claude Opus 5.5
1 330 Elo

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,67 %du score général. Arena, vision porte 33 % de la tâche Vision et multimodal (5 % du score général), que se partagent 3 benchmarks.

En couleur, la tâche Vision et multimodal dans le score général. En noir, la part d'Arena, vision.

Le classement du benchmark

Scores relevés sur arena.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Fable 5AnthropicÉlevée1 310,1 Elo95,2
2Qwen3.8 Max (0902)AlibabaMaximale1 300,9 Elo93,0
3Claude Opus 4.6Anthropic · 2 configurationsÉlevée1 299,4 Elo92,7
4Claude Opus 4.7Anthropic · 2 configurationsNon précisée1 298,7 Elo92,5
5Gemini 3.7 FlashGoogle DeepMindÉlevée1 295,0 Elo91,6
6Muse SparkMeta AINon précisée1 293,9 Elo91,4
7Muse Spark 1.2Meta AINon précisée1 292,4 Elo91,0
8Muse Spark 1.3Meta AIMaximale1 289,6 Elo90,4
9Gemini 3 ProGoogle DeepMindNon précisée1 289,1 Elo90,3
10Claude Opus 5AnthropicÉlevée1 288,8 Elo90,2
121 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 121 →Replier le classement ↑
11GPT-5.6 SolOpenAIMaximale1 286,8 Elo89,7
12Claude Fable 5.1AnthropicMaximale1 286,6 Elo89,7
13GPT-5.5OpenAI · 2 configurationsNon précisée1 286,5 Elo89,6
13Claude Opus 4.8Anthropic · 2 configurationsÉlevée1 286,5 Elo89,6
15Gemini 3.8 FlashGoogle DeepMindÉlevée1 286,3 Elo89,6
16GPT-6 AstraOpenAIMaximale1 285,1 Elo89,3
17Gemini 3.5 FlashGoogle DeepMind · 2 configurationsÉlevée1 284,5 Elo89,2
18GPT-5.4OpenAI · 2 configurationsÉlevée1 284,1 Elo89,1
19GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsNon précisée1 281,2 Elo88,4
20Gemini 3.6 FlashGoogle DeepMindÉlevée1 280,1 Elo88,1
21Gemini 3.1 ProGoogle DeepMindNon précisée1 279,6 Elo88,0
22Muse Spark 1.1Meta AINon précisée1 279,5 Elo88,0
23Grok 4.5xAINon précisée1 278,7 Elo87,8
24GPT-5.2 ChatOpenAINon précisée1 278,3 Elo87,7
25GPT-5.5 InstantOpenAINon précisée1 276,1 Elo87,2
26Claude Sonnet 4.6AnthropicNon précisée1 275,4 Elo87,0
27Gemini 3 FlashGoogle DeepMind · 2 configurationsNon précisée1 273,0 Elo86,5
28GPT-5.6 TerraOpenAIMaximale1 267,9 Elo85,3
29Qwen3.7-PlusAlibabaNon précisée1 265,8 Elo84,8
30Kimi K2.6Moonshot · poids ouvertsNon précisée1 264,8 Elo84,5
31Claude Sonnet 5AnthropicÉlevée1 264,6 Elo84,5
32Gemini 3.5 Flash-LiteGoogle DeepMindNon précisée1 264,1 Elo84,4
33Grok 4.6xAIÉlevée1 263,2 Elo84,2
34Gemma 4 31B ITGoogle DeepMind · poids ouvertsNon précisée1 263,1 Elo84,1
35GPT-5.6 LunaOpenAIMaximale1 259,1 Elo83,2
36Seed 2.0 ProByteDanceNon précisée1 256,5 Elo82,6
37Grok 4.20 Beta (0309)xAIÉlevée1 255,6 Elo82,4
38MiMo-V2.6-FlashXiaomi · poids ouvertsNon précisée1 252,9 Elo81,7
39Kimi K2.5Moonshot · poids ouvertsÉlevée1 252,1 Elo81,6
40GPT-5.1OpenAI · 2 configurationsÉlevée1 251,3 Elo81,4
41GPT-5.4 MiniOpenAIÉlevée1 250,9 Elo81,3
42Grok 4.20 Multi Agent BetaxAINon précisée1 249,9 Elo81,0
43Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée1 247,4 Elo80,4
44MiMo-V2.6-ProXiaomi · poids ouvertsNon précisée1 246,4 Elo80,2
45Qwen3.5 397B-A17BAlibaba · poids ouvertsNon précisée1 245,3 Elo80,0
46Grok 4.3 BetaxAINon précisée1 244,3 Elo79,7
47GPT-5.2OpenAI · 2 configurationsÉlevée1 242,8 Elo79,4
48Qwen 3.8 27BAlibaba · poids ouvertsNon précisée1 242,3 Elo79,2
49Gemma 4 26B A4BGoogle DeepMind · poids ouvertsNon précisée1 241,9 Elo79,2
50ChatGPT-4o LatestOpenAINon précisée1 238,8 Elo78,4
51Kimi K2.5 InstantMoonshot · poids ouvertsNon précisée1 236,7 Elo77,9
52MiniMax-M3MiniMax · poids ouvertsNon précisée1 236,5 Elo77,9
53Gemini 3.1 Flash-LiteGoogle DeepMindNon précisée1 234,6 Elo77,4
54MiMo-V2.5Xiaomi · poids ouvertsNon précisée1 231,6 Elo76,7
55Gemini 2.5 Flash (Sep 2025)Google DeepMindNon précisée1 230,3 Elo76,4
56GLM-5V-TurboZ.ai (Zhipu AI)Non précisée1 229,9 Elo76,3
57Qwen3.5-122B-A10BAlibaba · poids ouvertsNon précisée1 226,4 Elo75,5
58GPT-5OpenAI · 2 configurationsNon précisée1 225,5 Elo75,3
59GPT-4.5OpenAINon précisée1 225,1 Elo75,2
60ERNIE 5.0BaiduNon précisée1 218,7 Elo73,7
61Qwen3.5-27BAlibaba · poids ouvertsNon précisée1 216,7 Elo73,2
62MiMo V2 OmniXiaomiNon précisée1 216,2 Elo73,1
63o3OpenAINon précisée1 215,5 Elo72,9
64Qwen3 VL 235B A22B InstructAlibaba · poids ouvertsNon précisée1 215,0 Elo72,8
64Gemini 2.5 Flash (Jun 2025)Google DeepMindNon précisée1 215,0 Elo72,8
66GPT-4.1OpenAINon précisée1 214,0 Elo72,6
67Claude Opus 4Anthropic · 2 configurationsÉlevée1 207,3 Elo71,0
68Inkling-SmallThinking Machines · poids ouvertsNon précisée1 206,8 Elo70,9
69Claude Sonnet 4Anthropic · 2 configurationsÉlevée1 206,2 Elo70,8
70GPT-4.1 miniOpenAINon précisée1 200,9 Elo69,5
71o4-miniOpenAINon précisée1 200,7 Elo69,5
72Mistral Large 3Mistral AI · poids ouvertsNon précisée1 200,3 Elo69,4
73GPT-5.4 NanoOpenAIÉlevée1 199,6 Elo69,2
73Mistral Medium 3.5Mistral AI · poids ouvertsNon précisée1 199,6 Elo69,2
75Grok 4.1 FastxAIÉlevée1 196,2 Elo68,4
76Claude 3.7 SonnetAnthropic · 2 configurationsÉlevée1 192,8 Elo67,6
77o1OpenAINon précisée1 192,7 Elo67,6
78Gemini 2.5 Flash-Lite (Jun 2025)Google DeepMindÉlevée1 188,2 Elo66,5
79Qwen3 VL 235B A22B ThinkingAlibaba · poids ouvertsÉlevée1 188,0 Elo66,5
80Qwen-VL-MaxAlibaba · 2 configurationsMaximale1 184,8 Elo65,7
81Grok 4xAINon précisée1 184,2 Elo65,6
82GPT-5 miniOpenAIÉlevée1 183,0 Elo65,3
83Gemini 1.5 Pro (Sept 2024)Google DeepMindNon précisée1 179,3 Elo64,4
84Gemini 2.5 Flash-Lite (Sep 2025)Google DeepMindSans1 174,4 Elo63,3
85Gemini 2.0 Flash (Feb 2025)Google DeepMindNon précisée1 171,8 Elo62,7
86GPT-4o (May 2024)OpenAINon précisée1 161,8 Elo60,3
87GLM-4.6VZ.ai (Zhipu AI) · poids ouvertsNon précisée1 161,4 Elo60,2
88Claude 3.5 SonnetAnthropic · 2 configurationsNon précisée1 160,7 Elo60,1
89Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée1 159,5 Elo59,8
90Mistral Medium 3.1Mistral AIMoyenne1 159,4 Elo59,7
91Hunyuan Vision 1.5TencentÉlevée1 155,5 Elo58,8
92Mistral Medium 3Mistral AIMoyenne1 155,3 Elo58,8
93GLM-4.5VZ.ai (Zhipu AI) · poids ouvertsNon précisée1 152,8 Elo58,2
94GPT-5 nanoOpenAIÉlevée1 146,0 Elo56,6
95Llama 4 MaverickMeta AI · poids ouvertsNon précisée1 145,1 Elo56,4
96Step 3StepFun · poids ouvertsNon précisée1 144,7 Elo56,3
97Gemini 1.5 Flash (Sep 2024)Google DeepMindNon précisée1 141,3 Elo55,5
98Mistral Small 3.2Mistral AI · poids ouvertsNon précisée1 139,8 Elo55,1
99Gemini 2.0 Flash-LiteGoogle DeepMindNon précisée1 135,9 Elo54,2
100Llama 4 ScoutMeta AI · poids ouvertsNon précisée1 127,5 Elo52,2
101Mistral Small 3.1Mistral AINon précisée1 127,0 Elo52,1
102Claude 3.5 HaikuAnthropicNon précisée1 126,8 Elo52,1
103Qwen2.5-72BAlibaba · poids ouvertsNon précisée1 121,2 Elo50,8
104Gemini 1.5 Pro (May 2024)Google DeepMindNon précisée1 119,6 Elo50,4
105GPT-4o (Aug 2024)OpenAINon précisée1 118,4 Elo50,1
106GPT-4 Turbo (Apr 2024)OpenAINon précisée1 111,9 Elo48,6
107Molmo 2 8BAllen Institute for AI · poids ouvertsNon précisée1 111,7 Elo48,5
108GPT-4o miniOpenAINon précisée1 097,2 Elo45,1
109Pixtral LargeMistral AI · poids ouvertsNon précisée1 095,2 Elo44,7
110GPT-4.1 nanoOpenAINon précisée1 088,7 Elo43,1
111Gemini 1.5 Flash 8BGoogle DeepMindNon précisée1 071,3 Elo39,0
112Claude 3 OpusAnthropicNon précisée1 061,6 Elo36,7
113Gemini 1.5 Flash (May 2024)Google DeepMindNon précisée1 059,5 Elo36,3
114Qwen2-VL-7B-InstructAlibabaNon précisée1 030,8 Elo29,5
115Pixtral 12BMistral AI · poids ouvertsNon précisée1 025,2 Elo28,2
116Amazon Nova ProAmazonNon précisée1 018,7 Elo26,7
116Amazon Nova LiteAmazonNon précisée1 018,7 Elo26,7
118Claude 3 SonnetAnthropicNon précisée1 016,4 Elo26,1
119Claude 3 HaikuAnthropicNon précisée1 000,0 Elo22,3
120MiniCPM-V-2_6OpenBMBNon précisée962,7 Elo13,5
121Phi-3.5-vision-instructMicrosoftNon précisée919,6 Elo3,4

En bref

Que mesure Arena, vision ?
Des duels à l'aveugle où la question porte sur une image fournie par l'internaute. Sur Quelle IA, il est rangé dans la tâche Vision et multimodal.
Comment Arena, vision est-il noté ?
Un score Elo calculé sur les duels avec image. Un modèle qui obtient 1 226 Elo a un score IA d'environ 75.
Qui est en tête sur Arena, vision ?
Claude Fable 5 (Anthropic) est en tête d'Arena, vision avec 1 310,1 Elo, dans l'édition du 28 septembre 2026. Suivent Qwen3.8 Max (0902) (1 300,9 Elo) et Claude Opus 4.6 (1 299,4 Elo). 121 modèles y sont mesurés.
Quelles sont les limites d'Arena, vision ?
Porte sur des images du quotidien. La précision sur des documents techniques n'est pas mesurée. Au 28 septembre 2026, le benchmark est actif.
Combien pèse Arena, vision dans le score IA ?
Arena, vision compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 33 % de la tâche Vision et multimodal (5 % du score général), que se partagent 3 benchmarks.
Qui maintient Arena, vision ?
Arena (ex LMArena). Sa page de référence : arena.ai/leaderboard.

Les autres benchmarks de la tâche Vision et multimodal

Tous les benchmarks →Comment le score IA est calculé →