Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

FrançaisFiche benchmark · EuroEval · euroeval.com

EuroEval, HellaSwag (bon sens)

Le modèle choisit la suite la plus plausible d'une situation décrite en français.

À quoi il sert

Sur Quelle IA, EuroEval, HellaSwag (bon sens) sert à noter la tâche Français : c'est l'un de ses 10 benchmarks. Il départage surtout les modèles dont le score IA approche 38.

Comment c'est noté

La part de bonnes réponses, corrigée du hasard.

Ce qu'il ne dit pas

Épreuve traduite de l'anglais, proche de la saturation pour les meilleurs modèles.

Comment lire le score

134 modèles mesurés · 190 mesures

En tête : GPT-6 Astra, 90,7 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 38. Le meilleur, GPT-6 Astra, atteint 90,7 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
60 %
Score IA 76niveau de Claude Sonnet 4.5
76 %
Score IA 100niveau de Claude Opus 5.5
87 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0,62 %du score général. EuroEval, HellaSwag (bon sens) porte 6 % de la tâche Français (10 % du score général), que se partagent 10 benchmarks.

En couleur, la tâche Français dans le score général. En noir, la part d'EuroEval, HellaSwag (bon sens).

Le classement du benchmark

Scores relevés sur euroeval.com · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-6 AstraOpenAINon précisée90,7 %112,5
2Gemini 3.7 FlashGoogle DeepMindNon précisée90,2 %110,7
3Claude Sonnet 4.5Anthropic · 2 configurationsSans87,9 %102,9
4Qwen3-235B-A22B-Instruct (Jul 2025)Alibaba · poids ouvertsNon précisée85,7 %96,8
5Qwen3.6 27BAlibaba · poids ouvertsNon précisée84,5 %93,5
6Claude Sonnet 4.6AnthropicNon précisée83,7 %91,6
7Mistral Small 3Mistral AINon précisée83,4 %90,9
8Mistral Small 3.1Mistral AINon précisée83,4 %90,9
9Gemini 3.6 FlashGoogle DeepMindNon précisée82,6 %88,9
10Qwen3-235B-A22B-Thinking (Jul 2025)AlibabaNon précisée82,4 %88,6
134 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 134 →Replier le classement ↑
11Gemini 3 ProGoogle DeepMindNon précisée81,8 %87,3
12Gemini 3 FlashGoogle DeepMind · 2 configurationsSans81,1 %85,8
13GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsNon précisée81,1 %85,6
14GPT-5.6 SolOpenAINon précisée80,9 %85,2
15chutes/Qwen3-Next-80B-A3B-InstructAlibaba · poids ouvertsNon précisée80,4 %84,2
16Llama 3.1-405BMeta AI · poids ouverts · 3 configurationsNon précisée80 %83,4
17Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée79,9 %83,1
18Gemma 4 31B ITGoogle DeepMind · poids ouverts · 2 configurationsNon précisée79,5 %82,3
19Qwen 3.8 27BAlibaba · poids ouvertsNon précisée79,4 %82,1
20Mistral Small 3.2Mistral AI · poids ouvertsNon précisée78,5 %80,4
21GPT-5.4OpenAISans78 %79,4
22GPT-5.6 TerraOpenAINon précisée77,9 %79,3
23Qwen2.5-72BAlibaba · poids ouvertsNon précisée77,8 %79,1
24Qwen3-Next-80B-A3B ThinkingAlibaba · poids ouvertsÉlevée77,4 %78,3
25Voxtral SmallMistral AI · poids ouvertsNon précisée77 %77,5
26GPT-5OpenAI · 3 configurationsÉlevée76,4 %76,5
27Magistral Small 1.2Mistral AI · poids ouvertsNon précisée76,4 %76,5
28Qwen3.5-35B-A3BAlibaba · poids ouvertsNon précisée76 %75,8
29Llama 4 ScoutMeta AI · poids ouvertsNon précisée75,9 %75,5
30Llama 3.3 70BMeta AI · poids ouvertsNon précisée75,7 %75,2
31Yi-1.5-34B01.AI · poids ouvertsNon précisée75,3 %74,4
32Llama-3.1-Nemotron-70B-InstructNVIDIA · poids ouvertsNon précisée74,6 %73,2
33Qwen3-32BAlibaba · poids ouvertsSans74,4 %72,8
34Aya Expanse 32BCohere · poids ouvertsNon précisée74 %72,2
35Ministral 3 14BMistral AI · poids ouverts · 2 configurationsÉlevée73,9 %72,0
36Qwen3-235B-A22BAlibaba · poids ouvertsNon précisée73,7 %71,7
37Gemini 2.5 Flash (Jun 2025)Google DeepMind · 2 configurationsSans73,2 %70,9
38GPT-4.1OpenAINon précisée72,8 %70,2
39Gemini 3.1 Flash-LiteGoogle DeepMindNon précisée72,2 %69,2
40GPT-5.6 LunaOpenAINon précisée71,9 %68,7
41GPT-5.2OpenAINon précisée71,5 %68,1
42Gemini 3.5 Flash-LiteGoogle DeepMindNon précisée71,5 %68,1
43Claude 3.7 SonnetAnthropic · 2 configurationsÉlevée71,4 %67,9
44GPT-5.4 MiniOpenAI · 4 configurationsMoyenne70,7 %66,8
45Llama 3.1-70BMeta AI · poids ouverts · 2 configurationsNon précisée70,6 %66,6
46Gemma 4 26B A4BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée70,4 %66,3
47Claude 3.5 SonnetAnthropicNon précisée70,3 %66,1
48Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée69,6 %65,2
49QwQ-32BAlibaba · poids ouvertsNon précisée69,5 %64,9
50Grok 3xAINon précisée69 %64,2
51Claude Haiku 4.5AnthropicNon précisée68,7 %63,6
52Qwen3.5-9BAlibaba · poids ouvertsNon précisée68,6 %63,5
53GPT-5 miniOpenAI · 3 configurationsÉlevée67,9 %62,5
54Ministral 3 8BMistral AI · poids ouverts · 2 configurationsÉlevée67,8 %62,3
55o3OpenAINon précisée67,4 %61,7
56Gemma 2 27BGoogle DeepMind · 2 configurationsNon précisée67,2 %61,5
57Qwen3-14BAlibaba · poids ouverts · 2 configurationsSans66,7 %60,7
58Grok-2 (Dec 2024)xAINon précisée66,3 %60,1
59Phi-4Microsoft · poids ouvertsNon précisée65,9 %59,5
60GLM-4.5-AirZ.ai (Zhipu AI) · poids ouverts · 2 configurationsSans65,4 %58,8
61Qwen3-30B-A3BAlibaba · poids ouvertsSans65,2 %58,5
62Gemma 3 12BGoogle DeepMind · poids ouvertsNon précisée64,8 %58,0
63Llama 3-70BMeta AI · poids ouverts · 2 configurationsNon précisée63,4 %55,9
64Magistral Small 1.0Mistral AI · poids ouvertsNon précisée63 %55,4
65Ministral 8BMistral AI · poids ouvertsNon précisée63 %55,4
66o4-miniOpenAINon précisée62,6 %54,9
67Grok 4.1 FastxAIÉlevée61,8 %53,7
68Gemma 2 9BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée61,5 %53,2
69gpt-oss-120bOpenAI · poids ouvertsNon précisée60,7 %52,2
70GPT-4.1 miniOpenAINon précisée60,4 %51,8
71Qwen3.5-4BAlibaba · poids ouvertsNon précisée60,1 %51,4
72GPT-5 nanoOpenAI · 3 configurationsÉlevée59,8 %50,9
73Gemini 2.5 Flash-Lite (Jun 2025)Google DeepMind · 4 configurationsSans58,9 %49,7
74qwen3-4b-instruct-2507AlibabaNon précisée58,9 %49,7
75Apertus v1.5 70BSwiss AI (EPFL, ETH Zurich) · poids ouvertsNon précisée57,1 %47,3
76Apertus 70B InstructSwiss AI (EPFL, ETH Zurich) · poids ouvertsNon précisée56,3 %46,2
77Nemotron 3 Nano 30BNVIDIA · poids ouverts · 3 configurationsSans56,2 %46,0
78Qwen3-8BAlibaba · poids ouverts · 2 configurationsSans56,1 %45,9
79Ministral 3 3BMistral AI · poids ouverts · 2 configurationsÉlevée56 %45,8
80Qwen3-4BAlibaba · poids ouverts · 3 configurationsÉlevée56 %45,8
81gpt-oss-20bOpenAI · poids ouverts · 3 configurationsMoyenne55,7 %45,5
82Gemma 3n E4BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée55,7 %45,4
83DeepSeek-R1-Distill-Qwen-32BDeepSeekNon précisée55,4 %45,0
84DeepSeek-R1-Distill-Llama-70BDeepSeek · poids ouvertsNon précisée54,4 %43,7
85Grok-3 minixAIÉlevée53,6 %42,7
86glm-4.7-flashZ.ai (Zhipu AI) · poids ouverts · 2 configurationsNon précisée53,6 %42,6
87o3-miniOpenAINon précisée53,3 %42,2
88EuroLLM 22B InstructEuroLLM · poids ouverts · 2 configurationsNon précisée52 %40,5
89Qwen1.5-14BAlibaba · poids ouverts · 2 configurationsNon précisée51,1 %39,4
90Reka Flash 3Reka AINon précisée49,9 %37,8
91Mistral NeMoMistral AI · poids ouvertsNon précisée49,5 %37,2
92Claude 3.5 HaikuAnthropicNon précisée49,2 %36,8
93c4ai-command-r-08-2024Cohere · poids ouvertsNon précisée48,9 %36,4
94Mixtral 8x7BMistral AI · poids ouverts · 2 configurationsNon précisée48,6 %36,1
95DeepSeek-R1-Distill-Qwen-14BDeepSeekNon précisée47,2 %34,2
96OLMo 3.1 32B InstructAllen Institute for AI · poids ouvertsNon précisée47,2 %34,2
97granite-4.0-microIBM · poids ouvertsNon précisée46,6 %33,4
98GPT-5.4 NanoOpenAI · 4 configurationsMoyenne45,2 %31,7
99Llama 3.1-8BMeta AI · poids ouverts · 2 configurationsNon précisée44,7 %30,9
100Luciole 23B Instruct 1.1OpenLLM-France · poids ouvertsNon précisée44,1 %30,2
101EuroLLM 9B Instruct (2512)EuroLLM · poids ouvertsNon précisée43,4 %29,2
102Llama 2-70BMeta AI · poids ouverts · 2 configurationsNon précisée42,1 %27,5
103deepseek-r1-0528-qwen3-8bDeepSeek · poids ouvertsNon précisée40,7 %25,5
104nvidia-nemotron-nano-9b-v2NVIDIA · poids ouverts · 2 configurationsNon précisée40,3 %25,1
105Llama 3-8BMeta AI · poids ouverts · 2 configurationsNon précisée38,6 %22,6
106Apertus 8B InstructSwiss AI (EPFL · poids ouvertsNon précisée38 %21,9
107Qwen3.5-2BAlibaba · poids ouvertsNon précisée37 %20,5
108OLMo 2 Furious 13BAllen Institute for AI · poids ouvertsNon précisée36,5 %19,8
109Qwen2.5-1.5BAlibaba · poids ouvertsNon précisée34,3 %16,6
110Gemma 3 4BGoogle DeepMind · poids ouvertsNon précisée33,9 %16,1
111Phi-4 ReasoningMicrosoft · poids ouvertsÉlevée30,8 %11,3
112Qwen3-1.7BAlibaba · 2 configurationsSans29,7 %9,7
113EuroLLM 9B InstructEuroLLM · poids ouvertsNon précisée28,5 %7,7
114Falcon 2 11BTechnology Innovation Institute · poids ouvertsNon précisée27,8 %6,6
115Luciole 8B Instruct 1.1OpenLLM-France · poids ouvertsNon précisée27,7 %6,5
116ALIA-40bBarcelona Supercomputing Center · poids ouvertsNon précisée26,6 %4,7
117Gemma 7BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée26,4 %4,3
118Mistral 7B v0.2Mistral AINon précisée24,3 %0,6
119Llama 3.2 3BMeta AI · poids ouvertsNon précisée23,7 %-0,5
120DeepSeek-R1-Distill-Llama-8BDeepSeekNon précisée19,9 %-7,7
121Phi-4 MiniMicrosoft · poids ouvertsÉlevée19,7 %-8,2
122Mistral 7B v0.3Mistral AI · poids ouvertsNon précisée18,2 %-11,4
123DeepSeek-R1-Distill-Qwen-7BDeepSeekNon précisée17,5 %-12,9
124Mistral 7B v0.1Mistral AI · poids ouverts · 2 configurationsNon précisée16,6 %-15,0
125Llama 2-13BMeta AI · poids ouverts · 2 configurationsNon précisée11,4 %-29,4
126Qwen3-0.6BAlibaba · 2 configurationsNon précisée11,1 %-30,2
127Qwen3.5-0.8BAlibaba · poids ouvertsNon précisée7,6 %-43,9
128Salamandra 7B InstructBarcelona Supercomputing Center · poids ouvertsNon précisée7,4 %-45,0
129Gemma 3 1BGoogle DeepMind · poids ouvertsNon précisée6,8 %-48,0
130DeepSeek-R1-Distill-Qwen-1.5BDeepSeekNon précisée5,1 %-57,8
131Phi-2Microsoft · poids ouvertsNon précisée4,6 %-61,3
132Gemma 2BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée3 %-76,3
133Llama 3.2 1BMeta AI · poids ouverts · 2 configurationsNon précisée0,5 %-112,8
134Gemma 3 270MGoogle DeepMind · poids ouverts · 2 configurationsNon précisée-0,3 %-112,8

En bref

Que mesure EuroEval, HellaSwag (bon sens) ?
Le modèle choisit la suite la plus plausible d'une situation décrite en français. Sur Quelle IA, il est rangé dans la tâche Français.
Comment EuroEval, HellaSwag (bon sens) est-il noté ?
La part de bonnes réponses, corrigée du hasard. Un modèle qui obtient 50 % a un score IA d'environ 38.
Qui est en tête sur EuroEval, HellaSwag (bon sens) ?
GPT-6 Astra (OpenAI) est en tête d'EuroEval, HellaSwag (bon sens) avec 90,7 %, dans l'édition du 28 septembre 2026. Suivent Gemini 3.7 Flash (90,2 %) et Claude Sonnet 4.5 (87,9 %). 134 modèles y sont mesurés.
Quelles sont les limites d'EuroEval, HellaSwag (bon sens) ?
Épreuve traduite de l'anglais, proche de la saturation pour les meilleurs modèles. Au 28 septembre 2026, le benchmark est actif.
Combien pèse EuroEval, HellaSwag (bon sens) dans le score IA ?
EuroEval, HellaSwag (bon sens) compte pour 0,62 % du score général, dans l'édition du 28 septembre 2026. Il porte 6 % de la tâche Français (10 % du score général), que se partagent 10 benchmarks.
Qui maintient EuroEval, HellaSwag (bon sens) ?
EuroEval. Sa page de référence : euroeval.com/leaderboards/Monolingual/french.

Les autres benchmarks de la tâche Français

Tous les benchmarks →Comment le score IA est calculé →