Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

FrançaisFiche benchmark · EuroEval · euroeval.com

EuroEval, ScaLA (grammaire)

Le modèle doit dire si une phrase française est correcte ou si elle a été abîmée.

À quoi il sert

Sur Quelle IA, EuroEval, ScaLA (grammaire) sert à noter la tâche Français : c'est l'un de ses 10 benchmarks. Il départage surtout les modèles dont le score IA approche 67.

Comment c'est noté

Un score d'accord avec la bonne réponse, de 0 à 100, corrigé du hasard.

Ce qu'il ne dit pas

Juge la détection des fautes. La qualité de ce que le modèle écrit lui-même n'est pas notée.

Comment lire le score

136 modèles mesurés · 192 mesures

En tête : GLM-5.3-Flash, 78 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 67. Le meilleur, GLM-5.3-Flash, atteint 78 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
43 %
Score IA 76niveau de Claude Sonnet 4.5
55 %
Score IA 100niveau de Claude Opus 5.5
65 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0,62 %du score général. EuroEval, ScaLA (grammaire) porte 6 % de la tâche Français (10 % du score général), que se partagent 10 benchmarks.

En couleur, la tâche Français dans le score général. En noir, la part d'EuroEval, ScaLA (grammaire).

Le classement du benchmark

Scores relevés sur euroeval.com · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsNon précisée78 %133,5
2Gemini 3 ProGoogle DeepMindNon précisée75,6 %126,5
3Gemma 4 31B ITGoogle DeepMind · poids ouverts · 2 configurationsNon précisée74,2 %122,6
4GPT-6 AstraOpenAINon précisée74,2 %122,6
5Ministral 3 14BMistral AI · poids ouverts · 2 configurationsÉlevée73,6 %121,0
6Gemini 3.1 Flash-LiteGoogle DeepMindNon précisée72,6 %118,3
7Gemini 3 FlashGoogle DeepMind · 2 configurationsSans72,4 %117,7
8Claude Sonnet 4.6AnthropicNon précisée72,1 %117,0
9Gemma 4 26B A4BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée70,8 %113,6
10Gemini 3.7 FlashGoogle DeepMindNon précisée70,5 %112,7
136 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 136 →Replier le classement ↑
11Gemini 3.5 Flash-LiteGoogle DeepMindNon précisée69,8 %111,1
12Gemini 3.6 FlashGoogle DeepMindNon précisée69,3 %109,7
13Apertus v1.5 70BSwiss AI (EPFL, ETH Zurich) · poids ouvertsNon précisée69,1 %109,4
14Qwen 3.8 27BAlibaba · poids ouvertsNon précisée68,7 %108,3
15Ministral 3 8BMistral AI · poids ouverts · 2 configurationsNon précisée68,3 %107,3
16GPT-5.2OpenAINon précisée67,5 %105,4
17GPT-5.4 MiniOpenAI · 4 configurationsFaible66,8 %103,9
18Llama 3.1-70BMeta AI · poids ouverts · 2 configurationsNon précisée66,6 %103,3
19GPT-5.4OpenAISans65 %99,6
20Nemotron 3 Nano 30BNVIDIA · poids ouverts · 3 configurationsNon précisée61,6 %91,8
21GPT-5.6 LunaOpenAINon précisée61,2 %90,9
22Qwen3.5-35B-A3BAlibaba · poids ouvertsNon précisée60,4 %89,1
23Qwen3.5-4BAlibaba · poids ouvertsNon précisée59,5 %87,2
24Qwen3.5-9BAlibaba · poids ouvertsNon précisée58,6 %85,3
25glm-4.7-flashZ.ai (Zhipu AI) · poids ouverts · 2 configurationsNon précisée58 %84,0
26Qwen3.6 27BAlibaba · poids ouvertsNon précisée57,6 %83,0
27Ministral 3 3BMistral AI · poids ouverts · 2 configurationsNon précisée56,7 %81,2
28EuroLLM 22B InstructEuroLLM · poids ouverts · 2 configurationsNon précisée56 %79,7
29granite-4.0-microIBM · poids ouvertsNon précisée55,9 %79,4
30Luciole 23B Instruct 1.1OpenLLM-France · poids ouvertsNon précisée55,1 %77,8
31Gemma 3n E4BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée54 %75,3
32EuroLLM 9B Instruct (2512)EuroLLM · poids ouvertsNon précisée53,6 %74,5
33Llama 3.1-405BMeta AI · poids ouverts · 3 configurationsNon précisée52,6 %72,5
34Qwen3.5-2BAlibaba · poids ouvertsNon précisée52,3 %71,8
35Gemma 3 4BGoogle DeepMind · poids ouvertsNon précisée50,6 %68,2
36OLMo 3.1 32B InstructAllen Institute for AI · poids ouvertsNon précisée50,4 %67,8
37GPT-5.6 TerraOpenAINon précisée50,2 %67,3
37Grok 4.1 FastxAIÉlevée50,2 %67,3
39Qwen3-1.7BAlibaba · 2 configurationsSans49,2 %65,2
40GPT-5.4 NanoOpenAI · 4 configurationsFaible46,4 %59,4
41Qwen2.5-72BAlibaba · poids ouvertsNon précisée46,1 %58,7
42Mistral Small 3.2Mistral AI · poids ouvertsNon précisée45,9 %58,2
43Gemini 2.5 Flash (Jun 2025)Google DeepMind · 2 configurationsÉlevée45,6 %57,5
44GPT-5.6 SolOpenAINon précisée45,4 %57,1
45Qwen3-235B-A22B-Instruct (Jul 2025)Alibaba · poids ouvertsNon précisée45,3 %57,0
46Magistral Small 1.2Mistral AI · poids ouvertsNon précisée45,1 %56,6
47Claude Sonnet 4.5Anthropic · 2 configurationsSans44,7 %55,7
48chutes/Qwen3-Next-80B-A3B-InstructAlibaba · poids ouvertsNon précisée44,6 %55,4
49Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée44,4 %55,0
50Yi-1.5-34B01.AI · poids ouvertsNon précisée44,4 %55,0
51Llama 3.1-8BMeta AI · poids ouverts · 2 configurationsNon précisée44,3 %54,8
52Mixtral 8x7BMistral AI · poids ouverts · 2 configurationsNon précisée43,2 %52,6
53GPT-4.1OpenAINon précisée43 %51,9
54Llama 3-70BMeta AI · poids ouverts · 2 configurationsNon précisée42,9 %51,7
55Claude 3.7 SonnetAnthropic · 2 configurationsSans42,6 %51,2
56Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée42,6 %51,1
57GPT-5OpenAI · 3 configurationsFaible42,5 %50,9
58Llama-3.1-Nemotron-70B-InstructNVIDIA · poids ouvertsNon précisée42,2 %50,4
59Qwen3-32BAlibaba · poids ouvertsSans42,1 %50,1
60gpt-oss-120bOpenAI · poids ouvertsNon précisée42 %49,8
61Gemini 2.5 Flash-Lite (Jun 2025)Google DeepMind · 4 configurationsÉlevée41,8 %49,5
61Llama 4 ScoutMeta AI · poids ouvertsNon précisée41,8 %49,5
63Gemma 2 27BGoogle DeepMind · 2 configurationsNon précisée41,7 %49,3
64Voxtral SmallMistral AI · poids ouvertsNon précisée41,6 %49,0
65Phi-4Microsoft · poids ouvertsNon précisée40,9 %47,5
66Magistral Small 1.0Mistral AI · poids ouvertsNon précisée40,9 %47,5
67Qwen3-14BAlibaba · poids ouverts · 2 configurationsSans40,8 %47,2
68c4ai-command-r-08-2024Cohere · poids ouvertsNon précisée40,7 %47,0
69Llama 3.3 70BMeta AI · poids ouvertsNon précisée40,6 %46,9
70GPT-4.1 miniOpenAINon précisée40,6 %46,7
71GLM-4.5-AirZ.ai (Zhipu AI) · poids ouverts · 2 configurationsÉlevée40,2 %45,9
71Mistral Small 3.1Mistral AINon précisée40,2 %45,9
73Claude Haiku 4.5AnthropicNon précisée40,1 %45,8
74Grok 3xAINon précisée40 %45,4
75Qwen3-30B-A3BAlibaba · poids ouvertsSans39,9 %45,4
76Gemma 3 12BGoogle DeepMind · poids ouvertsNon précisée39,7 %44,8
77Gemma 2 9BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée39,5 %44,4
78o3-miniOpenAINon précisée39,1 %43,5
79Gemini 2.5 Flash (Apr 2025)Google DeepMindNon précisée39 %43,3
80Gemini 1.5 Flash (Sep 2024)Google DeepMindNon précisée38,7 %42,7
81Qwen1.5-14BAlibaba · poids ouverts · 2 configurationsNon précisée38,7 %42,7
82Aya Expanse 32BCohere · poids ouvertsNon précisée38,2 %41,4
83qwen3-4b-instruct-2507AlibabaNon précisée38,1 %41,2
84Qwen3-8BAlibaba · poids ouverts · 2 configurationsNon précisée38 %41,1
85Mistral NeMoMistral AI · poids ouvertsNon précisée37,1 %39,1
86Qwen3-4BAlibaba · poids ouverts · 3 configurationsÉlevée37 %38,8
87Grok-3 minixAIÉlevée36,8 %38,4
88gpt-oss-20bOpenAI · poids ouverts · 3 configurationsFaible36,8 %38,3
89deepseek-r1-0528-qwen3-8bDeepSeek · poids ouvertsNon précisée36,6 %38,0
90Reka Flash 3Reka AINon précisée35,9 %36,3
91o4-miniOpenAINon précisée35,4 %35,2
91Qwen3-235B-A22BAlibaba · poids ouvertsNon précisée35,4 %35,2
93Luciole 8B Instruct 1.1OpenLLM-France · poids ouvertsNon précisée35,4 %35,1
94QwQ-32BAlibaba · poids ouvertsNon précisée35 %34,2
95Apertus 70B InstructSwiss AI (EPFL, ETH Zurich) · poids ouvertsNon précisée34,5 %33,2
96o3OpenAINon précisée33,5 %30,7
97nvidia-nemotron-nano-9b-v2NVIDIA · poids ouverts · 2 configurationsNon précisée33,4 %30,6
98Qwen3-235B-A22B-Thinking (Jul 2025)AlibabaNon précisée33,1 %29,8
99Falcon 2 11BTechnology Innovation Institute · poids ouvertsNon précisée33,1 %29,8
100DeepSeek-R1-Distill-Llama-70BDeepSeek · poids ouvertsNon précisée32,6 %28,6
101Grok-2 (Dec 2024)xAINon précisée32,4 %28,2
102GPT-5 miniOpenAI · 3 configurationsÉlevée32,2 %27,7
103Apertus 8B InstructSwiss AI (EPFL · poids ouvertsNon précisée32,1 %27,3
104Mistral Small 3Mistral AINon précisée32 %27,2
105GPT-5 nanoOpenAI · 3 configurationsÉlevée31,6 %26,2
106Llama 2-70BMeta AI · poids ouverts · 2 configurationsNon précisée31,4 %25,7
107OLMo 2 Furious 13BAllen Institute for AI · poids ouvertsNon précisée31,4 %25,6
108Llama 3-8BMeta AI · poids ouverts · 2 configurationsNon précisée30,2 %22,7
109Mistral 7B v0.1Mistral AI · poids ouverts · 2 configurationsNon précisée27,6 %16,2
110DeepSeek-R1-Distill-Qwen-32BDeepSeekNon précisée26,3 %12,5
111Mistral 7B v0.3Mistral AI · poids ouvertsNon précisée26,1 %12,1
112DeepSeek-R1-Distill-Qwen-14BDeepSeekNon précisée25,4 %10,0
113EuroLLM 9B InstructEuroLLM · poids ouvertsNon précisée25,3 %9,8
114Qwen3-Next-80B-A3B ThinkingAlibaba · poids ouvertsÉlevée24 %6,0
115Mistral 7B v0.2Mistral AINon précisée23,4 %4,3
116Gemma 7BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée20,9 %-3,3
117Llama 2-13BMeta AI · poids ouverts · 2 configurationsNon précisée20,1 %-6,0
118Llama 2-7BMeta AI · poids ouvertsNon précisée16,3 %-19,3
119Llama 3.2 3BMeta AI · poids ouvertsNon précisée15,4 %-22,8
120Qwen2.5-1.5BAlibaba · poids ouvertsNon précisée14,8 %-25,6
121DeepSeek-R1-Distill-Llama-8BDeepSeekNon précisée14,7 %-25,9
122Salamandra 7B InstructBarcelona Supercomputing Center · poids ouvertsNon précisée13 %-33,3
123DeepSeek-R1-Distill-Qwen-7BDeepSeekNon précisée12,5 %-35,9
124Gemma 3 1BGoogle DeepMind · poids ouvertsNon précisée12,1 %-37,7
125Qwen3-0.6BAlibaba · 2 configurationsNon précisée10,4 %-46,9
126Qwen3.5-0.8BAlibaba · poids ouvertsNon précisée9,6 %-51,5
127Phi-4 MiniMicrosoft · poids ouvertsÉlevée8 %-62,2
128Ministral 8BMistral AI · poids ouvertsNon précisée7,8 %-63,2
129DeepSeek-R1-Distill-Qwen-1.5BDeepSeekNon précisée4,1 %-99,0
130Phi-4-Reasoning-plusMicrosoft · poids ouvertsNon précisée3,8 %-103,5
131Llama 3.2 1BMeta AI · poids ouverts · 2 configurationsNon précisée3,4 %-110,0
132Phi-2Microsoft · poids ouvertsNon précisée3,2 %-113,0
133Gemma 3 270MGoogle DeepMind · poids ouverts · 2 configurationsNon précisée2,7 %-121,7
134ALIA-40bBarcelona Supercomputing Center · poids ouvertsNon précisée2,2 %-134,2
135Gemma 2BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée0,8 %-175,4
136Phi-4 ReasoningMicrosoft · poids ouvertsÉlevée0,1 %-175,4

En bref

Que mesure EuroEval, ScaLA (grammaire) ?
Le modèle doit dire si une phrase française est correcte ou si elle a été abîmée. Sur Quelle IA, il est rangé dans la tâche Français.
Comment EuroEval, ScaLA (grammaire) est-il noté ?
Un score d'accord avec la bonne réponse, de 0 à 100, corrigé du hasard. Un modèle qui obtient 50 % a un score IA d'environ 67.
Qui est en tête sur EuroEval, ScaLA (grammaire) ?
GLM-5.3-Flash (Z.ai (Zhipu AI)) est en tête d'EuroEval, ScaLA (grammaire) avec 78 %, dans l'édition du 28 septembre 2026. Suivent Gemini 3 Pro (75,6 %) et Gemma 4 31B IT (74,2 %). 136 modèles y sont mesurés.
Quelles sont les limites d'EuroEval, ScaLA (grammaire) ?
Juge la détection des fautes. La qualité de ce que le modèle écrit lui-même n'est pas notée. Au 28 septembre 2026, le benchmark est actif.
Combien pèse EuroEval, ScaLA (grammaire) dans le score IA ?
EuroEval, ScaLA (grammaire) compte pour 0,62 % du score général, dans l'édition du 28 septembre 2026. Il porte 6 % de la tâche Français (10 % du score général), que se partagent 10 benchmarks.
Qui maintient EuroEval, ScaLA (grammaire) ?
EuroEval. Sa page de référence : euroeval.com/leaderboards/Monolingual/french.

Les autres benchmarks de la tâche Français

Tous les benchmarks →Comment le score IA est calculé →