Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

FrançaisFiche benchmark · EuroEval · euroeval.com

EuroEval, INCLUDE (connaissances)

Des questions à choix multiples de connaissances, posées en français.

À quoi il sert

Sur Quelle IA, EuroEval, INCLUDE (connaissances) sert à noter la tâche Français : c'est l'un de ses 10 benchmarks. Il départage surtout les modèles dont le score IA approche 41.

Comment c'est noté

La part de bonnes réponses, corrigée du hasard.

Ce qu'il ne dit pas

Mesure ce que le modèle sait, en français. Sa rédaction n'est pas évaluée.

Comment lire le score

64 modèles mesurés · 86 mesures

En tête : Gemini 3 Flash, 87,7 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 41. Le meilleur, Gemini 3 Flash, atteint 87,7 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
57 %
Score IA 76niveau de Claude Sonnet 4.5
73 %
Score IA 100niveau de Claude Opus 5.5
84 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0,62 %du score général. EuroEval, INCLUDE (connaissances) porte 6 % de la tâche Français (10 % du score général), que se partagent 10 benchmarks.

En couleur, la tâche Français dans le score général. En noir, la part d'EuroEval, INCLUDE (connaissances).

Le classement du benchmark

Scores relevés sur euroeval.com · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Gemini 3 FlashGoogle DeepMind · 2 configurationsÉlevée87,7 %111,9
2Gemini 3.7 FlashGoogle DeepMindNon précisée84,9 %103,3
3GPT-5.6 SolOpenAINon précisée84,1 %101,3
4Gemini 3.6 FlashGoogle DeepMindNon précisée84 %100,9
5GPT-5 miniOpenAINon précisée80,8 %92,8
6Grok 4.1 FastxAIÉlevée79,7 %90,3
7GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsNon précisée79,2 %89,4
8GPT-5.4 MiniOpenAI · 4 configurationsFaible79,2 %89,3
9GPT-6 AstraOpenAINon précisée78,8 %88,5
10GPT-4.1OpenAINon précisée76,9 %84,3
64 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 64 →Replier le classement ↑
11GPT-5.6 TerraOpenAINon précisée75,6 %81,8
12Qwen3.6 27BAlibaba · poids ouvertsNon précisée75,4 %81,4
13Claude Sonnet 4.5Anthropic · 2 configurationsÉlevée75,2 %81,0
14Qwen 3.8 27BAlibaba · poids ouvertsNon précisée74,8 %80,3
15Claude Sonnet 4.6AnthropicNon précisée73,9 %78,5
16Qwen3.5-35B-A3BAlibaba · poids ouvertsNon précisée73,6 %78,1
17Mistral Small 3.2Mistral AI · poids ouvertsNon précisée72,8 %76,5
18GPT-5.4OpenAISans72,2 %75,5
19GPT-5.4 NanoOpenAI · 4 configurationsÉlevée72 %75,2
20Gemma 4 26B A4BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée72 %75,1
21gpt-oss-120bOpenAI · poids ouvertsNon précisée71,3 %73,9
22GPT-5.6 LunaOpenAINon précisée71,3 %73,9
23Mistral Small 3.1Mistral AINon précisée70,5 %72,4
24Qwen2.5-72BAlibaba · poids ouvertsNon précisée70,4 %72,3
25Gemini 3.1 Flash-LiteGoogle DeepMindNon précisée69,2 %70,3
26Nemotron 3 Nano 30BNVIDIA · poids ouverts · 2 configurationsNon précisée69,2 %70,1
27gpt-oss-20bOpenAI · poids ouverts · 3 configurationsMoyenne67,9 %68,1
28Gemma 4 31B ITGoogle DeepMind · poids ouverts · 2 configurationsNon précisée67,8 %67,9
29Llama 3.3 70BMeta AI · poids ouvertsNon précisée67,4 %67,2
30Gemini 2.5 Flash-Lite (Jun 2025)Google DeepMind · 2 configurationsÉlevée66,9 %66,3
31Qwen3.5-9BAlibaba · poids ouvertsNon précisée64,5 %62,6
32Qwen3-32BAlibaba · poids ouvertsSans64,5 %62,5
33Qwen3-14BAlibaba · poids ouvertsSans63,8 %61,5
34Qwen3.5-4BAlibaba · poids ouvertsNon précisée63,1 %60,4
35Ministral 3 8BMistral AI · poids ouverts · 2 configurationsÉlevée62,6 %59,6
36Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée61,9 %58,5
37Qwen3-4BAlibaba · poids ouverts · 2 configurationsÉlevée61,3 %57,6
38EuroLLM 22B InstructEuroLLM · poids ouvertsNon précisée60,8 %56,8
39Llama 3.1-70BMeta AI · poids ouvertsNon précisée59,9 %55,4
40GPT-5.2OpenAINon précisée59,9 %55,4
41GPT-5 nanoOpenAINon précisée59,4 %54,8
42Claude Haiku 4.5AnthropicNon précisée57,8 %52,3
43Gemma 3 12BGoogle DeepMind · poids ouvertsNon précisée57,5 %51,8
44glm-4.7-flashZ.ai (Zhipu AI) · poids ouverts · 2 configurationsNon précisée56,4 %50,3
45Qwen3-8BAlibaba · poids ouvertsSans54,3 %47,3
46Gemini 3.5 Flash-LiteGoogle DeepMindNon précisée54,3 %47,2
47Ministral 3 3BMistral AI · poids ouverts · 2 configurationsNon précisée50,8 %42,1
48Ministral 3 14BMistral AI · poids ouverts · 2 configurationsNon précisée49,9 %40,8
49EuroLLM 9B InstructEuroLLM · poids ouvertsNon précisée45,6 %34,6
50Luciole 23B Instruct 1.1OpenLLM-France · poids ouvertsNon précisée45,3 %34,2
51Llama 3.1-8BMeta AI · poids ouverts · 2 configurationsNon précisée42,9 %30,7
52Apertus v1.5 70BSwiss AI (EPFL, ETH Zurich) · poids ouvertsNon précisée38,8 %24,5
53EuroLLM 9B Instruct (2512)EuroLLM · poids ouvertsNon précisée37,9 %23,2
54Luciole 8B Instruct 1.1OpenLLM-France · poids ouvertsNon précisée36,8 %21,4
55Gemma 3 4BGoogle DeepMind · poids ouvertsNon précisée35,6 %19,5
56Llama 3.2 3BMeta AI · poids ouvertsNon précisée31,4 %12,7
57Qwen3-1.7BAlibabaSans29,4 %9,3
58Salamandra 7B InstructBarcelona Supercomputing Center · poids ouvertsNon précisée27,4 %5,9
59Qwen3.5-2BAlibaba · poids ouvertsNon précisée26,9 %4,8
60Qwen3-0.6BAlibabaSans11,5 %-32,6
61Qwen3.5-0.8BAlibaba · poids ouvertsNon précisée10,5 %-36,5
62Gemma 3 1BGoogle DeepMind · poids ouvertsNon précisée6,8 %-53,9
63Gemma 3 270MGoogle DeepMind · poids ouverts · 2 configurationsNon précisée5,6 %-60,9
64Llama 3.2 1BMeta AI · poids ouverts · 2 configurationsNon précisée2,3 %-94,0

En bref

Que mesure EuroEval, INCLUDE (connaissances) ?
Des questions à choix multiples de connaissances, posées en français. Sur Quelle IA, il est rangé dans la tâche Français.
Comment EuroEval, INCLUDE (connaissances) est-il noté ?
La part de bonnes réponses, corrigée du hasard. Un modèle qui obtient 50 % a un score IA d'environ 41.
Qui est en tête sur EuroEval, INCLUDE (connaissances) ?
Gemini 3 Flash (Google DeepMind) est en tête d'EuroEval, INCLUDE (connaissances) avec 87,7 %, dans l'édition du 28 septembre 2026. Suivent Gemini 3.7 Flash (84,9 %) et GPT-5.6 Sol (84,1 %). 64 modèles y sont mesurés.
Quelles sont les limites d'EuroEval, INCLUDE (connaissances) ?
Mesure ce que le modèle sait, en français. Sa rédaction n'est pas évaluée. Au 28 septembre 2026, le benchmark est actif.
Combien pèse EuroEval, INCLUDE (connaissances) dans le score IA ?
EuroEval, INCLUDE (connaissances) compte pour 0,62 % du score général, dans l'édition du 28 septembre 2026. Il porte 6 % de la tâche Français (10 % du score général), que se partagent 10 benchmarks.
Qui maintient EuroEval, INCLUDE (connaissances) ?
EuroEval. Sa page de référence : euroeval.com/leaderboards/Monolingual/french.

Les autres benchmarks de la tâche Français

Tous les benchmarks →Comment le score IA est calculé →