Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

FrançaisFiche benchmark · EuroEval · euroeval.com

EuroEval, FQuAD (compréhension)

Le modèle lit un texte en français et répond à une question dont la réponse s'y trouve.

À quoi il sert

Sur Quelle IA, EuroEval, FQuAD (compréhension) sert à noter la tâche Français : c'est l'un de ses 10 benchmarks.

Comment c'est noté

La part de mots communs entre sa réponse et la réponse attendue.

Ce qu'il ne dit pas

Une réponse juste mais formulée autrement perd des points.

Comment lire le score

134 modèles mesurés · 190 mesures

En tête : Llama 3.1-405B, 77,4 %

Chaque trait est un modèle, placé à son meilleur score. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 67 %. Le meilleur, Llama 3.1-405B, atteint 77,4 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
67 %
Score IA 76niveau de Claude Sonnet 4.5
71 %
Score IA 100niveau de Claude Opus 5.5
75 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0,62 %du score général. EuroEval, FQuAD (compréhension) porte 6 % de la tâche Français (10 % du score général), que se partagent 10 benchmarks.

En couleur, la tâche Français dans le score général. En noir, la part d'EuroEval, FQuAD (compréhension).

Le classement du benchmark

Scores relevés sur euroeval.com · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Llama 3.1-405BMeta AI · poids ouverts · 3 configurationsNon précisée77,4 %116,3
2Llama 3.1-70BMeta AI · poids ouverts · 2 configurationsNon précisée76,7 %112,0
3Nemotron 3 Nano 30BNVIDIA · poids ouverts · 3 configurationsSans76,3 %108,9
4Llama 3-70BMeta AI · poids ouverts · 2 configurationsNon précisée76,1 %107,7
5Qwen3-32BAlibaba · poids ouvertsSans76 %106,9
6Gemma 2 27BGoogle DeepMind · 2 configurationsNon précisée75,9 %106,3
7Yi-1.5-34B01.AI · poids ouvertsNon précisée75,7 %105,2
8Qwen3-14BAlibaba · poids ouverts · 2 configurationsSans75,6 %104,4
9Llama 2-70BMeta AI · poids ouverts · 2 configurationsNon précisée75,4 %103,0
10Mistral Small 3.1Mistral AINon précisée75 %100,7
134 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 134 →Replier le classement ↑
11Gemma 3n E4BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée74,5 %97,5
12Ministral 3 8BMistral AI · poids ouverts · 2 configurationsÉlevée74,5 %97,3
13Mixtral 8x7BMistral AI · poids ouverts · 2 configurationsNon précisée74,5 %97,3
14Llama 3.1-8BMeta AI · poids ouverts · 2 configurationsNon précisée74,4 %96,5
15Magistral Small 1.0Mistral AI · poids ouvertsNon précisée74,3 %96,3
16Magistral Small 1.2Mistral AI · poids ouvertsNon précisée74,2 %95,6
17Mistral Small 3.2Mistral AI · poids ouvertsNon précisée73,7 %92,6
18Voxtral SmallMistral AI · poids ouvertsNon précisée73,6 %92,0
19Llama 2-13BMeta AI · poids ouverts · 2 configurationsNon précisée73,2 %89,5
20Gemma 2 9BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée73,1 %88,6
21Mistral NeMoMistral AI · poids ouvertsNon précisée73 %88,0
22GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsNon précisée72,8 %87,0
23Gemma 7BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée72,8 %86,6
24Llama 3-8BMeta AI · poids ouverts · 2 configurationsNon précisée72,7 %86,0
25Mistral Small 3Mistral AINon précisée72,4 %84,6
26Qwen3-30B-A3BAlibaba · poids ouvertsSans72,3 %83,9
27Ministral 3 14BMistral AI · poids ouverts · 2 configurationsÉlevée72,3 %83,5
28Mistral 7B v0.1Mistral AI · poids ouverts · 2 configurationsNon précisée71,9 %81,3
29Claude Haiku 4.5AnthropicNon précisée71,8 %80,8
30GPT-5.4 MiniOpenAI · 4 configurationsSans71,3 %77,8
31Qwen3-8BAlibaba · poids ouverts · 2 configurationsSans71,1 %76,8
32GPT-5.4OpenAISans71,1 %76,5
33Qwen2.5-72BAlibaba · poids ouvertsNon précisée71 %76,0
34Qwen3-235B-A22BAlibaba · poids ouvertsNon précisée71 %75,9
35Claude Sonnet 4.5Anthropic · 2 configurationsSans70,9 %75,4
36Mistral 7B v0.3Mistral AI · poids ouvertsNon précisée70,8 %75,1
37Grok 4.1 FastxAIÉlevée70,7 %74,5
38Ministral 3 3BMistral AI · poids ouverts · 2 configurationsÉlevée70,6 %73,8
39EuroLLM 22B InstructEuroLLM · poids ouverts · 2 configurationsNon précisée70,6 %73,4
40Qwen3-235B-A22B-Instruct (Jul 2025)Alibaba · poids ouvertsNon précisée70,5 %73,3
41GPT-5.2OpenAINon précisée70,2 %71,5
42c4ai-command-r-08-2024Cohere · poids ouvertsNon précisée70,1 %71,1
43Gemma 4 31B ITGoogle DeepMind · poids ouverts · 2 configurationsNon précisée70,1 %71,0
44Apertus 8B InstructSwiss AI (EPFL · poids ouvertsNon précisée70,1 %70,7
45Grok-2 (Dec 2024)xAINon précisée70 %70,4
45Llama-3.1-Nemotron-70B-InstructNVIDIA · poids ouvertsNon précisée70 %70,4
47Apertus v1.5 70BSwiss AI (EPFL, ETH Zurich) · poids ouvertsNon précisée69,9 %69,9
48OLMo 3.1 32B InstructAllen Institute for AI · poids ouvertsNon précisée69,8 %69,3
48ALIA-40bBarcelona Supercomputing Center · poids ouvertsNon précisée69,8 %69,3
50Qwen3-235B-A22B-Thinking (Jul 2025)AlibabaNon précisée69,8 %68,8
51Ministral 8BMistral AI · poids ouvertsNon précisée69,7 %68,8
52chutes/Qwen3-Next-80B-A3B-InstructAlibaba · poids ouvertsNon précisée69,7 %68,7
53GPT-5 miniOpenAI · 3 configurationsFaible69,7 %68,6
54Qwen 3.8 27BAlibaba · poids ouvertsNon précisée69,6 %67,9
55Qwen3.6 27BAlibaba · poids ouvertsNon précisée69,5 %67,2
56GPT-5.4 NanoOpenAI · 4 configurationsFaible69,5 %67,2
57EuroLLM 9B Instruct (2512)EuroLLM · poids ouvertsNon précisée69,3 %66,5
58GPT-5.6 TerraOpenAINon précisée69,3 %66,1
59GPT-5.6 LunaOpenAINon précisée69,1 %64,8
60Grok-3 minixAIÉlevée68,8 %63,5
61Qwen1.5-14BAlibaba · poids ouverts · 2 configurationsNon précisée68,6 %62,4
62GPT-4.1 miniOpenAINon précisée68,6 %62,1
63DeepSeek-R1-Distill-Llama-70BDeepSeek · poids ouvertsNon précisée68,6 %62,0
64Aya Expanse 32BCohere · poids ouvertsNon précisée68,5 %61,9
65EuroLLM 9B InstructEuroLLM · poids ouvertsNon précisée68,5 %61,6
66Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée68,5 %61,5
67Llama 4 ScoutMeta AI · poids ouvertsNon précisée68,5 %61,5
68Gemini 3.5 Flash-LiteGoogle DeepMindNon précisée68,4 %61,2
69Qwen3-4BAlibaba · poids ouverts · 3 configurationsSans68,3 %60,9
70Gemini 3 ProGoogle DeepMindNon précisée68,3 %60,8
71Gemma 4 26B A4BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée68,2 %59,8
72Reka Flash 3Reka AINon précisée68 %59,1
73nvidia-nemotron-nano-9b-v2NVIDIA · poids ouverts · 2 configurationsNon précisée67,9 %58,5
74GPT-5.6 SolOpenAINon précisée67,8 %58,1
75QwQ-32BAlibaba · poids ouvertsNon précisée67,8 %57,6
75Gemma 3 12BGoogle DeepMind · poids ouvertsNon précisée67,8 %57,6
77Qwen3.5-35B-A3BAlibaba · poids ouvertsNon précisée67,7 %57,1
78glm-4.7-flashZ.ai (Zhipu AI) · poids ouverts · 2 configurationsNon précisée67,7 %57,0
79Gemini 2.5 Flash-Lite (Jun 2025)Google DeepMind · 4 configurationsSans67,4 %55,9
80granite-4.0-microIBM · poids ouvertsNon précisée67,4 %55,5
81Claude Sonnet 4.6AnthropicNon précisée67,3 %55,0
82Gemini 2.5 Flash (Apr 2025)Google DeepMindNon précisée67,2 %54,6
83Gemini 3.1 Flash-LiteGoogle DeepMindNon précisée66,7 %51,6
84Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée66,6 %51,4
85Claude 3.7 SonnetAnthropic · 2 configurationsÉlevée66,5 %50,9
86qwen3-4b-instruct-2507AlibabaNon précisée66,3 %49,9
87GPT-5OpenAI · 3 configurationsFaible66,3 %49,7
88Gemini 2.5 Flash (Jun 2025)Google DeepMind · 2 configurationsSans66,3 %49,5
89Phi-4 ReasoningMicrosoft · poids ouvertsÉlevée66 %47,9
90Qwen3-Next-80B-A3B ThinkingAlibaba · poids ouvertsÉlevée65,9 %47,5
91Gemini 3.6 FlashGoogle DeepMindNon précisée65,7 %46,5
92deepseek-r1-0528-qwen3-8bDeepSeek · poids ouvertsNon précisée65,6 %46,1
93OLMo 2 Furious 13BAllen Institute for AI · poids ouvertsNon précisée65,5 %45,6
94Grok 3xAINon précisée65,5 %45,4
95o3OpenAINon précisée65,4 %44,6
96Apertus 70B InstructSwiss AI (EPFL, ETH Zurich) · poids ouvertsNon précisée65,3 %44,2
97o4-miniOpenAINon précisée65,3 %44,2
98Gemini 3.7 FlashGoogle DeepMindNon précisée65,2 %43,5
99Llama 3.3 70BMeta AI · poids ouvertsNon précisée65,1 %43,2
100Qwen2.5-1.5BAlibaba · poids ouvertsNon précisée65,1 %43,1
101GPT-5 nanoOpenAI · 3 configurationsÉlevée64,8 %41,8
102Qwen3.5-2BAlibaba · poids ouvertsNon précisée64,8 %41,5
103Luciole 23B Instruct 1.1OpenLLM-France · poids ouvertsNon précisée64,5 %39,9
104GPT-4.1OpenAINon précisée64,4 %39,4
105Gemini 3 FlashGoogle DeepMind · 2 configurationsSans64,2 %38,4
106GPT-6 AstraOpenAINon précisée63,8 %36,4
107Qwen3-1.7BAlibaba · 2 configurationsNon précisée63,6 %35,1
108o3-miniOpenAINon précisée63,4 %34,0
109gpt-oss-20bOpenAI · poids ouverts · 3 configurationsMoyenne63,2 %33,2
110gpt-oss-120bOpenAI · poids ouvertsNon précisée63,1 %32,5
111Luciole 8B Instruct 1.1OpenLLM-France · poids ouvertsNon précisée61,6 %25,0
112Llama 3.2 3BMeta AI · poids ouvertsNon précisée61 %22,0
113Llama 2-7BMeta AI · poids ouvertsNon précisée59,2 %13,1
114DeepSeek-R1-Distill-Qwen-14BDeepSeekNon précisée58,4 %8,9
115Gemma 2BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée57,9 %6,2
116Qwen3.5-0.8BAlibaba · poids ouvertsNon précisée57,1 %2,4
117Phi-2Microsoft · poids ouvertsNon précisée55,9 %-3,3
118DeepSeek-R1-Distill-Qwen-32BDeepSeekNon précisée53,8 %-13,6
119Mistral 7B v0.2Mistral AINon précisée50,8 %-28,3
120Qwen3-0.6BAlibaba · 2 configurationsNon précisée49,6 %-34,2
121DeepSeek-R1-Distill-Qwen-7BDeepSeekNon précisée47,4 %-44,5
122Falcon 2 11BTechnology Innovation Institute · poids ouvertsNon précisée47,1 %-46,0
123Llama 3.2 1BMeta AI · poids ouverts · 2 configurationsNon précisée44,7 %-57,7
124Qwen3.5-9BAlibaba · poids ouvertsNon précisée42,4 %-69,3
125DeepSeek-R1-Distill-Llama-8BDeepSeekNon précisée40,9 %-76,6
126Gemma 3 4BGoogle DeepMind · poids ouvertsNon précisée38,6 %-88,0
127Qwen3.5-4BAlibaba · poids ouvertsNon précisée38 %-91,0
128Phi-4Microsoft · poids ouvertsNon précisée37,5 %-93,6
129GLM-4.5-AirZ.ai (Zhipu AI) · poids ouverts · 2 configurationsSans34,3 %-110,7
130Gemma 3 270MGoogle DeepMind · poids ouverts · 2 configurationsNon précisée28,7 %-142,2
131DeepSeek-R1-Distill-Qwen-1.5BDeepSeekNon précisée25,6 %-160,6
132Salamandra 7B InstructBarcelona Supercomputing Center · poids ouvertsNon précisée18,2 %-213,3
133Gemma 3 1BGoogle DeepMind · poids ouvertsNon précisée16,9 %-224,0
134Phi-4 MiniMicrosoft · poids ouvertsÉlevée9,8 %-300,4

En bref

Que mesure EuroEval, FQuAD (compréhension) ?
Le modèle lit un texte en français et répond à une question dont la réponse s'y trouve. Sur Quelle IA, il est rangé dans la tâche Français.
Comment EuroEval, FQuAD (compréhension) est-il noté ?
La part de mots communs entre sa réponse et la réponse attendue. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 67 %.
Qui est en tête sur EuroEval, FQuAD (compréhension) ?
Llama 3.1-405B (Meta AI) est en tête d'EuroEval, FQuAD (compréhension) avec 77,4 %, dans l'édition du 28 septembre 2026. Suivent Llama 3.1-70B (76,7 %) et Nemotron 3 Nano 30B (76,3 %). 134 modèles y sont mesurés.
Quelles sont les limites d'EuroEval, FQuAD (compréhension) ?
Une réponse juste mais formulée autrement perd des points. Au 28 septembre 2026, le benchmark est actif.
Combien pèse EuroEval, FQuAD (compréhension) dans le score IA ?
EuroEval, FQuAD (compréhension) compte pour 0,62 % du score général, dans l'édition du 28 septembre 2026. Il porte 6 % de la tâche Français (10 % du score général), que se partagent 10 benchmarks.
Qui maintient EuroEval, FQuAD (compréhension) ?
EuroEval. Sa page de référence : euroeval.com/leaderboards/Monolingual/french.

Les autres benchmarks de la tâche Français

Tous les benchmarks →Comment le score IA est calculé →