Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

FrançaisFiche benchmark · EuroEval · euroeval.com

EuroEval, MultiLoKo (connaissances locales)

Des questions de culture propre aux pays francophones, posées en français.

À quoi il sert

Sur Quelle IA, EuroEval, MultiLoKo (connaissances locales) sert à noter la tâche Français : c'est l'un de ses 10 benchmarks. Il départage surtout les modèles dont le score IA approche 79.

Comment c'est noté

La part de réponses exactes.

Ce qu'il ne dit pas

Peu de modèles mesurés. Exige la réponse exacte, au mot près.

Comment lire le score

64 modèles mesurés · 85 mesures

En tête : Gemini 3.7 Flash, 89,1 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 79. Le meilleur, Gemini 3.7 Flash, atteint 89,1 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
17 %
Score IA 76niveau de Claude Sonnet 4.5
46 %
Score IA 100niveau de Claude Opus 5.5
76 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0,62 %du score général. EuroEval, MultiLoKo (connaissances locales) porte 6 % de la tâche Français (10 % du score général), que se partagent 10 benchmarks.

En couleur, la tâche Français dans le score général. En noir, la part d'EuroEval, MultiLoKo (connaissances locales).

Le classement du benchmark

Scores relevés sur euroeval.com · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Gemini 3.7 FlashGoogle DeepMindNon précisée89,1 %116,3
2Gemini 3 FlashGoogle DeepMind · 2 configurationsÉlevée87,4 %113,4
3Gemini 3.6 FlashGoogle DeepMindNon précisée86,5 %112,1
4GPT-6 AstraOpenAINon précisée86,1 %111,5
5GPT-5.6 SolOpenAINon précisée83,3 %107,6
6GPT-5.6 LunaOpenAINon précisée67 %91,9
7GPT-5.6 TerraOpenAINon précisée66,6 %91,6
8GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsNon précisée61,3 %87,5
9GPT-5.4 MiniOpenAI · 4 configurationsMoyenne60,6 %87,0
10Gemini 3.1 Flash-LiteGoogle DeepMindNon précisée56,5 %84,0
64 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 64 →Replier le classement ↑
11Grok 4.1 FastxAIÉlevée52,4 %81,1
12GPT-5 miniOpenAINon précisée49,2 %78,8
13Claude Sonnet 4.5Anthropic · 2 configurationsÉlevée47,9 %77,9
14GPT-4.1OpenAINon précisée47,4 %77,6
15Claude Sonnet 4.6AnthropicNon précisée43,6 %74,9
16GPT-5.4OpenAISans42,9 %74,4
17Gemini 2.5 Flash-Lite (Jun 2025)Google DeepMind · 2 configurationsÉlevée41,9 %73,6
18Gemma 4 31B ITGoogle DeepMind · poids ouverts · 2 configurationsNon précisée38,4 %71,2
19Mistral Small 3.1Mistral AINon précisée34,2 %67,9
20Qwen3.5-35B-A3BAlibaba · poids ouvertsNon précisée34,1 %67,8
21Gemma 4 26B A4BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée33,5 %67,4
22Gemini 3.5 Flash-LiteGoogle DeepMindNon précisée32,7 %66,7
23Mistral Small 3.2Mistral AI · poids ouvertsNon précisée32,6 %66,7
24GPT-5.4 NanoOpenAI · 4 configurationsMoyenne32,2 %66,3
25Qwen3.6 27BAlibaba · poids ouvertsNon précisée31,6 %65,8
26Llama 3.3 70BMeta AI · poids ouvertsNon précisée30,5 %65,0
27GPT-5.2OpenAINon précisée30,5 %64,9
28Qwen2.5-72BAlibaba · poids ouvertsNon précisée29,1 %63,7
29Qwen 3.8 27BAlibaba · poids ouvertsNon précisée27,8 %62,6
30GPT-5 nanoOpenAINon précisée26,6 %61,6
31gpt-oss-120bOpenAI · poids ouvertsNon précisée25,9 %61,0
32Ministral 3 14BMistral AI · poids ouverts · 2 configurationsNon précisée25,9 %60,9
33glm-4.7-flashZ.ai (Zhipu AI) · poids ouvertsNon précisée24,2 %59,4
34Nemotron 3 Nano 30BNVIDIA · poids ouverts · 2 configurationsNon précisée22,8 %58,0
35Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée20,3 %55,4
36Claude Haiku 4.5AnthropicNon précisée19,5 %54,5
37Qwen3-14BAlibaba · poids ouvertsSans18,8 %53,7
38Qwen3.5-9BAlibaba · poids ouvertsNon précisée18,7 %53,6
39EuroLLM 22B InstructEuroLLM · poids ouvertsNon précisée18,2 %53,1
40Qwen3-4BAlibaba · poids ouverts · 2 configurationsÉlevée17,5 %52,2
41Llama 3.1-70BMeta AI · poids ouvertsNon précisée17,3 %51,9
42Gemma 3 12BGoogle DeepMind · poids ouvertsNon précisée17,1 %51,7
43Qwen3-8BAlibaba · poids ouvertsSans17,1 %51,6
44Ministral 3 8BMistral AI · poids ouverts · 2 configurationsNon précisée16,9 %51,4
45Apertus v1.5 70BSwiss AI (EPFL, ETH Zurich) · poids ouvertsNon précisée16,8 %51,2
46Qwen3.5-4BAlibaba · poids ouvertsNon précisée15,7 %49,9
47Gemma 3 4BGoogle DeepMind · poids ouvertsNon précisée15,2 %49,3
48Qwen3-32BAlibaba · poids ouvertsSans14,7 %48,5
49gpt-oss-20bOpenAI · poids ouverts · 3 configurationsMoyenne13 %46,1
50Luciole 23B Instruct 1.1OpenLLM-France · poids ouvertsNon précisée12,8 %45,6
51EuroLLM 9B InstructEuroLLM · poids ouvertsNon précisée11,6 %43,8
52Llama 3.1-8BMeta AI · poids ouverts · 2 configurationsNon précisée11,5 %43,5
53EuroLLM 9B Instruct (2512)EuroLLM · poids ouvertsNon précisée10,7 %42,2
54Ministral 3 3BMistral AI · poids ouverts · 2 configurationsNon précisée10,7 %42,2
55Qwen3.5-2BAlibaba · poids ouvertsNon précisée8,5 %37,7
56Llama 3.2 3BMeta AI · poids ouvertsNon précisée8,4 %37,4
56Qwen3.5-0.8BAlibaba · poids ouvertsNon précisée8,4 %37,4
58Luciole 8B Instruct 1.1OpenLLM-France · poids ouvertsNon précisée7,6 %35,5
59Salamandra 7B InstructBarcelona Supercomputing Center · poids ouvertsNon précisée7,3 %34,7
60Qwen3-1.7BAlibabaSans5,6 %29,8
61Gemma 3 1BGoogle DeepMind · poids ouvertsNon précisée4,5 %25,6
62Llama 3.2 1BMeta AI · poids ouverts · 2 configurationsNon précisée3,2 %19,4
63Gemma 3 270MGoogle DeepMind · poids ouverts · 2 configurationsNon précisée0,4 %-1,3
64Qwen3-0.6BAlibabaSans-2 %-1,3

En bref

Que mesure EuroEval, MultiLoKo (connaissances locales) ?
Des questions de culture propre aux pays francophones, posées en français. Sur Quelle IA, il est rangé dans la tâche Français.
Comment EuroEval, MultiLoKo (connaissances locales) est-il noté ?
La part de réponses exactes. Un modèle qui obtient 50 % a un score IA d'environ 79.
Qui est en tête sur EuroEval, MultiLoKo (connaissances locales) ?
Gemini 3.7 Flash (Google DeepMind) est en tête d'EuroEval, MultiLoKo (connaissances locales) avec 89,1 %, dans l'édition du 28 septembre 2026. Suivent Gemini 3 Flash (87,4 %) et Gemini 3.6 Flash (86,5 %). 64 modèles y sont mesurés.
Quelles sont les limites d'EuroEval, MultiLoKo (connaissances locales) ?
Peu de modèles mesurés. Exige la réponse exacte, au mot près. Au 28 septembre 2026, le benchmark est actif.
Combien pèse EuroEval, MultiLoKo (connaissances locales) dans le score IA ?
EuroEval, MultiLoKo (connaissances locales) compte pour 0,62 % du score général, dans l'édition du 28 septembre 2026. Il porte 6 % de la tâche Français (10 % du score général), que se partagent 10 benchmarks.
Qui maintient EuroEval, MultiLoKo (connaissances locales) ?
EuroEval. Sa page de référence : euroeval.com/leaderboards/Monolingual/french.

Les autres benchmarks de la tâche Français

Tous les benchmarks →Comment le score IA est calculé →