Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

FrançaisFiche benchmark · EuroEval · euroeval.com

EuroEval, Allociné (sentiment)

Le modèle dit si une critique de film en français est positive ou négative.

SATURÉ

À quoi il sert

Sur Quelle IA, EuroEval, Allociné (sentiment) sert à noter la tâche Français : c'est l'un de ses 10 benchmarks.

Comment c'est noté

Un score d'accord avec la bonne réponse, de 0 à 100.

Ce qu'il ne dit pas

Épreuve facile : presque tous les modèles récents dépassent 90.

Comment lire le score

134 modèles mesurés · 190 mesures

En tête : o3, 98,2 %

Chaque trait est un modèle, placé à son meilleur score. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 94 %. Le meilleur, o3, atteint 98,2 %. Le seuil de saturation (95 %) est franchi : au sommet, les meilleurs modèles ne se départagent plus.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
94 %
Score IA 76niveau de Claude Sonnet 4.5
97 %
Score IA 100niveau de Claude Opus 5.5
98 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0,62 %du score général. EuroEval, Allociné (sentiment) porte 6 % de la tâche Français (10 % du score général), que se partagent 10 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.

En couleur, la tâche Français dans le score général. En noir, la part d'EuroEval, Allociné (sentiment).

Le classement du benchmark

Scores relevés sur euroeval.com · édition du
RangModèleRéflexionScore publiéSuggèreSource
1o3OpenAINon précisée98,2 %108,2
2GPT-5OpenAI · 3 configurationsÉlevée97,3 %89,2
3Gemini 3.5 Flash-LiteGoogle DeepMindNon précisée97 %83,8
4Ministral 3 14BMistral AI · poids ouverts · 2 configurationsNon précisée96,9 %82,3
5GPT-5.4 MiniOpenAI · 4 configurationsÉlevée96,8 %80,1
5Grok 4.1 FastxAIÉlevée96,8 %80,1
7GPT-6 AstraOpenAINon précisée96,7 %78,7
7GPT-5.6 SolOpenAINon précisée96,7 %78,7
7Gemini 3 ProGoogle DeepMindNon précisée96,7 %78,7
7Gemini 3 FlashGoogle DeepMind · 2 configurationsÉlevée96,7 %78,7
134 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 134 →Replier le classement ↑
11Ministral 3 8BMistral AI · poids ouverts · 2 configurationsNon précisée96,6 %77,7
12Grok 3xAINon précisée96,5 %75,4
12GPT-5 nanoOpenAI · 3 configurationsÉlevée96,5 %75,4
14Gemini 3.6 FlashGoogle DeepMindNon précisée96,3 %73,2
14Claude Sonnet 4.6AnthropicNon précisée96,3 %73,2
16GPT-4.1 miniOpenAINon précisée96,2 %72,1
17Gemma 4 31B ITGoogle DeepMind · poids ouverts · 2 configurationsNon précisée96,2 %71,1
18GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsNon précisée96,1 %70,2
19Luciole 23B Instruct 1.1OpenLLM-France · poids ouvertsNon précisée96,1 %70,1
20GPT-4.1OpenAINon précisée96 %69,4
21GPT-5 miniOpenAI · 3 configurationsÉlevée96 %69,3
21o4-miniOpenAINon précisée96 %69,3
23GPT-5.4OpenAISans96 %69,2
24Claude Haiku 4.5AnthropicNon précisée95,9 %68,3
25gpt-oss-120bOpenAI · poids ouvertsNon précisée95,8 %67,1
26Qwen3.5-35B-A3BAlibaba · poids ouvertsNon précisée95,8 %66,2
27Claude Sonnet 4.5Anthropic · 2 configurationsÉlevée95,7 %65,8
28GPT-5.2OpenAINon précisée95,7 %65,5
29Qwen 3.8 27BAlibaba · poids ouvertsNon précisée95,5 %63,6
29Gemma 4 26B A4BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée95,5 %63,6
31glm-4.7-flashZ.ai (Zhipu AI) · poids ouverts · 2 configurationsNon précisée95,3 %61,1
32Qwen3.6 27BAlibaba · poids ouvertsNon précisée95,2 %60,4
33GPT-5.6 TerraOpenAINon précisée95,1 %59,5
34Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée95,1 %59,1
34Yi-1.5-34B01.AI · poids ouvertsNon précisée95,1 %59,1
36Qwen3.5-9BAlibaba · poids ouvertsNon précisée95,1 %58,8
37Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée95 %58,0
38Gemini 3.7 FlashGoogle DeepMindNon précisée95 %57,9
39Gemma 2 27BGoogle DeepMind · 2 configurationsNon précisée95 %57,8
40OLMo 3.1 32B InstructAllen Institute for AI · poids ouvertsNon précisée95 %57,6
41Qwen3-235B-A22B-Thinking (Jul 2025)AlibabaNon précisée94,9 %57,2
42Mistral Small 3.1Mistral AINon précisée94,9 %57,0
43chutes/Qwen3-Next-80B-A3B-InstructAlibaba · poids ouvertsNon précisée94,8 %56,0
44Claude 3.7 SonnetAnthropic · 2 configurationsÉlevée94,7 %55,4
45Llama 3.1-70BMeta AI · poids ouverts · 2 configurationsNon précisée94,7 %55,3
46Llama 3.3 70BMeta AI · poids ouvertsNon précisée94,7 %55,2
47Qwen3-Next-80B-A3B ThinkingAlibaba · poids ouvertsÉlevée94,7 %55,0
48Qwen2.5-72BAlibaba · poids ouvertsNon précisée94,7 %54,8
49EuroLLM 22B InstructEuroLLM · poids ouverts · 2 configurationsNon précisée94,6 %54,2
50Qwen3-235B-A22B-Instruct (Jul 2025)Alibaba · poids ouvertsNon précisée94,6 %54,0
51Llama-3.1-Nemotron-70B-InstructNVIDIA · poids ouvertsNon précisée94,6 %53,9
52Qwen3-32BAlibaba · poids ouvertsSans94,5 %53,3
53Mistral 7B v0.3Mistral AI · poids ouvertsNon précisée94,5 %53,1
54Qwen3-14BAlibaba · poids ouverts · 2 configurationsSans94,5 %53,0
54Llama 3.1-405BMeta AI · poids ouverts · 3 configurationsNon précisée94,5 %53,0
56Gemma 2 9BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée94,5 %52,8
57Llama 3-70BMeta AI · poids ouverts · 2 configurationsNon précisée94,4 %52,7
58Magistral Small 1.2Mistral AI · poids ouvertsNon précisée94,4 %52,5
59QwQ-32BAlibaba · poids ouvertsNon précisée94,3 %51,8
60Nemotron 3 Nano 30BNVIDIA · poids ouverts · 3 configurationsNon précisée94,3 %51,7
61Gemini 2.5 Flash (Jun 2025)Google DeepMind · 2 configurationsSans94,3 %51,4
62GPT-5.4 NanoOpenAI · 4 configurationsÉlevée94,3 %51,3
63Mistral Small 3.2Mistral AI · poids ouvertsNon précisée94,3 %51,2
64EuroLLM 9B Instruct (2512)EuroLLM · poids ouvertsNon précisée94,3 %51,0
65Phi-4Microsoft · poids ouvertsNon précisée94,2 %50,7
66Grok-3 minixAIÉlevée94,1 %49,8
66Reka Flash 3Reka AINon précisée94,1 %49,8
68DeepSeek-R1-Distill-Llama-70BDeepSeek · poids ouvertsNon précisée94,1 %49,6
68Mixtral 8x7BMistral AI · poids ouverts · 2 configurationsNon précisée94,1 %49,6
68OLMo 2 Furious 13BAllen Institute for AI · poids ouvertsNon précisée94,1 %49,6
71Gemini 3.1 Flash-LiteGoogle DeepMindNon précisée94,1 %49,5
72Llama 3-8BMeta AI · poids ouverts · 2 configurationsNon précisée94 %48,8
73Voxtral SmallMistral AI · poids ouvertsNon précisée93,9 %47,9
74GPT-5.6 LunaOpenAINon précisée93,9 %47,8
75Qwen3-235B-A22BAlibaba · poids ouvertsNon précisée93,9 %47,6
76Mistral Small 3Mistral AINon précisée93,8 %47,4
77GLM-4.5-AirZ.ai (Zhipu AI) · poids ouverts · 2 configurationsÉlevée93,8 %47,3
78Magistral Small 1.0Mistral AI · poids ouvertsNon précisée93,6 %45,3
79Llama 4 ScoutMeta AI · poids ouvertsNon précisée93,6 %45,1
79Llama 3.1-8BMeta AI · poids ouverts · 2 configurationsNon précisée93,6 %45,1
81Llama 2-70BMeta AI · poids ouverts · 2 configurationsNon précisée93,5 %44,9
82ALIA-40bBarcelona Supercomputing Center · poids ouvertsNon précisée93,4 %43,9
83Apertus v1.5 70BSwiss AI (EPFL, ETH Zurich) · poids ouvertsNon précisée93,3 %43,2
84Qwen3-30B-A3BAlibaba · poids ouvertsSans93,3 %43,1
84Mistral NeMoMistral AI · poids ouvertsNon précisée93,3 %43,1
86Aya Expanse 32BCohere · poids ouvertsNon précisée93,3 %42,9
87Qwen1.5-14BAlibaba · poids ouverts · 2 configurationsNon précisée93,2 %42,7
88Falcon 2 11BTechnology Innovation Institute · poids ouvertsNon précisée93,2 %42,3
89Gemma 3 12BGoogle DeepMind · poids ouvertsNon précisée93,2 %42,3
90o3-miniOpenAINon précisée93,1 %42,0
91DeepSeek-R1-Distill-Qwen-32BDeepSeekNon précisée93,1 %41,7
92Gemma 3n E4BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée93,1 %41,6
93Mistral 7B v0.1Mistral AI · poids ouverts · 2 configurationsNon précisée93,1 %41,4
94Gemini 2.5 Flash-Lite (Jun 2025)Google DeepMind · 4 configurationsSans93,1 %41,3
94Qwen3-8BAlibaba · poids ouverts · 2 configurationsNon précisée93,1 %41,3
96Luciole 8B Instruct 1.1OpenLLM-France · poids ouvertsNon précisée93 %41,0
97EuroLLM 9B InstructEuroLLM · poids ouvertsNon précisée93 %40,8
98Qwen3.5-4BAlibaba · poids ouvertsNon précisée93 %40,6
99Ministral 8BMistral AI · poids ouvertsNon précisée92,8 %39,5
100Apertus 70B InstructSwiss AI (EPFL, ETH Zurich) · poids ouvertsNon précisée92,8 %39,5
101deepseek-r1-0528-qwen3-8bDeepSeek · poids ouvertsNon précisée92,3 %36,3
102Llama 3.2 3BMeta AI · poids ouvertsNon précisée92,3 %36,1
103Grok-2 (Dec 2024)xAINon précisée92,1 %34,6
104Qwen3-4BAlibaba · poids ouverts · 3 configurationsÉlevée92 %34,3
105granite-4.0-microIBM · poids ouvertsNon précisée91,9 %33,4
106DeepSeek-R1-Distill-Qwen-14BDeepSeekNon précisée91,9 %33,2
107Qwen3.5-2BAlibaba · poids ouvertsNon précisée91,9 %33,1
108Mistral 7B v0.2Mistral AINon précisée91,7 %32,3
109Llama 2-13BMeta AI · poids ouverts · 2 configurationsNon précisée91,5 %31,0
110qwen3-4b-instruct-2507AlibabaNon précisée91,5 %30,8
111Ministral 3 3BMistral AI · poids ouverts · 2 configurationsÉlevée91,1 %28,2
112Apertus 8B InstructSwiss AI (EPFL · poids ouvertsNon précisée91 %27,6
113Gemma 3 4BGoogle DeepMind · poids ouvertsNon précisée91 %27,6
114c4ai-command-r-08-2024Cohere · poids ouvertsNon précisée90,9 %27,4
115gpt-oss-20bOpenAI · poids ouverts · 3 configurationsMoyenne90,5 %24,7
116nvidia-nemotron-nano-9b-v2NVIDIA · poids ouverts · 2 configurationsNon précisée90,4 %24,4
117Gemma 7BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée90,1 %22,7
118Llama 3.2 1BMeta AI · poids ouverts · 2 configurationsNon précisée89,8 %21,2
119Gemma 2BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée89,2 %17,9
120Qwen3-1.7BAlibaba · 2 configurationsNon précisée86,9 %7,7
121Gemma 3 1BGoogle DeepMind · poids ouvertsNon précisée84,3 %-2,6
122DeepSeek-R1-Distill-Llama-8BDeepSeekNon précisée83,8 %-4,4
123Qwen2.5-1.5BAlibaba · poids ouvertsNon précisée82,9 %-7,3
124DeepSeek-R1-Distill-Qwen-7BDeepSeekNon précisée81,6 %-11,5
125Qwen3.5-0.8BAlibaba · poids ouvertsNon précisée81,6 %-11,6
126Llama 2-7BMeta AI · poids ouvertsNon précisée78 %-22,3
127Qwen3-0.6BAlibaba · 2 configurationsNon précisée75,7 %-28,6
128Salamandra 7B InstructBarcelona Supercomputing Center · poids ouvertsNon précisée53,1 %-76,9
129Phi-4 MiniMicrosoft · poids ouvertsÉlevée48,5 %-85,6
130Gemma 3 270MGoogle DeepMind · poids ouverts · 2 configurationsNon précisée41,1 %-99,9
131DeepSeek-R1-Distill-Qwen-1.5BDeepSeekNon précisée36,9 %-108,6
132Phi-4 ReasoningMicrosoft · poids ouvertsÉlevée35 %-112,4
133Phi-4-Reasoning-plusMicrosoft · poids ouvertsNon précisée12,6 %-175,5
134Phi-2Microsoft · poids ouvertsNon précisée7,6 %-202,6

En bref

Que mesure EuroEval, Allociné (sentiment) ?
Le modèle dit si une critique de film en français est positive ou négative. Sur Quelle IA, il est rangé dans la tâche Français.
Comment EuroEval, Allociné (sentiment) est-il noté ?
Un score d'accord avec la bonne réponse, de 0 à 100. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 94 %.
Qui est en tête sur EuroEval, Allociné (sentiment) ?
o3 (OpenAI) est en tête d'EuroEval, Allociné (sentiment) avec 98,2 %, dans l'édition du 28 septembre 2026. Suivent GPT-5 (97,3 %) et Gemini 3.5 Flash-Lite (97 %). 134 modèles y sont mesurés.
Quelles sont les limites d'EuroEval, Allociné (sentiment) ?
Épreuve facile : presque tous les modèles récents dépassent 90. Au 28 septembre 2026, le benchmark est saturé.
Combien pèse EuroEval, Allociné (sentiment) dans le score IA ?
EuroEval, Allociné (sentiment) compte pour 0,62 % du score général, dans l'édition du 28 septembre 2026. Il porte 6 % de la tâche Français (10 % du score général), que se partagent 10 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.
Qui maintient EuroEval, Allociné (sentiment) ?
EuroEval. Sa page de référence : euroeval.com/leaderboards/Monolingual/french.

Les autres benchmarks de la tâche Français

Tous les benchmarks →Comment le score IA est calculé →