Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

FrançaisFiche benchmark · EuroEval · euroeval.com

EuroEval, OrangeSum (résumé)

Le modèle résume un article de presse en français.

À quoi il sert

Sur Quelle IA, EuroEval, OrangeSum (résumé) sert à noter la tâche Français : c'est l'un de ses 10 benchmarks.

Comment c'est noté

La proximité entre son résumé et un résumé de référence, mesurée automatiquement.

Ce qu'il ne dit pas

Un bon résumé différent de la référence est mal noté. Les écarts entre modèles sont faibles.

Comment lire le score

69 modèles mesurés · 91 mesures

En tête : GLM-5.3-Flash, 40,9 %

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 39 %. Le meilleur, GLM-5.3-Flash, atteint 40,9 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
37 %
Score IA 76niveau de Claude Sonnet 4.5
38 %
Score IA 100niveau de Claude Opus 5.5
39 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0,62 %du score général. EuroEval, OrangeSum (résumé) porte 6 % de la tâche Français (10 % du score général), que se partagent 10 benchmarks.

En couleur, la tâche Français dans le score général. En noir, la part d'EuroEval, OrangeSum (résumé).

Le classement du benchmark

Scores relevés sur euroeval.com · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsNon précisée40,9 %143,4
2Gemini 3 ProGoogle DeepMindNon précisée39,5 %111,9
3Claude Sonnet 4.5Anthropic · 2 configurationsSans39,5 %111,2
4Gemini 3.7 FlashGoogle DeepMindNon précisée39,2 %104,0
5Apertus v1.5 70BSwiss AI (EPFL, ETH Zurich) · poids ouvertsNon précisée39,1 %102,3
6Gemma 4 31B ITGoogle DeepMind · poids ouverts · 2 configurationsNon précisée39 %99,2
7Gemma 4 26B A4BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée38,9 %97,3
8GPT-4.1OpenAINon précisée38,9 %96,1
9Gemini 3.5 Flash-LiteGoogle DeepMindNon précisée38,8 %95,2
10Gemini 3.1 Flash-LiteGoogle DeepMindNon précisée38,6 %90,4
69 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 69 →Replier le classement ↑
11Gemini 3 FlashGoogle DeepMind · 2 configurationsSans38,6 %90,1
11Gemini 2.5 Flash-Lite (Jun 2025)Google DeepMind · 2 configurationsSans38,6 %90,1
11EuroLLM 9B Instruct (2512)EuroLLM · poids ouvertsNon précisée38,6 %90,1
14Mistral Small 3.1Mistral AINon précisée38,6 %88,4
15EuroLLM 9B InstructEuroLLM · poids ouvertsNon précisée38,5 %86,0
16Llama 3.3 70BMeta AI · poids ouvertsNon précisée38,4 %84,6
17Claude Haiku 4.5AnthropicNon précisée38,4 %84,1
17Luciole 23B Instruct 1.1OpenLLM-France · poids ouvertsNon précisée38,4 %84,1
19Qwen 3.8 27BAlibaba · poids ouvertsNon précisée38,3 %82,4
20Grok 4.1 FastxAIÉlevée38,2 %80,7
21Gemini 3.6 FlashGoogle DeepMindNon précisée38,2 %80,5
22GPT-5.4 MiniOpenAI · 4 configurationsSans38 %74,9
22Qwen3.6 27BAlibaba · poids ouvertsNon précisée38 %74,9
24Ministral 3 14BMistral AI · poids ouverts · 2 configurationsNon précisée38 %74,7
24Qwen2.5-72BAlibaba · poids ouvertsNon précisée38 %74,7
26Qwen3-32BAlibaba · poids ouvertsSans38 %74,0
27Llama 3.1-8BMeta AI · poids ouverts · 2 configurationsNon précisée37,9 %73,5
28Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée37,9 %72,3
28Luciole 8B Instruct 1.1OpenLLM-France · poids ouvertsNon précisée37,9 %72,3
30Qwen3-14BAlibaba · poids ouvertsSans37,9 %71,8
30Gemma 3 12BGoogle DeepMind · poids ouvertsNon précisée37,9 %71,8
32Mistral Small 3.2Mistral AI · poids ouvertsNon précisée37,9 %71,6
33Qwen3.5-2BAlibaba · poids ouvertsNon précisée37,8 %71,3
34granite-4.0-microIBM · poids ouvertsNon précisée37,8 %69,6
35Claude Sonnet 4.6AnthropicNon précisée37,8 %69,4
36GPT-5 miniOpenAINon précisée37,5 %63,6
37Qwen3-8BAlibaba · poids ouvertsSans37,5 %63,3
38Gemma 3n E4BGoogle DeepMind · poids ouvertsNon précisée37,4 %60,6
39GPT-5.6 TerraOpenAINon précisée37,4 %60,4
39Qwen3.5-35B-A3BAlibaba · poids ouvertsNon précisée37,4 %60,4
41Qwen3-4BAlibaba · poids ouverts · 2 configurationsSans37,4 %60,2
42GPT-5.6 LunaOpenAINon précisée37,4 %59,4
43GPT-5.6 SolOpenAINon précisée37,3 %58,2
44GPT-6 AstraOpenAINon précisée37,3 %57,7
45Ministral 3 8BMistral AI · poids ouverts · 2 configurationsNon précisée37,2 %55,8
46GPT-5.4OpenAISans37,1 %53,6
47Llama 3.2 3BMeta AI · poids ouvertsNon précisée37,1 %52,4
48Qwen3.5-9BAlibaba · poids ouvertsNon précisée37 %51,9
49Gemma 3 4BGoogle DeepMind · poids ouvertsNon précisée36,9 %48,2
50GPT-5.2OpenAINon précisée36,8 %45,3
51Qwen3.5-0.8BAlibaba · poids ouvertsNon précisée36,5 %39,4
52Qwen3-1.7BAlibabaSans36,5 %38,6
53Voxtral SmallMistral AI · poids ouvertsNon précisée36,4 %37,2
54glm-4.7-flashZ.ai (Zhipu AI) · poids ouverts · 2 configurationsNon précisée36,3 %34,7
55OLMo 3.1 32B InstructAllen Institute for AI · poids ouvertsNon précisée36,2 %31,8
56EuroLLM 22B InstructEuroLLM · poids ouvertsNon précisée36 %26,3
57GPT-5.4 NanoOpenAI · 4 configurationsSans35,7 %19,2
58Qwen3.5-4BAlibaba · poids ouvertsNon précisée35,7 %17,9
59Ministral 3 3BMistral AI · poids ouverts · 2 configurationsÉlevée35,1 %4,5
60GPT-5 nanoOpenAINon précisée35 %2,0
61Qwen3-0.6BAlibabaSans34,8 %-2,5
62Nemotron 3 Nano 30BNVIDIA · poids ouverts · 2 configurationsNon précisée34,7 %-6,8
63gpt-oss-20bOpenAI · poids ouverts · 3 configurationsFaible34,6 %-8,8
64gpt-oss-120bOpenAI · poids ouvertsNon précisée34,6 %-9,6
65Gemma 3 270MGoogle DeepMind · poids ouverts · 2 configurationsNon précisée32,3 %-67,9
66Llama 3.2 1BMeta AI · poids ouverts · 2 configurationsNon précisée31,4 %-89,9
67Gemma 3 1BGoogle DeepMind · poids ouvertsNon précisée31 %-102,7
68Llama 3.1-70BMeta AI · poids ouvertsNon précisée30,6 %-111,2
69Salamandra 7B InstructBarcelona Supercomputing Center · poids ouvertsNon précisée28,8 %-160,3

En bref

Que mesure EuroEval, OrangeSum (résumé) ?
Le modèle résume un article de presse en français. Sur Quelle IA, il est rangé dans la tâche Français.
Comment EuroEval, OrangeSum (résumé) est-il noté ?
La proximité entre son résumé et un résumé de référence, mesurée automatiquement. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 39 %.
Qui est en tête sur EuroEval, OrangeSum (résumé) ?
GLM-5.3-Flash (Z.ai (Zhipu AI)) est en tête d'EuroEval, OrangeSum (résumé) avec 40,9 %, dans l'édition du 28 septembre 2026. Suivent Gemini 3 Pro (39,5 %) et Claude Sonnet 4.5 (39,5 %). 69 modèles y sont mesurés.
Quelles sont les limites d'EuroEval, OrangeSum (résumé) ?
Un bon résumé différent de la référence est mal noté. Les écarts entre modèles sont faibles. Au 28 septembre 2026, le benchmark est actif.
Combien pèse EuroEval, OrangeSum (résumé) dans le score IA ?
EuroEval, OrangeSum (résumé) compte pour 0,62 % du score général, dans l'édition du 28 septembre 2026. Il porte 6 % de la tâche Français (10 % du score général), que se partagent 10 benchmarks.
Qui maintient EuroEval, OrangeSum (résumé) ?
EuroEval. Sa page de référence : euroeval.com/leaderboards/Monolingual/french.

Les autres benchmarks de la tâche Français

Tous les benchmarks →Comment le score IA est calculé →