Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

ÉcritureFiche benchmark · Lech Mazur (projet personnel) · github.com

Lech Mazur Writing

Écrire de courtes nouvelles de 400 à 500 mots qui intègrent dix éléments imposés : personnage, objet, lieu, époque, ton.

ARCHIVÉ

À quoi il sert

Lech Mazur Writing servait à noter la tâche Écriture. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

Comment c'est noté

Note moyenne sur 10 donnée par sept modèles correcteurs selon une grille de 16 questions, sur 500 nouvelles.

Pour le calcul, ce score est ramené entre 0 et 1 : 0 vaut 0 et 10, le plafond retenu, vaut 1.

Ce qu'il ne dit pas

Ce sont des IA qui notent des IA, en anglais. Le classement est figé à sa version d'août 2025, les suivantes ayant changé de barème.

Comment lire le score

44 modèles mesurés · 49 mesures

En tête : GPT-5, 8,6

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 5 a un score IA d'environ 20. Le meilleur, GPT-5, atteint 8,6. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
7
Score IA 76niveau de Claude Sonnet 4.5
8,2
Score IA 100niveau de Claude Opus 5.5
9

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. Lech Mazur Writing est archivé et ne compte plus : la tâche Écriture (5 % du score général) repose sur un autre benchmark.

En couleur, la tâche Écriture dans le score général. Lech Mazur Writing n'y a plus de part.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-5OpenAIMoyenne8,687,6
2Kimi K2 (Jul 2025)MoonshotNon précisée8,5686,3
3Claude Opus 4.1Anthropic · 2 configurationsNon précisée8,4783,7
4o3-proOpenAIMoyenne8,4482,8
5o3OpenAIMoyenne8,3981,4
6Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée8,3881,2
7Claude Opus 4Anthropic · 2 configurationsBudget8,3680,6
8GPT-5 miniOpenAIMoyenne8,3179,3
9Qwen3-235B-A22BAlibaba · poids ouvertsNon précisée8,379,0
9DeepSeek-R1DeepSeek · poids ouvertsNon précisée8,379,0
44 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 44 →Replier le classement ↑
11Qwen3-235B-A22B-Thinking (Jul 2025)AlibabaNon précisée8,2477,4
12DeepSeek-R1 (May 2025)DeepSeek · poids ouvertsNon précisée8,1976,1
13GPT-4o (Nov 2024)OpenAINon précisée8,1875,9
14Claude Sonnet 4Anthropic · 2 configurationsBudget8,1474,9
15Claude 3.7 SonnetAnthropic · 2 configurationsBudget8,1174,2
16Gemini 2.5 Pro (May 2025)Google DeepMindNon précisée8,0973,7
17Gemini 2.5 Pro (Mar 2025)Google DeepMindNon précisée8,0572,7
18Claude 3.5 Sonnet (October 2024)AnthropicNon précisée8,0372,2
19QwQ-32BAlibaba · poids ouvertsNon précisée8,0272,0
20Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée7,9971,3
21Mistral Medium 3Mistral AINon précisée7,7365,5
22gpt-oss-120bOpenAI · poids ouvertsNon précisée7,7165,1
23DeepSeek-V3 (Mar 2025)DeepSeek · poids ouvertsNon précisée7,764,9
24Grok 4xAINon précisée7,6964,7
25Gemini 2.5 Flash (Apr 2025)Google DeepMindNon précisée7,6563,8
26Grok 3xAINon précisée7,6463,6
27GPT-4.5OpenAINon précisée7,5662,0
28Qwen3-30B-A3BAlibaba · poids ouvertsNon précisée7,5361,4
29o4-miniOpenAIMoyenne7,560,8
30Gemini 2.0 Flash Thinking (Jan 2025)Google DeepMindNon précisée7,3858,4
31Grok-3 minixAIFaible7,3557,9
31Claude 3.5 HaikuAnthropicNon précisée7,3557,9
33GLM-4.5Z.ai (Zhipu AI) · poids ouvertsNon précisée7,3457,7
34Qwen2.5-MaxAlibabaNon précisée7,2956,7
35Gemini 2.0 Flash (Dec 2024)Google DeepMindNon précisée7,1554,1
36o1OpenAIMoyenne7,0251,8
37Mistral Large 2 (Jul 2024)Mistral AINon précisée6,949,6
38GPT-4o miniOpenAINon précisée6,7246,5
39o1-miniOpenAIMoyenne6,4942,7
40Grok-2 (Dec 2024)xAINon précisée6,3640,6
41Phi-4Microsoft · poids ouvertsNon précisée6,2639,0
42Llama 4 MaverickMeta AI · poids ouvertsNon précisée6,238,0
43o3-miniOpenAI · 2 configurationsÉlevée6,1737,6
44Amazon Nova ProAmazonNon précisée6,0535,7

En bref

Que mesure Lech Mazur Writing ?
Écrire de courtes nouvelles de 400 à 500 mots qui intègrent dix éléments imposés : personnage, objet, lieu, époque, ton. Sur Quelle IA, il est rangé dans la tâche Écriture.
Comment Lech Mazur Writing est-il noté ?
Note moyenne sur 10 donnée par sept modèles correcteurs selon une grille de 16 questions, sur 500 nouvelles. Un modèle qui obtient 5 a un score IA d'environ 20.
Qui est en tête sur Lech Mazur Writing ?
GPT-5 (OpenAI) est en tête de Lech Mazur Writing avec 8,6, dans l'édition du 28 septembre 2026. Suivent Kimi K2 (Jul 2025) (8,56) et Claude Opus 4.1 (8,47). 44 modèles y sont mesurés.
Quelles sont les limites de Lech Mazur Writing ?
Ce sont des IA qui notent des IA, en anglais. Le classement est figé à sa version d'août 2025, les suivantes ayant changé de barème. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse Lech Mazur Writing dans le score IA ?
Lech Mazur Writing compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Écriture (5 % du score général) repose sur un autre benchmark.
Qui maintient Lech Mazur Writing ?
Lech Mazur (projet personnel). Sa page de référence : github.com/lechmazur/writing.

Les autres benchmarks de la tâche Écriture

Tous les benchmarks →Comment le score IA est calculé →