# Lech Mazur Writing

> Fiche du benchmark Lech Mazur Writing sur Quelle IA, édition du 28 septembre 2026. Écrire de courtes nouvelles de 400 à 500 mots qui intègrent dix éléments imposés : personnage, objet, lieu, époque, ton. En tête au 28 septembre 2026 : GPT-5 (8,6). Notation, limites et classement des 44 modèles mesurés.

Page : https://quelleia.com/benchmarks/lech_mazur_writing/
Source du benchmark : https://github.com/lechmazur/writing
Mainteneur : Lech Mazur (projet personnel)
Tâche : Écriture
État : archivé

## À quoi il sert

Lech Mazur Writing servait à noter la tâche Écriture. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

## Comment c'est noté

Note moyenne sur 10 donnée par sept modèles correcteurs selon une grille de 16 questions, sur 500 nouvelles.

Pour le calcul, ce score est ramené entre 0 et 1 : 0 vaut 0 et 10, le plafond retenu, vaut 1.

## Ce qu'il ne dit pas

Ce sont des IA qui notent des IA, en anglais. Le classement est figé à sa version d'août 2025, les suivantes ayant changé de barème.

## Qui le tient

Lech Mazur (projet personnel).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 5 a un score IA d'environ 20. Le meilleur, GPT-5, atteint 8,6. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 7
- Score IA 76 (niveau de Claude Sonnet 4.5) : 8,2
- Score IA 100 (niveau de Claude Opus 5.5) : 9

## Son poids dans le score IA

0 % du score général. Lech Mazur Writing est archivé et ne compte plus : la tâche Écriture (5 % du score général) repose sur un autre benchmark.

## Classement (44 modèles mesurés · 49 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Moyenne | 8,6 | 87,6 | https://epoch.ai/benchmarks |
| 2 | [Kimi K2 (Jul 2025)](https://quelleia.com/modeles/kimi-k2-jul-2025.md) | Moonshot | non précisée | 8,56 | 86,3 | https://epoch.ai/benchmarks |
| 3 | [Claude Opus 4.1](https://quelleia.com/modeles/claude-opus-4-1.md) | Anthropic | non précisée | 8,47 | 83,7 | https://epoch.ai/benchmarks |
| 4 | [o3-pro](https://quelleia.com/modeles/o3-pro.md) | OpenAI | Moyenne | 8,44 | 82,8 | https://epoch.ai/benchmarks |
| 5 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Moyenne | 8,39 | 81,4 | https://epoch.ai/benchmarks |
| 6 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 8,38 | 81,2 | https://epoch.ai/benchmarks |
| 7 | [Claude Opus 4](https://quelleia.com/modeles/claude-opus-4.md) | Anthropic | Budget | 8,36 | 80,6 | https://epoch.ai/benchmarks |
| 8 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | Moyenne | 8,31 | 79,3 | https://epoch.ai/benchmarks |
| 9 | [Qwen3-235B-A22B](https://quelleia.com/modeles/qwen3-235b-a22b.md) | Alibaba | non précisée | 8,3 | 79,0 | https://epoch.ai/benchmarks |
| 9 | [DeepSeek-R1](https://quelleia.com/modeles/deepseek-r1.md) | DeepSeek | non précisée | 8,3 | 79,0 | https://epoch.ai/benchmarks |
| 11 | [Qwen3-235B-A22B-Thinking (Jul 2025)](https://quelleia.com/modeles/qwen3-235b-a22b-thinking-jul-2025.md) | Alibaba | non précisée | 8,24 | 77,4 | https://epoch.ai/benchmarks |
| 12 | [DeepSeek-R1 (May 2025)](https://quelleia.com/modeles/deepseek-r1-may-2025.md) | DeepSeek | non précisée | 8,19 | 76,1 | https://epoch.ai/benchmarks |
| 13 | [GPT-4o (Nov 2024)](https://quelleia.com/modeles/gpt-4o-nov-2024.md) | OpenAI | non précisée | 8,18 | 75,9 | https://epoch.ai/benchmarks |
| 14 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | Budget | 8,14 | 74,9 | https://epoch.ai/benchmarks |
| 15 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | Budget | 8,11 | 74,2 | https://epoch.ai/benchmarks |
| 16 | [Gemini 2.5 Pro (May 2025)](https://quelleia.com/modeles/gemini-2-5-pro-may-2025.md) | Google DeepMind | non précisée | 8,09 | 73,7 | https://epoch.ai/benchmarks |
| 17 | [Gemini 2.5 Pro (Mar 2025)](https://quelleia.com/modeles/gemini-2-5-pro-mar-2025.md) | Google DeepMind | non précisée | 8,05 | 72,7 | https://epoch.ai/benchmarks |
| 18 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 8,03 | 72,2 | https://epoch.ai/benchmarks |
| 19 | [QwQ-32B](https://quelleia.com/modeles/qwq-32b.md) | Alibaba | non précisée | 8,02 | 72,0 | https://epoch.ai/benchmarks |
| 20 | [Gemma 3 27B](https://quelleia.com/modeles/gemma-3-27b.md) | Google DeepMind | non précisée | 7,99 | 71,3 | https://epoch.ai/benchmarks |
| 21 | [Mistral Medium 3](https://quelleia.com/modeles/mistral-medium-3.md) | Mistral AI | non précisée | 7,73 | 65,5 | https://epoch.ai/benchmarks |
| 22 | [gpt-oss-120b](https://quelleia.com/modeles/gpt-oss-120b.md) | OpenAI | non précisée | 7,71 | 65,1 | https://epoch.ai/benchmarks |
| 23 | [DeepSeek-V3 (Mar 2025)](https://quelleia.com/modeles/deepseek-v3-mar-2025.md) | DeepSeek | non précisée | 7,7 | 64,9 | https://epoch.ai/benchmarks |
| 24 | [Grok 4](https://quelleia.com/modeles/grok-4.md) | xAI | non précisée | 7,69 | 64,7 | https://epoch.ai/benchmarks |
| 25 | [Gemini 2.5 Flash (Apr 2025)](https://quelleia.com/modeles/gemini-2-5-flash-apr-2025.md) | Google DeepMind | non précisée | 7,65 | 63,8 | https://epoch.ai/benchmarks |
| 26 | [Grok 3](https://quelleia.com/modeles/grok-3.md) | xAI | non précisée | 7,64 | 63,6 | https://epoch.ai/benchmarks |
| 27 | [GPT-4.5](https://quelleia.com/modeles/gpt-4-5.md) | OpenAI | non précisée | 7,56 | 62,0 | https://epoch.ai/benchmarks |
| 28 | [Qwen3-30B-A3B](https://quelleia.com/modeles/qwen3-30b-a3b.md) | Alibaba | non précisée | 7,53 | 61,4 | https://epoch.ai/benchmarks |
| 29 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Moyenne | 7,5 | 60,8 | https://epoch.ai/benchmarks |
| 30 | [Gemini 2.0 Flash Thinking (Jan 2025)](https://quelleia.com/modeles/gemini-2-0-flash-thinking-jan-2025.md) | Google DeepMind | non précisée | 7,38 | 58,4 | https://epoch.ai/benchmarks |
| 31 | [Grok-3 mini](https://quelleia.com/modeles/grok-3-mini.md) | xAI | Faible | 7,35 | 57,9 | https://epoch.ai/benchmarks |
| 31 | [Claude 3.5 Haiku](https://quelleia.com/modeles/claude-3-5-haiku.md) | Anthropic | non précisée | 7,35 | 57,9 | https://epoch.ai/benchmarks |
| 33 | [GLM-4.5](https://quelleia.com/modeles/glm-4-5.md) | Z.ai (Zhipu AI) | non précisée | 7,34 | 57,7 | https://epoch.ai/benchmarks |
| 34 | [Qwen2.5-Max](https://quelleia.com/modeles/qwen2-5-max.md) | Alibaba | non précisée | 7,29 | 56,7 | https://epoch.ai/benchmarks |
| 35 | [Gemini 2.0 Flash (Dec 2024)](https://quelleia.com/modeles/gemini-2-0-flash-dec-2024.md) | Google DeepMind | non précisée | 7,15 | 54,1 | https://epoch.ai/benchmarks |
| 36 | [o1](https://quelleia.com/modeles/o1.md) | OpenAI | Moyenne | 7,02 | 51,8 | https://epoch.ai/benchmarks |
| 37 | [Mistral Large 2 (Jul 2024)](https://quelleia.com/modeles/mistral-large-2-jul-2024.md) | Mistral AI | non précisée | 6,9 | 49,6 | https://epoch.ai/benchmarks |
| 38 | [GPT-4o mini](https://quelleia.com/modeles/gpt-4o-mini.md) | OpenAI | non précisée | 6,72 | 46,5 | https://epoch.ai/benchmarks |
| 39 | [o1-mini](https://quelleia.com/modeles/o1-mini.md) | OpenAI | Moyenne | 6,49 | 42,7 | https://epoch.ai/benchmarks |
| 40 | [Grok-2 (Dec 2024)](https://quelleia.com/modeles/grok-2-dec-2024.md) | xAI | non précisée | 6,36 | 40,6 | https://epoch.ai/benchmarks |
| 41 | [Phi-4](https://quelleia.com/modeles/phi-4.md) | Microsoft | non précisée | 6,26 | 39,0 | https://epoch.ai/benchmarks |
| 42 | [Llama 4 Maverick](https://quelleia.com/modeles/llama-4-maverick.md) | Meta AI | non précisée | 6,2 | 38,0 | https://epoch.ai/benchmarks |
| 43 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Élevée | 6,17 | 37,6 | https://epoch.ai/benchmarks |
| 44 | [Amazon Nova Pro](https://quelleia.com/modeles/amazon-nova-pro.md) | Amazon | non précisée | 6,05 | 35,7 | https://epoch.ai/benchmarks |

## En bref

**Que mesure Lech Mazur Writing ?** Écrire de courtes nouvelles de 400 à 500 mots qui intègrent dix éléments imposés : personnage, objet, lieu, époque, ton. Sur Quelle IA, il est rangé dans la tâche Écriture.

**Comment Lech Mazur Writing est-il noté ?** Note moyenne sur 10 donnée par sept modèles correcteurs selon une grille de 16 questions, sur 500 nouvelles. Un modèle qui obtient 5 a un score IA d'environ 20.

**Qui est en tête sur Lech Mazur Writing ?** GPT-5 (OpenAI) est en tête de Lech Mazur Writing avec 8,6, dans l'édition du 28 septembre 2026. Suivent Kimi K2 (Jul 2025) (8,56) et Claude Opus 4.1 (8,47). 44 modèles y sont mesurés.

**Quelles sont les limites de Lech Mazur Writing ?** Ce sont des IA qui notent des IA, en anglais. Le classement est figé à sa version d'août 2025, les suivantes ayant changé de barème. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse Lech Mazur Writing dans le score IA ?** Lech Mazur Writing compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Écriture (5 % du score général) repose sur un autre benchmark.

**Qui maintient Lech Mazur Writing ?** Lech Mazur (projet personnel). Sa page de référence : github.com/lechmazur/writing.

## Les autres benchmarks de la tâche Écriture

- [Arena, écriture créative](https://quelleia.com/benchmarks/arena_ecriture.md) : 276 modèles · 5 % du score

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
