À quoi il sert
Lech Mazur Writing servait à noter la tâche Écriture. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
ÉcritureFiche benchmark · Lech Mazur (projet personnel) · github.com
Écrire de courtes nouvelles de 400 à 500 mots qui intègrent dix éléments imposés : personnage, objet, lieu, époque, ton.
Lech Mazur Writing servait à noter la tâche Écriture. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
Note moyenne sur 10 donnée par sept modèles correcteurs selon une grille de 16 questions, sur 500 nouvelles.
Pour le calcul, ce score est ramené entre 0 et 1 : 0 vaut 0 et 10, le plafond retenu, vaut 1.
Ce sont des IA qui notent des IA, en anglais. Le classement est figé à sa version d'août 2025, les suivantes ayant changé de barème.
Lech Mazur (projet personnel).
github.com/lechmazur/writing · tâche Écriture · 44 modèles mesurés
En tête : GPT-5, 8,6
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 5 a un score IA d'environ 20. Le meilleur, GPT-5, atteint 8,6. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. Lech Mazur Writing est archivé et ne compte plus : la tâche Écriture (5 % du score général) repose sur un autre benchmark.
En couleur, la tâche Écriture dans le score général. Lech Mazur Writing n'y a plus de part.