# MirrorCode

> Fiche du benchmark MirrorCode sur Quelle IA, édition du 28 septembre 2026. Réécrire de zéro un programme complet (utilitaire Unix, interpréteur, compresseur) sans voir son code, en reproduisant exactement son comportement. En tête au 28 septembre 2026 : Claude Opus 5.5 (77,4 %). Notation, limites et classement des 9 modèles mesurés.

Page : https://quelleia.com/benchmarks/mirrorcode/
Source du benchmark : https://epoch.ai/benchmarks/mirrorcode
Mainteneur : Epoch AI et METR
Tâche : Code
État : actif

## À quoi il sert

Sur Quelle IA, MirrorCode sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 96.

## Comment c'est noté

Part des programmes reproduits à l'identique, tous les tests passés, sur 30 tâches avec trois essais chacune.

## Ce qu'il ne dit pas

Les programmes d'origine sont publics et ont pu être vus à l'entraînement. Le budget accordé est énorme : jusqu'à 10 milliards de jetons et 7 jours par tâche.

## Qui le tient

Epoch AI et METR.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 96. Le meilleur, Claude Opus 5.5, atteint 77,4 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %. Avec 9 modèles mesurés seulement, cet étalonnage reste fragile.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : moins de 1 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 1 %
- Score IA 100 (niveau de Claude Opus 5.5) : 71 %

## Son poids dans le score IA

1,15 % du score général. MirrorCode porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

## Classement (9 modèles mesurés, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Claude Opus 5.5](https://quelleia.com/modeles/claude-opus-5-5.md) | Anthropic | Maximale | 77,4 % | 101,5 | https://epoch.ai/benchmarks |
| 2 | [Claude Fable 5.1](https://quelleia.com/modeles/claude-fable-5-1.md) | Anthropic | Élevée | 73,3 % | 100,5 | https://epoch.ai/benchmarks |
| 3 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Élevée | 63,9 % | 98,6 | https://epoch.ai/benchmarks |
| 4 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | Élevée | 46,7 % | 95,4 | https://epoch.ai/benchmarks |
| 5 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | Élevée | 31,1 % | 92,5 | https://epoch.ai/benchmarks |
| 6 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Élevée | 20 % | 89,8 | https://epoch.ai/benchmarks |
| 7 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Élevée | 15,6 % | 88,5 | https://epoch.ai/benchmarks |
| 8 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Élevée | 10 % | 86,2 | https://epoch.ai/benchmarks |
| 9 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | Élevée | 8,9 % | 85,6 | https://epoch.ai/benchmarks |

## En bref

**Que mesure MirrorCode ?** Réécrire de zéro un programme complet (utilitaire Unix, interpréteur, compresseur) sans voir son code, en reproduisant exactement son comportement. Sur Quelle IA, il est rangé dans la tâche Code.

**Comment MirrorCode est-il noté ?** Part des programmes reproduits à l'identique, tous les tests passés, sur 30 tâches avec trois essais chacune. Un modèle qui obtient 50 % a un score IA d'environ 96.

**Qui est en tête sur MirrorCode ?** Claude Opus 5.5 (Anthropic) est en tête de MirrorCode avec 77,4 %, dans l'édition du 28 septembre 2026. Suivent Claude Fable 5.1 (73,3 %) et Claude Fable 5 (63,9 %). 9 modèles y sont mesurés.

**Quelles sont les limites de MirrorCode ?** Les programmes d'origine sont publics et ont pu être vus à l'entraînement. Le budget accordé est énorme : jusqu'à 10 milliards de jetons et 7 jours par tâche. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse MirrorCode dans le score IA ?** MirrorCode compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

**Qui maintient MirrorCode ?** Epoch AI et METR. Sa page de référence : epoch.ai/benchmarks/mirrorcode.

## Les autres benchmarks de la tâche Code

- [Arena, questions de code](https://quelleia.com/benchmarks/arena_code.md) : 275 modèles · 1,15 % du score
- [WeirdML (v2)](https://quelleia.com/benchmarks/weirdml.md) : 129 modèles · 1,15 % du score
- [SciCode](https://quelleia.com/benchmarks/scicode.md) : 120 modèles · 1,15 % du score
- [Terminal-Bench 2.0](https://quelleia.com/benchmarks/terminal_bench.md) : 45 modèles · 1,15 % du score
- [FrontierCode](https://quelleia.com/benchmarks/frontiercode.md) : 37 modèles · 1,15 % du score
- [SWE-bench Verified](https://quelleia.com/benchmarks/swe_bench_verified.md) : 32 modèles · 1,15 % du score
- [DeepSWE](https://quelleia.com/benchmarks/deepswe.md) : 26 modèles · 1,15 % du score
- [GSO](https://quelleia.com/benchmarks/gso_bench.md) : 26 modèles · 1,15 % du score
- [GBAEval](https://quelleia.com/benchmarks/gbaeval.md) : 23 modèles · 1,15 % du score
- [FrontierSWE](https://quelleia.com/benchmarks/frontierswe.md) : 16 modèles · 1,15 % du score
- [CursorBench](https://quelleia.com/benchmarks/cursorbench.md) : 13 modèles · 1,15 % du score
- [WeirdML v3](https://quelleia.com/benchmarks/weirdml_v3.md) : 11 modèles · 1,15 % du score
- [Aider Polyglot](https://quelleia.com/benchmarks/aider_polyglot.md) : 54 modèles · hors score, archivé
- [LiveBench, code](https://quelleia.com/benchmarks/livebench_code.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
