Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

CodeFiche benchmark · Epoch AI et METR · epoch.ai

MirrorCode

Réécrire de zéro un programme complet (utilitaire Unix, interpréteur, compresseur) sans voir son code, en reproduisant exactement son comportement.

À quoi il sert

Sur Quelle IA, MirrorCode sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 96.

Comment c'est noté

Part des programmes reproduits à l'identique, tous les tests passés, sur 30 tâches avec trois essais chacune.

Ce qu'il ne dit pas

Les programmes d'origine sont publics et ont pu être vus à l'entraînement. Le budget accordé est énorme : jusqu'à 10 milliards de jetons et 7 jours par tâche.

Comment lire le score

9 modèles mesurés

En tête : Claude Opus 5.5, 77,4 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 96. Le meilleur, Claude Opus 5.5, atteint 77,4 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %. Avec 9 modèles mesurés seulement, cet étalonnage reste fragile.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
moins de 1 %
Score IA 76niveau de Claude Sonnet 4.5
1 %
Score IA 100niveau de Claude Opus 5.5
71 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,15 %du score général. MirrorCode porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

En couleur, la tâche Code dans le score général. En noir, la part de MirrorCode.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Opus 5.5AnthropicMaximale77,4 %101,5
2Claude Fable 5.1AnthropicÉlevée73,3 %100,5
3Claude Fable 5AnthropicÉlevée63,9 %98,6
4GPT-6 AstraOpenAIÉlevée46,7 %95,4
5Claude Opus 4.7AnthropicÉlevée31,1 %92,5
6GPT-5.6 SolOpenAIÉlevée20 %89,8
7GPT-5.4OpenAIÉlevée15,6 %88,5
8GPT-5.5OpenAIÉlevée10 %86,2
9Gemini 3.1 ProGoogle DeepMindÉlevée8,9 %85,6

9 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

En bref

Que mesure MirrorCode ?
Réécrire de zéro un programme complet (utilitaire Unix, interpréteur, compresseur) sans voir son code, en reproduisant exactement son comportement. Sur Quelle IA, il est rangé dans la tâche Code.
Comment MirrorCode est-il noté ?
Part des programmes reproduits à l'identique, tous les tests passés, sur 30 tâches avec trois essais chacune. Un modèle qui obtient 50 % a un score IA d'environ 96.
Qui est en tête sur MirrorCode ?
Claude Opus 5.5 (Anthropic) est en tête de MirrorCode avec 77,4 %, dans l'édition du 28 septembre 2026. Suivent Claude Fable 5.1 (73,3 %) et Claude Fable 5 (63,9 %). 9 modèles y sont mesurés.
Quelles sont les limites de MirrorCode ?
Les programmes d'origine sont publics et ont pu être vus à l'entraînement. Le budget accordé est énorme : jusqu'à 10 milliards de jetons et 7 jours par tâche. Au 28 septembre 2026, le benchmark est actif.
Combien pèse MirrorCode dans le score IA ?
MirrorCode compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
Qui maintient MirrorCode ?
Epoch AI et METR. Sa page de référence : epoch.ai/benchmarks/mirrorcode.

Les autres benchmarks de la tâche Code

Tous les benchmarks →Comment le score IA est calculé →