À quoi il sert
Sur Quelle IA, MirrorCode sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 96.
Sur Quelle IA, MirrorCode sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 96.
Part des programmes reproduits à l'identique, tous les tests passés, sur 30 tâches avec trois essais chacune.
Les programmes d'origine sont publics et ont pu être vus à l'entraînement. Le budget accordé est énorme : jusqu'à 10 milliards de jetons et 7 jours par tâche.
Epoch AI et METR.
epoch.ai/benchmarks/mirrorcode · tâche Code · 9 modèles mesurés
En tête : Claude Opus 5.5, 77,4 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 96. Le meilleur, Claude Opus 5.5, atteint 77,4 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %. Avec 9 modèles mesurés seulement, cet étalonnage reste fragile.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,15 %du score général. MirrorCode porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
En couleur, la tâche Code dans le score général. En noir, la part de MirrorCode.
9 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.