À quoi il sert
Sur Quelle IA, GBAEval sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 90.
CodeFiche benchmark · Équipe GBAEval (gbaeval.com) · gbaeval.com
Écrire de zéro, en 24 heures au plus, un émulateur de Game Boy Advance en Rust et WebAssembly.
Sur Quelle IA, GBAEval sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 90.
Score global de 0 à 1 : l'émulateur est comparé à l'émulateur de référence Mesen2 sur l'image, le comportement matériel et le son.
Une seule tâche, très particulière, et des émulateurs open source existent dans les données d'entraînement. Le site ne dit pas clairement qui tient le benchmark.
Équipe GBAEval (gbaeval.com).
gbaeval.com · tâche Code · 23 modèles mesurés
En tête : Claude Opus 5, 79,6 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 90. Le meilleur, Claude Opus 5, atteint 79,6 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,15 %du score général. GBAEval porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
En couleur, la tâche Code dans le score général. En noir, la part de GBAEval.