Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

CodeFiche benchmark · Équipe GBAEval (gbaeval.com) · gbaeval.com

GBAEval

Écrire de zéro, en 24 heures au plus, un émulateur de Game Boy Advance en Rust et WebAssembly.

À quoi il sert

Sur Quelle IA, GBAEval sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 90.

Comment c'est noté

Score global de 0 à 1 : l'émulateur est comparé à l'émulateur de référence Mesen2 sur l'image, le comportement matériel et le son.

Ce qu'il ne dit pas

Une seule tâche, très particulière, et des émulateurs open source existent dans les données d'entraînement. Le site ne dit pas clairement qui tient le benchmark.

Qui le tient

Équipe GBAEval (gbaeval.com).

gbaeval.com · tâche Code · 23 modèles mesurés

Comment lire le score

23 modèles mesurés

En tête : Claude Opus 5, 79,6 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 90. Le meilleur, Claude Opus 5, atteint 79,6 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
moins de 1 %
Score IA 76niveau de Claude Sonnet 4.5
2 %
Score IA 100niveau de Claude Opus 5.5
95 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,15 %du score général. GBAEval porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

En couleur, la tâche Code dans le score général. En noir, la part de GBAEval.

Le classement du benchmark

Scores relevés sur gbaeval.com · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Opus 5AnthropicNon précisée79,6 %94,5
2Claude Fable 5AnthropicNon précisée74,5 %93,5
3Claude Opus 4.8AnthropicNon précisée70,9 %92,9
4Grok 4.5xAINon précisée65,4 %92,1
5Claude Sonnet 5AnthropicNon précisée65,3 %92,0
6GPT-5.5OpenAINon précisée53,2 %90,3
7GPT-5.6 SolOpenAINon précisée52,6 %90,3
8Claude Sonnet 4.6AnthropicNon précisée48,8 %89,7
9Kimi K3Moonshot · poids ouvertsNon précisée48,3 %89,7
10GPT-5.4OpenAINon précisée45,1 %89,2
23 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 23 →Replier le classement ↑
11Claude Opus 4.6AnthropicNon précisée44,1 %89,1
12Claude Opus 4.7AnthropicNon précisée43,8 %89,1
13Muse Spark 1.1Meta AINon précisée7,9 %81,6
14Gemini 3.5 FlashGoogle DeepMindNon précisée6,7 %81,0
15Grok Build 0.1xAINon précisée2,4 %77,4
16MiniMax-M3MiniMax · poids ouvertsNon précisée0,9 %74,4
17Kimi K2.6Moonshot · poids ouvertsNon précisée0,9 %74,4
18Kimi K2.7 CodeMoonshot · poids ouvertsNon précisée0,9 %74,4
19Gemini 3.1 ProGoogle DeepMindNon précisée0,8 %74,4
20Qwen3.7-MaxAlibabaNon précisée0,4 %74,4
21GLM-5.2Z.ai (Zhipu AI) · poids ouvertsNon précisée0 %74,4
22GLM-5.1Z.ai (Zhipu AI) · poids ouvertsNon précisée0 %74,4
22MiniMax-M2.7MiniMax · poids ouvertsNon précisée0 %74,4

En bref

Que mesure GBAEval ?
Écrire de zéro, en 24 heures au plus, un émulateur de Game Boy Advance en Rust et WebAssembly. Sur Quelle IA, il est rangé dans la tâche Code.
Comment GBAEval est-il noté ?
Score global de 0 à 1 : l'émulateur est comparé à l'émulateur de référence Mesen2 sur l'image, le comportement matériel et le son. Un modèle qui obtient 50 % a un score IA d'environ 90.
Qui est en tête sur GBAEval ?
Claude Opus 5 (Anthropic) est en tête de GBAEval avec 79,6 %, dans l'édition du 28 septembre 2026. Suivent Claude Fable 5 (74,5 %) et Claude Opus 4.8 (70,9 %). 23 modèles y sont mesurés.
Quelles sont les limites de GBAEval ?
Une seule tâche, très particulière, et des émulateurs open source existent dans les données d'entraînement. Le site ne dit pas clairement qui tient le benchmark. Au 28 septembre 2026, le benchmark est actif.
Combien pèse GBAEval dans le score IA ?
GBAEval compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
Qui maintient GBAEval ?
Équipe GBAEval (gbaeval.com). Sa page de référence : gbaeval.com.

Les autres benchmarks de la tâche Code

Tous les benchmarks →Comment le score IA est calculé →