# GBAEval

> Fiche du benchmark GBAEval sur Quelle IA, édition du 28 septembre 2026. Écrire de zéro, en 24 heures au plus, un émulateur de Game Boy Advance en Rust et WebAssembly. En tête au 28 septembre 2026 : Claude Opus 5 (79,6 %). Notation, limites et classement des 23 modèles mesurés.

Page : https://quelleia.com/benchmarks/gbaeval/
Source du benchmark : https://gbaeval.com/
Mainteneur : Équipe GBAEval (gbaeval.com)
Tâche : Code
État : actif

## À quoi il sert

Sur Quelle IA, GBAEval sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 90.

## Comment c'est noté

Score global de 0 à 1 : l'émulateur est comparé à l'émulateur de référence Mesen2 sur l'image, le comportement matériel et le son.

## Ce qu'il ne dit pas

Une seule tâche, très particulière, et des émulateurs open source existent dans les données d'entraînement. Le site ne dit pas clairement qui tient le benchmark.

## Qui le tient

Équipe GBAEval (gbaeval.com).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 90. Le meilleur, Claude Opus 5, atteint 79,6 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : moins de 1 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 2 %
- Score IA 100 (niveau de Claude Opus 5.5) : 95 %

## Son poids dans le score IA

1,15 % du score général. GBAEval porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

## Classement (23 modèles mesurés, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | non précisée | 79,6 % | 94,5 | https://gbaeval.com/model/claude-opus-5 |
| 2 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | non précisée | 74,5 % | 93,5 | https://gbaeval.com/model/claude-fable-5 |
| 3 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | non précisée | 70,9 % | 92,9 | https://gbaeval.com/model/claude-opus-4-8 |
| 4 | [Grok 4.5](https://quelleia.com/modeles/grok-4-5.md) | xAI | non précisée | 65,4 % | 92,1 | https://gbaeval.com/model/grok-4-5 |
| 5 | [Claude Sonnet 5](https://quelleia.com/modeles/claude-sonnet-5.md) | Anthropic | non précisée | 65,3 % | 92,0 | https://gbaeval.com/model/claude-sonnet-5 |
| 6 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | non précisée | 53,2 % | 90,3 | https://gbaeval.com/model/gpt-5-5 |
| 7 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | non précisée | 52,6 % | 90,3 | https://gbaeval.com/model/codex-gpt-5-6-sol |
| 8 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | non précisée | 48,8 % | 89,7 | https://gbaeval.com/model/claude-sonnet |
| 9 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | non précisée | 48,3 % | 89,7 | https://gbaeval.com/model/kimi-k3 |
| 10 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | non précisée | 45,1 % | 89,2 | https://gbaeval.com/model/gpt-5-4 |
| 11 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | non précisée | 44,1 % | 89,1 | https://gbaeval.com/model/claude-opus-4-6 |
| 12 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | non précisée | 43,8 % | 89,1 | https://gbaeval.com/model/claude-opus |
| 13 | [Muse Spark 1.1](https://quelleia.com/modeles/muse-spark-1-1.md) | Meta AI | non précisée | 7,9 % | 81,6 | https://gbaeval.com/model/goose-muse-spark-1-1 |
| 14 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | non précisée | 6,7 % | 81,0 | https://gbaeval.com/model/goose-gemini-3-5-flash |
| 15 | [Grok Build 0.1](https://quelleia.com/modeles/grok-build-0-1.md) | xAI | non précisée | 2,4 % | 77,4 | https://gbaeval.com/model/grok |
| 16 | [MiniMax-M3](https://quelleia.com/modeles/minimax-m3.md) | MiniMax | non précisée | 0,9 % | 74,4 | https://gbaeval.com/model/goose-minimax-m3 |
| 17 | [Kimi K2.6](https://quelleia.com/modeles/kimi-k2-6.md) | Moonshot | non précisée | 0,9 % | 74,4 | https://gbaeval.com/model/goose-kimi-k2-6 |
| 18 | [Kimi K2.7 Code](https://quelleia.com/modeles/kimi-k2-7-code.md) | Moonshot | non précisée | 0,9 % | 74,4 | https://gbaeval.com/model/goose-kimi-k2-7 |
| 19 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 0,8 % | 74,4 | https://gbaeval.com/model/gemini-pro |
| 20 | [Qwen3.7-Max](https://quelleia.com/modeles/qwen3-7-max.md) | Alibaba | non précisée | 0,4 % | 74,4 | https://gbaeval.com/model/goose-qwen3-7-max |
| 21 | [GLM-5.2](https://quelleia.com/modeles/glm-5-2.md) | Z.ai (Zhipu AI) | non précisée | 0 % | 74,4 | https://gbaeval.com/model/goose-glm-5-2 |
| 22 | [GLM-5.1](https://quelleia.com/modeles/glm-5-1.md) | Z.ai (Zhipu AI) | non précisée | 0 % | 74,4 | https://gbaeval.com/model/goose-glm-5-1 |
| 22 | [MiniMax-M2.7](https://quelleia.com/modeles/minimax-m2-7.md) | MiniMax | non précisée | 0 % | 74,4 | https://gbaeval.com/model/goose-minimax-m2-7 |

## En bref

**Que mesure GBAEval ?** Écrire de zéro, en 24 heures au plus, un émulateur de Game Boy Advance en Rust et WebAssembly. Sur Quelle IA, il est rangé dans la tâche Code.

**Comment GBAEval est-il noté ?** Score global de 0 à 1 : l'émulateur est comparé à l'émulateur de référence Mesen2 sur l'image, le comportement matériel et le son. Un modèle qui obtient 50 % a un score IA d'environ 90.

**Qui est en tête sur GBAEval ?** Claude Opus 5 (Anthropic) est en tête de GBAEval avec 79,6 %, dans l'édition du 28 septembre 2026. Suivent Claude Fable 5 (74,5 %) et Claude Opus 4.8 (70,9 %). 23 modèles y sont mesurés.

**Quelles sont les limites de GBAEval ?** Une seule tâche, très particulière, et des émulateurs open source existent dans les données d'entraînement. Le site ne dit pas clairement qui tient le benchmark. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse GBAEval dans le score IA ?** GBAEval compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

**Qui maintient GBAEval ?** Équipe GBAEval (gbaeval.com). Sa page de référence : gbaeval.com.

## Les autres benchmarks de la tâche Code

- [Arena, questions de code](https://quelleia.com/benchmarks/arena_code.md) : 275 modèles · 1,15 % du score
- [WeirdML (v2)](https://quelleia.com/benchmarks/weirdml.md) : 129 modèles · 1,15 % du score
- [SciCode](https://quelleia.com/benchmarks/scicode.md) : 120 modèles · 1,15 % du score
- [Terminal-Bench 2.0](https://quelleia.com/benchmarks/terminal_bench.md) : 45 modèles · 1,15 % du score
- [FrontierCode](https://quelleia.com/benchmarks/frontiercode.md) : 37 modèles · 1,15 % du score
- [SWE-bench Verified](https://quelleia.com/benchmarks/swe_bench_verified.md) : 32 modèles · 1,15 % du score
- [DeepSWE](https://quelleia.com/benchmarks/deepswe.md) : 26 modèles · 1,15 % du score
- [GSO](https://quelleia.com/benchmarks/gso_bench.md) : 26 modèles · 1,15 % du score
- [FrontierSWE](https://quelleia.com/benchmarks/frontierswe.md) : 16 modèles · 1,15 % du score
- [CursorBench](https://quelleia.com/benchmarks/cursorbench.md) : 13 modèles · 1,15 % du score
- [WeirdML v3](https://quelleia.com/benchmarks/weirdml_v3.md) : 11 modèles · 1,15 % du score
- [MirrorCode](https://quelleia.com/benchmarks/mirrorcode.md) : 9 modèles · 1,15 % du score
- [Aider Polyglot](https://quelleia.com/benchmarks/aider_polyglot.md) : 54 modèles · hors score, archivé
- [LiveBench, code](https://quelleia.com/benchmarks/livebench_code.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
