# BALROG

> Fiche du benchmark BALROG sur Quelle IA, édition du 28 septembre 2026. Jouer à six jeux, du simple BabyAI au redoutable NetHack, qui demandent d'explorer, de planifier et de tenir sur la durée. En tête au 28 septembre 2026 : GPT-6 Astra (68,3 %). Notation, limites et classement des 37 modèles mesurés.

Page : https://quelleia.com/benchmarks/balrog/
Source du benchmark : https://balrogai.com/
Mainteneur : Équipe BALROG (auteurs de l'article de 2024)
Tâche : Agents
État : actif

## À quoi il sert

Sur Quelle IA, BALROG sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 85.

## Comment c'est noté

Progression moyenne dans les six jeux, de 0 à 1, calculée sur plusieurs parties par jeu.

## Ce qu'il ne dit pas

La moyenne cache de grands écarts : les modèles terminent les jeux simples mais avancent à peine dans NetHack.

## Qui le tient

Équipe BALROG (auteurs de l'article de 2024).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 85. Le meilleur, GPT-6 Astra, atteint 68,3 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 22 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 42 %
- Score IA 100 (niveau de Claude Opus 5.5) : 63 %

## Son poids dans le score IA

1,67 % du score général. BALROG porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

## Classement (37 modèles mesurés · 41 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | Maximale | 68,3 % | 105,7 | https://balrogai.com/ |
| 2 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | Maximale | 63,4 % | 99,8 | https://balrogai.com/ |
| 3 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 60 % | 96,0 | https://balrogai.com/ |
| 4 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | non précisée | 58,1 % | 93,9 | https://balrogai.com/ |
| 5 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 57 % | 92,7 | https://epoch.ai/benchmarks |
| 6 | [GPT-5.6 Terra](https://quelleia.com/modeles/gpt-5-6-terra.md) | OpenAI | Maximale | 53,2 % | 88,5 | https://balrogai.com/ |
| 7 | [Gemini 3 Flash](https://quelleia.com/modeles/gemini-3-flash.md) | Google DeepMind | non précisée | 48,1 % | 83,0 | https://balrogai.com/ |
| 8 | [GPT-5.6 Luna](https://quelleia.com/modeles/gpt-5-6-luna.md) | OpenAI | Maximale | 45,6 % | 80,3 | https://balrogai.com/ |
| 9 | [Grok 4](https://quelleia.com/modeles/grok-4.md) | xAI | non précisée | 43,6 % | 78,2 | https://balrogai.com/ |
| 10 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | non précisée | 43,5 % | 78,0 | https://epoch.ai/benchmarks |
| 11 | [Gemini 2.5 Pro (Mar 2025)](https://quelleia.com/modeles/gemini-2-5-pro-mar-2025.md) | Google DeepMind | non précisée | 43,3 % | 77,8 | https://balrogai.com/ |
| 12 | [DeepSeek-R1](https://quelleia.com/modeles/deepseek-r1.md) | DeepSeek | non précisée | 34,9 % | 68,3 | https://balrogai.com/ |
| 13 | [Gemini 2.5 Flash (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-flash-jun-2025.md) | Google DeepMind | non précisée | 33,5 % | 66,6 | https://balrogai.com/ |
| 14 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Faible | 32,8 % | 65,8 | https://balrogai.com/ |
| 15 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 32,6 % | 65,5 | https://balrogai.com/ |
| 16 | [GPT-4o (May 2024)](https://quelleia.com/modeles/gpt-4o-may-2024.md) | OpenAI | non précisée | 32,3 % | 65,2 | https://balrogai.com/ |
| 17 | [Claude Haiku 4.5](https://quelleia.com/modeles/claude-haiku-4-5.md) | Anthropic | non précisée | 31,2 % | 63,8 | https://epoch.ai/benchmarks |
| 18 | [Grok 3](https://quelleia.com/modeles/grok-3.md) | xAI | non précisée | 29,5 % | 61,6 | https://balrogai.com/ |
| 19 | [Reka Flash 3](https://quelleia.com/modeles/reka-flash-3.md) | Reka AI | non précisée | 29,2 % | 61,3 | https://balrogai.com/ |
| 20 | [Llama 3.1-70B](https://quelleia.com/modeles/llama-3-1-70b.md) | Meta AI | non précisée | 27,9 % | 59,5 | https://balrogai.com/ |
| 21 | [Llama 3.2 90B](https://quelleia.com/modeles/llama-3-2-90b.md) | Meta AI | non précisée | 27,3 % | 58,7 | https://balrogai.com/ |
| 22 | [Llama 3.3 70B](https://quelleia.com/modeles/llama-3-3-70b.md) | Meta AI | non précisée | 23 % | 52,6 | https://balrogai.com/ |
| 23 | [Gemini 1.5 Pro (Sept 2024)](https://quelleia.com/modeles/gemini-1-5-pro-sept-2024.md) | Google DeepMind | non précisée | 21 % | 49,5 | https://balrogai.com/ |
| 24 | [DeepSeek-R1-Distill-Qwen-32B](https://quelleia.com/modeles/deepseek-r1-distill-qwen-32b.md) | DeepSeek | non précisée | 19,5 % | 47,0 | https://balrogai.com/ |
| 25 | [Claude 3.5 Haiku](https://quelleia.com/modeles/claude-3-5-haiku.md) | Anthropic | non précisée | 19,3 % | 46,6 | https://balrogai.com/ |
| 26 | [Mistral NeMo](https://quelleia.com/modeles/mistral-nemo.md) | Mistral AI | non précisée | 17,6 % | 43,6 | https://balrogai.com/ |
| 27 | [GPT-4o mini](https://quelleia.com/modeles/gpt-4o-mini.md) | OpenAI | non précisée | 17,4 % | 43,2 | https://balrogai.com/ |
| 28 | [Llama 3.2 11B](https://quelleia.com/modeles/llama-3-2-11b.md) | Meta AI | non précisée | 16,8 % | 42,1 | https://balrogai.com/ |
| 29 | [Qwen2.5-72B](https://quelleia.com/modeles/qwen2-5-72b.md) | Alibaba | non précisée | 16,2 % | 40,9 | https://balrogai.com/ |
| 30 | [Llama 3.1-8B](https://quelleia.com/modeles/llama-3-1-8b.md) | Meta AI | non précisée | 15,1 % | 38,6 | https://balrogai.com/ |
| 31 | [Gemini 1.5 Flash (Sep 2024)](https://quelleia.com/modeles/gemini-1-5-flash-sep-2024.md) | Google DeepMind | non précisée | 14,6 % | 37,6 | https://balrogai.com/ |
| 32 | [Qwen2-VL-72B-Instruct](https://quelleia.com/modeles/qwen2-vl-72b-instruct.md) | Alibaba | non précisée | 12,8 % | 33,5 | https://balrogai.com/ |
| 33 | [Phi-4](https://quelleia.com/modeles/phi-4.md) | Microsoft | non précisée | 11,6 % | 30,5 | https://balrogai.com/ |
| 34 | [Llama 3.2 3B](https://quelleia.com/modeles/llama-3-2-3b.md) | Meta AI | non précisée | 10,1 % | 26,3 | https://balrogai.com/ |
| 35 | [Qwen2.5-7B](https://quelleia.com/modeles/qwen2-5-7b.md) | Alibaba | non précisée | 7,8 % | 18,7 | https://balrogai.com/ |
| 36 | [Llama 3.2 1B](https://quelleia.com/modeles/llama-3-2-1b.md) | Meta AI | non précisée | 6,6 % | 13,8 | https://balrogai.com/ |
| 37 | [Qwen2-VL-7B-Instruct](https://quelleia.com/modeles/qwen2-vl-7b-instruct.md) | Alibaba | non précisée | 3,7 % | -2,6 | https://balrogai.com/ |

## En bref

**Que mesure BALROG ?** Jouer à six jeux, du simple BabyAI au redoutable NetHack, qui demandent d'explorer, de planifier et de tenir sur la durée. Sur Quelle IA, il est rangé dans la tâche Agents.

**Comment BALROG est-il noté ?** Progression moyenne dans les six jeux, de 0 à 1, calculée sur plusieurs parties par jeu. Un modèle qui obtient 50 % a un score IA d'environ 85.

**Qui est en tête sur BALROG ?** GPT-6 Astra (OpenAI) est en tête de BALROG avec 68,3 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5 (63,4 %) et GPT-5.6 Sol (60 %). 37 modèles y sont mesurés.

**Quelles sont les limites de BALROG ?** La moyenne cache de grands écarts : les modèles terminent les jeux simples mais avancent à peine dans NetHack. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse BALROG dans le score IA ?** BALROG compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

**Qui maintient BALROG ?** Équipe BALROG (auteurs de l'article de 2024). Sa page de référence : balrogai.com.

## Les autres benchmarks de la tâche Agents

- [Vending-Bench 2](https://quelleia.com/benchmarks/vending_bench_2.md) : 56 modèles · 1,67 % du score
- [METR Time Horizons (taux de réussite)](https://quelleia.com/benchmarks/metr_time_horizons.md) : 41 modèles · 1,67 % du score
- [APEX-Agents](https://quelleia.com/benchmarks/apex_agents.md) : 34 modèles · 1,67 % du score
- [DeepResearch Bench](https://quelleia.com/benchmarks/deepresearch_bench.md) : 24 modèles · 1,67 % du score
- [EBR-bench (Earthborne Rangers)](https://quelleia.com/benchmarks/ebr_bench.md) : 23 modèles · 1,67 % du score
- [Remote Labor Index](https://quelleia.com/benchmarks/remote_labor_index.md) : 13 modèles · 1,67 % du score
- [PostTrainBench](https://quelleia.com/benchmarks/posttrainbench.md) : 11 modèles · 1,67 % du score
- [OSWorld 2.0](https://quelleia.com/benchmarks/osworld_2.md) : 9 modèles · 1,67 % du score
- [TheAgentCompany](https://quelleia.com/benchmarks/the_agent_company.md) : 14 modèles · hors score, archivé
- [GDPval](https://quelleia.com/benchmarks/gdpval.md) : 11 modèles · hors score, archivé
- [OSWorld](https://quelleia.com/benchmarks/osworld.md) : 9 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
