Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

AgentsFiche benchmark · Équipe BALROG (auteurs de l'article de 2024) · balrogai.com

BALROG

Jouer à six jeux, du simple BabyAI au redoutable NetHack, qui demandent d'explorer, de planifier et de tenir sur la durée.

À quoi il sert

Sur Quelle IA, BALROG sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 85.

Comment c'est noté

Progression moyenne dans les six jeux, de 0 à 1, calculée sur plusieurs parties par jeu.

Ce qu'il ne dit pas

La moyenne cache de grands écarts : les modèles terminent les jeux simples mais avancent à peine dans NetHack.

Qui le tient

Équipe BALROG (auteurs de l'article de 2024).

balrogai.com · tâche Agents · 37 modèles mesurés

Comment lire le score

37 modèles mesurés · 41 mesures

En tête : GPT-6 Astra, 68,3 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 85. Le meilleur, GPT-6 Astra, atteint 68,3 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
22 %
Score IA 76niveau de Claude Sonnet 4.5
42 %
Score IA 100niveau de Claude Opus 5.5
63 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,67 %du score général. BALROG porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

En couleur, la tâche Agents dans le score général. En noir, la part de BALROG.

Le classement du benchmark

Scores relevés auprès de 2 sources · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-6 AstraOpenAIMaximale68,3 %105,7
2Claude Opus 5AnthropicMaximale63,4 %99,8
3GPT-5.6 SolOpenAIMaximale60 %96,0
4Gemini 3 ProGoogle DeepMindNon précisée58,1 %93,9
5Gemini 3.1 ProGoogle DeepMind · 2 configurationsNon précisée57 %92,7
6GPT-5.6 TerraOpenAIMaximale53,2 %88,5
7Gemini 3 FlashGoogle DeepMindNon précisée48,1 %83,0
8GPT-5.6 LunaOpenAIMaximale45,6 %80,3
9Grok 4xAINon précisée43,6 %78,2
10Claude Opus 4.5Anthropic · 3 configurationsNon précisée43,5 %78,0
37 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 37 →Replier le classement ↑
11Gemini 2.5 Pro (Mar 2025)Google DeepMindNon précisée43,3 %77,8
12DeepSeek-R1DeepSeek · poids ouvertsNon précisée34,9 %68,3
13Gemini 2.5 Flash (Jun 2025)Google DeepMindNon précisée33,5 %66,6
14GPT-5OpenAIFaible32,8 %65,8
15Claude 3.5 Sonnet (October 2024)AnthropicNon précisée32,6 %65,5
16GPT-4o (May 2024)OpenAINon précisée32,3 %65,2
17Claude Haiku 4.5Anthropic · 2 configurationsNon précisée31,2 %63,8
18Grok 3xAINon précisée29,5 %61,6
19Reka Flash 3Reka AINon précisée29,2 %61,3
20Llama 3.1-70BMeta AI · poids ouvertsNon précisée27,9 %59,5
21Llama 3.2 90BMeta AI · poids ouvertsNon précisée27,3 %58,7
22Llama 3.3 70BMeta AI · poids ouvertsNon précisée23 %52,6
23Gemini 1.5 Pro (Sept 2024)Google DeepMindNon précisée21 %49,5
24DeepSeek-R1-Distill-Qwen-32BDeepSeekNon précisée19,5 %47,0
25Claude 3.5 HaikuAnthropicNon précisée19,3 %46,6
26Mistral NeMoMistral AI · poids ouvertsNon précisée17,6 %43,6
27GPT-4o miniOpenAINon précisée17,4 %43,2
28Llama 3.2 11BMeta AI · poids ouvertsNon précisée16,8 %42,1
29Qwen2.5-72BAlibaba · poids ouvertsNon précisée16,2 %40,9
30Llama 3.1-8BMeta AI · poids ouvertsNon précisée15,1 %38,6
31Gemini 1.5 Flash (Sep 2024)Google DeepMindNon précisée14,6 %37,6
32Qwen2-VL-72B-InstructAlibabaNon précisée12,8 %33,5
33Phi-4Microsoft · poids ouvertsNon précisée11,6 %30,5
34Llama 3.2 3BMeta AI · poids ouvertsNon précisée10,1 %26,3
35Qwen2.5-7BAlibaba · poids ouvertsNon précisée7,8 %18,7
36Llama 3.2 1BMeta AI · poids ouvertsNon précisée6,6 %13,8
37Qwen2-VL-7B-InstructAlibabaNon précisée3,7 %-2,6

En bref

Que mesure BALROG ?
Jouer à six jeux, du simple BabyAI au redoutable NetHack, qui demandent d'explorer, de planifier et de tenir sur la durée. Sur Quelle IA, il est rangé dans la tâche Agents.
Comment BALROG est-il noté ?
Progression moyenne dans les six jeux, de 0 à 1, calculée sur plusieurs parties par jeu. Un modèle qui obtient 50 % a un score IA d'environ 85.
Qui est en tête sur BALROG ?
GPT-6 Astra (OpenAI) est en tête de BALROG avec 68,3 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5 (63,4 %) et GPT-5.6 Sol (60 %). 37 modèles y sont mesurés.
Quelles sont les limites de BALROG ?
La moyenne cache de grands écarts : les modèles terminent les jeux simples mais avancent à peine dans NetHack. Au 28 septembre 2026, le benchmark est actif.
Combien pèse BALROG dans le score IA ?
BALROG compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.
Qui maintient BALROG ?
Équipe BALROG (auteurs de l'article de 2024). Sa page de référence : balrogai.com.

Les autres benchmarks de la tâche Agents

Tous les benchmarks →Comment le score IA est calculé →