# BIG-Bench Hard (BBH)

> Fiche du benchmark BIG-Bench Hard (BBH) sur Quelle IA, édition du 28 septembre 2026. 23 exercices de logique et de raisonnement en plusieurs étapes, retenus en 2022 parce que les modèles y échouaient. En tête au 28 septembre 2026 : Gemini 1.5 Pro (May 2024) (89,2 %). Notation, limites et classement des 45 modèles mesurés.

Page : https://quelleia.com/benchmarks/bbh/
Source du benchmark : https://github.com/suzgunmirac/BIG-Bench-Hard
Mainteneur : Suzgun et al. (Google Research et Stanford), à partir de BIG-bench
Tâche : Tests historiques
État : archivé

## À quoi il sert

BIG-Bench Hard (BBH) est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

## Comment c'est noté

Moyenne des bonnes réponses sur l'ensemble des exercices.

Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

## Ce qu'il ne dit pas

Jeu public de 2022, largement vu à l'entraînement et saturé. Les scores viennent d'articles aux réglages variés.

## Qui le tient

Suzgun et al. (Google Research et Stanford), à partir de BIG-bench.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 62 % a un score IA d'environ 19. Le meilleur, Gemini 1.5 Pro (May 2024), atteint 89,2 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 84 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 94 %
- Score IA 100 (niveau de Claude Opus 5.5) : 97 %

## Son poids dans le score IA

0 % du score général. BIG-Bench Hard (BBH) est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

## Classement (45 modèles mesurés · 88 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Gemini 1.5 Pro (May 2024)](https://quelleia.com/modeles/gemini-1-5-pro-may-2024.md) | Google DeepMind | non précisée | 89,2 % | 62,3 | https://epoch.ai/benchmarks |
| 2 | [DeepSeek-V3](https://quelleia.com/modeles/deepseek-v3.md) | DeepSeek | non précisée | 87,5 % | 58,1 | https://epoch.ai/benchmarks |
| 3 | [Gemini 1.5 Pro (Feb 2024)](https://quelleia.com/modeles/gemini-1-5-pro-feb-2024.md) | Google DeepMind | non précisée | 84 % | 50,6 | https://epoch.ai/benchmarks |
| 4 | [Llama 3.1-405B](https://quelleia.com/modeles/llama-3-1-405b.md) | Meta AI | non précisée | 82,9 % | 48,5 | https://epoch.ai/benchmarks |
| 5 | [phi-3-medium 14B](https://quelleia.com/modeles/phi-3-medium-14b.md) | Microsoft | non précisée | 81,4 % | 45,9 | https://epoch.ai/benchmarks |
| 6 | [Qwen2.5-72B](https://quelleia.com/modeles/qwen2-5-72b.md) | Alibaba | non précisée | 79,8 % | 43,1 | https://epoch.ai/benchmarks |
| 7 | [phi-3-small 7.4B](https://quelleia.com/modeles/phi-3-small-7-4b.md) | Microsoft | non précisée | 79,1 % | 42,0 | https://epoch.ai/benchmarks |
| 8 | [DeepSeek-V2 (MoE-236B, May 2024)](https://quelleia.com/modeles/deepseek-v2-moe-236b-may-2024.md) | DeepSeek | non précisée | 78,8 % | 41,5 | https://epoch.ai/benchmarks |
| 9 | [GPT-4 (Jun 2023)](https://quelleia.com/modeles/gpt-4-jun-2023.md) | OpenAI | non précisée | 75,1 % | 35,9 | https://epoch.ai/benchmarks |
| 10 | [Yi-34B](https://quelleia.com/modeles/yi-34b.md) | 01.AI | non précisée | 71,7 % | 31,0 | https://epoch.ai/benchmarks |
| 10 | [phi-3-mini 3.8B](https://quelleia.com/modeles/phi-3-mini-3-8b.md) | Microsoft | non précisée | 71,7 % | 31,0 | https://epoch.ai/benchmarks |
| 12 | [Stable Beluga 2](https://quelleia.com/modeles/stable-beluga-2.md) | Stability AI | non précisée | 69,3 % | 27,7 | https://epoch.ai/benchmarks |
| 13 | [Llama 2-70B](https://quelleia.com/modeles/llama-2-70b.md) | Meta AI | non précisée | 64,9 % | 21,9 | https://epoch.ai/benchmarks |
| 14 | [GPT-3.5 Turbo (Jun 2023)](https://quelleia.com/modeles/gpt-3-5-turbo-jun-2023.md) | OpenAI | non précisée | 61,6 % | 17,5 | https://epoch.ai/benchmarks |
| 15 | [Phi-2](https://quelleia.com/modeles/phi-2.md) | Microsoft | non précisée | 59,4 % | 14,7 | https://epoch.ai/benchmarks |
| 16 | [Nemotron-4 15B](https://quelleia.com/modeles/nemotron-4-15b.md) | NVIDIA | non précisée | 58,7 % | 13,8 | https://epoch.ai/benchmarks |
| 17 | [LLaMA-65B](https://quelleia.com/modeles/llama-65b.md) | Meta AI | non précisée | 58,4 % | 13,4 | https://epoch.ai/benchmarks |
| 18 | [Llama 2-13B](https://quelleia.com/modeles/llama-2-13b.md) | Meta AI | non précisée | 58,2 % | 13,1 | https://epoch.ai/benchmarks |
| 19 | [Mistral 7B v0.1](https://quelleia.com/modeles/mistral-7b-v0-1.md) | Mistral AI | non précisée | 56,1 % | 10,3 | https://epoch.ai/benchmarks |
| 20 | [Gemma 7B](https://quelleia.com/modeles/gemma-7b.md) | Google DeepMind | non précisée | 55,1 % | 9,0 | https://epoch.ai/benchmarks |
| 21 | [Qwen-14B](https://quelleia.com/modeles/qwen-14b.md) | Alibaba | non précisée | 55 % | 8,8 | https://epoch.ai/benchmarks |
| 22 | [internlm-20b](https://quelleia.com/modeles/internlm-20b.md) | Shanghai AI Laboratory | non précisée | 52,5 % | 5,4 | https://epoch.ai/benchmarks |
| 23 | [LLaMA-33B](https://quelleia.com/modeles/llama-33b.md) | Meta AI | non précisée | 50 % | 1,8 | https://epoch.ai/benchmarks |
| 24 | [Baichuan2-13B](https://quelleia.com/modeles/baichuan2-13b.md) | Baichuan | non précisée | 49 % | 0,3 | https://epoch.ai/benchmarks |
| 25 | [Baichuan2-13B-Chat](https://quelleia.com/modeles/baichuan2-13b-chat.md) | Baichuan AI | non précisée | 47,2 % | -2,4 | https://epoch.ai/benchmarks |
| 25 | [Yi 6B](https://quelleia.com/modeles/yi-6b.md) | 01.AI | non précisée | 47,2 % | -2,4 | https://epoch.ai/benchmarks |
| 27 | [Qwen-7B](https://quelleia.com/modeles/qwen-7b.md) | Alibaba | non précisée | 45 % | -6,0 | https://epoch.ai/benchmarks |
| 28 | [Llama 2-34B](https://quelleia.com/modeles/llama-2-34b.md) | Meta AI | non précisée | 44,1 % | -7,5 | https://epoch.ai/benchmarks |
| 29 | [vicuna-13b-v1.1](https://quelleia.com/modeles/vicuna-13b-v1-1.md) |  | non précisée | 43 % | -9,4 | https://epoch.ai/benchmarks |
| 30 | [Baichuan 1-13B](https://quelleia.com/modeles/baichuan-1-13b.md) | Baichuan | non précisée | 43 % | -9,4 | https://epoch.ai/benchmarks |
| 31 | [internlm-chat-20b](https://quelleia.com/modeles/internlm-chat-20b.md) | Shanghai AI Laboratory | non précisée | 42,4 % | -10,5 | https://epoch.ai/benchmarks |
| 32 | [Baichuan 2-7B](https://quelleia.com/modeles/baichuan-2-7b.md) | Baichuan | non précisée | 41,6 % | -12,0 | https://epoch.ai/benchmarks |
| 33 | [Llama 2-7B](https://quelleia.com/modeles/llama-2-7b.md) | Meta AI | non précisée | 39,2 % | -16,9 | https://epoch.ai/benchmarks |
| 34 | [MPT-30B](https://quelleia.com/modeles/mpt-30b.md) | MosaicML | non précisée | 38 % | -19,5 | https://epoch.ai/benchmarks |
| 35 | [LLaMA-13B](https://quelleia.com/modeles/llama-13b.md) | Meta AI | non précisée | 37,9 % | -19,7 | https://epoch.ai/benchmarks |
| 36 | [Falcon-40B](https://quelleia.com/modeles/falcon-40b.md) | Technology Innovation Institute | non précisée | 37,1 % | -21,6 | https://epoch.ai/benchmarks |
| 37 | [internlm-7b](https://quelleia.com/modeles/internlm-7b.md) | Shanghai AI Laboratory | non précisée | 37 % | -21,8 | https://epoch.ai/benchmarks |
| 38 | [MPT-7B](https://quelleia.com/modeles/mpt-7b.md) | MosaicML | non précisée | 35,6 % | -25,4 | https://epoch.ai/benchmarks |
| 39 | [Gemma 2B](https://quelleia.com/modeles/gemma-2b.md) | Google DeepMind | non précisée | 35,2 % | -26,5 | https://epoch.ai/benchmarks |
| 40 | [INTELLECT-1](https://quelleia.com/modeles/intellect-1.md) | Prime Intellect | non précisée | 34,8 % | -27,5 | https://epoch.ai/benchmarks |
| 41 | [chatglm2-6b](https://quelleia.com/modeles/chatglm2-6b.md) | Z.ai (Zhipu AI) | non précisée | 33,7 % | -30,9 | https://epoch.ai/benchmarks |
| 42 | [LLaMA-7B](https://quelleia.com/modeles/llama-7b.md) | Meta AI | non précisée | 33,5 % | -31,6 | https://epoch.ai/benchmarks |
| 43 | [Baichuan1-7B](https://quelleia.com/modeles/baichuan1-7b.md) | Baichuan | non précisée | 32,5 % | -35,1 | https://epoch.ai/benchmarks |
| 44 | [Falcon-7B](https://quelleia.com/modeles/falcon-7b.md) | Technology Innovation Institute | non précisée | 28,8 % | -53,1 | https://epoch.ai/benchmarks |
| 45 | [Qwen-1_8B](https://quelleia.com/modeles/qwen-1-8b.md) | Alibaba | non précisée | 28,2 % | -57,3 | https://epoch.ai/benchmarks |

## En bref

**Que mesure BIG-Bench Hard (BBH) ?** 23 exercices de logique et de raisonnement en plusieurs étapes, retenus en 2022 parce que les modèles y échouaient. C'est un test historique, hors des scores d'aujourd'hui.

**Comment BIG-Bench Hard (BBH) est-il noté ?** Moyenne des bonnes réponses sur l'ensemble des exercices. Un modèle qui obtient 62 % a un score IA d'environ 19.

**Qui est en tête sur BIG-Bench Hard (BBH) ?** Gemini 1.5 Pro (May 2024) (Google DeepMind) est en tête de BIG-Bench Hard (BBH) avec 89,2 %, dans l'édition du 28 septembre 2026. Suivent DeepSeek-V3 (87,5 %) et Gemini 1.5 Pro (Feb 2024) (84 %). 45 modèles y sont mesurés.

**Quelles sont les limites de BIG-Bench Hard (BBH) ?** Jeu public de 2022, largement vu à l'entraînement et saturé. Les scores viennent d'articles aux réglages variés. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse BIG-Bench Hard (BBH) dans le score IA ?** BIG-Bench Hard (BBH) compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

**Qui maintient BIG-Bench Hard (BBH) ?** Suzgun et al. (Google Research et Stanford), à partir de BIG-bench. Sa page de référence : github.com/suzgunmirac/BIG-Bench-Hard.

## Les autres tests historiques

- [MMLU](https://quelleia.com/benchmarks/mmlu.md) : 127 modèles · hors score, archivé
- [WinoGrande](https://quelleia.com/benchmarks/winogrande.md) : 77 modèles · hors score, archivé
- [ARC (AI2 Reasoning Challenge)](https://quelleia.com/benchmarks/arc_ai2.md) : 76 modèles · hors score, archivé
- [BoolQ](https://quelleia.com/benchmarks/boolq.md) : 76 modèles · hors score, archivé
- [HellaSwag](https://quelleia.com/benchmarks/hellaswag.md) : 75 modèles · hors score, archivé
- [PIQA](https://quelleia.com/benchmarks/piqa.md) : 59 modèles · hors score, archivé
- [LiveBench](https://quelleia.com/benchmarks/livebench.md) : 48 modèles · hors score, archivé
- [OpenBookQA](https://quelleia.com/benchmarks/openbookqa.md) : 42 modèles · hors score, archivé
- [TriviaQA](https://quelleia.com/benchmarks/triviaqa.md) : 38 modèles · hors score, archivé
- [LAMBADA](https://quelleia.com/benchmarks/lambada.md) : 26 modèles · hors score, archivé
- [ScienceQA](https://quelleia.com/benchmarks/scienceqa.md) : 23 modèles · hors score, archivé
- [ANLI (Adversarial NLI)](https://quelleia.com/benchmarks/anli.md) : 11 modèles · hors score, archivé
- [SuperGLUE](https://quelleia.com/benchmarks/superglue.md) : 8 modèles · hors score, archivé
- [CommonsenseQA 2.0](https://quelleia.com/benchmarks/csqa2.md) : 6 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
