Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

Test historiqueFiche benchmark · Suzgun et al. (Google Research et Stanford), à partir de BIG-bench · github.com

BIG-Bench Hard (BBH)

23 exercices de logique et de raisonnement en plusieurs étapes, retenus en 2022 parce que les modèles y échouaient.

ARCHIVÉ

À quoi il sert

BIG-Bench Hard (BBH) est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

Comment c'est noté

Moyenne des bonnes réponses sur l'ensemble des exercices.

Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

Ce qu'il ne dit pas

Jeu public de 2022, largement vu à l'entraînement et saturé. Les scores viennent d'articles aux réglages variés.

Comment lire le score

45 modèles mesurés · 88 mesures

En tête : Gemini 1.5 Pro (May 2024), 89,2 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 62 % a un score IA d'environ 19. Le meilleur, Gemini 1.5 Pro (May 2024), atteint 89,2 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
84 %
Score IA 76niveau de Claude Sonnet 4.5
94 %
Score IA 100niveau de Claude Opus 5.5
97 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. BIG-Bench Hard (BBH) est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Gemini 1.5 Pro (May 2024)Google DeepMindNon précisée89,2 %62,3
2DeepSeek-V3DeepSeek · poids ouverts · 2 configurationsNon précisée87,5 %58,1
3Gemini 1.5 Pro (Feb 2024)Google DeepMindNon précisée84 %50,6
4Llama 3.1-405BMeta AI · poids ouverts · 2 configurationsNon précisée82,9 %48,5
5phi-3-medium 14BMicrosoft · poids ouvertsNon précisée81,4 %45,9
6Qwen2.5-72BAlibaba · poids ouverts · 2 configurationsNon précisée79,8 %43,1
7phi-3-small 7.4BMicrosoft · poids ouvertsNon précisée79,1 %42,0
8DeepSeek-V2 (MoE-236B, May 2024)DeepSeek · poids ouverts · 2 configurationsNon précisée78,8 %41,5
9GPT-4 (Jun 2023)OpenAINon précisée75,1 %35,9
10Yi-34B01.AI · poids ouverts · 3 configurationsNon précisée71,7 %31,0
45 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 45 →Replier le classement ↑
10phi-3-mini 3.8BMicrosoft · poids ouvertsNon précisée71,7 %31,0
12Stable Beluga 2Stability AI · poids ouvertsNon précisée69,3 %27,7
13Llama 2-70BMeta AI · poids ouverts · 4 configurationsNon précisée64,9 %21,9
14GPT-3.5 Turbo (Jun 2023)OpenAINon précisée61,6 %17,5
15Phi-2Microsoft · poids ouvertsNon précisée59,4 %14,7
16Nemotron-4 15BNVIDIANon précisée58,7 %13,8
17LLaMA-65BMeta AI · poids ouverts · 2 configurationsNon précisée58,4 %13,4
18Llama 2-13BMeta AI · poids ouverts · 6 configurationsNon précisée58,2 %13,1
19Mistral 7B v0.1Mistral AI · poids ouverts · 2 configurationsNon précisée56,1 %10,3
20Gemma 7BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée55,1 %9,0
21Qwen-14BAlibaba · poids ouverts · 5 configurationsNon précisée55 %8,8
22internlm-20bShanghai AI LaboratoryNon précisée52,5 %5,4
23LLaMA-33BMeta AI · poids ouverts · 2 configurationsNon précisée50 %1,8
24Baichuan2-13BBaichuan · poids ouverts · 3 configurationsNon précisée49 %0,3
25Baichuan2-13B-ChatBaichuan AI · 2 configurationsNon précisée47,2 %-2,4
25Yi 6B01.AI · poids ouverts · 3 configurationsNon précisée47,2 %-2,4
27Qwen-7BAlibaba · poids ouverts · 2 configurationsNon précisée45 %-6,0
28Llama 2-34BMeta AI · 3 configurationsNon précisée44,1 %-7,5
29vicuna-13b-v1.1Non précisée43 %-9,4
30Baichuan 1-13BBaichuan · poids ouvertsNon précisée43 %-9,4
31internlm-chat-20bShanghai AI Laboratory · 2 configurationsNon précisée42,4 %-10,5
32Baichuan 2-7BBaichuan · poids ouverts · 2 configurationsNon précisée41,6 %-12,0
33Llama 2-7BMeta AI · poids ouverts · 3 configurationsNon précisée39,2 %-16,9
34MPT-30BMosaicML · poids ouvertsNon précisée38 %-19,5
35LLaMA-13BMeta AI · poids ouverts · 3 configurationsNon précisée37,9 %-19,7
36Falcon-40BTechnology Innovation Institute · poids ouvertsNon précisée37,1 %-21,6
37internlm-7bShanghai AI LaboratoryNon précisée37 %-21,8
38MPT-7BMosaicML · poids ouverts · 3 configurationsNon précisée35,6 %-25,4
39Gemma 2BGoogle DeepMind · poids ouvertsNon précisée35,2 %-26,5
40INTELLECT-1Prime IntellectNon précisée34,8 %-27,5
41chatglm2-6bZ.ai (Zhipu AI) · 2 configurationsNon précisée33,7 %-30,9
42LLaMA-7BMeta AI · poids ouverts · 3 configurationsNon précisée33,5 %-31,6
43Baichuan1-7BBaichuan · poids ouvertsNon précisée32,5 %-35,1
44Falcon-7BTechnology Innovation Institute · poids ouverts · 2 configurationsNon précisée28,8 %-53,1
45Qwen-1_8BAlibaba · 2 configurationsNon précisée28,2 %-57,3

En bref

Que mesure BIG-Bench Hard (BBH) ?
23 exercices de logique et de raisonnement en plusieurs étapes, retenus en 2022 parce que les modèles y échouaient. C'est un test historique, hors des scores d'aujourd'hui.
Comment BIG-Bench Hard (BBH) est-il noté ?
Moyenne des bonnes réponses sur l'ensemble des exercices. Un modèle qui obtient 62 % a un score IA d'environ 19.
Qui est en tête sur BIG-Bench Hard (BBH) ?
Gemini 1.5 Pro (May 2024) (Google DeepMind) est en tête de BIG-Bench Hard (BBH) avec 89,2 %, dans l'édition du 28 septembre 2026. Suivent DeepSeek-V3 (87,5 %) et Gemini 1.5 Pro (Feb 2024) (84 %). 45 modèles y sont mesurés.
Quelles sont les limites de BIG-Bench Hard (BBH) ?
Jeu public de 2022, largement vu à l'entraînement et saturé. Les scores viennent d'articles aux réglages variés. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse BIG-Bench Hard (BBH) dans le score IA ?
BIG-Bench Hard (BBH) compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.
Qui maintient BIG-Bench Hard (BBH) ?
Suzgun et al. (Google Research et Stanford), à partir de BIG-bench. Sa page de référence : github.com/suzgunmirac/BIG-Bench-Hard.

Les autres tests historiques

Tous les benchmarks →Comment le score IA est calculé →