Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

Test historiqueFiche benchmark · Google AI Language (Clark et al., 2019) · github.com

BoolQ

Répondre par oui ou par non à une vraie question d'internaute, à partir d'un court passage de texte.

ARCHIVÉ

À quoi il sert

BoolQ est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

Comment c'est noté

Part de bonnes réponses ; le hasard donne 50 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 50 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

Ce qu'il ne dit pas

Test de 2019 saturé. Avec deux réponses possibles, les écarts entre modèles sont minces.

Comment lire le score

76 modèles mesurés · 136 mesures

En tête : T5-11B, 91,2 %

Chaque trait est un modèle, placé à son meilleur score. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 92 %. Le meilleur, T5-11B, atteint 91,2 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
92 %
Score IA 76niveau de Claude Sonnet 4.5
95 %
Score IA 100niveau de Claude Opus 5.5
97 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. BoolQ est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1T5-11BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée91,2 %46,3
2PaLM 2-LGoogle DeepMindNon précisée90,9 %44,5
3T5-3BGoogle DeepMind · poids ouvertsNon précisée89,9 %38,8
4Inflection-1Inflection AINon précisée89,7 %37,7
5Stable Beluga 2Stability AI · poids ouvertsNon précisée89,4 %36,1
6Falcon-180BTechnology Innovation Institute · poids ouverts · 2 configurationsNon précisée89 %34,0
7GPT-4o miniOpenAINon précisée88,7 %32,5
7PaLM (540B)Google Research · 3 configurationsNon précisée88,7 %32,5
9Llama 2-70BMeta AI · poids ouverts · 4 configurationsNon précisée88,6 %32,0
9PaLM 2-MGoogle DeepMindNon précisée88,6 %32,0
76 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 76 →Replier le classement ↑
11davinci-003OpenAINon précisée88,1 %29,5
11PaLM 2-SGoogle DeepMindNon précisée88,1 %29,5
13davinci-002OpenAINon précisée87,7 %27,6
14internlm-20bShanghai AI LaboratoryNon précisée87,5 %26,6
15Mistral 7B v0.1Mistral AI · poids ouverts · 2 configurationsNon précisée87,4 %26,2
16LLaMA-65BMeta AI · poids ouverts · 4 configurationsNon précisée87,1 %24,8
17GPT-3.5 Turbo (Jun 2023)OpenAINon précisée87 %24,3
18Qwen-14BAlibaba · poids ouvertsNon précisée86,2 %20,7
19LLaMA-33BMeta AI · poids ouverts · 4 configurationsNon précisée86,1 %20,2
20Gemini 1.5 Flash (May 2024)Google DeepMindNon précisée85,8 %18,9
21Gemma 2 9BGoogle DeepMind · poids ouvertsNon précisée85,7 %18,5
22T5-LargeGoogle DeepMindNon précisée85,4 %17,2
23MPT-30BMosaicML · poids ouverts · 3 configurationsNon précisée85 %15,5
24Megatron-Turing NLG 530BMicrosoft · 5 configurationsNon précisée84,8 %14,8
25PaLM 62BGoogle DeepMindNon précisée84,8 %14,6
26Phi-3.5-MoEMicrosoft · poids ouvertsNon précisée84,6 %13,8
27ChinchillaDeepMind · 3 configurationsNon précisée83,7 %10,1
27Llama 2-34BMeta AI · 2 configurationsNon précisée83,7 %10,1
29vicuna-13b-v1.1Non précisée83,5 %9,3
30Mistral 7B v0.2Mistral AINon précisée83,2 %8,1
30Gemma 7BGoogle DeepMind · poids ouvertsNon précisée83,2 %8,1
32Falcon-40BTechnology Innovation Institute · poids ouverts · 3 configurationsNon précisée83,1 %7,7
33Llama 3.1-8BMeta AI · poids ouvertsNon précisée82,8 %6,5
34Mistral NeMoMistral AI · poids ouvertsNon précisée82,5 %5,4
35Llama 2-13BMeta AI · poids ouverts · 5 configurationsNon précisée82,4 %5,0
36T5-BaseGoogle DeepMindNon précisée81,4 %1,1
37Vicuna-13B-v1.3Large Model Systems Organization · poids ouvertsNon précisée80,8 %-1,1
38Gopher (280B)DeepMind · 3 configurationsNon précisée79,4 %-6,3
39OPT-175BMeta AI · poids ouvertsNon précisée79,3 %-6,7
40chatglm2-6bZ.ai (Zhipu AI)Non précisée79 %-7,8
41LLaMA-13BMeta AI · poids ouverts · 4 configurationsNon précisée78,7 %-8,8
42Phi-3.5-miniMicrosoft · poids ouvertsNon précisée78 %-11,4
43Llama 2-7BMeta AI · poids ouverts · 6 configurationsNon précisée77,9 %-11,7
44InstructGPT 175BOpenAI · 9 configurationsNon précisée77,5 %-13,2
45LLaMA-7BMeta AI · poids ouverts · 6 configurationsNon précisée76,5 %-16,7
46Qwen-7BAlibaba · poids ouvertsNon précisée76,4 %-17,1
46T5-SmallGoogle DeepMindNon précisée76,4 %-17,1
48OPT-66BMeta AI · poids ouvertsNon précisée76 %-18,5
49Phi-1.5Microsoft · poids ouvertsNon précisée75,8 %-19,2
50Falcon-7BTechnology Innovation Institute · poids ouverts · 6 configurationsNon précisée75,3 %-21,0
51MPT-7BMosaicML · poids ouverts · 4 configurationsNon précisée75 %-22,1
52XGen-7BSalesforce · poids ouvertsNon précisée74,3 %-24,5
53GPT-3 175B (davinci)OpenAINon précisée72,2 %-32,0
54open_llama_7bNon précisée70,6 %-37,8
55BLOOM-176BHugging Face · poids ouvertsNon précisée70,4 %-38,6
56Gemma 2BGoogle DeepMind · poids ouvertsNon précisée69,4 %-42,3
57RedPajama-INCITE-7B-BaseNon précisée69,3 %-42,6
58Qwen-1_8BAlibabaNon précisée68 %-47,6
59Baichuan2-13BBaichuan · poids ouvertsNon précisée67 %-51,5
60GPT-3 6.7BOpenAINon précisée65,6 %-57,1
61GPT-J-6BEleutherAI · poids ouvertsNon précisée65,4 %-57,9
62opt-13bMeta AINon précisée65 %-59,6
63GPT-NeoX-20BEleutherAI · poids ouvertsNon précisée64,9 %-60,0
64internlm-7bShanghai AI LaboratoryNon précisée64,1 %-63,5
65Baichuan 2-7BBaichuan · poids ouvertsNon précisée63,2 %-67,5
66InstructGPT 6BOpenAINon précisée62 %-73,1
67GPT-2 (1.5B)OpenAI · poids ouvertsNon précisée61,8 %-74,1
67GPT-Neo-2.7BEleutherAI · poids ouvertsNon précisée61,8 %-74,1
69Cerebras-GPT-13BCerebras Systems · poids ouvertsNon précisée61,1 %-77,6
70OPT-1.3BMeta AI · poids ouvertsNon précisée59,6 %-85,7
71stablelm-tuned-alpha-7bStability AINon précisée59 %-89,3
72GPT-3 MediumOpenAINon précisée58,1 %-94,9
73GPT-3 XL (babbage)OpenAINon précisée57,4 %-99,6
74Dolly 2.0-12bDatabricks · poids ouvertsNon précisée56,3 %-107,9
75InstructGPT 350MOpenAINon précisée46,4 %-225,7
76InstructGPT 1.3BOpenAINon précisée45,1 %-225,7

En bref

Que mesure BoolQ ?
Répondre par oui ou par non à une vraie question d'internaute, à partir d'un court passage de texte. C'est un test historique, hors des scores d'aujourd'hui.
Comment BoolQ est-il noté ?
Part de bonnes réponses ; le hasard donne 50 %. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 92 %.
Qui est en tête sur BoolQ ?
T5-11B (Google DeepMind) est en tête de BoolQ avec 91,2 %, dans l'édition du 28 septembre 2026. Suivent PaLM 2-L (90,9 %) et T5-3B (89,9 %). 76 modèles y sont mesurés.
Quelles sont les limites de BoolQ ?
Test de 2019 saturé. Avec deux réponses possibles, les écarts entre modèles sont minces. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse BoolQ dans le score IA ?
BoolQ compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.
Qui maintient BoolQ ?
Google AI Language (Clark et al., 2019). Sa page de référence : github.com/google-research-datasets/boolean-questions.

Les autres tests historiques

Tous les benchmarks →Comment le score IA est calculé →