# BoolQ

> Fiche du benchmark BoolQ sur Quelle IA, édition du 28 septembre 2026. Répondre par oui ou par non à une vraie question d'internaute, à partir d'un court passage de texte. En tête au 28 septembre 2026 : T5-11B (91,2 %). Notation, limites et classement des 76 modèles mesurés.

Page : https://quelleia.com/benchmarks/boolq/
Source du benchmark : https://github.com/google-research-datasets/boolean-questions
Mainteneur : Google AI Language (Clark et al., 2019)
Tâche : Tests historiques
État : archivé

## À quoi il sert

BoolQ est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

## Comment c'est noté

Part de bonnes réponses ; le hasard donne 50 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 50 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

## Ce qu'il ne dit pas

Test de 2019 saturé. Avec deux réponses possibles, les écarts entre modèles sont minces.

## Qui le tient

Google AI Language (Clark et al., 2019).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 92 %. Le meilleur, T5-11B, atteint 91,2 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 92 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 95 %
- Score IA 100 (niveau de Claude Opus 5.5) : 97 %

## Son poids dans le score IA

0 % du score général. BoolQ est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

## Classement (76 modèles mesurés · 136 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [T5-11B](https://quelleia.com/modeles/t5-11b.md) | Google DeepMind | non précisée | 91,2 % | 46,3 | https://epoch.ai/benchmarks |
| 2 | [PaLM 2-L](https://quelleia.com/modeles/palm-2-l.md) | Google DeepMind | non précisée | 90,9 % | 44,5 | https://epoch.ai/benchmarks |
| 3 | [T5-3B](https://quelleia.com/modeles/t5-3b.md) | Google DeepMind | non précisée | 89,9 % | 38,8 | https://epoch.ai/benchmarks |
| 4 | [Inflection-1](https://quelleia.com/modeles/inflection-1.md) | Inflection AI | non précisée | 89,7 % | 37,7 | https://epoch.ai/benchmarks |
| 5 | [Stable Beluga 2](https://quelleia.com/modeles/stable-beluga-2.md) | Stability AI | non précisée | 89,4 % | 36,1 | https://epoch.ai/benchmarks |
| 6 | [Falcon-180B](https://quelleia.com/modeles/falcon-180b.md) | Technology Innovation Institute | non précisée | 89 % | 34,0 | https://epoch.ai/benchmarks |
| 7 | [GPT-4o mini](https://quelleia.com/modeles/gpt-4o-mini.md) | OpenAI | non précisée | 88,7 % | 32,5 | https://epoch.ai/benchmarks |
| 7 | [PaLM (540B)](https://quelleia.com/modeles/palm-540b.md) | Google Research | non précisée | 88,7 % | 32,5 | https://epoch.ai/benchmarks |
| 9 | [Llama 2-70B](https://quelleia.com/modeles/llama-2-70b.md) | Meta AI | non précisée | 88,6 % | 32,0 | https://epoch.ai/benchmarks |
| 9 | [PaLM 2-M](https://quelleia.com/modeles/palm-2-m.md) | Google DeepMind | non précisée | 88,6 % | 32,0 | https://epoch.ai/benchmarks |
| 11 | [davinci-003](https://quelleia.com/modeles/davinci-003.md) | OpenAI | non précisée | 88,1 % | 29,5 | https://epoch.ai/benchmarks |
| 11 | [PaLM 2-S](https://quelleia.com/modeles/palm-2-s.md) | Google DeepMind | non précisée | 88,1 % | 29,5 | https://epoch.ai/benchmarks |
| 13 | [davinci-002](https://quelleia.com/modeles/davinci-002.md) | OpenAI | non précisée | 87,7 % | 27,6 | https://epoch.ai/benchmarks |
| 14 | [internlm-20b](https://quelleia.com/modeles/internlm-20b.md) | Shanghai AI Laboratory | non précisée | 87,5 % | 26,6 | https://epoch.ai/benchmarks |
| 15 | [Mistral 7B v0.1](https://quelleia.com/modeles/mistral-7b-v0-1.md) | Mistral AI | non précisée | 87,4 % | 26,2 | https://epoch.ai/benchmarks |
| 16 | [LLaMA-65B](https://quelleia.com/modeles/llama-65b.md) | Meta AI | non précisée | 87,1 % | 24,8 | https://epoch.ai/benchmarks |
| 17 | [GPT-3.5 Turbo (Jun 2023)](https://quelleia.com/modeles/gpt-3-5-turbo-jun-2023.md) | OpenAI | non précisée | 87 % | 24,3 | https://epoch.ai/benchmarks |
| 18 | [Qwen-14B](https://quelleia.com/modeles/qwen-14b.md) | Alibaba | non précisée | 86,2 % | 20,7 | https://epoch.ai/benchmarks |
| 19 | [LLaMA-33B](https://quelleia.com/modeles/llama-33b.md) | Meta AI | non précisée | 86,1 % | 20,2 | https://epoch.ai/benchmarks |
| 20 | [Gemini 1.5 Flash (May 2024)](https://quelleia.com/modeles/gemini-1-5-flash-may-2024.md) | Google DeepMind | non précisée | 85,8 % | 18,9 | https://epoch.ai/benchmarks |
| 21 | [Gemma 2 9B](https://quelleia.com/modeles/gemma-2-9b.md) | Google DeepMind | non précisée | 85,7 % | 18,5 | https://epoch.ai/benchmarks |
| 22 | [T5-Large](https://quelleia.com/modeles/t5-large.md) | Google DeepMind | non précisée | 85,4 % | 17,2 | https://epoch.ai/benchmarks |
| 23 | [MPT-30B](https://quelleia.com/modeles/mpt-30b.md) | MosaicML | non précisée | 85 % | 15,5 | https://epoch.ai/benchmarks |
| 24 | [Megatron-Turing NLG 530B](https://quelleia.com/modeles/megatron-turing-nlg-530b.md) | Microsoft | non précisée | 84,8 % | 14,8 | https://epoch.ai/benchmarks |
| 25 | [PaLM 62B](https://quelleia.com/modeles/palm-62b.md) | Google DeepMind | non précisée | 84,8 % | 14,6 | https://epoch.ai/benchmarks |
| 26 | [Phi-3.5-MoE](https://quelleia.com/modeles/phi-3-5-moe.md) | Microsoft | non précisée | 84,6 % | 13,8 | https://epoch.ai/benchmarks |
| 27 | [Chinchilla](https://quelleia.com/modeles/chinchilla.md) | DeepMind | non précisée | 83,7 % | 10,1 | https://epoch.ai/benchmarks |
| 27 | [Llama 2-34B](https://quelleia.com/modeles/llama-2-34b.md) | Meta AI | non précisée | 83,7 % | 10,1 | https://epoch.ai/benchmarks |
| 29 | [vicuna-13b-v1.1](https://quelleia.com/modeles/vicuna-13b-v1-1.md) |  | non précisée | 83,5 % | 9,3 | https://epoch.ai/benchmarks |
| 30 | [Mistral 7B v0.2](https://quelleia.com/modeles/mistral-7b-v0-2.md) | Mistral AI | non précisée | 83,2 % | 8,1 | https://epoch.ai/benchmarks |
| 30 | [Gemma 7B](https://quelleia.com/modeles/gemma-7b.md) | Google DeepMind | non précisée | 83,2 % | 8,1 | https://epoch.ai/benchmarks |
| 32 | [Falcon-40B](https://quelleia.com/modeles/falcon-40b.md) | Technology Innovation Institute | non précisée | 83,1 % | 7,7 | https://epoch.ai/benchmarks |
| 33 | [Llama 3.1-8B](https://quelleia.com/modeles/llama-3-1-8b.md) | Meta AI | non précisée | 82,8 % | 6,5 | https://epoch.ai/benchmarks |
| 34 | [Mistral NeMo](https://quelleia.com/modeles/mistral-nemo.md) | Mistral AI | non précisée | 82,5 % | 5,4 | https://epoch.ai/benchmarks |
| 35 | [Llama 2-13B](https://quelleia.com/modeles/llama-2-13b.md) | Meta AI | non précisée | 82,4 % | 5,0 | https://epoch.ai/benchmarks |
| 36 | [T5-Base](https://quelleia.com/modeles/t5-base.md) | Google DeepMind | non précisée | 81,4 % | 1,1 | https://epoch.ai/benchmarks |
| 37 | [Vicuna-13B-v1.3](https://quelleia.com/modeles/vicuna-13b-v1-3.md) | Large Model Systems Organization | non précisée | 80,8 % | -1,1 | https://epoch.ai/benchmarks |
| 38 | [Gopher (280B)](https://quelleia.com/modeles/gopher-280b.md) | DeepMind | non précisée | 79,4 % | -6,3 | https://epoch.ai/benchmarks |
| 39 | [OPT-175B](https://quelleia.com/modeles/opt-175b.md) | Meta AI | non précisée | 79,3 % | -6,7 | https://epoch.ai/benchmarks |
| 40 | [chatglm2-6b](https://quelleia.com/modeles/chatglm2-6b.md) | Z.ai (Zhipu AI) | non précisée | 79 % | -7,8 | https://epoch.ai/benchmarks |
| 41 | [LLaMA-13B](https://quelleia.com/modeles/llama-13b.md) | Meta AI | non précisée | 78,7 % | -8,8 | https://epoch.ai/benchmarks |
| 42 | [Phi-3.5-mini](https://quelleia.com/modeles/phi-3-5-mini.md) | Microsoft | non précisée | 78 % | -11,4 | https://epoch.ai/benchmarks |
| 43 | [Llama 2-7B](https://quelleia.com/modeles/llama-2-7b.md) | Meta AI | non précisée | 77,9 % | -11,7 | https://epoch.ai/benchmarks |
| 44 | [InstructGPT 175B](https://quelleia.com/modeles/instructgpt-175b.md) | OpenAI | non précisée | 77,5 % | -13,2 | https://epoch.ai/benchmarks |
| 45 | [LLaMA-7B](https://quelleia.com/modeles/llama-7b.md) | Meta AI | non précisée | 76,5 % | -16,7 | https://epoch.ai/benchmarks |
| 46 | [Qwen-7B](https://quelleia.com/modeles/qwen-7b.md) | Alibaba | non précisée | 76,4 % | -17,1 | https://epoch.ai/benchmarks |
| 46 | [T5-Small](https://quelleia.com/modeles/t5-small.md) | Google DeepMind | non précisée | 76,4 % | -17,1 | https://epoch.ai/benchmarks |
| 48 | [OPT-66B](https://quelleia.com/modeles/opt-66b.md) | Meta AI | non précisée | 76 % | -18,5 | https://epoch.ai/benchmarks |
| 49 | [Phi-1.5](https://quelleia.com/modeles/phi-1-5.md) | Microsoft | non précisée | 75,8 % | -19,2 | https://epoch.ai/benchmarks |
| 50 | [Falcon-7B](https://quelleia.com/modeles/falcon-7b.md) | Technology Innovation Institute | non précisée | 75,3 % | -21,0 | https://epoch.ai/benchmarks |
| 51 | [MPT-7B](https://quelleia.com/modeles/mpt-7b.md) | MosaicML | non précisée | 75 % | -22,1 | https://epoch.ai/benchmarks |
| 52 | [XGen-7B](https://quelleia.com/modeles/xgen-7b.md) | Salesforce | non précisée | 74,3 % | -24,5 | https://epoch.ai/benchmarks |
| 53 | [GPT-3 175B (davinci)](https://quelleia.com/modeles/gpt-3-175b-davinci.md) | OpenAI | non précisée | 72,2 % | -32,0 | https://epoch.ai/benchmarks |
| 54 | [open_llama_7b](https://quelleia.com/modeles/open-llama-7b.md) |  | non précisée | 70,6 % | -37,8 | https://epoch.ai/benchmarks |
| 55 | [BLOOM-176B](https://quelleia.com/modeles/bloom-176b.md) | Hugging Face | non précisée | 70,4 % | -38,6 | https://epoch.ai/benchmarks |
| 56 | [Gemma 2B](https://quelleia.com/modeles/gemma-2b.md) | Google DeepMind | non précisée | 69,4 % | -42,3 | https://epoch.ai/benchmarks |
| 57 | [RedPajama-INCITE-7B-Base](https://quelleia.com/modeles/redpajama-incite-7b-base.md) |  | non précisée | 69,3 % | -42,6 | https://epoch.ai/benchmarks |
| 58 | [Qwen-1_8B](https://quelleia.com/modeles/qwen-1-8b.md) | Alibaba | non précisée | 68 % | -47,6 | https://epoch.ai/benchmarks |
| 59 | [Baichuan2-13B](https://quelleia.com/modeles/baichuan2-13b.md) | Baichuan | non précisée | 67 % | -51,5 | https://epoch.ai/benchmarks |
| 60 | [GPT-3 6.7B](https://quelleia.com/modeles/gpt-3-6-7b.md) | OpenAI | non précisée | 65,6 % | -57,1 | https://epoch.ai/benchmarks |
| 61 | [GPT-J-6B](https://quelleia.com/modeles/gpt-j-6b.md) | EleutherAI | non précisée | 65,4 % | -57,9 | https://epoch.ai/benchmarks |
| 62 | [opt-13b](https://quelleia.com/modeles/opt-13b.md) | Meta AI | non précisée | 65 % | -59,6 | https://epoch.ai/benchmarks |
| 63 | [GPT-NeoX-20B](https://quelleia.com/modeles/gpt-neox-20b.md) | EleutherAI | non précisée | 64,9 % | -60,0 | https://epoch.ai/benchmarks |
| 64 | [internlm-7b](https://quelleia.com/modeles/internlm-7b.md) | Shanghai AI Laboratory | non précisée | 64,1 % | -63,5 | https://epoch.ai/benchmarks |
| 65 | [Baichuan 2-7B](https://quelleia.com/modeles/baichuan-2-7b.md) | Baichuan | non précisée | 63,2 % | -67,5 | https://epoch.ai/benchmarks |
| 66 | [InstructGPT 6B](https://quelleia.com/modeles/instructgpt-6b.md) | OpenAI | non précisée | 62 % | -73,1 | https://epoch.ai/benchmarks |
| 67 | [GPT-2 (1.5B)](https://quelleia.com/modeles/gpt-2-1-5b.md) | OpenAI | non précisée | 61,8 % | -74,1 | https://epoch.ai/benchmarks |
| 67 | [GPT-Neo-2.7B](https://quelleia.com/modeles/gpt-neo-2-7b.md) | EleutherAI | non précisée | 61,8 % | -74,1 | https://epoch.ai/benchmarks |
| 69 | [Cerebras-GPT-13B](https://quelleia.com/modeles/cerebras-gpt-13b.md) | Cerebras Systems | non précisée | 61,1 % | -77,6 | https://epoch.ai/benchmarks |
| 70 | [OPT-1.3B](https://quelleia.com/modeles/opt-1-3b.md) | Meta AI | non précisée | 59,6 % | -85,7 | https://epoch.ai/benchmarks |
| 71 | [stablelm-tuned-alpha-7b](https://quelleia.com/modeles/stablelm-tuned-alpha-7b.md) | Stability AI | non précisée | 59 % | -89,3 | https://epoch.ai/benchmarks |
| 72 | [GPT-3 Medium](https://quelleia.com/modeles/gpt-3-medium.md) | OpenAI | non précisée | 58,1 % | -94,9 | https://epoch.ai/benchmarks |
| 73 | [GPT-3 XL (babbage)](https://quelleia.com/modeles/gpt-3-xl-babbage.md) | OpenAI | non précisée | 57,4 % | -99,6 | https://epoch.ai/benchmarks |
| 74 | [Dolly 2.0-12b](https://quelleia.com/modeles/dolly-2-0-12b.md) | Databricks | non précisée | 56,3 % | -107,9 | https://epoch.ai/benchmarks |
| 75 | [InstructGPT 350M](https://quelleia.com/modeles/instructgpt-350m.md) | OpenAI | non précisée | 46,4 % | -225,7 | https://epoch.ai/benchmarks |
| 76 | [InstructGPT 1.3B](https://quelleia.com/modeles/instructgpt-1-3b.md) | OpenAI | non précisée | 45,1 % | -225,7 | https://epoch.ai/benchmarks |

## En bref

**Que mesure BoolQ ?** Répondre par oui ou par non à une vraie question d'internaute, à partir d'un court passage de texte. C'est un test historique, hors des scores d'aujourd'hui.

**Comment BoolQ est-il noté ?** Part de bonnes réponses ; le hasard donne 50 %. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 92 %.

**Qui est en tête sur BoolQ ?** T5-11B (Google DeepMind) est en tête de BoolQ avec 91,2 %, dans l'édition du 28 septembre 2026. Suivent PaLM 2-L (90,9 %) et T5-3B (89,9 %). 76 modèles y sont mesurés.

**Quelles sont les limites de BoolQ ?** Test de 2019 saturé. Avec deux réponses possibles, les écarts entre modèles sont minces. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse BoolQ dans le score IA ?** BoolQ compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

**Qui maintient BoolQ ?** Google AI Language (Clark et al., 2019). Sa page de référence : github.com/google-research-datasets/boolean-questions.

## Les autres tests historiques

- [MMLU](https://quelleia.com/benchmarks/mmlu.md) : 127 modèles · hors score, archivé
- [WinoGrande](https://quelleia.com/benchmarks/winogrande.md) : 77 modèles · hors score, archivé
- [ARC (AI2 Reasoning Challenge)](https://quelleia.com/benchmarks/arc_ai2.md) : 76 modèles · hors score, archivé
- [HellaSwag](https://quelleia.com/benchmarks/hellaswag.md) : 75 modèles · hors score, archivé
- [PIQA](https://quelleia.com/benchmarks/piqa.md) : 59 modèles · hors score, archivé
- [LiveBench](https://quelleia.com/benchmarks/livebench.md) : 48 modèles · hors score, archivé
- [BIG-Bench Hard (BBH)](https://quelleia.com/benchmarks/bbh.md) : 45 modèles · hors score, archivé
- [OpenBookQA](https://quelleia.com/benchmarks/openbookqa.md) : 42 modèles · hors score, archivé
- [TriviaQA](https://quelleia.com/benchmarks/triviaqa.md) : 38 modèles · hors score, archivé
- [LAMBADA](https://quelleia.com/benchmarks/lambada.md) : 26 modèles · hors score, archivé
- [ScienceQA](https://quelleia.com/benchmarks/scienceqa.md) : 23 modèles · hors score, archivé
- [ANLI (Adversarial NLI)](https://quelleia.com/benchmarks/anli.md) : 11 modèles · hors score, archivé
- [SuperGLUE](https://quelleia.com/benchmarks/superglue.md) : 8 modèles · hors score, archivé
- [CommonsenseQA 2.0](https://quelleia.com/benchmarks/csqa2.md) : 6 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
