# OpenBookQA

> Fiche du benchmark OpenBookQA sur Quelle IA, édition du 28 septembre 2026. Des questions de sciences élémentaires qui demandent de combiner un fait du cours avec du bon sens. En tête au 28 septembre 2026 : 2 modèles ex æquo (88 %). Notation, limites et classement des 42 modèles mesurés.

Page : https://quelleia.com/benchmarks/openbookqa/
Source du benchmark : https://allenai.org/data/open-book-qa
Mainteneur : Allen Institute for AI
Tâche : Tests historiques
État : archivé

## À quoi il sert

OpenBookQA est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

## Comment c'est noté

Part de bonnes réponses à quatre choix ; le hasard donne 25 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

## Ce qu'il ne dit pas

Test de 2018, aujourd'hui saturé. Les scores viennent d'articles aux réglages variés.

## Qui le tient

Allen Institute for AI.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 62 % a un score IA d'environ 1. 2 modèles partagent la première place avec 88 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 88 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 94 %
- Score IA 100 (niveau de Claude Opus 5.5) : 97 %

## Son poids dans le score IA

0 % du score général. OpenBookQA est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

## Classement (42 modèles mesurés · 70 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [phi-3-small 7.4B](https://quelleia.com/modeles/phi-3-small-7-4b.md) | Microsoft | non précisée | 88 % | 50,5 | https://epoch.ai/benchmarks |
| 1 | [phi-3-mini 3.8B](https://quelleia.com/modeles/phi-3-mini-3-8b.md) | Microsoft | non précisée | 88 % | 50,5 | https://epoch.ai/benchmarks |
| 3 | [phi-3-medium 14B](https://quelleia.com/modeles/phi-3-medium-14b.md) | Microsoft | non précisée | 87,4 % | 48,7 | https://epoch.ai/benchmarks |
| 4 | [GPT-3.5 Turbo (Nov 2023)](https://quelleia.com/modeles/gpt-3-5-turbo-nov-2023.md) | OpenAI | non précisée | 86 % | 44,9 | https://epoch.ai/benchmarks |
| 5 | [Mixtral 8x7B](https://quelleia.com/modeles/mixtral-8x7b.md) | Mistral AI | non précisée | 85,8 % | 44,4 | https://epoch.ai/benchmarks |
| 6 | [Llama 3-8B](https://quelleia.com/modeles/llama-3-8b.md) | Meta AI | non précisée | 82,6 % | 36,8 | https://epoch.ai/benchmarks |
| 7 | [Mistral 7B v0.1](https://quelleia.com/modeles/mistral-7b-v0-1.md) | Mistral AI | non précisée | 79,8 % | 30,9 | https://epoch.ai/benchmarks |
| 8 | [Gemma 7B](https://quelleia.com/modeles/gemma-7b.md) | Google DeepMind | non précisée | 78,6 % | 28,5 | https://epoch.ai/benchmarks |
| 9 | [Phi-2](https://quelleia.com/modeles/phi-2.md) | Microsoft | non précisée | 73,6 % | 19,3 | https://epoch.ai/benchmarks |
| 10 | [PaLM (540B)](https://quelleia.com/modeles/palm-540b.md) | Google Research | non précisée | 68 % | 10,0 | https://epoch.ai/benchmarks |
| 11 | [InstructGPT 175B](https://quelleia.com/modeles/instructgpt-175b.md) | OpenAI | non précisée | 65,4 % | 5,8 | https://epoch.ai/benchmarks |
| 12 | [Falcon-180B](https://quelleia.com/modeles/falcon-180b.md) | Technology Innovation Institute | non précisée | 64,2 % | 3,9 | https://epoch.ai/benchmarks |
| 13 | [GLaM](https://quelleia.com/modeles/glam.md) | Google DeepMind | non précisée | 63 % | 2,0 | https://epoch.ai/benchmarks |
| 14 | [Llama 2-70B](https://quelleia.com/modeles/llama-2-70b.md) | Meta AI | non précisée | 60,2 % | -2,5 | https://epoch.ai/benchmarks |
| 14 | [LLaMA-65B](https://quelleia.com/modeles/llama-65b.md) | Meta AI | non précisée | 60,2 % | -2,5 | https://epoch.ai/benchmarks |
| 16 | [LLaMA-33B](https://quelleia.com/modeles/llama-33b.md) | Meta AI | non précisée | 58,6 % | -5,0 | https://epoch.ai/benchmarks |
| 16 | [Llama 2-7B](https://quelleia.com/modeles/llama-2-7b.md) | Meta AI | non précisée | 58,6 % | -5,0 | https://epoch.ai/benchmarks |
| 18 | [Llama 2-34B](https://quelleia.com/modeles/llama-2-34b.md) | Meta AI | non précisée | 58,2 % | -5,7 | https://epoch.ai/benchmarks |
| 19 | [PaLM 2-M](https://quelleia.com/modeles/palm-2-m.md) | Google DeepMind | non précisée | 57,4 % | -6,9 | https://epoch.ai/benchmarks |
| 20 | [LLaMA-7B](https://quelleia.com/modeles/llama-7b.md) | Meta AI | non précisée | 57,2 % | -7,3 | https://epoch.ai/benchmarks |
| 21 | [Llama 2-13B](https://quelleia.com/modeles/llama-2-13b.md) | Meta AI | non précisée | 57 % | -7,6 | https://epoch.ai/benchmarks |
| 22 | [Falcon-40B](https://quelleia.com/modeles/falcon-40b.md) | Technology Innovation Institute | non précisée | 56,6 % | -8,2 | https://epoch.ai/benchmarks |
| 23 | [LLaMA-13B](https://quelleia.com/modeles/llama-13b.md) | Meta AI | non précisée | 56,4 % | -8,6 | https://epoch.ai/benchmarks |
| 24 | [PaLM 2-S](https://quelleia.com/modeles/palm-2-s.md) | Google DeepMind | non précisée | 56,2 % | -8,9 | https://epoch.ai/benchmarks |
| 25 | [MPT-30B](https://quelleia.com/modeles/mpt-30b.md) | MosaicML | non précisée | 52 % | -15,9 | https://epoch.ai/benchmarks |
| 26 | [Falcon-7B](https://quelleia.com/modeles/falcon-7b.md) | Technology Innovation Institute | non précisée | 51,6 % | -16,6 | https://epoch.ai/benchmarks |
| 27 | [MPT-7B](https://quelleia.com/modeles/mpt-7b.md) | MosaicML | non précisée | 51,4 % | -16,9 | https://epoch.ai/benchmarks |
| 28 | [PaLM 62B](https://quelleia.com/modeles/palm-62b.md) | Google DeepMind | non précisée | 50,4 % | -18,7 | https://epoch.ai/benchmarks |
| 29 | [XGen-7B](https://quelleia.com/modeles/xgen-7b.md) | Salesforce | non précisée | 40,2 % | -39,5 | https://epoch.ai/benchmarks |
| 30 | [RedPajama-INCITE-7B-Base](https://quelleia.com/modeles/redpajama-incite-7b-base.md) |  | non précisée | 40 % | -40,0 | https://epoch.ai/benchmarks |
| 31 | [opt-13b](https://quelleia.com/modeles/opt-13b.md) | Meta AI | non précisée | 39,8 % | -40,5 | https://epoch.ai/benchmarks |
| 32 | [Dolly 2.0-12b](https://quelleia.com/modeles/dolly-2-0-12b.md) | Databricks | non précisée | 39,2 % | -42,0 | https://epoch.ai/benchmarks |
| 33 | [open_llama_7b](https://quelleia.com/modeles/open-llama-7b.md) |  | non précisée | 39 % | -42,5 | https://epoch.ai/benchmarks |
| 34 | [GPT-NeoX-20B](https://quelleia.com/modeles/gpt-neox-20b.md) | EleutherAI | non précisée | 38,8 % | -43,1 | https://epoch.ai/benchmarks |
| 35 | [GPT-J-6B](https://quelleia.com/modeles/gpt-j-6b.md) | EleutherAI | non précisée | 38,2 % | -44,7 | https://epoch.ai/benchmarks |
| 36 | [Phi-1.5](https://quelleia.com/modeles/phi-1-5.md) | Microsoft | non précisée | 37,2 % | -47,5 | https://epoch.ai/benchmarks |
| 37 | [Cerebras-GPT-13B](https://quelleia.com/modeles/cerebras-gpt-13b.md) | Cerebras Systems | non précisée | 35,8 % | -51,8 | https://epoch.ai/benchmarks |
| 38 | [vicuna-13b-v1.1](https://quelleia.com/modeles/vicuna-13b-v1-1.md) |  | non précisée | 33 % | -62,0 | https://epoch.ai/benchmarks |
| 39 | [stablelm-tuned-alpha-7b](https://quelleia.com/modeles/stablelm-tuned-alpha-7b.md) | Stability AI | non précisée | 32,4 % | -64,6 | https://epoch.ai/benchmarks |
| 40 | [OPT-1.3B](https://quelleia.com/modeles/opt-1-3b.md) | Meta AI | non précisée | 24 % | -135,4 | https://epoch.ai/benchmarks |
| 41 | [GPT-Neo-2.7B](https://quelleia.com/modeles/gpt-neo-2-7b.md) | EleutherAI | non précisée | 23,2 % | -135,4 | https://epoch.ai/benchmarks |
| 42 | [GPT-2 (1.5B)](https://quelleia.com/modeles/gpt-2-1-5b.md) | OpenAI | non précisée | 22,4 % | -135,4 | https://epoch.ai/benchmarks |

## En bref

**Que mesure OpenBookQA ?** Des questions de sciences élémentaires qui demandent de combiner un fait du cours avec du bon sens. C'est un test historique, hors des scores d'aujourd'hui.

**Comment OpenBookQA est-il noté ?** Part de bonnes réponses à quatre choix ; le hasard donne 25 %. Un modèle qui obtient 62 % a un score IA d'environ 1.

**Qui est en tête sur OpenBookQA ?** phi-3-small 7.4B et phi-3-mini 3.8B sont en tête d'OpenBookQA avec 88 %, dans l'édition du 28 septembre 2026. Suivent phi-3-medium 14B (87,4 %) et GPT-3.5 Turbo (Nov 2023) (86 %). 42 modèles y sont mesurés.

**Quelles sont les limites d'OpenBookQA ?** Test de 2018, aujourd'hui saturé. Les scores viennent d'articles aux réglages variés. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse OpenBookQA dans le score IA ?** OpenBookQA compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

**Qui maintient OpenBookQA ?** Allen Institute for AI. Sa page de référence : allenai.org/data/open-book-qa.

## Les autres tests historiques

- [MMLU](https://quelleia.com/benchmarks/mmlu.md) : 127 modèles · hors score, archivé
- [WinoGrande](https://quelleia.com/benchmarks/winogrande.md) : 77 modèles · hors score, archivé
- [ARC (AI2 Reasoning Challenge)](https://quelleia.com/benchmarks/arc_ai2.md) : 76 modèles · hors score, archivé
- [BoolQ](https://quelleia.com/benchmarks/boolq.md) : 76 modèles · hors score, archivé
- [HellaSwag](https://quelleia.com/benchmarks/hellaswag.md) : 75 modèles · hors score, archivé
- [PIQA](https://quelleia.com/benchmarks/piqa.md) : 59 modèles · hors score, archivé
- [LiveBench](https://quelleia.com/benchmarks/livebench.md) : 48 modèles · hors score, archivé
- [BIG-Bench Hard (BBH)](https://quelleia.com/benchmarks/bbh.md) : 45 modèles · hors score, archivé
- [TriviaQA](https://quelleia.com/benchmarks/triviaqa.md) : 38 modèles · hors score, archivé
- [LAMBADA](https://quelleia.com/benchmarks/lambada.md) : 26 modèles · hors score, archivé
- [ScienceQA](https://quelleia.com/benchmarks/scienceqa.md) : 23 modèles · hors score, archivé
- [ANLI (Adversarial NLI)](https://quelleia.com/benchmarks/anli.md) : 11 modèles · hors score, archivé
- [SuperGLUE](https://quelleia.com/benchmarks/superglue.md) : 8 modèles · hors score, archivé
- [CommonsenseQA 2.0](https://quelleia.com/benchmarks/csqa2.md) : 6 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
