Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

Test historiqueFiche benchmark · Allen Institute for AI · allenai.org

OpenBookQA

Des questions de sciences élémentaires qui demandent de combiner un fait du cours avec du bon sens.

ARCHIVÉ

À quoi il sert

OpenBookQA est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

Comment c'est noté

Part de bonnes réponses à quatre choix ; le hasard donne 25 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

Ce qu'il ne dit pas

Test de 2018, aujourd'hui saturé. Les scores viennent d'articles aux réglages variés.

Comment lire le score

42 modèles mesurés · 70 mesures

En tête : 2 modèles, 88 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 62 % a un score IA d'environ 1. 2 modèles partagent la première place avec 88 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
88 %
Score IA 76niveau de Claude Sonnet 4.5
94 %
Score IA 100niveau de Claude Opus 5.5
97 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. OpenBookQA est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1phi-3-small 7.4BMicrosoft · poids ouvertsNon précisée88 %50,5
1phi-3-mini 3.8BMicrosoft · poids ouverts · 3 configurationsNon précisée88 %50,5
3phi-3-medium 14BMicrosoft · poids ouverts · 2 configurationsNon précisée87,4 %48,7
4GPT-3.5 Turbo (Nov 2023)OpenAINon précisée86 %44,9
5Mixtral 8x7BMistral AI · poids ouvertsNon précisée85,8 %44,4
6Llama 3-8BMeta AI · poids ouverts · 2 configurationsNon précisée82,6 %36,8
7Mistral 7B v0.1Mistral AI · poids ouvertsNon précisée79,8 %30,9
8Gemma 7BGoogle DeepMind · poids ouvertsNon précisée78,6 %28,5
9Phi-2Microsoft · poids ouverts · 2 configurationsNon précisée73,6 %19,3
10PaLM (540B)Google Research · 4 configurationsNon précisée68 %10,0
42 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 42 →Replier le classement ↑
11InstructGPT 175BOpenAI · 7 configurationsNon précisée65,4 %5,8
12Falcon-180BTechnology Innovation Institute · poids ouvertsNon précisée64,2 %3,9
13GLaMGoogle DeepMind · 3 configurationsNon précisée63 %2,0
14Llama 2-70BMeta AI · poids ouvertsNon précisée60,2 %-2,5
14LLaMA-65BMeta AI · poids ouverts · 2 configurationsNon précisée60,2 %-2,5
16LLaMA-33BMeta AI · poids ouverts · 2 configurationsNon précisée58,6 %-5,0
16Llama 2-7BMeta AI · poids ouverts · 2 configurationsNon précisée58,6 %-5,0
18Llama 2-34BMeta AINon précisée58,2 %-5,7
19PaLM 2-MGoogle DeepMindNon précisée57,4 %-6,9
20LLaMA-7BMeta AI · poids ouverts · 4 configurationsNon précisée57,2 %-7,3
21Llama 2-13BMeta AI · poids ouvertsNon précisée57 %-7,6
22Falcon-40BTechnology Innovation Institute · poids ouvertsNon précisée56,6 %-8,2
23LLaMA-13BMeta AI · poids ouverts · 2 configurationsNon précisée56,4 %-8,6
24PaLM 2-SGoogle DeepMind · 2 configurationsNon précisée56,2 %-8,9
25MPT-30BMosaicML · poids ouvertsNon précisée52 %-15,9
26Falcon-7BTechnology Innovation Institute · poids ouverts · 3 configurationsNon précisée51,6 %-16,6
27MPT-7BMosaicML · poids ouverts · 3 configurationsNon précisée51,4 %-16,9
28PaLM 62BGoogle DeepMindNon précisée50,4 %-18,7
29XGen-7BSalesforce · poids ouvertsNon précisée40,2 %-39,5
30RedPajama-INCITE-7B-BaseNon précisée40 %-40,0
31opt-13bMeta AINon précisée39,8 %-40,5
32Dolly 2.0-12bDatabricks · poids ouvertsNon précisée39,2 %-42,0
33open_llama_7bNon précisée39 %-42,5
34GPT-NeoX-20BEleutherAI · poids ouvertsNon précisée38,8 %-43,1
35GPT-J-6BEleutherAI · poids ouvertsNon précisée38,2 %-44,7
36Phi-1.5Microsoft · poids ouvertsNon précisée37,2 %-47,5
37Cerebras-GPT-13BCerebras Systems · poids ouvertsNon précisée35,8 %-51,8
38vicuna-13b-v1.1Non précisée33 %-62,0
39stablelm-tuned-alpha-7bStability AINon précisée32,4 %-64,6
40OPT-1.3BMeta AI · poids ouvertsNon précisée24 %-135,4
41GPT-Neo-2.7BEleutherAI · poids ouvertsNon précisée23,2 %-135,4
42GPT-2 (1.5B)OpenAI · poids ouvertsNon précisée22,4 %-135,4

En bref

Que mesure OpenBookQA ?
Des questions de sciences élémentaires qui demandent de combiner un fait du cours avec du bon sens. C'est un test historique, hors des scores d'aujourd'hui.
Comment OpenBookQA est-il noté ?
Part de bonnes réponses à quatre choix ; le hasard donne 25 %. Un modèle qui obtient 62 % a un score IA d'environ 1.
Qui est en tête sur OpenBookQA ?
phi-3-small 7.4B et phi-3-mini 3.8B sont en tête d'OpenBookQA avec 88 %, dans l'édition du 28 septembre 2026. Suivent phi-3-medium 14B (87,4 %) et GPT-3.5 Turbo (Nov 2023) (86 %). 42 modèles y sont mesurés.
Quelles sont les limites d'OpenBookQA ?
Test de 2018, aujourd'hui saturé. Les scores viennent d'articles aux réglages variés. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse OpenBookQA dans le score IA ?
OpenBookQA compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.
Qui maintient OpenBookQA ?
Allen Institute for AI. Sa page de référence : allenai.org/data/open-book-qa.

Les autres tests historiques

Tous les benchmarks →Comment le score IA est calculé →