# ScienceQA

> Fiche du benchmark ScienceQA sur Quelle IA, édition du 28 septembre 2026. Des questions de sciences de niveau école et collège, à choix multiples, souvent accompagnées d'une image ou d'un schéma. En tête au 28 septembre 2026 : Phi-3.5-vision-instruct (91,3 %). Notation, limites et classement des 23 modèles mesurés.

Page : https://quelleia.com/benchmarks/scienceqa/
Source du benchmark : https://scienceqa.github.io/
Mainteneur : Lu et al. (2022)
Tâche : Tests historiques
État : archivé

## À quoi il sert

ScienceQA est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

## Comment c'est noté

Part de bonnes réponses à choix multiples.

Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

## Ce qu'il ne dit pas

La plupart des résultats concernent des modèles de recherche entraînés spécialement sur ce jeu, peu comparables aux assistants grand public.

## Qui le tient

Lu et al. (2022).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 63 % a un score IA d'environ 4. Le meilleur, Phi-3.5-vision-instruct, atteint 91,3 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 92 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 97 %
- Score IA 100 (niveau de Claude Opus 5.5) : plus de 99 %

## Son poids dans le score IA

0 % du score général. ScienceQA est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

## Classement (23 modèles mesurés · 26 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Phi-3.5-vision-instruct](https://quelleia.com/modeles/phi-3-5-vision-instruct.md) | Microsoft | non précisée | 91,3 % | 48,9 | https://epoch.ai/benchmarks |
| 2 | [GPT-4o (May 2024)](https://quelleia.com/modeles/gpt-4o-may-2024.md) | OpenAI | non précisée | 88,5 % | 41,8 | https://epoch.ai/benchmarks |
| 3 | [Gemini 1.0 Pro Vision](https://quelleia.com/modeles/gemini-1-0-pro-vision.md) | Google DeepMind | non précisée | 79,7 % | 26,0 | https://epoch.ai/benchmarks |
| 4 | [falcon-11B-vlm](https://quelleia.com/modeles/falcon-11b-vlm.md) | Technology Innovation Institute | non précisée | 74,9 % | 19,4 | https://epoch.ai/benchmarks |
| 5 | [BLIP-2 (Q-Former)](https://quelleia.com/modeles/blip-2-q-former.md) | Salesforce Research | non précisée | 74,2 % | 18,4 | https://epoch.ai/benchmarks |
| 6 | [InstructGPT 175B](https://quelleia.com/modeles/instructgpt-175b.md) | OpenAI | non précisée | 74 % | 18,2 | https://epoch.ai/benchmarks |
| 7 | [llama3-llava-next-8b](https://quelleia.com/modeles/llama3-llava-next-8b.md) |  | non précisée | 73,7 % | 17,8 | https://epoch.ai/benchmarks |
| 8 | [llava-v1.6-vicuna-13b](https://quelleia.com/modeles/llava-v1-6-vicuna-13b.md) |  | non précisée | 73,6 % | 17,7 | https://epoch.ai/benchmarks |
| 9 | [llava-v1.6-mistral-7b](https://quelleia.com/modeles/llava-v1-6-mistral-7b.md) |  | non précisée | 72,8 % | 16,7 | https://epoch.ai/benchmarks |
| 10 | [MM1-7B-Chat](https://quelleia.com/modeles/mm1-7b-chat.md) | Apple | non précisée | 72,6 % | 16,4 | https://epoch.ai/benchmarks |
| 11 | [Claude 3 Haiku](https://quelleia.com/modeles/claude-3-haiku.md) | Anthropic | non précisée | 72 % | 15,6 | https://epoch.ai/benchmarks |
| 12 | [llava-v1.6-vicuna-7b](https://quelleia.com/modeles/llava-v1-6-vicuna-7b.md) |  | non précisée | 70,6 % | 13,9 | https://epoch.ai/benchmarks |
| 13 | [InternVL-Chat-ViT-6B-Vicuna-13B](https://quelleia.com/modeles/internvl-chat-vit-6b-vicuna-13b.md) | Shanghai AI Laboratory | non précisée | 70,1 % | 13,3 | https://epoch.ai/benchmarks |
| 14 | [MM1-3B-Chat](https://quelleia.com/modeles/mm1-3b-chat.md) | Apple | non précisée | 69,4 % | 12,4 | https://epoch.ai/benchmarks |
| 15 | [Qwen-VL-Chat](https://quelleia.com/modeles/qwen-vl-chat.md) | Alibaba | non précisée | 68,2 % | 11,0 | https://epoch.ai/benchmarks |
| 16 | [llava-v1.5-7b](https://quelleia.com/modeles/llava-v1-5-7b.md) |  | non précisée | 66,8 % | 9,3 | https://epoch.ai/benchmarks |
| 17 | [InternVL-Chat-ViT-6B-Vicuna-7B](https://quelleia.com/modeles/internvl-chat-vit-6b-vicuna-7b.md) | Shanghai AI Laboratory | non précisée | 66,2 % | 8,6 | https://epoch.ai/benchmarks |
| 18 | [instructblip-vicuna-13b](https://quelleia.com/modeles/instructblip-vicuna-13b.md) |  | non précisée | 63,1 % | 5,0 | https://epoch.ai/benchmarks |
| 19 | [instructblip-vicuna-7b](https://quelleia.com/modeles/instructblip-vicuna-7b.md) |  | non précisée | 60,5 % | 1,9 | https://epoch.ai/benchmarks |
| 20 | [Llama 2-13B](https://quelleia.com/modeles/llama-2-13b.md) | Meta AI | non précisée | 55,8 % | -3,7 | https://epoch.ai/benchmarks |
| 21 | [LLaMA-13B](https://quelleia.com/modeles/llama-13b.md) | Meta AI | non précisée | 43,3 % | -20,6 | https://epoch.ai/benchmarks |
| 22 | [Llama 2-7B](https://quelleia.com/modeles/llama-2-7b.md) | Meta AI | non précisée | 43,1 % | -21,0 | https://epoch.ai/benchmarks |
| 23 | [LLaMA-7B](https://quelleia.com/modeles/llama-7b.md) | Meta AI | non précisée | 36,2 % | -34,0 | https://epoch.ai/benchmarks |

## En bref

**Que mesure ScienceQA ?** Des questions de sciences de niveau école et collège, à choix multiples, souvent accompagnées d'une image ou d'un schéma. C'est un test historique, hors des scores d'aujourd'hui.

**Comment ScienceQA est-il noté ?** Part de bonnes réponses à choix multiples. Un modèle qui obtient 63 % a un score IA d'environ 4.

**Qui est en tête sur ScienceQA ?** Phi-3.5-vision-instruct (Microsoft) est en tête de ScienceQA avec 91,3 %, dans l'édition du 28 septembre 2026. Suivent GPT-4o (May 2024) (88,5 %) et Gemini 1.0 Pro Vision (79,7 %). 23 modèles y sont mesurés.

**Quelles sont les limites de ScienceQA ?** La plupart des résultats concernent des modèles de recherche entraînés spécialement sur ce jeu, peu comparables aux assistants grand public. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse ScienceQA dans le score IA ?** ScienceQA compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

**Qui maintient ScienceQA ?** Lu et al. (2022). Sa page de référence : scienceqa.github.io.

## Les autres tests historiques

- [MMLU](https://quelleia.com/benchmarks/mmlu.md) : 127 modèles · hors score, archivé
- [WinoGrande](https://quelleia.com/benchmarks/winogrande.md) : 77 modèles · hors score, archivé
- [ARC (AI2 Reasoning Challenge)](https://quelleia.com/benchmarks/arc_ai2.md) : 76 modèles · hors score, archivé
- [BoolQ](https://quelleia.com/benchmarks/boolq.md) : 76 modèles · hors score, archivé
- [HellaSwag](https://quelleia.com/benchmarks/hellaswag.md) : 75 modèles · hors score, archivé
- [PIQA](https://quelleia.com/benchmarks/piqa.md) : 59 modèles · hors score, archivé
- [LiveBench](https://quelleia.com/benchmarks/livebench.md) : 48 modèles · hors score, archivé
- [BIG-Bench Hard (BBH)](https://quelleia.com/benchmarks/bbh.md) : 45 modèles · hors score, archivé
- [OpenBookQA](https://quelleia.com/benchmarks/openbookqa.md) : 42 modèles · hors score, archivé
- [TriviaQA](https://quelleia.com/benchmarks/triviaqa.md) : 38 modèles · hors score, archivé
- [LAMBADA](https://quelleia.com/benchmarks/lambada.md) : 26 modèles · hors score, archivé
- [ANLI (Adversarial NLI)](https://quelleia.com/benchmarks/anli.md) : 11 modèles · hors score, archivé
- [SuperGLUE](https://quelleia.com/benchmarks/superglue.md) : 8 modèles · hors score, archivé
- [CommonsenseQA 2.0](https://quelleia.com/benchmarks/csqa2.md) : 6 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
