Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

Test historiqueFiche benchmark · Lu et al. (2022) · scienceqa.github.io

ScienceQA

Des questions de sciences de niveau école et collège, à choix multiples, souvent accompagnées d'une image ou d'un schéma.

ARCHIVÉ

À quoi il sert

ScienceQA est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

Comment c'est noté

Part de bonnes réponses à choix multiples.

Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

Ce qu'il ne dit pas

La plupart des résultats concernent des modèles de recherche entraînés spécialement sur ce jeu, peu comparables aux assistants grand public.

Comment lire le score

23 modèles mesurés · 26 mesures

En tête : Phi-3.5-vision-instruct, 91,3 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 63 % a un score IA d'environ 4. Le meilleur, Phi-3.5-vision-instruct, atteint 91,3 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
92 %
Score IA 76niveau de Claude Sonnet 4.5
97 %
Score IA 100niveau de Claude Opus 5.5
plus de 99 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. ScienceQA est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Phi-3.5-vision-instructMicrosoftNon précisée91,3 %48,9
2GPT-4o (May 2024)OpenAINon précisée88,5 %41,8
3Gemini 1.0 Pro VisionGoogle DeepMindNon précisée79,7 %26,0
4falcon-11B-vlmTechnology Innovation InstituteNon précisée74,9 %19,4
5BLIP-2 (Q-Former)Salesforce Research · poids ouvertsNon précisée74,2 %18,4
6InstructGPT 175BOpenAI · 2 configurationsNon précisée74 %18,2
7llama3-llava-next-8bNon précisée73,7 %17,8
8llava-v1.6-vicuna-13bNon précisée73,6 %17,7
9llava-v1.6-mistral-7bNon précisée72,8 %16,7
10MM1-7B-ChatAppleNon précisée72,6 %16,4
23 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 23 →Replier le classement ↑
11Claude 3 HaikuAnthropicNon précisée72 %15,6
12llava-v1.6-vicuna-7b2 configurationsNon précisée70,6 %13,9
13InternVL-Chat-ViT-6B-Vicuna-13BShanghai AI LaboratoryNon précisée70,1 %13,3
14MM1-3B-ChatAppleNon précisée69,4 %12,4
15Qwen-VL-ChatAlibaba · 2 configurationsNon précisée68,2 %11,0
16llava-v1.5-7bNon précisée66,8 %9,3
17InternVL-Chat-ViT-6B-Vicuna-7BShanghai AI LaboratoryNon précisée66,2 %8,6
18instructblip-vicuna-13bNon précisée63,1 %5,0
19instructblip-vicuna-7bNon précisée60,5 %1,9
20Llama 2-13BMeta AI · poids ouvertsNon précisée55,8 %-3,7
21LLaMA-13BMeta AI · poids ouvertsNon précisée43,3 %-20,6
22Llama 2-7BMeta AI · poids ouvertsNon précisée43,1 %-21,0
23LLaMA-7BMeta AI · poids ouvertsNon précisée36,2 %-34,0

En bref

Que mesure ScienceQA ?
Des questions de sciences de niveau école et collège, à choix multiples, souvent accompagnées d'une image ou d'un schéma. C'est un test historique, hors des scores d'aujourd'hui.
Comment ScienceQA est-il noté ?
Part de bonnes réponses à choix multiples. Un modèle qui obtient 63 % a un score IA d'environ 4.
Qui est en tête sur ScienceQA ?
Phi-3.5-vision-instruct (Microsoft) est en tête de ScienceQA avec 91,3 %, dans l'édition du 28 septembre 2026. Suivent GPT-4o (May 2024) (88,5 %) et Gemini 1.0 Pro Vision (79,7 %). 23 modèles y sont mesurés.
Quelles sont les limites de ScienceQA ?
La plupart des résultats concernent des modèles de recherche entraînés spécialement sur ce jeu, peu comparables aux assistants grand public. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse ScienceQA dans le score IA ?
ScienceQA compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.
Qui maintient ScienceQA ?
Lu et al. (2022). Sa page de référence : scienceqa.github.io.

Les autres tests historiques

Tous les benchmarks →Comment le score IA est calculé →