À quoi il sert
ScienceQA est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Test historiqueFiche benchmark · Lu et al. (2022) · scienceqa.github.io
Des questions de sciences de niveau école et collège, à choix multiples, souvent accompagnées d'une image ou d'un schéma.
ScienceQA est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Part de bonnes réponses à choix multiples.
Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.
La plupart des résultats concernent des modèles de recherche entraînés spécialement sur ce jeu, peu comparables aux assistants grand public.
Lu et al. (2022).
scienceqa.github.io · test historique · 23 modèles mesurés
En tête : Phi-3.5-vision-instruct, 91,3 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 63 % a un score IA d'environ 4. Le meilleur, Phi-3.5-vision-instruct, atteint 91,3 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. ScienceQA est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.