À quoi il sert
OpenBookQA est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Test historiqueFiche benchmark · Allen Institute for AI · allenai.org
Des questions de sciences élémentaires qui demandent de combiner un fait du cours avec du bon sens.
OpenBookQA est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Part de bonnes réponses à quatre choix ; le hasard donne 25 %.
Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.
Test de 2018, aujourd'hui saturé. Les scores viennent d'articles aux réglages variés.
Allen Institute for AI.
allenai.org/data/open-book-qa · test historique · 42 modèles mesurés
En tête : 2 modèles, 88 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 62 % a un score IA d'environ 1. 2 modèles partagent la première place avec 88 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. OpenBookQA est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.