À quoi il sert
CommonsenseQA 2.0 est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Test historiqueFiche benchmark · Allen Institute for AI et université de Tel-Aviv (Talmor et al., 2021) · allenai.github.io
Des affirmations de bon sens sur les objets, les situations sociales et les causes, à juger vraies ou fausses.
CommonsenseQA 2.0 est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Part de bonnes réponses ; le hasard donne 50 %.
Pour le calcul, ce score est ramené entre 0 et 1 : 50 %, le niveau du hasard, vaut 0 et 100 % vaut 1.
Dix résultats seulement, tous sur d'anciens modèles. Inutile pour comparer les assistants actuels.
Allen Institute for AI et université de Tel-Aviv (Talmor et al., 2021).
allenai.github.io/csqa2 · test historique · 6 modèles mesurés
En tête : T5-11B, 67,8 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 75 % a un score IA d'environ 61. Le meilleur, T5-11B, atteint 67,8 %. Le benchmark est archivé, faute de modèle récent mesuré. Avec 6 modèles mesurés seulement, cet étalonnage reste fragile.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. CommonsenseQA 2.0 est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.
6 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.