À quoi il sert
BoolQ est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Test historiqueFiche benchmark · Google AI Language (Clark et al., 2019) · github.com
Répondre par oui ou par non à une vraie question d'internaute, à partir d'un court passage de texte.
BoolQ est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Part de bonnes réponses ; le hasard donne 50 %.
Pour le calcul, ce score est ramené entre 0 et 1 : 50 %, le niveau du hasard, vaut 0 et 100 % vaut 1.
Test de 2019 saturé. Avec deux réponses possibles, les écarts entre modèles sont minces.
Google AI Language (Clark et al., 2019).
github.com/google-research-datasets/boolean-questions · test historique · 76 modèles mesurés
En tête : T5-11B, 91,2 %
Chaque trait est un modèle, placé à son meilleur score. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 92 %. Le meilleur, T5-11B, atteint 91,2 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. BoolQ est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.