À quoi il sert
ANLI (Adversarial NLI) est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Test historiqueFiche benchmark · Facebook AI Research (Nie et al., 2019) · github.com
Dire si une phrase découle d'une autre, la contredit ou ne permet pas de conclure, sur des exemples écrits pour piéger les modèles.
ANLI (Adversarial NLI) est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Part de bonnes réponses parmi trois choix ; le hasard donne 33 %.
Pour le calcul, ce score est ramené entre 0 et 1 : 33 %, le niveau du hasard, vaut 0 et 100 % vaut 1.
Test de 2019. Les résultats viennent d'articles aux réglages variés et ne concernent que d'anciens modèles.
Facebook AI Research (Nie et al., 2019).
github.com/facebookresearch/anli · test historique · 11 modèles mesurés
En tête : 2 modèles, 58,1 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 67 % a un score IA d'environ 46. 2 modèles partagent la première place avec 58,1 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. ANLI (Adversarial NLI) est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.