À quoi il sert
WinoGrande est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Test historiqueFiche benchmark · Allen Institute for AI (Sakaguchi et al., 2019) · winogrande.allenai.org
Trouver à quoi renvoie un pronom ambigu dans une phrase, ce qui demande du bon sens et une connaissance du monde.
WinoGrande est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Part de bonnes réponses entre deux choix ; le hasard donne 50 %.
Pour le calcul, ce score est ramené entre 0 et 1 : 50 %, le niveau du hasard, vaut 0 et 100 % vaut 1.
Test de 2019 saturé. Les scores viennent d'articles aux réglages variés.
Allen Institute for AI (Sakaguchi et al., 2019).
winogrande.allenai.org · test historique · 77 modèles mesurés
En tête : Llama 3.1-405B, 89,2 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 75 % a un score IA d'environ 9. Le meilleur, Llama 3.1-405B, atteint 89,2 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. WinoGrande est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.