À quoi il sert
HellaSwag est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Test historiqueFiche benchmark · Zellers et al. (université de Washington et Allen Institute for AI) · rowanzellers.com
Choisir la suite la plus plausible d'une courte scène du quotidien parmi quatre propositions, dont trois pièges écrits par une machine.
HellaSwag est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Part de bonnes réponses ; le hasard donne 25 %.
Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.
Test de 2019, saturé et largement présent dans les données d'entraînement. Il ne dit rien des modèles actuels.
Zellers et al. (université de Washington et Allen Institute for AI).
rowanzellers.com/hellaswag · test historique · 75 modèles mesurés
En tête : GPT-4 (Mar 2023), 95,3 %
Chaque trait est un modèle, placé à son meilleur score. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 88 %. Le meilleur, GPT-4 (Mar 2023), atteint 95,3 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. HellaSwag est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.