À quoi il sert
PIQA est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Test historiqueFiche benchmark · Bisk et al. (2019) · arxiv.org
Choisir, entre deux façons de faire, celle qui marche dans le monde physique pour un problème de tous les jours.
PIQA est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Part de bonnes réponses entre deux choix ; le hasard donne 50 %.
Pour le calcul, ce score est ramené entre 0 et 1 : 50 %, le niveau du hasard, vaut 0 et 100 % vaut 1.
Test de 2019 saturé. Avec deux choix seulement, le hasard pèse lourd et les écarts entre modèles sont faibles.
Bisk et al. (2019).
arxiv.org/abs/1911.11641 · test historique · 59 modèles mesurés
En tête : GPT-4o mini, 88,7 %
Chaque trait est un modèle, placé à son meilleur score. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 86 %. Le meilleur, GPT-4o mini, atteint 88,7 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. PIQA est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.