À quoi il sert
MMLU est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Test historiqueFiche benchmark · Hendrycks et al. (UC Berkeley, 2020) · github.com
Des milliers de questions à choix multiples sur 57 matières, du lycée au niveau professionnel : droit, médecine, histoire, physique.
MMLU est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Part de bonnes réponses à quatre choix ; le hasard donne 25 %.
Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.
Saturé autour de 90 %, présent dans les données d'entraînement et entaché de quelques questions erronées. Il ne départage plus les modèles récents.
Hendrycks et al. (UC Berkeley, 2020).
github.com/hendrycks/test · test historique · 127 modèles mesurés
En tête : GPT-4o (Nov 2024), 88,1 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 63 % a un score IA d'environ 12. Le meilleur, GPT-4o (Nov 2024), atteint 88,1 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. MMLU est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.