À quoi il sert
MATH Level 5 servait à noter la tâche Mathématiques. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
MathsFiche benchmark · Epoch AI pour l'évaluation ; jeu MATH de Hendrycks et al. (2021) · epoch.ai
Les 1 324 problèmes les plus durs du jeu MATH, tirés de concours de lycée américains comme l'AMC et l'AIME.
MATH Level 5 servait à noter la tâche Mathématiques. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
Part de réponses finales justes ; l'équivalence avec la solution attendue est jugée par un modèle correcteur.
Jeu public depuis 2021, donc probablement vu à l'entraînement. Les meilleurs modèles dépassent 98 % : le test ne départage plus le haut du classement.
Epoch AI pour l'évaluation ; jeu MATH de Hendrycks et al. (2021).
epoch.ai/benchmarks/math-level-5 · tâche Maths · 94 modèles mesurés
En tête : GPT-5, 98,1 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 49. Le meilleur, GPT-5, atteint 98,1 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. MATH Level 5 est archivé et ne compte plus : la tâche Mathématiques (10 % du score général) repose sur 8 autres benchmarks.
En couleur, la tâche Mathématiques dans le score général. MATH Level 5 n'y a plus de part.