À quoi il sert
Sur Quelle IA, FrontierMath, palier 4 (version 2025) sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks. Il départage surtout les modèles dont le score IA approche 90.
Sur Quelle IA, FrontierMath, palier 4 (version 2025) sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks. Il départage surtout les modèles dont le score IA approche 90.
Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé.
Pour le calcul, ce score est ramené entre 0 et 1 : 0 % vaut 0 et 60 %, le plafond retenu, vaut 1.
Version remplacée en juin 2026 après correction de 12 énoncés et retrait de 7 autres ; Epoch estime le score maximal à 60 %. OpenAI a financé le jeu et en détient une partie.
Epoch AI.
epoch.ai/benchmarks/frontiermath · tâche Maths · 55 modèles mesurés
En tête : AI Co-Mathematician, 47,9 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 30 % a un score IA d'environ 90. Le meilleur, AI Co-Mathematician, atteint 47,9 %. Le benchmark sera dit saturé quand un modèle atteindra 57 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,25 %du score général. FrontierMath, palier 4 (version 2025) porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks.
En couleur, la tâche Mathématiques dans le score général. En noir, la part de FrontierMath, palier 4 (version 2025).