À quoi il sert
Sur Quelle IA, FrontierMath, palier 4 (v2) sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks. Il départage surtout les modèles dont le score IA approche 90.
MathsFiche benchmark · Epoch AI · epoch.ai
43 problèmes de niveau recherche, corrigés en 2026, qui peuvent occuper un mathématicien professionnel plusieurs jours.
Sur Quelle IA, FrontierMath, palier 4 (v2) sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks. Il départage surtout les modèles dont le score IA approche 90.
Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé.
Avec 43 problèmes, chacun pèse plus de deux points, et le meilleur modèle frôle déjà le maximum. OpenAI a financé le jeu et en détient une partie.
Epoch AI.
epoch.ai/benchmarks/frontiermath · tâche Maths · 59 modèles mesurés
En tête : GPT-6 Astra, 97,6 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 90. Le meilleur, GPT-6 Astra, atteint 97,6 %. Le seuil de saturation (95 %) est franchi : au sommet, les meilleurs modèles ne se départagent plus.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,25 %du score général. FrontierMath, palier 4 (v2) porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.
En couleur, la tâche Mathématiques dans le score général. En noir, la part de FrontierMath, palier 4 (v2).