À quoi il sert
Sur Quelle IA, FrontierMath, paliers 1 à 3 (version 2025) sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks. Il départage surtout les modèles dont le score IA approche 80.
Sur Quelle IA, FrontierMath, paliers 1 à 3 (version 2025) sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks. Il départage surtout les modèles dont le score IA approche 80.
Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé.
Pour le calcul, ce score est ramené entre 0 et 1 : 0 % vaut 0 et 57 %, le plafond retenu, vaut 1.
Version remplacée en juin 2026 : plus de quatre énoncés sur dix ont dû être corrigés, et Epoch estime le score maximal à 57 %. OpenAI a financé le jeu et en détient une partie.
Epoch AI.
epoch.ai/benchmarks/frontiermath · tâche Maths · 70 modèles mesurés
En tête : GPT-5.5 Pro, 52,4 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 28 % a un score IA d'environ 80. Le meilleur, GPT-5.5 Pro, atteint 52,4 %. Le benchmark sera dit saturé quand un modèle atteindra 54,1 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,25 %du score général. FrontierMath, paliers 1 à 3 (version 2025) porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks.
En couleur, la tâche Mathématiques dans le score général. En noir, la part de FrontierMath, paliers 1 à 3 (version 2025).