À quoi il sert
Sur Quelle IA, FrontierMath, paliers 1 à 3 (v2) sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks. Il départage surtout les modèles dont le score IA approche 82.
Sur Quelle IA, FrontierMath, paliers 1 à 3 (v2) sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks. Il départage surtout les modèles dont le score IA approche 82.
Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé.
Le jeu est privé, donc peu exposé aux fuites, mais OpenAI l'a financé et a accès à une partie des problèmes. Les meilleurs modèles dépassent déjà 90 %.
Epoch AI.
epoch.ai/benchmarks/frontiermath · tâche Maths · 77 modèles mesurés
En tête : GPT-6 Astra, 93,7 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 82. Le meilleur, GPT-6 Astra, atteint 93,7 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,25 %du score général. FrontierMath, paliers 1 à 3 (v2) porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks.
En couleur, la tâche Mathématiques dans le score général. En noir, la part de FrontierMath, paliers 1 à 3 (v2).