À quoi il sert
Sur Quelle IA, FrontierMath Erdős sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks.
Sur Quelle IA, FrontierMath Erdős sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks.
Part des 68 conjectures résolues, la preuve étant vérifiée par la machine ; budget de 300 dollars et 72 heures par problème.
Presque tous les scores sont à zéro : le test guette une percée et ne classe pas encore les modèles. Une conjecture résolue peut ensuite fuiter dans les données d'entraînement.
Epoch AI, avec le site ErdősProblems.com de Thomas Bloom.
epoch.ai/benchmarks/frontiermath-erdos · tâche Maths · 5 modèles mesurés
En tête : GPT-6 Astra, 2,9 %
Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 1 %. Le meilleur, GPT-6 Astra, atteint 2,9 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %. Avec 5 modèles mesurés seulement, cet étalonnage reste fragile.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,25 %du score général. FrontierMath Erdős porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks.
En couleur, la tâche Mathématiques dans le score général. En noir, la part de FrontierMath Erdős.
5 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.