Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

MathsFiche benchmark · Epoch AI, avec le site ErdősProblems.com de Thomas Bloom · epoch.ai

FrontierMath Erdős

68 conjectures de Paul Erdős que personne n'a résolues, à démontrer ou à réfuter par une preuve formelle en Lean.

À quoi il sert

Sur Quelle IA, FrontierMath Erdős sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks.

Comment c'est noté

Part des 68 conjectures résolues, la preuve étant vérifiée par la machine ; budget de 300 dollars et 72 heures par problème.

Ce qu'il ne dit pas

Presque tous les scores sont à zéro : le test guette une percée et ne classe pas encore les modèles. Une conjecture résolue peut ensuite fuiter dans les données d'entraînement.

Comment lire le score

5 modèles mesurés

En tête : GPT-6 Astra, 2,9 %

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 1 %. Le meilleur, GPT-6 Astra, atteint 2,9 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %. Avec 5 modèles mesurés seulement, cet étalonnage reste fragile.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
moins de 1 %
Score IA 76niveau de Claude Sonnet 4.5
moins de 1 %
Score IA 100niveau de Claude Opus 5.5
1 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,25 %du score général. FrontierMath Erdős porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks.

En couleur, la tâche Mathématiques dans le score général. En noir, la part de FrontierMath Erdős.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-6 AstraOpenAIMaximale2,9 %118,8
2Claude Fable 5.1AnthropicMaximale0 %99,6
2Claude Fable 5AnthropicMaximale0 %99,6
2GPT-5.6 SolOpenAIMaximale0 %99,6
2GPT-5.5OpenAIMaximale0 %99,6

5 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

En bref

Que mesure FrontierMath Erdős ?
68 conjectures de Paul Erdős que personne n'a résolues, à démontrer ou à réfuter par une preuve formelle en Lean. Sur Quelle IA, il est rangé dans la tâche Mathématiques.
Comment FrontierMath Erdős est-il noté ?
Part des 68 conjectures résolues, la preuve étant vérifiée par la machine ; budget de 300 dollars et 72 heures par problème. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 1 %.
Qui est en tête sur FrontierMath Erdős ?
GPT-6 Astra (OpenAI) est en tête de FrontierMath Erdős avec 2,9 %, dans l'édition du 28 septembre 2026. Suivent Claude Fable 5.1 (0 %) et Claude Fable 5 (0 %). 5 modèles y sont mesurés.
Quelles sont les limites de FrontierMath Erdős ?
Presque tous les scores sont à zéro : le test guette une percée et ne classe pas encore les modèles. Une conjecture résolue peut ensuite fuiter dans les données d'entraînement. Au 28 septembre 2026, le benchmark est actif.
Combien pèse FrontierMath Erdős dans le score IA ?
FrontierMath Erdős compte pour 1,25 % du score général, dans l'édition du 28 septembre 2026. Il porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks.
Qui maintient FrontierMath Erdős ?
Epoch AI, avec le site ErdősProblems.com de Thomas Bloom. Sa page de référence : epoch.ai/benchmarks/frontiermath-erdos.

Les autres benchmarks de la tâche Mathématiques

Tous les benchmarks →Comment le score IA est calculé →