# FrontierMath Erdős

> Fiche du benchmark FrontierMath Erdős sur Quelle IA, édition du 28 septembre 2026. 68 conjectures de Paul Erdős que personne n'a résolues, à démontrer ou à réfuter par une preuve formelle en Lean. En tête au 28 septembre 2026 : GPT-6 Astra (2,9 %). Notation, limites et classement des 5 modèles mesurés.

Page : https://quelleia.com/benchmarks/frontiermath_erdos/
Source du benchmark : https://epoch.ai/benchmarks/frontiermath-erdos
Mainteneur : Epoch AI, avec le site ErdősProblems.com de Thomas Bloom
Tâche : Mathématiques
État : actif

## À quoi il sert

Sur Quelle IA, FrontierMath Erdős sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks.

## Comment c'est noté

Part des 68 conjectures résolues, la preuve étant vérifiée par la machine ; budget de 300 dollars et 72 heures par problème.

## Ce qu'il ne dit pas

Presque tous les scores sont à zéro : le test guette une percée et ne classe pas encore les modèles. Une conjecture résolue peut ensuite fuiter dans les données d'entraînement.

## Qui le tient

Epoch AI, avec le site ErdősProblems.com de Thomas Bloom.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 1 %. Le meilleur, GPT-6 Astra, atteint 2,9 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %. Avec 5 modèles mesurés seulement, cet étalonnage reste fragile.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : moins de 1 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : moins de 1 %
- Score IA 100 (niveau de Claude Opus 5.5) : 1 %

## Son poids dans le score IA

1,25 % du score général. FrontierMath Erdős porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks.

## Classement (5 modèles mesurés, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | Maximale | 2,9 % | 118,8 | https://epoch.ai/benchmarks |
| 2 | [Claude Fable 5.1](https://quelleia.com/modeles/claude-fable-5-1.md) | Anthropic | Maximale | 0 % | 99,6 | https://epoch.ai/benchmarks |
| 2 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Maximale | 0 % | 99,6 | https://epoch.ai/benchmarks |
| 2 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 0 % | 99,6 | https://epoch.ai/benchmarks |
| 2 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Maximale | 0 % | 99,6 | https://epoch.ai/benchmarks |

## En bref

**Que mesure FrontierMath Erdős ?** 68 conjectures de Paul Erdős que personne n'a résolues, à démontrer ou à réfuter par une preuve formelle en Lean. Sur Quelle IA, il est rangé dans la tâche Mathématiques.

**Comment FrontierMath Erdős est-il noté ?** Part des 68 conjectures résolues, la preuve étant vérifiée par la machine ; budget de 300 dollars et 72 heures par problème. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 1 %.

**Qui est en tête sur FrontierMath Erdős ?** GPT-6 Astra (OpenAI) est en tête de FrontierMath Erdős avec 2,9 %, dans l'édition du 28 septembre 2026. Suivent Claude Fable 5.1 (0 %) et Claude Fable 5 (0 %). 5 modèles y sont mesurés.

**Quelles sont les limites de FrontierMath Erdős ?** Presque tous les scores sont à zéro : le test guette une percée et ne classe pas encore les modèles. Une conjecture résolue peut ensuite fuiter dans les données d'entraînement. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse FrontierMath Erdős dans le score IA ?** FrontierMath Erdős compte pour 1,25 % du score général, dans l'édition du 28 septembre 2026. Il porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks.

**Qui maintient FrontierMath Erdős ?** Epoch AI, avec le site ErdősProblems.com de Thomas Bloom. Sa page de référence : epoch.ai/benchmarks/frontiermath-erdos.

## Les autres benchmarks de la tâche Mathématiques

- [Arena, questions de maths](https://quelleia.com/benchmarks/arena_maths.md) : 269 modèles · 1,25 % du score
- [OTIS Mock AIME 2024-2025](https://quelleia.com/benchmarks/otis_mock_aime_2024_2025.md) : 190 modèles · 1,25 % du score, saturé
- [FrontierMath, paliers 1 à 3 (v2)](https://quelleia.com/benchmarks/frontiermath_tiers_1_3_v2.md) : 77 modèles · 1,25 % du score
- [FrontierMath, paliers 1 à 3 (version 2025)](https://quelleia.com/benchmarks/frontiermath.md) : 70 modèles · 1,25 % du score
- [ProofBench](https://quelleia.com/benchmarks/proofbench.md) : 70 modèles · 1,25 % du score, saturé
- [FrontierMath, palier 4 (v2)](https://quelleia.com/benchmarks/frontiermath_tier_4_v2.md) : 59 modèles · 1,25 % du score, saturé
- [FrontierMath, palier 4 (version 2025)](https://quelleia.com/benchmarks/frontiermath_tier_4.md) : 55 modèles · 1,25 % du score
- [MATH Level 5](https://quelleia.com/benchmarks/math_level_5.md) : 94 modèles · hors score, archivé
- [GSM8K](https://quelleia.com/benchmarks/gsm8k.md) : 82 modèles · hors score, archivé
- [LiveBench, mathématiques](https://quelleia.com/benchmarks/livebench_maths.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
