Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

MathsFiche benchmark · Epoch AI · epoch.ai

FrontierMath, palier 4 (v2)

43 problèmes de niveau recherche, corrigés en 2026, qui peuvent occuper un mathématicien professionnel plusieurs jours.

SATURÉ

À quoi il sert

Sur Quelle IA, FrontierMath, palier 4 (v2) sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks. Il départage surtout les modèles dont le score IA approche 90.

Comment c'est noté

Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé.

Ce qu'il ne dit pas

Avec 43 problèmes, chacun pèse plus de deux points, et le meilleur modèle frôle déjà le maximum. OpenAI a financé le jeu et en détient une partie.

Comment lire le score

59 modèles mesurés · 66 mesures

En tête : GPT-6 Astra, 97,6 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 90. Le meilleur, GPT-6 Astra, atteint 97,6 %. Le seuil de saturation (95 %) est franchi : au sommet, les meilleurs modèles ne se départagent plus.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
moins de 1 %
Score IA 76niveau de Claude Sonnet 4.5
4 %
Score IA 100niveau de Claude Opus 5.5
90 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,25 %du score général. FrontierMath, palier 4 (v2) porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.

En couleur, la tâche Mathématiques dans le score général. En noir, la part de FrontierMath, palier 4 (v2).

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-6 AstraOpenAI · 6 configurationsMaximale97,6 %106,3
2Claude Opus 5.5AnthropicMaximale95 %103,0
3Claude Fable 5AnthropicMaximale90,2 %99,8
4Claude Fable 5.1AnthropicMaximale87,8 %98,8
5GPT-5.6 SolOpenAI · 2 configurationsMaximale82,9 %97,1
6Claude Sonnet 5.5AnthropicMaximale80,5 %96,4
7GPT-5.5 ProOpenAIMaximale78 %95,7
8AI Co-MathematicianGoogle DeepMindNon précisée75,6 %95,2
9Claude Opus 5AnthropicMaximale73,2 %94,6
10GPT-5.5OpenAIMaximale72,5 %94,5
59 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 59 →Replier le classement ↑
11GPT-5.6 TerraOpenAIMaximale70,7 %94,1
12GPT-5.6 LunaOpenAIMaximale61 %92,2
13GPT-5.4 ProOpenAIMaximale58,5 %91,8
14Claude Opus 4.8AnthropicMaximale56,1 %91,3
15GPT-5.4OpenAIMaximale49 %90,1
16Muse Spark 1.3Meta AI · 2 configurationsMaximale46,3 %89,6
16Qwen 3.8 MaxAlibabaMaximale46,3 %89,6
18GPT-5.2 ProOpenAIMaximale46 %89,6
19Kimi K3Moonshot · poids ouvertsMaximale39 %88,4
20Gemini 3.7 FlashGoogle DeepMindÉlevée36,6 %87,9
21Qwen3.8 Max (0902)AlibabaMaximale34,1 %87,4
21Qwen3.7-MaxAlibabaNon précisée34,1 %87,4
23Grok 4.6xAIMaximale31,7 %87,0
23Claude Opus 4.7AnthropicMaximale31,7 %87,0
25GPT-5.2OpenAIMaximale31,7 %87,0
26Claude Sonnet 5AnthropicMaximale29,3 %86,5
26GLM-5.3Z.ai (Zhipu AI) · poids ouvertsMaximale29,3 %86,5
26GLM-5.2Z.ai (Zhipu AI) · poids ouvertsMaximale29,3 %86,5
29Claude Opus 4.6AnthropicMaximale26,8 %86,0
29DeepSeek V4 Pro 0813DeepSeek · poids ouvertsMaximale26,8 %86,0
29Gemini 3.1 ProGoogle DeepMindNon précisée26,8 %86,0
29Gemini 3.5 FlashGoogle DeepMindÉlevée26,8 %86,0
33Kimi K2.6Moonshot · poids ouvertsNon précisée25,6 %85,7
34Grok 4.5xAIÉlevée24,4 %85,4
34DeepSeek V4 Flash 0731DeepSeek · poids ouvertsMaximale24,4 %85,4
36Gemini 3.8 FlashGoogle DeepMindÉlevée22 %84,8
36Gemini 3.6 FlashGoogle DeepMindÉlevée22 %84,8
36GPT-5OpenAIÉlevée22 %84,8
39GPT-5 ProOpenAIÉlevée19,5 %84,2
40GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsMaximale17,1 %83,5
40Grok 4.20xAINon précisée17,1 %83,5
40Gemini 3 FlashGoogle DeepMindNon précisée17,1 %83,5
40Inkling-SmallThinking Machines · poids ouvertsMaximale17,1 %83,5
44Grok 4.3 BetaxAIÉlevée14,6 %82,7
45Kimi K2.7 CodeMoonshot · poids ouvertsNon précisée12,2 %81,8
45GPT-5.4 NanoOpenAIÉlevée12,2 %81,8
45GPT-5 miniOpenAIÉlevée12,2 %81,8
48GPT-5.4 MiniOpenAIMaximale9,8 %80,7
49Claude Opus 4.5AnthropicBudget4,9 %77,5
49InklingThinking Machines · poids ouvertsMaximale4,9 %77,5
49o4-miniOpenAIÉlevée4,9 %77,5
52DeepSeek-V4-ProDeepSeek · poids ouvertsMaximale2,4 %74,4
52Claude Sonnet 4.5AnthropicBudget2,4 %74,4
52GPT-5.5 InstantOpenAINon précisée2,4 %74,4
52Claude Opus 4.1AnthropicBudget2,4 %74,4
52GPT-5 nanoOpenAIÉlevée2,4 %74,4
57Gemini 3.5 Flash-LiteGoogle DeepMindÉlevée0 %70,5
57Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée0 %70,5
57o3-miniOpenAIÉlevée0 %70,5

En bref

Que mesure FrontierMath, palier 4 (v2) ?
43 problèmes de niveau recherche, corrigés en 2026, qui peuvent occuper un mathématicien professionnel plusieurs jours. Sur Quelle IA, il est rangé dans la tâche Mathématiques.
Comment FrontierMath, palier 4 (v2) est-il noté ?
Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé. Un modèle qui obtient 50 % a un score IA d'environ 90.
Qui est en tête sur FrontierMath, palier 4 (v2) ?
GPT-6 Astra (OpenAI) est en tête de FrontierMath, palier 4 (v2) avec 97,6 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5.5 (95 %) et Claude Fable 5 (90,2 %). 59 modèles y sont mesurés.
Quelles sont les limites de FrontierMath, palier 4 (v2) ?
Avec 43 problèmes, chacun pèse plus de deux points, et le meilleur modèle frôle déjà le maximum. OpenAI a financé le jeu et en détient une partie. Au 28 septembre 2026, le benchmark est saturé.
Combien pèse FrontierMath, palier 4 (v2) dans le score IA ?
FrontierMath, palier 4 (v2) compte pour 1,25 % du score général, dans l'édition du 28 septembre 2026. Il porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.
Qui maintient FrontierMath, palier 4 (v2) ?
Epoch AI. Sa page de référence : epoch.ai/benchmarks/frontiermath.

Les autres benchmarks de la tâche Mathématiques

Tous les benchmarks →Comment le score IA est calculé →