Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

MathsFiche benchmark · Vals AI · vals.ai

ProofBench

Démontrer des théorèmes de niveau licence avancée et master dans le langage formel Lean 4, avec une preuve vérifiée par la machine.

SATURÉ

À quoi il sert

Sur Quelle IA, ProofBench sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks. Il départage surtout les modèles dont le score IA approche 88.

Comment c'est noté

Part de théorèmes dont la preuve est acceptée par Lean, sur 100 problèmes privés, avec 40 tours d'échange au plus.

Ce qu'il ne dit pas

Trois modèles atteignent 100 % : le test est saturé. Le fichier mêle des scores d'avant et d'après la correction d'août 2026, non comparables entre eux.

Comment lire le score

70 modèles mesurés

En tête : 3 modèles, 100 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 88. 3 modèles partagent la première place avec 100 %. Le seuil de saturation (95 %) est franchi : au sommet, les meilleurs modèles ne se départagent plus.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
moins de 1 %
Score IA 76niveau de Claude Sonnet 4.5
5 %
Score IA 100niveau de Claude Opus 5.5
96 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,25 %du score général. ProofBench porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.

En couleur, la tâche Mathématiques dans le score général. En noir, la part de ProofBench.

Le classement du benchmark

Scores relevés sur vals.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Opus 5.5AnthropicMaximale100 %105,8
1Claude Sonnet 5.5AnthropicMaximale100 %105,8
1Claude Fable 5.1AnthropicMaximale100 %105,8
4GPT-6 AstraOpenAINon précisée99 %105,8
4Claude Opus 5AnthropicMaximale99 %105,8
6Claude Fable 5AnthropicMaximale95 %99,3
7Kimi K3Moonshot · poids ouvertsNon précisée87 %95,3
8GPT-5.6 SolOpenAIMaximale83 %94,1
9Claude Sonnet 5AnthropicMaximale77 %92,6
10Tencent Hy4 previewTencent · poids ouvertsNon précisée75 %92,2
70 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 70 →Replier le classement ↑
11GPT-5.6 TerraOpenAIMaximale74 %92,0
12Claude Opus 4.8AnthropicMaximale69 %91,0
13GPT-5.6 LunaOpenAIMaximale60 %89,5
14Gemini 3.7 FlashGoogle DeepMindNon précisée58 %89,2
14Qwen 3.8 MaxAlibabaNon précisée58 %89,2
16GPT-5.4OpenAIMaximale56 %88,8
16DeepSeek V4 Flash 0731DeepSeek · poids ouvertsNon précisée56 %88,8
18Claude Opus 4.7AnthropicMaximale54 %88,5
18DeepSeek V4.1 FlashDeepSeek · poids ouvertsNon précisée54 %88,5
20Grok 4.6xAINon précisée51 %88,1
21GPT-5.5OpenAIMaximale50 %87,9
21Claude Opus 4.6AnthropicMaximale50 %87,9
21DeepSeek V4 Pro 0813DeepSeek · poids ouvertsNon précisée50 %87,9
24GLM-5.3Z.ai (Zhipu AI) · poids ouvertsMaximale49 %87,8
25Gemini 3.8 FlashGoogle DeepMindNon précisée48 %87,6
26Claude Sonnet 4.6AnthropicMaximale45 %87,1
27Muse Spark 1.2Meta AINon précisée43 %86,8
28Muse Spark 1.1Meta AINon précisée39 %86,2
29Gemini 3.6 FlashGoogle DeepMindNon précisée36 %85,7
29Claude Opus 4.5AnthropicNon précisée36 %85,7
31GLM-5.2Z.ai (Zhipu AI) · poids ouvertsMaximale35 %85,5
32Grok 4.7xAINon précisée34 %85,3
33Grok 4.5xAIÉlevée31 %84,8
33Gemini 3.5 FlashGoogle DeepMindÉlevée31 %84,8
35Gemini 3.1 ProGoogle DeepMindNon précisée26 %83,8
35Qwen3.7-MaxAlibabaNon précisée26 %83,8
37GLM-5.1Z.ai (Zhipu AI) · poids ouvertsNon précisée22,2 %83,0
38MiMo-V2.5-ProXiaomi · poids ouvertsNon précisée22 %83,0
39GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsMaximale21 %82,8
39GPT-5.4 MiniOpenAIMaximale21 %82,8
41Gemini 3 ProGoogle DeepMindNon précisée20 %82,5
42Claude Sonnet 4.5AnthropicNon précisée19 %82,3
43GPT-5OpenAIÉlevée18 %82,0
43MiniMax-M3MiniMax · poids ouvertsNon précisée18 %82,0
45Muse SparkMeta AINon précisée17 %81,8
46Kimi K2.6Moonshot · poids ouvertsNon précisée16 %81,5
46Qwen 3.8 27BAlibaba · poids ouvertsNon précisée16 %81,5
46DeepSeek-V4-ProDeepSeek · poids ouvertsMaximale16 %81,5
46MiMo-V2.5Xiaomi · poids ouvertsNon précisée16 %81,5
50GPT-5.2OpenAIMaximale15 %81,2
50Gemini 3 FlashGoogle DeepMindNon précisée15 %81,2
52Grok 4.20xAINon précisée14 %80,9
53Gemini 3.5 Flash-LiteGoogle DeepMindNon précisée13 %80,5
54GPT-5 nanoOpenAIÉlevée12 %80,2
55Grok 4.3 BetaxAIÉlevée11 %79,8
56GPT-5.1-Codex-MaxOpenAINon précisée9 %78,9
56GPT-5 miniOpenAIÉlevée9 %78,9
56Mistral Medium 3.5Mistral AI · poids ouvertsNon précisée9 %78,9
59DeepSeek-V3.2DeepSeek · poids ouvertsNon précisée8 %78,4
60Inkling-SmallThinking Machines · poids ouvertsNon précisée6 %77,2
60GLM-4.7Z.ai (Zhipu AI) · poids ouvertsNon précisée6 %77,2
62GPT-5.4 NanoOpenAIÉlevée5 %76,5
63MiniMax-M2.5MiniMax · poids ouvertsNon précisée4 %75,6
63Grok 4.1 FastxAINon précisée4 %75,6
65MiniMax-M2.7MiniMax · poids ouvertsNon précisée3 %74,4
65Mercury 2.5Inception LabsNon précisée3 %74,4
67Nemotron 3 UltraNVIDIA · poids ouvertsNon précisée2 %72,8
68InklingThinking Machines · poids ouvertsNon précisée0 %70,1
68Laguna M.1Poolside · poids ouvertsNon précisée0 %70,1
68Laguna XS.2Poolside · poids ouvertsNon précisée0 %70,1

En bref

Que mesure ProofBench ?
Démontrer des théorèmes de niveau licence avancée et master dans le langage formel Lean 4, avec une preuve vérifiée par la machine. Sur Quelle IA, il est rangé dans la tâche Mathématiques.
Comment ProofBench est-il noté ?
Part de théorèmes dont la preuve est acceptée par Lean, sur 100 problèmes privés, avec 40 tours d'échange au plus. Un modèle qui obtient 50 % a un score IA d'environ 88.
Qui est en tête sur ProofBench ?
Claude Opus 5.5, Claude Sonnet 5.5 et Claude Fable 5.1 sont en tête de ProofBench avec 100 %, dans l'édition du 28 septembre 2026. Suivent GPT-6 Astra (99 %) et Claude Opus 5 (99 %). 70 modèles y sont mesurés.
Quelles sont les limites de ProofBench ?
Trois modèles atteignent 100 % : le test est saturé. Le fichier mêle des scores d'avant et d'après la correction d'août 2026, non comparables entre eux. Au 28 septembre 2026, le benchmark est saturé.
Combien pèse ProofBench dans le score IA ?
ProofBench compte pour 1,25 % du score général, dans l'édition du 28 septembre 2026. Il porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.
Qui maintient ProofBench ?
Vals AI. Sa page de référence : vals.ai/benchmarks/proof_bench.

Les autres benchmarks de la tâche Mathématiques

Tous les benchmarks →Comment le score IA est calculé →