# ProofBench

> Fiche du benchmark ProofBench sur Quelle IA, édition du 28 septembre 2026. Démontrer des théorèmes de niveau licence avancée et master dans le langage formel Lean 4, avec une preuve vérifiée par la machine. En tête au 28 septembre 2026 : 3 modèles ex æquo (100 %). Notation, limites et classement des 70 modèles mesurés.

Page : https://quelleia.com/benchmarks/proofbench/
Source du benchmark : https://www.vals.ai/benchmarks/proof_bench
Mainteneur : Vals AI
Tâche : Mathématiques
État : saturé

## À quoi il sert

Sur Quelle IA, ProofBench sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks. Il départage surtout les modèles dont le score IA approche 88.

## Comment c'est noté

Part de théorèmes dont la preuve est acceptée par Lean, sur 100 problèmes privés, avec 40 tours d'échange au plus.

## Ce qu'il ne dit pas

Trois modèles atteignent 100 % : le test est saturé. Le fichier mêle des scores d'avant et d'après la correction d'août 2026, non comparables entre eux.

## Qui le tient

Vals AI.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 88. 3 modèles partagent la première place avec 100 %. Le seuil de saturation (95 %) est franchi : au sommet, les meilleurs modèles ne se départagent plus.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : moins de 1 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 5 %
- Score IA 100 (niveau de Claude Opus 5.5) : 96 %

## Son poids dans le score IA

1,25 % du score général. ProofBench porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.

## Classement (70 modèles mesurés, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Claude Opus 5.5](https://quelleia.com/modeles/claude-opus-5-5.md) | Anthropic | Maximale | 100 % | 105,8 | https://www.vals.ai/benchmarks/proof_bench |
| 1 | [Claude Sonnet 5.5](https://quelleia.com/modeles/claude-sonnet-5-5.md) | Anthropic | Maximale | 100 % | 105,8 | https://www.vals.ai/benchmarks/proof_bench |
| 1 | [Claude Fable 5.1](https://quelleia.com/modeles/claude-fable-5-1.md) | Anthropic | Maximale | 100 % | 105,8 | https://www.vals.ai/benchmarks/proof_bench |
| 4 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | non précisée | 99 % | 105,8 | https://www.vals.ai/benchmarks/proof_bench |
| 4 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | Maximale | 99 % | 105,8 | https://www.vals.ai/benchmarks/proof_bench |
| 6 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Maximale | 95 % | 99,3 | https://www.vals.ai/benchmarks/proof_bench |
| 7 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | non précisée | 87 % | 95,3 | https://www.vals.ai/benchmarks/proof_bench |
| 8 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 83 % | 94,1 | https://www.vals.ai/benchmarks/proof_bench |
| 9 | [Claude Sonnet 5](https://quelleia.com/modeles/claude-sonnet-5.md) | Anthropic | Maximale | 77 % | 92,6 | https://www.vals.ai/benchmarks/proof_bench |
| 10 | [Tencent Hy4 preview](https://quelleia.com/modeles/tencent-hy4-preview.md) | Tencent | non précisée | 75 % | 92,2 | https://www.vals.ai/benchmarks/proof_bench |
| 11 | [GPT-5.6 Terra](https://quelleia.com/modeles/gpt-5-6-terra.md) | OpenAI | Maximale | 74 % | 92,0 | https://www.vals.ai/benchmarks/proof_bench |
| 12 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Maximale | 69 % | 91,0 | https://www.vals.ai/benchmarks/proof_bench |
| 13 | [GPT-5.6 Luna](https://quelleia.com/modeles/gpt-5-6-luna.md) | OpenAI | Maximale | 60 % | 89,5 | https://www.vals.ai/benchmarks/proof_bench |
| 14 | [Gemini 3.7 Flash](https://quelleia.com/modeles/gemini-3-7-flash.md) | Google DeepMind | non précisée | 58 % | 89,2 | https://www.vals.ai/benchmarks/proof_bench |
| 14 | [Qwen 3.8 Max](https://quelleia.com/modeles/qwen-3-8-max.md) | Alibaba | non précisée | 58 % | 89,2 | https://www.vals.ai/benchmarks/proof_bench |
| 16 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Maximale | 56 % | 88,8 | https://www.vals.ai/benchmarks/proof_bench |
| 16 | [DeepSeek V4 Flash 0731](https://quelleia.com/modeles/deepseek-v4-flash-0731.md) | DeepSeek | non précisée | 56 % | 88,8 | https://www.vals.ai/benchmarks/proof_bench |
| 18 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | Maximale | 54 % | 88,5 | https://www.vals.ai/benchmarks/proof_bench |
| 18 | [DeepSeek V4.1 Flash](https://quelleia.com/modeles/deepseek-v4-1-flash.md) | DeepSeek | non précisée | 54 % | 88,5 | https://www.vals.ai/benchmarks/proof_bench |
| 20 | [Grok 4.6](https://quelleia.com/modeles/grok-4-6.md) | xAI | non précisée | 51 % | 88,1 | https://www.vals.ai/benchmarks/proof_bench |
| 21 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Maximale | 50 % | 87,9 | https://www.vals.ai/benchmarks/proof_bench |
| 21 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | Maximale | 50 % | 87,9 | https://www.vals.ai/benchmarks/proof_bench |
| 21 | [DeepSeek V4 Pro 0813](https://quelleia.com/modeles/deepseek-v4-pro-0813.md) | DeepSeek | non précisée | 50 % | 87,9 | https://www.vals.ai/benchmarks/proof_bench |
| 24 | [GLM-5.3](https://quelleia.com/modeles/glm-5-3.md) | Z.ai (Zhipu AI) | Maximale | 49 % | 87,8 | https://www.vals.ai/benchmarks/proof_bench |
| 25 | [Gemini 3.8 Flash](https://quelleia.com/modeles/gemini-3-8-flash.md) | Google DeepMind | non précisée | 48 % | 87,6 | https://www.vals.ai/benchmarks/proof_bench |
| 26 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | Maximale | 45 % | 87,1 | https://www.vals.ai/benchmarks/proof_bench |
| 27 | [Muse Spark 1.2](https://quelleia.com/modeles/muse-spark-1-2.md) | Meta AI | non précisée | 43 % | 86,8 | https://www.vals.ai/benchmarks/proof_bench |
| 28 | [Muse Spark 1.1](https://quelleia.com/modeles/muse-spark-1-1.md) | Meta AI | non précisée | 39 % | 86,2 | https://www.vals.ai/benchmarks/proof_bench |
| 29 | [Gemini 3.6 Flash](https://quelleia.com/modeles/gemini-3-6-flash.md) | Google DeepMind | non précisée | 36 % | 85,7 | https://www.vals.ai/benchmarks/proof_bench |
| 29 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | non précisée | 36 % | 85,7 | https://www.vals.ai/benchmarks/proof_bench |
| 31 | [GLM-5.2](https://quelleia.com/modeles/glm-5-2.md) | Z.ai (Zhipu AI) | Maximale | 35 % | 85,5 | https://www.vals.ai/benchmarks/proof_bench |
| 32 | [Grok 4.7](https://quelleia.com/modeles/grok-4-7.md) | xAI | non précisée | 34 % | 85,3 | https://www.vals.ai/benchmarks/proof_bench |
| 33 | [Grok 4.5](https://quelleia.com/modeles/grok-4-5.md) | xAI | Élevée | 31 % | 84,8 | https://www.vals.ai/benchmarks/proof_bench |
| 33 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | Élevée | 31 % | 84,8 | https://www.vals.ai/benchmarks/proof_bench |
| 35 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 26 % | 83,8 | https://www.vals.ai/benchmarks/proof_bench |
| 35 | [Qwen3.7-Max](https://quelleia.com/modeles/qwen3-7-max.md) | Alibaba | non précisée | 26 % | 83,8 | https://www.vals.ai/benchmarks/proof_bench |
| 37 | [GLM-5.1](https://quelleia.com/modeles/glm-5-1.md) | Z.ai (Zhipu AI) | non précisée | 22,2 % | 83,0 | https://www.vals.ai/benchmarks/proof_bench |
| 38 | [MiMo-V2.5-Pro](https://quelleia.com/modeles/mimo-v2-5-pro.md) | Xiaomi | non précisée | 22 % | 83,0 | https://www.vals.ai/benchmarks/proof_bench |
| 39 | [GLM-5.3-Flash](https://quelleia.com/modeles/glm-5-3-flash.md) | Z.ai (Zhipu AI) | Maximale | 21 % | 82,8 | https://www.vals.ai/benchmarks/proof_bench |
| 39 | [GPT-5.4 Mini](https://quelleia.com/modeles/gpt-5-4-mini.md) | OpenAI | Maximale | 21 % | 82,8 | https://www.vals.ai/benchmarks/proof_bench |
| 41 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | non précisée | 20 % | 82,5 | https://www.vals.ai/benchmarks/proof_bench |
| 42 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | non précisée | 19 % | 82,3 | https://www.vals.ai/benchmarks/proof_bench |
| 43 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Élevée | 18 % | 82,0 | https://www.vals.ai/benchmarks/proof_bench |
| 43 | [MiniMax-M3](https://quelleia.com/modeles/minimax-m3.md) | MiniMax | non précisée | 18 % | 82,0 | https://www.vals.ai/benchmarks/proof_bench |
| 45 | [Muse Spark](https://quelleia.com/modeles/muse-spark.md) | Meta AI | non précisée | 17 % | 81,8 | https://www.vals.ai/benchmarks/proof_bench |
| 46 | [Kimi K2.6](https://quelleia.com/modeles/kimi-k2-6.md) | Moonshot | non précisée | 16 % | 81,5 | https://www.vals.ai/benchmarks/proof_bench |
| 46 | [Qwen 3.8 27B](https://quelleia.com/modeles/qwen-3-8-27b.md) | Alibaba | non précisée | 16 % | 81,5 | https://www.vals.ai/benchmarks/proof_bench |
| 46 | [DeepSeek-V4-Pro](https://quelleia.com/modeles/deepseek-v4-pro.md) | DeepSeek | Maximale | 16 % | 81,5 | https://www.vals.ai/benchmarks/proof_bench |
| 46 | [MiMo-V2.5](https://quelleia.com/modeles/mimo-v2-5.md) | Xiaomi | non précisée | 16 % | 81,5 | https://www.vals.ai/benchmarks/proof_bench |
| 50 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | Maximale | 15 % | 81,2 | https://www.vals.ai/benchmarks/proof_bench |
| 50 | [Gemini 3 Flash](https://quelleia.com/modeles/gemini-3-flash.md) | Google DeepMind | non précisée | 15 % | 81,2 | https://www.vals.ai/benchmarks/proof_bench |
| 52 | [Grok 4.20](https://quelleia.com/modeles/grok-4-20.md) | xAI | non précisée | 14 % | 80,9 | https://www.vals.ai/benchmarks/proof_bench |
| 53 | [Gemini 3.5 Flash-Lite](https://quelleia.com/modeles/gemini-3-5-flash-lite.md) | Google DeepMind | non précisée | 13 % | 80,5 | https://www.vals.ai/benchmarks/proof_bench |
| 54 | [GPT-5 nano](https://quelleia.com/modeles/gpt-5-nano.md) | OpenAI | Élevée | 12 % | 80,2 | https://www.vals.ai/benchmarks/proof_bench |
| 55 | [Grok 4.3 Beta](https://quelleia.com/modeles/grok-4-3-beta.md) | xAI | Élevée | 11 % | 79,8 | https://www.vals.ai/benchmarks/proof_bench |
| 56 | [GPT-5.1-Codex-Max](https://quelleia.com/modeles/gpt-5-1-codex-max.md) | OpenAI | non précisée | 9 % | 78,9 | https://www.vals.ai/benchmarks/proof_bench |
| 56 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | Élevée | 9 % | 78,9 | https://www.vals.ai/benchmarks/proof_bench |
| 56 | [Mistral Medium 3.5](https://quelleia.com/modeles/mistral-medium-3-5.md) | Mistral AI | non précisée | 9 % | 78,9 | https://www.vals.ai/benchmarks/proof_bench |
| 59 | [DeepSeek-V3.2](https://quelleia.com/modeles/deepseek-v3-2.md) | DeepSeek | non précisée | 8 % | 78,4 | https://www.vals.ai/benchmarks/proof_bench |
| 60 | [Inkling-Small](https://quelleia.com/modeles/inkling-small.md) | Thinking Machines | non précisée | 6 % | 77,2 | https://www.vals.ai/benchmarks/proof_bench |
| 60 | [GLM-4.7](https://quelleia.com/modeles/glm-4-7.md) | Z.ai (Zhipu AI) | non précisée | 6 % | 77,2 | https://www.vals.ai/benchmarks/proof_bench |
| 62 | [GPT-5.4 Nano](https://quelleia.com/modeles/gpt-5-4-nano.md) | OpenAI | Élevée | 5 % | 76,5 | https://www.vals.ai/benchmarks/proof_bench |
| 63 | [MiniMax-M2.5](https://quelleia.com/modeles/minimax-m2-5.md) | MiniMax | non précisée | 4 % | 75,6 | https://www.vals.ai/benchmarks/proof_bench |
| 63 | [Grok 4.1 Fast](https://quelleia.com/modeles/grok-4-1-fast.md) | xAI | non précisée | 4 % | 75,6 | https://www.vals.ai/benchmarks/proof_bench |
| 65 | [MiniMax-M2.7](https://quelleia.com/modeles/minimax-m2-7.md) | MiniMax | non précisée | 3 % | 74,4 | https://www.vals.ai/benchmarks/proof_bench |
| 65 | [Mercury 2.5](https://quelleia.com/modeles/mercury-2-5.md) | Inception Labs | non précisée | 3 % | 74,4 | https://www.vals.ai/benchmarks/proof_bench |
| 67 | [Nemotron 3 Ultra](https://quelleia.com/modeles/nemotron-3-ultra.md) | NVIDIA | non précisée | 2 % | 72,8 | https://www.vals.ai/benchmarks/proof_bench |
| 68 | [Inkling](https://quelleia.com/modeles/inkling.md) | Thinking Machines | non précisée | 0 % | 70,1 | https://www.vals.ai/benchmarks/proof_bench |
| 68 | [Laguna M.1](https://quelleia.com/modeles/laguna-m-1.md) | Poolside | non précisée | 0 % | 70,1 | https://www.vals.ai/benchmarks/proof_bench |
| 68 | [Laguna XS.2](https://quelleia.com/modeles/laguna-xs-2.md) | Poolside | non précisée | 0 % | 70,1 | https://www.vals.ai/benchmarks/proof_bench |

## En bref

**Que mesure ProofBench ?** Démontrer des théorèmes de niveau licence avancée et master dans le langage formel Lean 4, avec une preuve vérifiée par la machine. Sur Quelle IA, il est rangé dans la tâche Mathématiques.

**Comment ProofBench est-il noté ?** Part de théorèmes dont la preuve est acceptée par Lean, sur 100 problèmes privés, avec 40 tours d'échange au plus. Un modèle qui obtient 50 % a un score IA d'environ 88.

**Qui est en tête sur ProofBench ?** Claude Opus 5.5, Claude Sonnet 5.5 et Claude Fable 5.1 sont en tête de ProofBench avec 100 %, dans l'édition du 28 septembre 2026. Suivent GPT-6 Astra (99 %) et Claude Opus 5 (99 %). 70 modèles y sont mesurés.

**Quelles sont les limites de ProofBench ?** Trois modèles atteignent 100 % : le test est saturé. Le fichier mêle des scores d'avant et d'après la correction d'août 2026, non comparables entre eux. Au 28 septembre 2026, le benchmark est saturé.

**Combien pèse ProofBench dans le score IA ?** ProofBench compte pour 1,25 % du score général, dans l'édition du 28 septembre 2026. Il porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.

**Qui maintient ProofBench ?** Vals AI. Sa page de référence : vals.ai/benchmarks/proof_bench.

## Les autres benchmarks de la tâche Mathématiques

- [Arena, questions de maths](https://quelleia.com/benchmarks/arena_maths.md) : 269 modèles · 1,25 % du score
- [OTIS Mock AIME 2024-2025](https://quelleia.com/benchmarks/otis_mock_aime_2024_2025.md) : 190 modèles · 1,25 % du score, saturé
- [FrontierMath, paliers 1 à 3 (v2)](https://quelleia.com/benchmarks/frontiermath_tiers_1_3_v2.md) : 77 modèles · 1,25 % du score
- [FrontierMath, paliers 1 à 3 (version 2025)](https://quelleia.com/benchmarks/frontiermath.md) : 70 modèles · 1,25 % du score
- [FrontierMath, palier 4 (v2)](https://quelleia.com/benchmarks/frontiermath_tier_4_v2.md) : 59 modèles · 1,25 % du score, saturé
- [FrontierMath, palier 4 (version 2025)](https://quelleia.com/benchmarks/frontiermath_tier_4.md) : 55 modèles · 1,25 % du score
- [FrontierMath Erdős](https://quelleia.com/benchmarks/frontiermath_erdos.md) : 5 modèles · 1,25 % du score
- [MATH Level 5](https://quelleia.com/benchmarks/math_level_5.md) : 94 modèles · hors score, archivé
- [GSM8K](https://quelleia.com/benchmarks/gsm8k.md) : 82 modèles · hors score, archivé
- [LiveBench, mathématiques](https://quelleia.com/benchmarks/livebench_maths.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
