# Classement Maths des modèles de langage

> Dans l'édition du 28 septembre 2026, GPT-6 Astra (OpenAI) est premier en mathématiques avec un score Maths de 102,0, ex æquo avec 7 autres modèles dont Claude Opus 5.5 et Claude Fable 5.1. La marge du premier va de 96,0 à 108,0 ; deux modèles dont les marges se recouvrent sont ex æquo. 81 modèles sont classés, 251 autres ont un score provisoire.

Page : https://quelleia.com/classement/maths/
Édition : 2026-W40, 28 septembre 2026
Question : Quel est le meilleur modèle en mathématiques ?

## Comment lire ce classement

Le score Maths résume les résultats d'un modèle sur les benchmarks de mathématiques où il a été mesuré. L'échelle est celle du score général : 100 correspond au meilleur modèle au lancement du site, 50 à GPT-4o de fin 2024. La barre indique la marge d'erreur : deux modèles dont les barres se chevauchent sont ex æquo.

## Modèles classés (81)

| Rang | Modèle | Éditeur | Score | Marge à 90 % | Couverture | Mesures | Prix entrée / sortie (€ par million de jetons) |
| --- | --- | --- | --- | --- | --- | --- | --- |
| 1 | GPT-6 Astra | OpenAI | 102,0 | de 96,0 à 108,0 | 75 % | 6 | 8,78 € / 44 € |
| 2 | Claude Opus 5.5 | Anthropic | 101,4 | de 96,0 à 106,9 | 62 % | 5 | 4 € / 20 € |
| 3 | Claude Fable 5.1 | Anthropic | 99,1 | de 95,2 à 103,0 | 75 % | 6 | 8,78 € / 44 € |
| 4 | Claude Fable 5 | Anthropic | 98,8 | de 94,9 à 102,7 | 75 % | 6 | 8,78 € / 44 € |
| 5 | Claude Sonnet 5.5 | Anthropic | 97,8 | de 93,6 à 101,9 | 50 % | 4 | 2 € / 10 € |
| 6 | Claude Opus 5 | Anthropic | 96,0 | de 92,2 à 99,7 | 62 % | 5 | 4,39 € / 22 € |
| 7 | GPT-5.6 Sol | OpenAI | 96,0 | de 93,1 à 98,8 | 75 % | 6 | 3,51 € / 18 € |
| 8 | GPT-5.5 Pro | OpenAI | 94,9 | de 92,7 à 97,1 | 62 % | 5 | 26 € / 158 € |
| 9 | GPT-5.6 Terra | OpenAI | 93,3 | de 91,2 à 95,5 | 62 % | 5 | 2,17 € / 13 € |
| 10 | GPT-5.4 Pro | OpenAI | 92,3 | de 90,7 à 93,9 | 50 % | 4 | 26 € / 158 € |
| 11 | GPT-5.5 | OpenAI | 91,5 | de 88,6 à 94,5 | 100 % | 8 | 4,34 € / 26 € |
| 12 | Claude Opus 4.8 | Anthropic | 91,0 | de 89,8 à 92,2 | 88 % | 7 | 4,39 € / 22 € |
| 13 | GPT-5.6 Luna | OpenAI | 91,0 | de 88,9 à 93,1 | 62 % | 5 | 0,87 € / 5,20 € |
| 14 | Kimi K3 | Moonshot | 91,0 | de 87,4 à 94,6 | 62 % | 5 | 2,60 € / 13 € |
| 15 | Muse Spark 1.3 | Meta AI | 89,7 | de 87,8 à 91,6 | 50 % | 4 | 1,25 € / 4,25 € |
| 16 | Claude Sonnet 5 | Anthropic | 89,4 | de 85,9 à 92,9 | 62 % | 5 | 1,73 € / 8,67 € |
| 17 | GPT-5.4 | OpenAI | 89,4 | de 88,2 à 90,7 | 88 % | 7 | 2,17 € / 13 € |
| 18 | Qwen 3.8 Max | Alibaba | 89,4 | de 88,1 à 90,7 | 50 % | 4 | 1,76 € / 5,27 € |
| 19 | Gemini 3.7 Flash | Google DeepMind | 88,6 | de 87,2 à 90,1 | 62 % | 5 | 1,50 € / 7,50 € |
| 20 | Claude Opus 4.7 | Anthropic | 87,9 | de 86,6 à 89,1 | 88 % | 7 | 4,39 € / 22 € |
| 21 | Grok 4.6 | xAI | 87,6 | de 86,0 à 89,2 | 62 % | 5 | 1,76 € / 5,27 € |
| 22 | GLM-5.3 | Z.ai (Zhipu AI) | 87,3 | de 85,9 à 88,8 | 62 % | 5 | 1,40 € / 4,40 € |
| 23 | Qwen3.8 Max (0902) | Alibaba | 87,3 | de 85,1 à 89,6 | 50 % | 4 | 1,76 € / 5,27 € |
| 24 | Claude Opus 4.6 | Anthropic | 87,1 | de 85,7 à 88,4 | 88 % | 7 | 4,39 € / 22 € |
| 25 | DeepSeek V4 Flash 0731 | DeepSeek | 87,1 | de 84,4 à 89,8 | 50 % | 4 | 0,18 € / 0,35 € |
| 26 | DeepSeek V4 Pro 0813 | DeepSeek | 87,1 | de 85,5 à 88,7 | 50 % | 4 | 0,61 € / 1,82 € |
| 27 | Gemini 3.8 Flash | Google DeepMind | 86,8 | de 84,8 à 88,9 | 62 % | 5 | 1,50 € / 7,50 € |
| 28 | GLM-5.2 | Z.ai (Zhipu AI) | 85,5 | de 83,1 à 87,9 | 62 % | 5 | 0,98 € / 3,08 € |
| 29 | Qwen3.7-Max | Alibaba | 85,5 | de 83,3 à 87,7 | 62 % | 5 | 1,08 € / 3,25 € |
| 30 | Gemini 3.6 Flash | Google DeepMind | 85,2 | de 83,7 à 86,8 | 62 % | 5 | 1,30 € / 6,50 € |
| 31 | Gemini 3.5 Flash | Google DeepMind | 85,0 | de 83,7 à 86,3 | 88 % | 7 | 1,30 € / 7,80 € |
| 32 | Grok 4.5 | xAI | 85,0 | de 83,4 à 86,5 | 62 % | 5 | 1,76 € / 5,27 € |
| 33 | GPT-5.2 | OpenAI | 84,7 | de 82,4 à 87,1 | 88 % | 7 | 1,52 € / 12 € |
| 34 | Gemini 3.1 Pro | Google DeepMind | 84,7 | de 83,3 à 86,1 | 88 % | 7 | 2 € / 12 € |
| 35 | Claude Sonnet 4.6 | Anthropic | 84,5 | de 80,4 à 88,5 | 62 % | 5 | 2,63 € / 13 € |
| 36 | Gemini 3 Pro | Google DeepMind | 83,9 | de 81,8 à 86,1 | 62 % | 5 | 1,73 € / 10 € |
| 37 | Kimi K2.6 | Moonshot | 83,7 | de 81,8 à 85,5 | 88 % | 7 | 0,59 € / 2,96 € |
| 38 | GLM-5.3-Flash | Z.ai (Zhipu AI) | 83,2 | de 81,3 à 85,0 | 62 % | 5 | 0,15 € / 0,50 € |
| 39 | Muse Spark | Meta AI | 83,2 | de 80,7 à 85,6 | 62 % | 5 | inconnu |
| 40 | GPT-5 | OpenAI | 82,6 | de 81,0 à 84,3 | 88 % | 7 | 1,08 € / 8,67 € |
| 41 | Gemini 3 Flash | Google DeepMind | 81,9 | de 79,9 à 83,9 | 88 % | 7 | 0,43 € / 2,60 € |
| 42 | GLM-5.1 | Z.ai (Zhipu AI) | 81,6 | de 79,0 à 84,2 | 75 % | 6 | 0,85 € / 2,67 € |
| 43 | GPT-5.1 | OpenAI | 81,6 | de 78,9 à 84,3 | 50 % | 4 | 1,08 € / 8,67 € |
| 44 | Grok 4.20 | xAI | 81,1 | de 78,6 à 83,5 | 50 % | 4 | 1,08 € / 2,17 € |
| 45 | DeepSeek-V4-Pro | DeepSeek | 80,6 | de 77,8 à 83,3 | 62 % | 5 | 0,38 € / 0,75 € |
| 46 | GPT-5.4 Mini | OpenAI | 80,6 | de 78,4 à 82,7 | 88 % | 7 | 0,65 € / 3,90 € |
| 47 | Inkling-Small | Thinking Machines | 80,3 | de 77,2 à 83,4 | 62 % | 5 | 0,45 € / 1,20 € |
| 48 | Grok 4.3 Beta | xAI | 80,0 | de 77,3 à 82,7 | 62 % | 5 | 1,08 € / 2,17 € |
| 49 | GPT-5 mini | OpenAI | 79,5 | de 77,3 à 81,7 | 88 % | 7 | 0,22 € / 1,73 € |
| 50 | Kimi K2.5 | Moonshot | 79,5 | de 76,7 à 82,3 | 50 % | 4 | 0,35 € / 1,65 € |
| 51 | GPT-5.4 Nano | OpenAI | 79,0 | de 76,9 à 81,0 | 88 % | 7 | 0,17 € / 1,08 € |
| 52 | Qwen 3.6 Plus | Alibaba | 79,0 | de 76,8 à 81,1 | 62 % | 5 | 0,28 € / 1,69 € |
| 53 | Claude Opus 4.5 | Anthropic | 78,5 | de 74,1 à 82,8 | 88 % | 7 | 4,39 € / 22 € |
| 54 | Qwen 3.6 Max (Preview) | Alibaba | 77,9 | de 75,1 à 80,7 | 50 % | 4 | 1,14 € / 6,85 € |
| 55 | o4-mini | OpenAI | 77,7 | de 74,9 à 80,5 | 75 % | 6 | 0,95 € / 3,82 € |
| 56 | DeepSeek-V3.2 | DeepSeek | 77,2 | de 74,5 à 79,8 | 62 % | 5 | 0,20 € / 0,30 € |
| 57 | Inkling | Thinking Machines | 76,6 | de 73,4 à 79,8 | 62 % | 5 | 0,95 € / 4,05 € |
| 58 | Kimi K2 Thinking | Moonshot | 76,1 | de 72,3 à 80,0 | 50 % | 4 | 0,52 € / 2,17 € |
| 59 | o3 | OpenAI | 75,9 | de 73,5 à 78,2 | 62 % | 5 | 1,76 € / 7,02 € |
| 60 | Grok 4 | xAI | 75,6 | de 72,5 à 78,7 | 50 % | 4 | 2,63 € / 13 € |
| 61 | Claude Sonnet 4.5 | Anthropic | 74,0 | de 70,3 à 77,7 | 88 % | 7 | 2,60 € / 13 € |
| 62 | GLM-5 | Z.ai (Zhipu AI) | 74,0 | de 70,9 à 77,2 | 50 % | 4 | 0,52 € / 1,66 € |
| 63 | Gemini 2.5 Pro (Jun 2025) | Google DeepMind | 73,8 | de 71,3 à 76,2 | 75 % | 6 | 1,10 € / 8,78 € |
| 64 | Qwen 3.6 Flash | Alibaba | 72,2 | de 69,4 à 75,0 | 50 % | 4 | 0,16 € / 0,99 € |
| 65 | Gemini 3.5 Flash-Lite | Google DeepMind | 71,7 | de 66,4 à 77,0 | 62 % | 5 | 0,26 € / 2,17 € |
| 66 | Qwen3-235B-A22B-Thinking (Jul 2025) | Alibaba | 71,7 | de 67,6 à 75,7 | 50 % | 4 | 0,26 € / 2,55 € |
| 67 | o3-mini | OpenAI | 71,4 | de 68,6 à 74,2 | 75 % | 6 | 0,97 € / 3,86 € |
| 68 | GPT-5 nano | OpenAI | 70,6 | de 66,6 à 74,7 | 88 % | 7 | 0,04 € / 0,35 € |
| 69 | GPT-5.5 Instant | OpenAI | 70,6 | de 65,1 à 76,2 | 50 % | 4 | 4,39 € / 26 € |
| 70 | Qwen 3.5 Flash (hosted 35B-A3B) | Alibaba | 70,6 | de 67,1 à 74,1 | 62 % | 5 | 0,09 € / 0,35 € |
| 71 | GLM-4.7 | Z.ai (Zhipu AI) | 70,1 | de 64,1 à 76,1 | 62 % | 5 | 0,35 € / 1,52 € |
| 72 | o1 | OpenAI | 69,3 | de 66,5 à 72,2 | 50 % | 4 | 13 € / 53 € |
| 73 | Claude Opus 4.1 | Anthropic | 68,5 | de 65,4 à 71,7 | 75 % | 6 | 13 € / 66 € |
| 74 | Claude Sonnet 4 | Anthropic | 68,0 | de 64,6 à 71,4 | 50 % | 4 | 2,60 € / 13 € |
| 75 | Claude Haiku 4.5 | Anthropic | 67,2 | de 64,0 à 70,5 | 50 % | 4 | 0,88 € / 4,39 € |
| 76 | Claude Opus 4 | Anthropic | 66,7 | de 62,5 à 71,0 | 50 % | 4 | 13 € / 66 € |
| 77 | Grok 3 | xAI | 63,8 | de 60,9 à 66,7 | 50 % | 4 | 2,63 € / 13 € |
| 78 | GPT-4.1 mini | OpenAI | 61,2 | de 58,0 à 64,5 | 50 % | 4 | 0,35 € / 1,39 € |
| 79 | GPT-4.1 | OpenAI | 59,7 | de 55,0 à 64,3 | 62 % | 5 | 1,76 € / 7,02 € |
| 80 | Claude 3.5 Sonnet | Anthropic | 48,7 | de 39,3 à 58,1 | 50 % | 4 | 2,63 € / 13 € |
| 81 | GPT-4o (Aug 2024) | OpenAI | 46,6 | de 39,1 à 54,1 | 50 % | 4 | 2,19 € / 8,78 € |

## Scores provisoires (251)

Ces modèles n'ont pas encore assez de mesures pour recevoir un rang. Ils sont listés du score le plus haut au plus bas.

| Rang | Modèle | Éditeur | Score | Marge à 90 % | Couverture | Mesures | Prix entrée / sortie (€ par million de jetons) |
| --- | --- | --- | --- | --- | --- | --- | --- |
| provisoire | Gemini 4 Argon | Google DeepMind | 96,5 | de 88,3 à 104,6 | 12 % | 1 | inconnu |
| provisoire | AI Co-Mathematician | Google DeepMind | 96,2 | de 93,7 à 98,7 | 25 % | 2 | inconnu |
| provisoire | Tencent Hy4 preview | Tencent | 92,3 | de 90,0 à 94,6 | 12 % | 1 | 0,74 € / 2,23 € |
| provisoire | GPT-5.2 Pro | OpenAI | 89,9 | de 88,5 à 91,4 | 38 % | 3 | 18 € / 147 € |
| provisoire | MiMo-V2.6-Pro | Xiaomi | 88,9 | de 80,7 à 97,1 | 12 % | 1 | 0,44 € / 0,87 € |
| provisoire | DeepSeek V4.1 Flash | DeepSeek | 88,6 | de 86,8 à 90,5 | 25 % | 2 | 0,15 € / 0,60 € |
| provisoire | GPT-6 Sol | OpenAI | 87,9 | de 79,6 à 96,1 | 12 % | 1 | 2 € / 10 € |
| provisoire | Muse Spark 1.2 | Meta AI | 86,8 | de 85,0 à 88,6 | 12 % | 1 | 1,25 € / 4,25 € |
| provisoire | Muse Spark 1.1 | Meta AI | 86,3 | de 84,3 à 88,2 | 25 % | 2 | 1,10 € / 3,73 € |
| provisoire | Grok 4.7 | xAI | 85,2 | de 81,9 à 88,6 | 25 % | 2 | 1,76 € / 5,27 € |
| provisoire | ERNIE 5.1 | Baidu | 84,7 | de 76,5 à 93,0 | 12 % | 1 | 0,66 € / 2,63 € |
| provisoire | Hy3 | Tencent | 84,7 | de 76,5 à 93,0 | 12 % | 1 | 0,15 € / 0,50 € |
| provisoire | GPT-5 Pro | OpenAI | 83,9 | de 82,0 à 85,9 | 38 % | 3 | 13 € / 105 € |
| provisoire | Qwen3.5 Max Preview | Alibaba | 83,9 | de 75,7 à 92,2 | 12 % | 1 | inconnu |
| provisoire | GPT-6 Luna | OpenAI | 83,4 | de 75,2 à 91,6 | 12 % | 1 | 0,10 € / 0,50 € |
| provisoire | MiMo-V2.5-Pro | Xiaomi | 83,2 | de 80,6 à 85,8 | 25 % | 2 | 0,38 € / 0,76 € |
| provisoire | GPT-5.2 Chat | OpenAI | 82,6 | de 74,4 à 90,9 | 12 % | 1 | 1,54 € / 12 € |
| provisoire | Grok 4.20 Beta 1 | xAI | 82,6 | de 74,4 à 90,9 | 12 % | 1 | inconnu |
| provisoire | Grok 4.20 Multi Agent Beta | xAI | 82,6 | de 74,4 à 90,9 | 12 % | 1 | 1,10 € / 2,19 € |
| provisoire | Kimi K2.7 Code | Moonshot | 82,4 | de 79,8 à 85,0 | 38 % | 3 | 0,83 € / 3,51 € |
| provisoire | MiMo-V2.6-Flash | Xiaomi | 82,1 | de 73,9 à 90,3 | 12 % | 1 | 0,14 € / 0,28 € |
| provisoire | Qwen 3.8 27B | Alibaba | 81,6 | de 78,6 à 84,6 | 25 % | 2 | 0,35 € / 2,75 € |
| provisoire | MiMo-V2.5 | Xiaomi | 81,3 | de 77,3 à 85,4 | 25 % | 2 | 0,12 € / 0,25 € |
| provisoire | Gemini 2.5 Deep Think | Google DeepMind | 80,8 | de 78,4 à 83,3 | 25 % | 2 | inconnu |
| provisoire | Grok 4.20 Beta (0309) | xAI | 80,6 | de 72,3 à 88,8 | 12 % | 1 | 1,76 € / 5,27 € |
| provisoire | DeepSeek-V4-Flash | DeepSeek | 80,3 | de 72,1 à 88,5 | 12 % | 1 | 0,09 € / 0,17 € |
| provisoire | Seed 2.0 Pro | ByteDance | 80,3 | de 72,1 à 88,5 | 12 % | 1 | 0,44 € / 2,63 € |
| provisoire | MiMo-V2-Pro | Xiaomi | 80,0 | de 71,8 à 88,3 | 12 % | 1 | 0,38 € / 0,76 € |
| provisoire | GPT-5.1-Codex-Max | OpenAI | 79,0 | de 74,2 à 83,8 | 12 % | 1 | 1,10 € / 8,78 € |
| provisoire | GPT-5.3 Chat | OpenAI | 78,2 | de 70,0 à 86,4 | 12 % | 1 | 1,52 € / 12 € |
| provisoire | ERNIE 5.0 | Baidu | 77,9 | de 69,7 à 86,2 | 12 % | 1 | 0,74 € / 2,96 € |
| provisoire | Kimi K2.5 Instant | Moonshot | 77,7 | de 69,5 à 85,9 | 12 % | 1 | inconnu |
| provisoire | Qwen3.7-Plus | Alibaba | 77,7 | de 73,4 à 82,0 | 38 % | 3 | 0,28 € / 1,11 € |
| provisoire | Mistral Medium 3.5 | Mistral AI | 77,4 | de 70,9 à 83,9 | 25 % | 2 | 1,30 € / 6,50 € |
| provisoire | Qwen3.6 27B | Alibaba | 77,2 | de 73,8 à 80,5 | 25 % | 2 | 0,53 € / 3,16 € |
| provisoire | GLM-5V-Turbo | Z.ai (Zhipu AI) | 76,9 | de 68,7 à 85,1 | 12 % | 1 | 1,05 € / 3,51 € |
| provisoire | Muse Glimmer 30B | Meta AI | 76,6 | de 68,4 à 84,9 | 12 % | 1 | 0,30 € / 1,10 € |
| provisoire | MiMo V2 Omni | Xiaomi | 76,4 | de 68,1 à 84,6 | 12 % | 1 | 0,12 € / 0,25 € |
| provisoire | Qwen 3.5 Plus (hosted 397B-A17B) | Alibaba | 76,4 | de 73,3 à 79,4 | 38 % | 3 | 0,35 € / 2,11 € |
| provisoire | Qwen3.5 397B-A17B | Alibaba | 76,1 | de 72,6 à 79,7 | 38 % | 3 | 0,34 € / 2,03 € |
| provisoire | Nemotron 3 Ultra | NVIDIA | 75,3 | de 70,2 à 80,4 | 38 % | 3 | inconnu |
| provisoire | Grok 4.1 | xAI | 74,8 | de 66,6 à 83,0 | 12 % | 1 | 1,76 € / 8,78 € |
| provisoire | Hunyuan Hy3 Preview | Tencent | 74,5 | de 66,3 à 82,8 | 12 % | 1 | inconnu |
| provisoire | MiniMax-M2.7 | MiniMax | 74,5 | de 67,0 à 82,1 | 25 % | 2 | 0,24 € / 1,04 € |
| provisoire | Grok 4.1 Fast | xAI | 74,3 | de 66,6 à 82,0 | 25 % | 2 | 0,17 € / 0,43 € |
| provisoire | Qwen3.5-122B-A10B | Alibaba | 74,3 | de 66,1 à 82,5 | 12 % | 1 | 0,35 € / 2,81 € |
| provisoire | ChatGPT-4o Latest | OpenAI | 74,0 | de 65,8 à 82,2 | 12 % | 1 | 4,39 € / 18 € |
| provisoire | gpt-oss-120b | OpenAI | 74,0 | de 65,9 à 82,2 | 25 % | 2 | 0,03 € / 0,16 € |
| provisoire | Gemma 4 26B A4B | Google DeepMind | 73,8 | de 67,0 à 80,5 | 25 % | 2 | 0,05 € / 0,29 € |
| provisoire | Grok 4 Fast Chat | xAI | 73,8 | de 65,5 à 82,0 | 12 % | 1 | inconnu |
| provisoire | Mercury 2.5 | Inception Labs | 73,8 | de 65,6 à 82,0 | 12 % | 1 | 0,04 € / 0,13 € |
| provisoire | Qwen3.5-27B | Alibaba | 73,8 | de 65,5 à 82,0 | 12 % | 1 | 0,26 € / 2,11 € |
| provisoire | Gemini 3.1 Flash-Lite | Google DeepMind | 73,5 | de 69,8 à 77,2 | 38 % | 3 | 0,22 € / 1,30 € |
| provisoire | DeepSeek-V3.2-Exp | DeepSeek | 73,0 | de 64,8 à 81,2 | 12 % | 1 | 0,25 € / 0,38 € |
| provisoire | Qwen 3.6 35B-A3B | Alibaba | 73,0 | de 69,0 à 76,9 | 25 % | 2 | 0,22 € / 1,30 € |
| provisoire | Qwen3.7 Flash | Alibaba | 72,7 | de 68,5 à 77,0 | 25 % | 2 | 0,03 € / 0,11 € |
| provisoire | Solar Pro 4 | Upstage | 72,5 | de 64,2 à 80,7 | 12 % | 1 | 0,26 € / 1,05 € |
| provisoire | MiniMax-M2.5 | MiniMax | 72,2 | de 63,5 à 80,9 | 25 % | 2 | 0,13 € / 1 € |
| provisoire | DeepSeek-V3.1 | DeepSeek | 71,9 | de 63,7 à 80,2 | 12 % | 1 | 0,18 € / 0,69 € |
| provisoire | Grok 4 Heavy | xAI | 71,7 | de 63,7 à 79,7 | 12 % | 1 | inconnu |
| provisoire | Kimi K2 (Sep 2025) | Moonshot | 71,7 | de 63,5 à 79,9 | 12 % | 1 | 0,55 € / 2,22 € |
| provisoire | Qwen3 VL 235B A22B Instruct | Alibaba | 71,4 | de 63,2 à 79,6 | 12 % | 1 | 0,47 € / 2,34 € |
| provisoire | DeepSeek-V3.1-Terminus | DeepSeek | 70,9 | de 62,7 à 79,1 | 12 % | 1 | 0,24 € / 0,88 € |
| provisoire | GLM-4.5 | Z.ai (Zhipu AI) | 70,9 | de 62,7 à 79,1 | 12 % | 1 | 0,52 € / 1,91 € |
| provisoire | Grok 4 Fast | xAI | 70,9 | de 62,7 à 79,1 | 12 % | 1 | 0,17 € / 0,43 € |
| provisoire | Laguna M.1 | Poolside | 70,6 | de 64,7 à 76,6 | 12 % | 1 | inconnu |
| provisoire | LongCat Flash Chat | Meituan | 70,6 | de 62,4 à 78,9 | 12 % | 1 | inconnu |
| provisoire | Gemma 4 31B IT | Google DeepMind | 70,4 | de 61,7 à 79,1 | 25 % | 2 | 0,10 € / 0,31 € |
| provisoire | MiniMax-M2.1 | MiniMax | 70,4 | de 62,1 à 78,6 | 12 % | 1 | 0,26 € / 1,05 € |
| provisoire | Qwen3-235B-A22B-Instruct (Jul 2025) | Alibaba | 70,4 | de 62,1 à 78,6 | 12 % | 1 | 0,19 € / 0,77 € |
| provisoire | Gemini 2.5 Flash (Sep 2025) | Google DeepMind | 70,1 | de 61,9 à 78,3 | 12 % | 1 | 0,26 € / 2,19 € |
| provisoire | Laguna XS.2 | Poolside | 70,1 | de 64,7 à 75,5 | 12 % | 1 | inconnu |
| provisoire | MiniMax-M3 | MiniMax | 70,1 | de 60,1 à 80,1 | 38 % | 3 | 0,24 € / 0,97 € |
| provisoire | Qwen3-Max | Alibaba | 70,1 | de 66,5 à 73,7 | 38 % | 3 | 0,68 € / 3,38 € |
| provisoire | Grok-3 mini | xAI | 69,6 | de 65,7 à 73,5 | 38 % | 3 | 0,26 € / 0,43 € |
| provisoire | chutes/Qwen3-Next-80B-A3B-Instruct | Alibaba | 69,3 | de 61,1 à 77,5 | 12 % | 1 | 0,44 € / 1,76 € |
| provisoire | Step 3.5 Flash | StepFun | 69,3 | de 61,1 à 77,5 | 12 % | 1 | 0,08 € / 0,26 € |
| provisoire | Gemini 2.5 Flash (Apr 2025) | Google DeepMind | 69,1 | de 65,4 à 72,7 | 12 % | 1 | 0,13 € / 0,53 € |
| provisoire | Hunyuan-T1 | Tencent | 68,8 | de 60,6 à 77,0 | 12 % | 1 | inconnu |
| provisoire | Gemini 2.5 Flash (May 2025) | Google DeepMind | 68,5 | de 65,0 à 72,1 | 12 % | 1 | 0,12 € / 2,77 € |
| provisoire | Qwen3 VL 235B A22B Thinking | Alibaba | 68,5 | de 60,3 à 76,8 | 12 % | 1 | 0,61 € / 2,46 € |
| provisoire | Qwen3.5-35B-A3B | Alibaba | 68,3 | de 64,8 à 71,7 | 25 % | 2 | 0,12 € / 0,87 € |
| provisoire | Qwen3-30B-A3B-Thinking (Jul 2025) | Alibaba | 68,0 | de 64,5 à 71,5 | 12 % | 1 | 0,32 € / 1,14 € |
| provisoire | Kimi K2 (Jul 2025) | Moonshot | 67,8 | de 59,5 à 76,0 | 12 % | 1 | 0,50 € / 2,02 € |
| provisoire | Mistral Large 3 | Mistral AI | 67,8 | de 59,5 à 76,0 | 12 % | 1 | 0,43 € / 1,30 € |
| provisoire | Gemini 2.5 Flash (Jun 2025) | Google DeepMind | 67,5 | de 60,4 à 74,5 | 38 % | 3 | 0,26 € / 2,17 € |
| provisoire | DeepSeek-R1 (May 2025) | DeepSeek | 67,2 | de 63,1 à 71,4 | 25 % | 2 | 0,43 € / 1,86 € |
| provisoire | GLM-4.6 | Z.ai (Zhipu AI) | 67,2 | de 59,9 à 74,6 | 38 % | 3 | 0,37 € / 1,51 € |
| provisoire | MiMo-V2-Flash | Xiaomi | 67,2 | de 59,0 à 75,5 | 12 % | 1 | 0,12 € / 0,25 € |
| provisoire | Mistral Medium 3.1 | Mistral AI | 67,2 | de 59,0 à 75,5 | 12 % | 1 | 0,35 € / 1,73 € |
| provisoire | Qwen3-235B-A22B | Alibaba | 67,2 | de 59,0 à 75,5 | 12 % | 1 | 0,61 € / 2,46 € |
| provisoire | seed-oss-36b-instruct | ByteDance | 67,2 | de 63,9 à 70,6 | 12 % | 1 | inconnu |
| provisoire | Qwen3-14B | Alibaba | 67,0 | de 63,7 à 70,3 | 12 % | 1 | 0,31 € / 1,23 € |
| provisoire | Qwen3-32B | Alibaba | 67,0 | de 63,7 à 70,2 | 25 % | 2 | 0,07 € / 0,24 € |
| provisoire | Qwen3-Coder-480B-A35B | Alibaba | 66,2 | de 58,0 à 74,4 | 12 % | 1 | 0,19 € / 1,56 € |
| provisoire | Trinity Large Thinking | Arcee AI | 66,2 | de 58,0 à 74,4 | 12 % | 1 | 0,19 € / 0,74 € |
| provisoire | gpt-oss-20b | OpenAI | 65,9 | de 59,0 à 72,9 | 25 % | 2 | 0,03 € / 0,12 € |
| provisoire | Qwen3-30B-A3B-Instruct (Jul 2025) | Alibaba | 65,7 | de 62,4 à 68,9 | 25 % | 2 | 0,26 € / 0,44 € |
| provisoire | Qwen3.5-9B | Alibaba | 65,7 | de 62,5 à 68,8 | 12 % | 1 | 0,10 € / 0,15 € |
| provisoire | Qwen3-30B-A3B | Alibaba | 65,4 | de 60,1 à 70,7 | 25 % | 2 | 0,10 € / 0,43 € |
| provisoire | Qwen3-Next-80B-A3B Thinking | Alibaba | 64,9 | de 56,7 à 73,1 | 12 % | 1 | inconnu |
| provisoire | Claude 3.7 Sonnet | Anthropic | 64,6 | de 61,6 à 67,7 | 38 % | 3 | 2,63 € / 13 € |
| provisoire | GLM-4.5-Air | Z.ai (Zhipu AI) | 64,6 | de 56,4 à 72,9 | 12 % | 1 | 0,18 € / 0,97 € |
| provisoire | QwQ-32B | Alibaba | 64,6 | de 61,0 à 68,3 | 25 % | 2 | 0,13 € / 0,35 € |
| provisoire | Gemini 2.0 Flash Thinking (Jan 2025) | Google DeepMind | 64,4 | de 61,3 à 67,4 | 12 % | 1 | inconnu |
| provisoire | glm-4.7-flash | Z.ai (Zhipu AI) | 64,4 | de 60,8 à 67,9 | 25 % | 2 | inconnu |
| provisoire | DeepSeek-R1-Distill-Qwen-32B | DeepSeek | 63,8 | de 60,8 à 66,9 | 12 % | 1 | 0,25 € / 0,76 € |
| provisoire | Qwen3-8B | Alibaba | 63,8 | de 60,8 à 66,9 | 12 % | 1 | 0,04 € / 0,35 € |
| provisoire | Qwen3.5-4B | Alibaba | 63,8 | de 60,8 à 66,9 | 12 % | 1 | 0,04 € / 0,06 € |
| provisoire | DeepSeek-R1 | DeepSeek | 63,3 | de 60,3 à 66,3 | 12 % | 1 | inconnu |
| provisoire | Gemini 2.5 Flash-Lite (Sep 2025) | Google DeepMind | 63,1 | de 54,8 à 71,3 | 12 % | 1 | 0,09 € / 0,35 € |
| provisoire | Qwen Plus (Apr 2025) | Alibaba | 63,1 | de 55,1 à 71,1 | 12 % | 1 | inconnu |
| provisoire | qwen3-4b-instruct-2507 | Alibaba | 62,8 | de 59,8 à 65,8 | 12 % | 1 | 0,18 € / 0,18 € |
| provisoire | DeepSeek-R1-Distill-Llama-70B | DeepSeek | 62,5 | de 59,6 à 65,5 | 12 % | 1 | 0,61 € / 0,69 € |
| provisoire | DeepSeek-R1-Distill-Qwen-14B | DeepSeek | 62,3 | de 59,3 à 65,3 | 12 % | 1 | 0,13 € / 0,38 € |
| provisoire | Llama 3.1 Nemotron Ultra 253B | NVIDIA | 62,3 | de 54,1 à 70,5 | 12 % | 1 | inconnu |
| provisoire | Llama 3.3 Nemotron Super 49B v1.5 | NVIDIA | 62,3 | de 54,1 à 70,5 | 12 % | 1 | inconnu |
| provisoire | MiniMax-M2 | MiniMax | 62,3 | de 54,1 à 70,5 | 12 % | 1 | 0,22 € / 0,87 € |
| provisoire | MiniMax-M1-80k | MiniMax | 62,0 | de 53,8 à 70,2 | 12 % | 1 | 0,12 € / 1,10 € |
| provisoire | Gemini 2.5 Flash-Lite (Jun 2025) | Google DeepMind | 61,8 | de 53,5 à 70,0 | 12 % | 1 | 0,09 € / 0,35 € |
| provisoire | Nemotron 3 Super 120B | NVIDIA | 61,8 | de 53,5 à 70,0 | 12 % | 1 | 0,08 € / 0,39 € |
| provisoire | INTELLECT-3 | Prime Intellect | 61,5 | de 53,3 à 69,7 | 12 % | 1 | inconnu |
| provisoire | o1-mini | OpenAI | 61,5 | de 58,4 à 64,6 | 38 % | 3 | 0,97 € / 3,86 € |
| provisoire | Hunyuan-TurboS | Tencent | 61,2 | de 53,0 à 69,5 | 12 % | 1 | inconnu |
| provisoire | GLM-4.5V | Z.ai (Zhipu AI) | 60,2 | de 52,0 à 68,4 | 12 % | 1 | inconnu |
| provisoire | Nemotron 3.5 Lightning | NVIDIA | 59,9 | de 51,7 à 68,2 | 12 % | 1 | 0,08 € / 0,20 € |
| provisoire | Step 3 | StepFun | 59,9 | de 51,7 à 68,2 | 12 % | 1 | inconnu |
| provisoire | deepseek-r1-0528-qwen3-8b | DeepSeek | 59,7 | de 56,6 à 62,8 | 12 % | 1 | 0,05 € / 0,08 € |
| provisoire | GPT-4.5 | OpenAI | 59,7 | de 52,1 à 67,3 | 25 % | 2 | inconnu |
| provisoire | DeepSeek-V3 (Mar 2025) | DeepSeek | 59,1 | de 55,1 à 63,2 | 25 % | 2 | 0,17 € / 0,67 € |
| provisoire | o1-preview | OpenAI | 57,6 | de 51,8 à 63,3 | 25 % | 2 | inconnu |
| provisoire | Mistral Medium 3 | Mistral AI | 57,3 | de 54,0 à 60,7 | 38 % | 3 | 0,35 € / 1,76 € |
| provisoire | Gemini 2.0 Flash (Feb 2025) | Google DeepMind | 57,1 | de 53,3 à 60,8 | 38 % | 3 | 0,09 € / 0,37 € |
| provisoire | Ling-flash-2.0 | Ant Group | 56,8 | de 48,6 à 65,0 | 12 % | 1 | inconnu |
| provisoire | Magistral Small 1.0 | Mistral AI | 56,5 | de 53,0 à 60,0 | 12 % | 1 | 0,43 € / 1,30 € |
| provisoire | Mistral Small 3.2 | Mistral AI | 56,5 | de 53,1 à 60,0 | 25 % | 2 | 0,07 € / 0,17 € |
| provisoire | Magistral Small 1.2 | Mistral AI | 55,8 | de 52,1 à 59,4 | 12 % | 1 | 0,44 € / 1,32 € |
| provisoire | GPT-4.1 nano | OpenAI | 55,2 | de 48,2 à 62,2 | 38 % | 3 | 0,09 € / 0,35 € |
| provisoire | Nemotron 3 Nano 30B | NVIDIA | 55,0 | de 46,7 à 63,2 | 12 % | 1 | inconnu |
| provisoire | glm-4.7-flash_none | Z.ai (Zhipu AI) | 54,7 | de 50,8 à 58,6 | 12 % | 1 | inconnu |
| provisoire | Gemini 1.5 Pro (Sept 2024) | Google DeepMind | 54,4 | de 50,3 à 58,6 | 25 % | 2 | inconnu |
| provisoire | Gemini 2.0 Flash-Lite | Google DeepMind | 54,2 | de 46,0 à 62,4 | 12 % | 1 | 0,07 € / 0,26 € |
| provisoire | Ring-flash-2.0 | Ant Group | 54,2 | de 46,0 à 62,4 | 12 % | 1 | inconnu |
| provisoire | Cohere Command A | Cohere | 53,9 | de 45,7 à 62,1 | 12 % | 1 | 2,17 € / 8,67 € |
| provisoire | Gemma 3 27B | Google DeepMind | 53,9 | de 49,9 à 57,9 | 25 % | 2 | 0,07 € / 0,14 € |
| provisoire | Llama 4 Maverick | Meta AI | 53,1 | de 48,9 à 57,4 | 38 % | 3 | 0,13 € / 0,52 € |
| provisoire | Granite 4.1 8B | IBM | 52,6 | de 44,4 à 60,8 | 12 % | 1 | 0,04 € / 0,09 € |
| provisoire | Qwen2.5-Max | Alibaba | 52,4 | de 45,3 à 59,4 | 38 % | 3 | 1,40 € / 5,62 € |
| provisoire | Qwen Plus (Jan 2025) | Alibaba | 52,1 | de 47,4 à 56,8 | 25 % | 2 | 0,35 € / 1,05 € |
| provisoire | DeepSeek-V3 | DeepSeek | 51,3 | de 45,2 à 57,4 | 25 % | 2 | inconnu |
| provisoire | Yi-Lightning | 01.AI | 51,3 | de 43,1 à 59,5 | 12 % | 1 | inconnu |
| provisoire | Gemma 3 12B | Google DeepMind | 51,1 | de 46,1 à 56,0 | 25 % | 2 | 0,04 € / 0,13 € |
| provisoire | Grok-2 (Aug 2024) | xAI | 51,1 | de 42,8 à 59,3 | 12 % | 1 | inconnu |
| provisoire | Gemini 1.5 Flash (Sep 2024) | Google DeepMind | 50,5 | de 45,0 à 56,1 | 38 % | 3 | inconnu |
| provisoire | OLMo 3.1 32B Instruct | Allen Institute for AI | 50,5 | de 42,3 à 58,7 | 12 % | 1 | inconnu |
| provisoire | DeepSeek-V2.5 (Dec 2024) | DeepSeek | 50,0 | de 41,8 à 58,2 | 12 % | 1 | inconnu |
| provisoire | GPT-4 Turbo (Nov 2023) | OpenAI | 49,5 | de 41,3 à 57,7 | 12 % | 1 | 8,78 € / 26 € |
| provisoire | Grok-2 (Dec 2024) | xAI | 49,2 | de 42,6 à 55,9 | 25 % | 2 | inconnu |
| provisoire | Llama 3.1-405B | Meta AI | 48,7 | de 42,1 à 55,3 | 25 % | 2 | 2,38 € / 2,60 € |
| provisoire | Claude 3.5 Sonnet (October 2024) | Anthropic | 48,2 | de 38,2 à 58,1 | 38 % | 3 | inconnu |
| provisoire | Magistral Medium 1.1 | Mistral AI | 48,2 | de 40,0 à 56,4 | 12 % | 1 | 1,73 € / 4,34 € |
| provisoire | OLMo 3 32B Think | Ai2 | 47,9 | de 39,7 à 56,1 | 12 % | 1 | 0,13 € / 0,43 € |
| provisoire | Phi-4 | Microsoft | 47,9 | de 40,6 à 55,2 | 25 % | 2 | 0,06 € / 0,12 € |
| provisoire | Llama 4 Scout | Meta AI | 47,4 | de 40,4 à 54,4 | 38 % | 3 | 0,09 € / 0,26 € |
| provisoire | DeepSeek-V2.5 (Sep 2024) | DeepSeek | 47,1 | de 38,9 à 55,3 | 12 % | 1 | inconnu |
| provisoire | GPT-4o (May 2024) | OpenAI | 46,9 | de 39,5 à 54,3 | 25 % | 2 | 4,39 € / 13 € |
| provisoire | Mistral Large 2 (Jul 2024) | Mistral AI | 46,9 | de 40,3 à 53,4 | 25 % | 2 | 1,76 € / 5,27 € |
| provisoire | Qwen2.5-72B | Alibaba | 46,9 | de 40,2 à 53,6 | 25 % | 2 | 2,46 € / 7,37 € |
| provisoire | Llama-3.1-Nemotron-70B-Instruct | NVIDIA | 46,6 | de 38,4 à 54,8 | 12 % | 1 | 0,52 € / 0,52 € |
| provisoire | Gemini 1.5 Pro (May 2024) | Google DeepMind | 46,4 | de 39,3 à 53,4 | 25 % | 2 | inconnu |
| provisoire | GPT-4 Turbo (Apr 2024) | OpenAI | 46,4 | de 39,3 à 53,5 | 38 % | 3 | inconnu |
| provisoire | Mistral Large 2 (Nov 2024) | Mistral AI | 46,4 | de 39,5 à 53,2 | 38 % | 3 | 1,76 € / 5,27 € |
| provisoire | Claude 3 Opus | Anthropic | 45,8 | de 37,8 à 53,9 | 25 % | 2 | 13 € / 66 € |
| provisoire | Gemma 3n E4B | Google DeepMind | 45,8 | de 37,6 à 54,0 | 12 % | 1 | 0,05 € / 0,10 € |
| provisoire | GPT-4o (Nov 2024) | OpenAI | 45,8 | de 37,8 à 53,8 | 25 % | 2 | 2,19 € / 8,78 € |
| provisoire | Qwen2.5-32B | Alibaba | 45,8 | de 38,4 à 53,2 | 12 % | 1 | 0,61 € / 2,46 € |
| provisoire | Grok-2 mini | xAI | 45,6 | de 37,4 à 53,8 | 12 % | 1 | inconnu |
| provisoire | Llama 3.3 70B | Meta AI | 45,6 | de 38,0 à 53,1 | 25 % | 2 | 0,09 € / 0,28 € |
| provisoire | Mistral Small 3.1 | Mistral AI | 45,0 | de 37,8 à 52,3 | 25 % | 2 | 0,09 € / 0,26 € |
| provisoire | GPT-4o mini | OpenAI | 44,8 | de 37,5 à 52,0 | 38 % | 3 | 0,13 € / 0,53 € |
| provisoire | Claude 3.5 Haiku | Anthropic | 44,5 | de 36,8 à 52,3 | 38 % | 3 | 0,70 € / 3,51 € |
| provisoire | Qwen-Turbo | Alibaba | 44,5 | de 36,7 à 52,4 | 12 % | 1 | 0,04 € / 0,18 € |
| provisoire | Tulu 3 (Tülu 3) 70B | Allen Institute for AI | 44,0 | de 36,0 à 52,0 | 12 % | 1 | inconnu |
| provisoire | Mistral Small 3 | Mistral AI | 43,5 | de 35,8 à 51,2 | 25 % | 2 | 0,04 € / 0,07 € |
| provisoire | Llama 3.1-70B | Meta AI | 43,2 | de 35,5 à 51,0 | 25 % | 2 | 0,63 € / 0,63 € |
| provisoire | Amazon Nova Pro | Amazon | 42,4 | de 34,3 à 50,6 | 12 % | 1 | 0,70 € / 2,81 € |
| provisoire | Llama 3.2 90B | Meta AI | 42,2 | de 34,0 à 50,4 | 12 % | 1 | 0,31 € / 0,35 € |
| provisoire | Gemma 3 4B | Google DeepMind | 41,9 | de 33,5 à 50,3 | 25 % | 2 | 0,04 € / 0,09 € |
| provisoire | Llama 3-70B | Meta AI | 41,7 | de 33,7 à 49,6 | 25 % | 2 | inconnu |
| provisoire | Qwen2-72B | Alibaba | 41,7 | de 33,5 à 49,8 | 12 % | 1 | inconnu |
| provisoire | Gemini 1.5 Flash (May 2024) | Google DeepMind | 41,4 | de 33,4 à 49,4 | 25 % | 2 | inconnu |
| provisoire | GPT-4 (Mar 2023) | OpenAI | 41,4 | de 32,6 à 50,2 | 25 % | 2 | 26 € / 53 € |
| provisoire | GPT-4 (Jun 2023) | OpenAI | 41,1 | de 32,7 à 49,6 | 25 % | 2 | inconnu |
| provisoire | Qwen2.5-Coder-32B-Instruct | Alibaba | 40,9 | de 32,7 à 49,0 | 12 % | 1 | 0,25 € / 0,76 € |
| provisoire | Claude 3 Sonnet | Anthropic | 40,3 | de 32,2 à 48,5 | 25 % | 2 | inconnu |
| provisoire | Hermes 2 Theta Llama-3 70B | Nous Research | 40,1 | de 32,2 à 48,0 | 12 % | 1 | inconnu |
| provisoire | Gemma 2 27B | Google DeepMind | 39,6 | de 31,4 à 47,8 | 25 % | 2 | 0,57 € / 0,57 € |
| provisoire | Nemotron-4 340B | NVIDIA | 39,6 | de 31,4 à 47,7 | 12 % | 1 | inconnu |
| provisoire | Claude 2 | Anthropic | 39,3 | de 31,6 à 47,0 | 12 % | 1 | inconnu |
| provisoire | GLM-4 (0520) | Z.ai (Zhipu AI) | 39,0 | de 30,9 à 47,2 | 12 % | 1 | inconnu |
| provisoire | Mistral Large | Mistral AI | 37,7 | de 29,5 à 46,0 | 25 % | 2 | 0,44 € / 1,32 € |
| provisoire | Amazon Nova Lite | Amazon | 37,2 | de 29,1 à 45,3 | 12 % | 1 | 0,05 € / 0,21 € |
| provisoire | Gemini 1.5 Flash 8B | Google DeepMind | 37,2 | de 28,7 à 45,8 | 25 % | 2 | inconnu |
| provisoire | Qwen3-1.7B | Alibaba | 37,2 | de 30,5 à 43,9 | 12 % | 1 | inconnu |
| provisoire | Claude 2.1 | Anthropic | 37,0 | de 30,4 à 43,5 | 12 % | 1 | inconnu |
| provisoire | Qwen2.5-7B | Alibaba | 36,7 | de 30,3 à 43,1 | 12 % | 1 | 0,15 € / 0,61 € |
| provisoire | Claude 3 Haiku | Anthropic | 36,2 | de 28,0 à 44,4 | 25 % | 2 | 0,22 € / 1,10 € |
| provisoire | Gemma 2 9B | Google DeepMind | 34,9 | de 26,7 à 43,0 | 25 % | 2 | inconnu |
| provisoire | Gemini 1.0 Pro | Google DeepMind | 34,6 | de 29,4 à 39,8 | 12 % | 1 | inconnu |
| provisoire | Mixtral 8x22B | Mistral AI | 34,1 | de 26,1 à 42,1 | 12 % | 1 | 1,76 € / 5,27 € |
| provisoire | Amazon Nova Micro | Amazon | 33,8 | de 25,8 à 41,8 | 12 % | 1 | 0,03 € / 0,12 € |
| provisoire | granite-4.0-micro | IBM | 33,8 | de 29,1 à 38,6 | 12 % | 1 | 0,01 € / 0,10 € |
| provisoire | Mistral Medium | Mistral AI | 32,8 | de 24,8 à 40,8 | 12 % | 1 | 1,32 € / 6,58 € |
| provisoire | Ministral 8B | Mistral AI | 32,0 | de 24,0 à 40,0 | 12 % | 1 | 0,09 € / 0,09 € |
| provisoire | Qwen1.5-110B | Alibaba | 32,0 | de 24,0 à 40,0 | 12 % | 1 | inconnu |
| provisoire | Qwen1.5-72B | Alibaba | 30,7 | de 22,8 à 38,6 | 12 % | 1 | inconnu |
| provisoire | Yi-1.5-34B | 01.AI | 30,7 | de 22,8 à 38,6 | 12 % | 1 | inconnu |
| provisoire | GPT-3.5 Turbo (Jan 2024) | OpenAI | 29,4 | de 21,4 à 37,4 | 38 % | 3 | 0,44 € / 1,32 € |
| provisoire | Llama 3.1-8B | Meta AI | 28,1 | de 20,1 à 36,0 | 25 % | 2 | 0,02 € / 0,03 € |
| provisoire | Llama 3-8B | Meta AI | 27,8 | de 19,9 à 35,7 | 25 % | 2 | inconnu |
| provisoire | Mixtral 8x7B | Mistral AI | 27,6 | de 19,7 à 35,4 | 12 % | 1 | 0,61 € / 0,61 € |
| provisoire | GPT-3.5 Turbo (Nov 2023) | OpenAI | 26,5 | de 18,7 à 34,3 | 12 % | 1 | 0,88 € / 1,76 € |
| provisoire | DBRX | Databricks | 25,7 | de 18,0 à 33,5 | 12 % | 1 | inconnu |
| provisoire | Qwen1.5-32B | Alibaba | 25,7 | de 18,0 à 33,5 | 12 % | 1 | inconnu |
| provisoire | Qwen1.5-14B | Alibaba | 22,9 | de 15,2 à 30,5 | 12 % | 1 | inconnu |
| provisoire | phi-3-small 7.4B | Microsoft | 22,1 | de 14,5 à 29,7 | 12 % | 1 | inconnu |
| provisoire | granite-4.0-1b | IBM | 21,8 | de 20,9 à 22,7 | 12 % | 1 | inconnu |
| provisoire | granite-4.0-350m | IBM | 21,8 | de 20,9 à 22,7 | 12 % | 1 | inconnu |
| provisoire | QwQ-32B-Preview | Alibaba | 20,0 | de 12,5 à 27,5 | 12 % | 1 | inconnu |
| provisoire | DeepSeek LLM 67B | DeepSeek | 19,7 | de 12,2 à 27,2 | 25 % | 2 | inconnu |
| provisoire | Yi-34B | 01.AI | 19,2 | de 11,8 à 26,7 | 12 % | 1 | inconnu |
| provisoire | Llama 3.2 3B | Meta AI | 17,6 | de 10,3 à 25,0 | 12 % | 1 | 0,04 € / 0,29 € |
| provisoire | Llama 2-70B | Meta AI | 16,3 | de 9,0 à 23,6 | 25 % | 2 | inconnu |
| provisoire | MPT-30B | MosaicML | 12,7 | de 5,6 à 19,7 | 12 % | 1 | inconnu |
| provisoire | phi-3-mini 3.8B | Microsoft | 12,4 | de 5,4 à 19,5 | 12 % | 1 | inconnu |
| provisoire | Qwen-14B | Alibaba | 12,4 | de 5,4 à 19,5 | 12 % | 1 | inconnu |
| provisoire | Qwen1.5-7B | Alibaba | 12,2 | de 5,1 à 19,2 | 12 % | 1 | inconnu |
| provisoire | Mistral 7B v0.2 | Mistral AI | 11,1 | de 4,2 à 18,1 | 12 % | 1 | 0,14 € / 0,19 € |
| provisoire | Gemma 7B | Google DeepMind | 10,6 | de 3,7 à 17,5 | 12 % | 1 | inconnu |
| provisoire | Mistral 7B v0.3 | Mistral AI | 10,3 | de 10,2 à 10,5 | 12 % | 1 | 0,22 € / 0,22 € |
| provisoire | Llama 2-13B | Meta AI | 8,5 | de 1,7 à 15,3 | 12 % | 1 | inconnu |
| provisoire | Llama 2-7B | Meta AI | 2,2 | de 0,0 à 8,5 | 12 % | 1 | inconnu |
| provisoire | chatglm2-6b | Z.ai (Zhipu AI) | 0,0 | de 0,0 à 0,0 | 12 % | 1 | inconnu |
| provisoire | DeepSeek-R1-Distill-Qwen-1.5B | DeepSeek | 0,0 | de 0,0 à 0,0 | 12 % | 1 | inconnu |
| provisoire | Dolly 2.0-12b | Databricks | 0,0 | de 0,0 à 0,0 | 12 % | 1 | inconnu |
| provisoire | Gemma 2B | Google DeepMind | 0,0 | de 0,0 à 3,1 | 12 % | 1 | inconnu |
| provisoire | Gemma 3 1B | Google DeepMind | 0,0 | de 0,0 à 0,0 | 12 % | 1 | inconnu |
| provisoire | Llama 3.2 1B | Meta AI | 0,0 | de 0,0 à 6,1 | 25 % | 2 | 0,02 € / 0,18 € |
| provisoire | LLaMA-13B | Meta AI | 0,0 | de 0,0 à 0,0 | 12 % | 1 | inconnu |
| provisoire | MPT-7B | MosaicML | 0,0 | de 0,0 à 2,0 | 12 % | 1 | inconnu |
| provisoire | stablelm-tuned-alpha-7b | Stability AI | 0,0 | de 0,0 à 0,0 | 12 % | 1 | inconnu |

## Ce qui compose le score

Le score Maths agrège 8 benchmarks, chacun pesé ci-dessous. 3 benchmarks archivés ne comptent plus. La tâche pèse 10 % du score général.

- Arena, questions de maths : 12,5 % du score de la tâche (actif)
- FrontierMath Erdős : 12,5 % du score de la tâche (actif)
- FrontierMath, palier 4 (v2) : 12,5 % du score de la tâche (saturé)
- FrontierMath, palier 4 (version 2025) : 12,5 % du score de la tâche (actif)
- FrontierMath, paliers 1 à 3 (v2) : 12,5 % du score de la tâche (actif)
- FrontierMath, paliers 1 à 3 (version 2025) : 12,5 % du score de la tâche (actif)
- OTIS Mock AIME 2024-2025 : 12,5 % du score de la tâche (saturé)
- ProofBench : 12,5 % du score de la tâche (saturé)

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
