Classement · édition du
Classement des modèles de langage, Agents
Quel modèle mène le mieux une tâche longue, en autonomie ?
Comment lire ce tableauComment lire ?
Le score Agents résume les résultats d'un modèle sur les benchmarks d'agents où il a été mesuré. L'échelle est celle du score général : 100 correspond au meilleur modèle au lancement du site, 50 à GPT-4o de fin 2024. La barre indique la marge d'erreur : deux modèles dont les barres se chevauchent sont ex æquo.
Dans l'édition du 28 septembre 2026, GPT-6 Astra (OpenAI) est premier pour les agents avec un score Agents de 99,9, ex æquo avec 3 autres modèles dont Claude Fable 5.1 et Claude Opus 5.
| Rang | Empreinte | Modèle | Étiquettes | Score et marge (50 à 110) | Couverture | Semaine | Prix, € / M jetons |
|---|---|---|---|---|---|---|---|
| Sans rang | Claude Sonnet 5.5PROVISOIREAnthropic | 100,994,9 à 106,9 | 11 % · 1 mesure | Entrée | 2 € / 10 € | ||
| Sans rang | Claude Opus 5.5PROVISOIREAnthropic | 100,197,5 à 102,7 | 22 % · 2 mesures | Entrée | 4 € / 20 € | ||
| EX ÆQUO · RANG 1L'écart entre ces modèles est plus petit que la marge d'erreur. | |||||||
| 1 | GPT-6 AstraNOUVEAUOpenAI | 99,996,5 à 103,3 | 56 % · 5 mesures | Entrée | 8,78 € / 44 € | ||
| Sans rang | Claude Mythos PreviewPROVISOIREAnthropic | 99,190,9 à 107,2 | 11 % · 1 mesure | Inconnu | |||
| 2 | Claude Fable 5.1NOUVEAUAnthropic | 96,794,2 à 99,3 | 44 % · 4 mesures | Entrée | 8,78 € / 44 € | ||
| Sans rang | GPT-6 SolPROVISOIREOpenAI | 96,093,6 à 98,3 | 11 % · 1 mesure | Entrée | 2 € / 10 € | ||
| 3 | Claude Opus 5Anthropic | 94,993,0 à 96,9 | 67 % · 6 mesures | 4,39 € / 22 € | |||
| 4 | Claude Fable 5Anthropic | 93,991,1 à 96,7 | 56 % · 5 mesures | 8,78 € / 44 € | |||
| Sans rang | Gemini 3.7 FlashPROVISOIREGoogle DeepMind | 93,987,8 à 100,0 | 22 % · 2 mesures | 1,50 € / 7,50 € | |||
| GROUPE 2Ex æquo · 7 modèles | |||||||
| 5 | GPT-5.6 SolOpenAI | 93,691,1 à 96,1 | 67 % · 6 mesures | 3,51 € / 18 € | |||
| Sans rang | Gemini 3.8 FlashPROVISOIREGoogle DeepMind | 93,387,4 à 99,3 | 22 % · 2 mesures | Entrée | 1,50 € / 7,50 € | ||
| Sans rang | Grok 4.6PROVISOIRExAI | 91,888,6 à 94,9 | 33 % · 3 mesures | 1,76 € / 5,27 € | |||
| Sans rang | Muse Spark 1.3PROVISOIREMeta AI | 91,586,6 à 96,4 | 11 % · 1 mesure | Entrée | 1,25 € / 4,25 € | ||
| Sans rang | GPT-5.6 TerraPROVISOIREOpenAI | 91,086,5 à 95,5 | 33 % · 3 mesures | 2,17 € / 13 € | |||
| 6 | GPT-5.5OpenAI | 90,788,1 à 93,3 | 78 % · 7 mesures | 4,34 € / 26 € | |||
| Sans rang | GLM-5.3PROVISOIREZ.ai (Zhipu AI) | 90,786,1 à 95,4 | 22 % · 2 mesures | 1,40 € / 4,40 € | |||
| 7 | Claude Opus 4.8Anthropic | 90,287,7 à 92,7 | 78 % · 7 mesures | 4,39 € / 22 € | |||
| Sans rang | Claude Sonnet 5PROVISOIREAnthropic | 89,785,1 à 94,2 | 22 % · 2 mesures | 1,73 € / 8,67 € | |||
| Sans rang | GLM-5.3-FlashPROVISOIREZ.ai (Zhipu AI) | 88,984,1 à 93,8 | 11 % · 1 mesure | 0,15 € / 0,50 € | |||
| Sans rang | Grok 4.5PROVISOIRExAI | 88,984,1 à 93,7 | 33 % · 3 mesures | 1,76 € / 5,27 € | |||
| Sans rang | Kimi K3PROVISOIREMoonshot | 88,984,6 à 93,2 | 33 % · 3 mesures | 2,60 € / 13 € | |||
| 8 | Claude Opus 4.7Anthropic | 88,485,7 à 91,1 | 56 % · 5 mesures | 4,39 € / 22 € | |||
| 9 | GPT-5.4OpenAI | 88,484,6 à 92,2 | 67 % · 6 mesures | 2,17 € / 13 € | |||
| 10 | GPT-5.2OpenAI | 88,183,4 à 92,8 | 56 % · 5 mesures | 1,52 € / 12 € | |||
| Sans rang | Muse Spark 1.1PROVISOIREMeta AI | 87,980,1 à 95,6 | 11 % · 1 mesure | 1,10 € / 3,73 € | |||
| 11 | Gemini 3 ProGoogle DeepMind | 86,880,1 à 93,5 | 56 % · 5 mesures | 1,73 € / 10 € | |||
| Sans rang | DeepSeek V4 Pro 0813PROVISOIREDeepSeek | 86,882,0 à 91,7 | 11 % · 1 mesure | 0,61 € / 1,82 € | |||
| GROUPE 3Ex æquo · 6 modèles | |||||||
| 12 | Claude Opus 4.6Anthropic | 86,683,1 à 90,1 | 67 % · 6 mesures | 4,39 € / 22 € | |||
| Sans rang | Gemini 3.6 FlashPROVISOIREGoogle DeepMind | 86,681,7 à 91,4 | 11 % · 1 mesure | 1,30 € / 6,50 € | |||
| Sans rang | GPT-5.3 CodexPROVISOIREOpenAI | 86,379,3 à 93,3 | 22 % · 2 mesures | 1,54 € / 12 € | |||
| Sans rang | Grok 4.20PROVISOIRExAI | 86,378,5 à 94,0 | 11 % · 1 mesure | 1,08 € / 2,17 € | |||
| Sans rang | GLM-5.2PROVISOIREZ.ai (Zhipu AI) | 85,880,3 à 91,2 | 33 % · 3 mesures | 0,98 € / 3,08 € | |||
| 13 | Claude Sonnet 4.6Anthropic | 85,581,1 à 89,9 | 44 % · 4 mesures | 2,63 € / 13 € | |||
| 14 | Claude Opus 4.5Anthropic | 85,280,8 à 89,7 | 67 % · 6 mesures | 4,39 € / 22 € | |||
| Sans rang | Qwen 3.6 Max (Preview)PROVISOIREAlibaba | 85,277,5 à 93,0 | 11 % · 1 mesure | 1,14 € / 6,85 € | |||
| Sans rang | DeepSeek-V4-ProPROVISOIREDeepSeek | 85,077,2 à 92,7 | 11 % · 1 mesure | 0,38 € / 0,75 € | |||
| Sans rang | Qwen 3.6 PlusPROVISOIREAlibaba | 85,077,2 à 92,7 | 11 % · 1 mesure | 0,28 € / 1,69 € | |||
| 15 | Gemini 3.1 ProGoogle DeepMind | 84,780,8 à 88,6 | 78 % · 7 mesures | 2 € / 12 € | |||
| Sans rang | Gemini 3 FlashPROVISOIREGoogle DeepMind | 84,777,9 à 91,5 | 33 % · 3 mesures | 0,43 € / 2,60 € | |||
| Sans rang | GPT-5.6 LunaPROVISOIREOpenAI | 84,777,3 à 92,1 | 22 % · 2 mesures | 0,87 € / 5,20 € | |||
| Sans rang | GLM-5.1PROVISOIREZ.ai (Zhipu AI) | 84,279,1 à 89,3 | 22 % · 2 mesures | 0,85 € / 2,67 € | |||
| Sans rang | GLM-5PROVISOIREZ.ai (Zhipu AI) | 83,775,9 à 91,4 | 11 % · 1 mesure | 0,52 € / 1,66 € | |||
| Sans rang | Qwen3.7-MaxPROVISOIREAlibaba | 83,778,0 à 89,4 | 11 % · 1 mesure | 1,08 € / 3,25 € | |||
| Sans rang | Kimi K2.7 CodePROVISOIREMoonshot | 82,977,4 à 88,4 | 22 % · 2 mesures | 0,83 € / 3,51 € | |||
| Sans rang | MiniMax-M3PROVISOIREMiniMax | 82,177,6 à 86,7 | 33 % · 3 mesures | 0,24 € / 0,97 € | |||
| Sans rang | Kimi K2.6PROVISOIREMoonshot | 81,975,2 à 88,5 | 33 % · 3 mesures | 0,59 € / 2,96 € | |||
| Sans rang | Muse Spark 1.2PROVISOIREMeta AI | 81,976,8 à 87,0 | 11 % · 1 mesure | 1,25 € / 4,25 € | |||
| Sans rang | GLM-4.7PROVISOIREZ.ai (Zhipu AI) | 81,673,8 à 89,4 | 11 % · 1 mesure | 0,35 € / 1,52 € | |||
| Sans rang | GPT-5.1PROVISOIREOpenAI | 81,673,1 à 90,1 | 22 % · 2 mesures | 1,08 € / 8,67 € | |||
| Sans rang | GPT-5.1-Codex-MaxPROVISOIREOpenAI | 81,373,5 à 89,2 | 11 % · 1 mesure | 1,10 € / 8,78 € | |||
| Sans rang | Kimi K2.5PROVISOIREMoonshot | 81,373,5 à 89,1 | 11 % · 1 mesure | 0,35 € / 1,65 € | |||
| 16 | Claude Sonnet 4.5Anthropic | 80,673,9 à 87,2 | 56 % · 5 mesures | 2,60 € / 13 € | |||
| Sans rang | Gemini 3.5 FlashPROVISOIREGoogle DeepMind | 79,873,7 à 85,8 | 33 % · 3 mesures | 1,30 € / 7,80 € | |||
| Sans rang | InklingPROVISOIREThinking Machines | 79,874,5 à 85,1 | 11 % · 1 mesure | 0,95 € / 4,05 € | |||
| Sans rang | Grok 4.1 FastPROVISOIRExAI | 79,271,4 à 87,1 | 11 % · 1 mesure | 0,17 € / 0,43 € | |||
| Sans rang | Claude Opus 4.1PROVISOIREAnthropic | 79,071,7 à 86,2 | 33 % · 3 mesures | 13 € / 66 € | |||
| Sans rang | DeepSeek-V3.2-ExpPROVISOIREDeepSeek | 79,071,2 à 86,8 | 11 % · 1 mesure | 0,25 € / 0,38 € | |||
| 17 | GPT-5OpenAI | 78,568,9 à 88,0 | 56 % · 5 mesures | 1,08 € / 8,67 € | |||
| Sans rang | Qwen3.7-PlusPROVISOIREAlibaba | 78,270,4 à 86,0 | 11 % · 1 mesure | 0,28 € / 1,11 € | |||
| Sans rang | Grok 4PROVISOIRExAI | 77,771,1 à 84,3 | 33 % · 3 mesures | 2,63 € / 13 € | |||
| Sans rang | o3PROVISOIREOpenAI | 76,468,8 à 83,9 | 22 % · 2 mesures | 1,76 € / 7,02 € | |||
| Sans rang | Qwen 3.5 Flash (hosted 35B-A3B)PROVISOIREAlibaba | 76,468,5 à 84,2 | 11 % · 1 mesure | 0,09 € / 0,35 € | |||
| Sans rang | Gemini 2.5 Pro (Mar 2025)PROVISOIREGoogle DeepMind | 75,667,7 à 83,5 | 11 % · 1 mesure | 2,19 € / 8,78 € | |||
| Sans rang | Qwen3.5 397B-A17BPROVISOIREAlibaba | 75,369,4 à 81,3 | 11 % · 1 mesure | 0,34 € / 2,03 € | |||
| Sans rang | Qwen3.5-27BPROVISOIREAlibaba | 75,367,4 à 83,2 | 11 % · 1 mesure | 0,26 € / 2,11 € | |||
| Sans rang | o4-miniPROVISOIREOpenAI | 74,567,0 à 82,1 | 11 % · 1 mesure | 0,95 € / 3,82 € | |||
| Sans rang | Claude Opus 4PROVISOIREAnthropic | 74,366,8 à 81,7 | 22 % · 2 mesures | 13 € / 66 € | |||
| Sans rang | GPT-5.4 MiniPROVISOIREOpenAI | 74,068,3 à 79,8 | 11 % · 1 mesure | 0,65 € / 3,90 € | |||
| Sans rang | Grok 4.3 BetaPROVISOIRExAI | 73,265,3 à 81,2 | 11 % · 1 mesure | 1,08 € / 2,17 € | |||
| Sans rang | Claude Sonnet 4PROVISOIREAnthropic | 72,765,3 à 80,1 | 22 % · 2 mesures | 2,60 € / 13 € | |||
| Sans rang | Gemini 2.5 Flash (Jun 2025)PROVISOIREGoogle DeepMind | 72,763,4 à 82,0 | 22 % · 2 mesures | 0,26 € / 2,17 € | |||
| GROUPE 4Un seul modèle dans ce groupe | |||||||
| 18 | Gemini 2.5 Pro (Jun 2025)Google DeepMind | 72,563,6 à 81,3 | 44 % · 4 mesures | 1,10 € / 8,78 € | |||
| Sans rang | Qwen3-MaxPROVISOIREAlibaba | 72,564,5 à 80,4 | 11 % · 1 mesure | 0,68 € / 3,38 € | |||
| Sans rang | Claude Haiku 4.5PROVISOIREAnthropic | 71,962,5 à 81,4 | 33 % · 3 mesures | 0,88 € / 4,39 € | |||
| Sans rang | MiniMax-M2PROVISOIREMiniMax | 71,964,0 à 79,9 | 11 % · 1 mesure | 0,22 € / 0,87 € | |||
| Sans rang | Kimi K2 ThinkingPROVISOIREMoonshot | 71,463,9 à 78,9 | 11 % · 1 mesure | 0,52 € / 2,17 € | |||
| Sans rang | Claude 3.7 SonnetPROVISOIREAnthropic | 70,162,7 à 77,5 | 22 % · 2 mesures | 2,63 € / 13 € | |||
| Sans rang | Gemini 3.1 Flash-LitePROVISOIREGoogle DeepMind | 68,863,1 à 74,5 | 11 % · 1 mesure | 0,22 € / 1,30 € | |||
| Sans rang | DeepSeek-R1PROVISOIREDeepSeek | 65,158,3 à 72,0 | 22 % · 2 mesures | Inconnu | |||
| Sans rang | DeepSeek-R1 (May 2025)PROVISOIREDeepSeek | 65,157,2 à 73,1 | 22 % · 2 mesures | 0,43 € / 1,86 € | |||
| Sans rang | o1PROVISOIREOpenAI | 64,657,3 à 72,0 | 11 % · 1 mesure | 13 € / 53 € | |||
| Sans rang | Qwen 3.5 Plus (hosted 397B-A17B)PROVISOIREAlibaba | 64,656,5 à 72,8 | 11 % · 1 mesure | 0,35 € / 2,11 € | |||
| Sans rang | Grok 3PROVISOIRExAI | 63,355,2 à 71,5 | 11 % · 1 mesure | 2,63 € / 13 € | |||
| Sans rang | DeepSeek-V3 (Mar 2025)PROVISOIREDeepSeek | 61,854,4 à 69,1 | 11 % · 1 mesure | 0,17 € / 0,67 € | |||
| Sans rang | GPT-4o (May 2024)PROVISOIREOpenAI | 60,252,0 à 68,4 | 11 % · 1 mesure | 4,39 € / 13 € | |||
| Sans rang | Claude 3.5 Sonnet (October 2024)PROVISOIREAnthropic | 59,452,0 à 66,9 | 22 % · 2 mesures | Inconnu | |||
| Sans rang | o1-previewPROVISOIREOpenAI | 58,451,0 à 65,7 | 11 % · 1 mesure | Inconnu | |||
| Sans rang | DeepSeek-V3PROVISOIREDeepSeek | 58,150,7 à 65,5 | 11 % · 1 mesure | Inconnu | |||
| Sans rang | Reka Flash 3PROVISOIREReka AI | 57,849,6 à 66,1 | 11 % · 1 mesure | 0,09 € / 0,18 € | |||
| Sans rang | gpt-oss-120bPROVISOIREOpenAI | 57,642,7 à 72,5 | 33 % · 3 mesures | 0,03 € / 0,16 € | |||
| Sans rang | DeepSeek-R1-Distill-Qwen-32BPROVISOIREDeepSeek | 54,746,5 à 62,9 | 11 % · 1 mesure | 0,25 € / 0,76 € | |||
| Sans rang | Claude 3.5 SonnetPROVISOIREAnthropic | 53,946,5 à 61,4 | 11 % · 1 mesure | 2,63 € / 13 € | |||
| Sans rang | Llama 3.1-70BPROVISOIREMeta AI | 53,745,4 à 61,9 | 11 % · 1 mesure | 0,63 € / 0,63 € | |||
| Sans rang | Gemini 1.5 Pro (Sept 2024)PROVISOIREGoogle DeepMind | 52,944,7 à 61,1 | 11 % · 1 mesure | Inconnu | |||
| Sans rang | GPT-4o (Nov 2024)PROVISOIREOpenAI | 52,645,1 à 60,1 | 11 % · 1 mesure | 2,19 € / 8,78 € | |||
| Sans rang | Llama 3.2 90BPROVISOIREMeta AI | 52,143,9 à 60,3 | 11 % · 1 mesure | 0,31 € / 0,35 € | |||
| Sans rang | Llama 3.3 70BPROVISOIREMeta AI | 51,643,4 à 59,8 | 11 % · 1 mesure | 0,09 € / 0,28 € | |||
| Sans rang | GPT-5 miniPROVISOIREOpenAI | 51,343,1 à 59,5 | 11 % · 1 mesure | 0,22 € / 1,73 € | |||
| Sans rang | MiniMax-M2.5PROVISOIREMiniMax | 51,343,1 à 59,5 | 11 % · 1 mesure | 0,13 € / 1 € | |||
| Sans rang | GPT-4 Turbo (Apr 2024)PROVISOIREOpenAI | 50,042,5 à 57,6 | 11 % · 1 mesure | Inconnu | |||
| Sans rang | Qwen3-235B-A22B-Thinking (Jul 2025)PROVISOIREAlibaba | 49,541,4 à 57,6 | 11 % · 1 mesure | 0,26 € / 2,55 € | |||
| Sans rang | GPT-4 Turbo (Nov 2023)PROVISOIREOpenAI | 48,741,1 à 56,3 | 11 % · 1 mesure | 8,78 € / 26 € | |||
| Sans rang | GPT-4o (Aug 2024)PROVISOIREOpenAI | 48,240,6 à 55,8 | 11 % · 1 mesure | 2,19 € / 8,78 € | |||
| Sans rang | Claude 3.5 HaikuPROVISOIREAnthropic | 47,939,8 à 56,1 | 11 % · 1 mesure | 0,70 € / 3,51 € | |||
| Sans rang | Qwen2.5-72BPROVISOIREAlibaba | 47,940,3 à 55,5 | 22 % · 2 mesures | 2,46 € / 7,37 € | |||
| Sans rang | GPT-4 (Mar 2023)PROVISOIREOpenAI | 47,439,7 à 55,1 | 11 % · 1 mesure | 26 € / 53 € | |||
| Sans rang | Claude 3 OpusPROVISOIREAnthropic | 45,037,3 à 52,8 | 11 % · 1 mesure | 13 € / 66 € | |||
| Sans rang | GPT-4o miniPROVISOIREOpenAI | 45,037,0 à 53,1 | 11 % · 1 mesure | 0,13 € / 0,53 € | |||
| Sans rang | Gemini 1.5 Flash (Sep 2024)PROVISOIREGoogle DeepMind | 44,836,7 à 52,8 | 11 % · 1 mesure | Inconnu | |||
| Sans rang | Llama 3.2 11BPROVISOIREMeta AI | 43,035,0 à 50,9 | 11 % · 1 mesure | 0,04 € / 0,59 € | |||
| Sans rang | GPT-4 (Jun 2023)PROVISOIREOpenAI | 42,434,6 à 50,3 | 11 % · 1 mesure | Inconnu | |||
| Sans rang | Qwen2-72BPROVISOIREAlibaba | 41,934,0 à 49,8 | 11 % · 1 mesure | Inconnu | |||
| Sans rang | Phi-4PROVISOIREMicrosoft | 40,332,5 à 48,2 | 11 % · 1 mesure | 0,06 € / 0,12 € | |||
| Sans rang | Mistral NeMoPROVISOIREMistral AI | 38,530,8 à 46,2 | 11 % · 1 mesure | 0,13 € / 0,13 € | |||
| Sans rang | Qwen2-VL-72B-InstructPROVISOIREAlibaba | 35,728,2 à 43,1 | 11 % · 1 mesure | Inconnu | |||
| Sans rang | GPT-3.5 Turbo InstructPROVISOIREOpenAI | 33,625,4 à 41,7 | 11 % · 1 mesure | 1,32 € / 1,76 € | |||
| Sans rang | Qwen2.5-7BPROVISOIREAlibaba | 32,825,6 à 40,0 | 11 % · 1 mesure | 0,15 € / 0,61 € | |||
| Sans rang | Llama 3.1-8BPROVISOIREMeta AI | 31,524,4 à 38,6 | 11 % · 1 mesure | 0,02 € / 0,03 € | |||
| Sans rang | GPT-3 175B (davinci)PROVISOIREOpenAI | 26,518,3 à 34,7 | 11 % · 1 mesure | Inconnu | |||
| Sans rang | Qwen2-VL-7B-InstructPROVISOIREAlibaba | 21,615,6 à 27,5 | 11 % · 1 mesure | Inconnu | |||
| Sans rang | Llama 3.2 3BPROVISOIREMeta AI | 17,412,0 à 22,8 | 11 % · 1 mesure | 0,04 € / 0,29 € | |||
| Sans rang | GPT-2 (1.5B)PROVISOIREOpenAI | 16,99,2 à 24,5 | 11 % · 1 mesure | Inconnu | |||
| Sans rang | Llama 3.2 1BPROVISOIREMeta AI | 0,00,0 à 0,3 | 11 % · 1 mesure | 0,02 € / 0,18 € | |||
Aucun modèle ne correspond à ces filtres.
18 modèles classés et 105 provisoires. La colonne Semaine se remplit à partir de la deuxième édition.
Ce qui compose le score
La démarche →Le score Agents agrège 9 benchmarks, chacun pesé ci-dessous. 3 benchmarks archivés ne comptent plus. La tâche pèse 15 % du score général.
- Actif11,1 %APEX-Agents
- Actif11,1 %BALROG
- Actif11,1 %DeepResearch Bench
- Actif11,1 %EBR-bench (Earthborne Rangers)
- Actif11,1 %METR Time Horizons (taux de réussite)
- Actif11,1 %OSWorld 2.0
- Actif11,1 %PostTrainBench
- Actif11,1 %Remote Labor Index
- Actif11,1 %Vending-Bench 2
Voir aussi : classement général, modèles ouverts, modèles locaux, rapport qualité-prix et votre classement, selon vos priorités.