# Classement Agents des modèles de langage

> Dans l'édition du 28 septembre 2026, GPT-6 Astra (OpenAI) est premier pour les agents avec un score Agents de 99,9, ex æquo avec 3 autres modèles dont Claude Fable 5.1 et Claude Opus 5. La marge du premier va de 96,5 à 103,3 ; deux modèles dont les marges se recouvrent sont ex æquo. 18 modèles sont classés, 105 autres ont un score provisoire.

Page : https://quelleia.com/classement/agents/
Édition : 2026-W40, 28 septembre 2026
Question : Quel modèle mène le mieux une tâche longue, en autonomie ?

## Comment lire ce classement

Le score Agents résume les résultats d'un modèle sur les benchmarks d'agents où il a été mesuré. L'échelle est celle du score général : 100 correspond au meilleur modèle au lancement du site, 50 à GPT-4o de fin 2024. La barre indique la marge d'erreur : deux modèles dont les barres se chevauchent sont ex æquo.

## Modèles classés (18)

| Rang | Modèle | Éditeur | Score | Marge à 90 % | Couverture | Mesures | Prix entrée / sortie (€ par million de jetons) |
| --- | --- | --- | --- | --- | --- | --- | --- |
| 1 | GPT-6 Astra | OpenAI | 99,9 | de 96,5 à 103,3 | 56 % | 5 | 8,78 € / 44 € |
| 2 | Claude Fable 5.1 | Anthropic | 96,7 | de 94,2 à 99,3 | 44 % | 4 | 8,78 € / 44 € |
| 3 | Claude Opus 5 | Anthropic | 94,9 | de 93,0 à 96,9 | 67 % | 6 | 4,39 € / 22 € |
| 4 | Claude Fable 5 | Anthropic | 93,9 | de 91,1 à 96,7 | 56 % | 5 | 8,78 € / 44 € |
| 5 | GPT-5.6 Sol | OpenAI | 93,6 | de 91,1 à 96,1 | 67 % | 6 | 3,51 € / 18 € |
| 6 | GPT-5.5 | OpenAI | 90,7 | de 88,1 à 93,3 | 78 % | 7 | 4,34 € / 26 € |
| 7 | Claude Opus 4.8 | Anthropic | 90,2 | de 87,7 à 92,7 | 78 % | 7 | 4,39 € / 22 € |
| 8 | Claude Opus 4.7 | Anthropic | 88,4 | de 85,7 à 91,1 | 56 % | 5 | 4,39 € / 22 € |
| 9 | GPT-5.4 | OpenAI | 88,4 | de 84,6 à 92,2 | 67 % | 6 | 2,17 € / 13 € |
| 10 | GPT-5.2 | OpenAI | 88,1 | de 83,4 à 92,8 | 56 % | 5 | 1,52 € / 12 € |
| 11 | Gemini 3 Pro | Google DeepMind | 86,8 | de 80,1 à 93,5 | 56 % | 5 | 1,73 € / 10 € |
| 12 | Claude Opus 4.6 | Anthropic | 86,6 | de 83,1 à 90,1 | 67 % | 6 | 4,39 € / 22 € |
| 13 | Claude Sonnet 4.6 | Anthropic | 85,5 | de 81,1 à 89,9 | 44 % | 4 | 2,63 € / 13 € |
| 14 | Claude Opus 4.5 | Anthropic | 85,2 | de 80,8 à 89,7 | 67 % | 6 | 4,39 € / 22 € |
| 15 | Gemini 3.1 Pro | Google DeepMind | 84,7 | de 80,8 à 88,6 | 78 % | 7 | 2 € / 12 € |
| 16 | Claude Sonnet 4.5 | Anthropic | 80,6 | de 73,9 à 87,2 | 56 % | 5 | 2,60 € / 13 € |
| 17 | GPT-5 | OpenAI | 78,5 | de 68,9 à 88,0 | 56 % | 5 | 1,08 € / 8,67 € |
| 18 | Gemini 2.5 Pro (Jun 2025) | Google DeepMind | 72,5 | de 63,6 à 81,3 | 44 % | 4 | 1,10 € / 8,78 € |

## Scores provisoires (105)

Ces modèles n'ont pas encore assez de mesures pour recevoir un rang. Ils sont listés du score le plus haut au plus bas.

| Rang | Modèle | Éditeur | Score | Marge à 90 % | Couverture | Mesures | Prix entrée / sortie (€ par million de jetons) |
| --- | --- | --- | --- | --- | --- | --- | --- |
| provisoire | Claude Sonnet 5.5 | Anthropic | 100,9 | de 94,9 à 106,9 | 11 % | 1 | 2 € / 10 € |
| provisoire | Claude Opus 5.5 | Anthropic | 100,1 | de 97,5 à 102,7 | 22 % | 2 | 4 € / 20 € |
| provisoire | Claude Mythos Preview | Anthropic | 99,1 | de 90,9 à 107,2 | 11 % | 1 | inconnu |
| provisoire | GPT-6 Sol | OpenAI | 96,0 | de 93,6 à 98,3 | 11 % | 1 | 2 € / 10 € |
| provisoire | Gemini 3.7 Flash | Google DeepMind | 93,9 | de 87,8 à 100,0 | 22 % | 2 | 1,50 € / 7,50 € |
| provisoire | Gemini 3.8 Flash | Google DeepMind | 93,3 | de 87,4 à 99,3 | 22 % | 2 | 1,50 € / 7,50 € |
| provisoire | Grok 4.6 | xAI | 91,8 | de 88,6 à 94,9 | 33 % | 3 | 1,76 € / 5,27 € |
| provisoire | Muse Spark 1.3 | Meta AI | 91,5 | de 86,6 à 96,4 | 11 % | 1 | 1,25 € / 4,25 € |
| provisoire | GPT-5.6 Terra | OpenAI | 91,0 | de 86,5 à 95,5 | 33 % | 3 | 2,17 € / 13 € |
| provisoire | GLM-5.3 | Z.ai (Zhipu AI) | 90,7 | de 86,1 à 95,4 | 22 % | 2 | 1,40 € / 4,40 € |
| provisoire | Claude Sonnet 5 | Anthropic | 89,7 | de 85,1 à 94,2 | 22 % | 2 | 1,73 € / 8,67 € |
| provisoire | GLM-5.3-Flash | Z.ai (Zhipu AI) | 88,9 | de 84,1 à 93,8 | 11 % | 1 | 0,15 € / 0,50 € |
| provisoire | Grok 4.5 | xAI | 88,9 | de 84,1 à 93,7 | 33 % | 3 | 1,76 € / 5,27 € |
| provisoire | Kimi K3 | Moonshot | 88,9 | de 84,6 à 93,2 | 33 % | 3 | 2,60 € / 13 € |
| provisoire | Muse Spark 1.1 | Meta AI | 87,9 | de 80,1 à 95,6 | 11 % | 1 | 1,10 € / 3,73 € |
| provisoire | DeepSeek V4 Pro 0813 | DeepSeek | 86,8 | de 82,0 à 91,7 | 11 % | 1 | 0,61 € / 1,82 € |
| provisoire | Gemini 3.6 Flash | Google DeepMind | 86,6 | de 81,7 à 91,4 | 11 % | 1 | 1,30 € / 6,50 € |
| provisoire | GPT-5.3 Codex | OpenAI | 86,3 | de 79,3 à 93,3 | 22 % | 2 | 1,54 € / 12 € |
| provisoire | Grok 4.20 | xAI | 86,3 | de 78,5 à 94,0 | 11 % | 1 | 1,08 € / 2,17 € |
| provisoire | GLM-5.2 | Z.ai (Zhipu AI) | 85,8 | de 80,3 à 91,2 | 33 % | 3 | 0,98 € / 3,08 € |
| provisoire | Qwen 3.6 Max (Preview) | Alibaba | 85,2 | de 77,5 à 93,0 | 11 % | 1 | 1,14 € / 6,85 € |
| provisoire | DeepSeek-V4-Pro | DeepSeek | 85,0 | de 77,2 à 92,7 | 11 % | 1 | 0,38 € / 0,75 € |
| provisoire | Qwen 3.6 Plus | Alibaba | 85,0 | de 77,2 à 92,7 | 11 % | 1 | 0,28 € / 1,69 € |
| provisoire | Gemini 3 Flash | Google DeepMind | 84,7 | de 77,9 à 91,5 | 33 % | 3 | 0,43 € / 2,60 € |
| provisoire | GPT-5.6 Luna | OpenAI | 84,7 | de 77,3 à 92,1 | 22 % | 2 | 0,87 € / 5,20 € |
| provisoire | GLM-5.1 | Z.ai (Zhipu AI) | 84,2 | de 79,1 à 89,3 | 22 % | 2 | 0,85 € / 2,67 € |
| provisoire | GLM-5 | Z.ai (Zhipu AI) | 83,7 | de 75,9 à 91,4 | 11 % | 1 | 0,52 € / 1,66 € |
| provisoire | Qwen3.7-Max | Alibaba | 83,7 | de 78,0 à 89,4 | 11 % | 1 | 1,08 € / 3,25 € |
| provisoire | Kimi K2.7 Code | Moonshot | 82,9 | de 77,4 à 88,4 | 22 % | 2 | 0,83 € / 3,51 € |
| provisoire | MiniMax-M3 | MiniMax | 82,1 | de 77,6 à 86,7 | 33 % | 3 | 0,24 € / 0,97 € |
| provisoire | Kimi K2.6 | Moonshot | 81,9 | de 75,2 à 88,5 | 33 % | 3 | 0,59 € / 2,96 € |
| provisoire | Muse Spark 1.2 | Meta AI | 81,9 | de 76,8 à 87,0 | 11 % | 1 | 1,25 € / 4,25 € |
| provisoire | GLM-4.7 | Z.ai (Zhipu AI) | 81,6 | de 73,8 à 89,4 | 11 % | 1 | 0,35 € / 1,52 € |
| provisoire | GPT-5.1 | OpenAI | 81,6 | de 73,1 à 90,1 | 22 % | 2 | 1,08 € / 8,67 € |
| provisoire | GPT-5.1-Codex-Max | OpenAI | 81,3 | de 73,5 à 89,2 | 11 % | 1 | 1,10 € / 8,78 € |
| provisoire | Kimi K2.5 | Moonshot | 81,3 | de 73,5 à 89,1 | 11 % | 1 | 0,35 € / 1,65 € |
| provisoire | Gemini 3.5 Flash | Google DeepMind | 79,8 | de 73,7 à 85,8 | 33 % | 3 | 1,30 € / 7,80 € |
| provisoire | Inkling | Thinking Machines | 79,8 | de 74,5 à 85,1 | 11 % | 1 | 0,95 € / 4,05 € |
| provisoire | Grok 4.1 Fast | xAI | 79,2 | de 71,4 à 87,1 | 11 % | 1 | 0,17 € / 0,43 € |
| provisoire | Claude Opus 4.1 | Anthropic | 79,0 | de 71,7 à 86,2 | 33 % | 3 | 13 € / 66 € |
| provisoire | DeepSeek-V3.2-Exp | DeepSeek | 79,0 | de 71,2 à 86,8 | 11 % | 1 | 0,25 € / 0,38 € |
| provisoire | Qwen3.7-Plus | Alibaba | 78,2 | de 70,4 à 86,0 | 11 % | 1 | 0,28 € / 1,11 € |
| provisoire | Grok 4 | xAI | 77,7 | de 71,1 à 84,3 | 33 % | 3 | 2,63 € / 13 € |
| provisoire | o3 | OpenAI | 76,4 | de 68,8 à 83,9 | 22 % | 2 | 1,76 € / 7,02 € |
| provisoire | Qwen 3.5 Flash (hosted 35B-A3B) | Alibaba | 76,4 | de 68,5 à 84,2 | 11 % | 1 | 0,09 € / 0,35 € |
| provisoire | Gemini 2.5 Pro (Mar 2025) | Google DeepMind | 75,6 | de 67,7 à 83,5 | 11 % | 1 | 2,19 € / 8,78 € |
| provisoire | Qwen3.5 397B-A17B | Alibaba | 75,3 | de 69,4 à 81,3 | 11 % | 1 | 0,34 € / 2,03 € |
| provisoire | Qwen3.5-27B | Alibaba | 75,3 | de 67,4 à 83,2 | 11 % | 1 | 0,26 € / 2,11 € |
| provisoire | o4-mini | OpenAI | 74,5 | de 67,0 à 82,1 | 11 % | 1 | 0,95 € / 3,82 € |
| provisoire | Claude Opus 4 | Anthropic | 74,3 | de 66,8 à 81,7 | 22 % | 2 | 13 € / 66 € |
| provisoire | GPT-5.4 Mini | OpenAI | 74,0 | de 68,3 à 79,8 | 11 % | 1 | 0,65 € / 3,90 € |
| provisoire | Grok 4.3 Beta | xAI | 73,2 | de 65,3 à 81,2 | 11 % | 1 | 1,08 € / 2,17 € |
| provisoire | Claude Sonnet 4 | Anthropic | 72,7 | de 65,3 à 80,1 | 22 % | 2 | 2,60 € / 13 € |
| provisoire | Gemini 2.5 Flash (Jun 2025) | Google DeepMind | 72,7 | de 63,4 à 82,0 | 22 % | 2 | 0,26 € / 2,17 € |
| provisoire | Qwen3-Max | Alibaba | 72,5 | de 64,5 à 80,4 | 11 % | 1 | 0,68 € / 3,38 € |
| provisoire | Claude Haiku 4.5 | Anthropic | 71,9 | de 62,5 à 81,4 | 33 % | 3 | 0,88 € / 4,39 € |
| provisoire | MiniMax-M2 | MiniMax | 71,9 | de 64,0 à 79,9 | 11 % | 1 | 0,22 € / 0,87 € |
| provisoire | Kimi K2 Thinking | Moonshot | 71,4 | de 63,9 à 78,9 | 11 % | 1 | 0,52 € / 2,17 € |
| provisoire | Claude 3.7 Sonnet | Anthropic | 70,1 | de 62,7 à 77,5 | 22 % | 2 | 2,63 € / 13 € |
| provisoire | Gemini 3.1 Flash-Lite | Google DeepMind | 68,8 | de 63,1 à 74,5 | 11 % | 1 | 0,22 € / 1,30 € |
| provisoire | DeepSeek-R1 | DeepSeek | 65,1 | de 58,3 à 72,0 | 22 % | 2 | inconnu |
| provisoire | DeepSeek-R1 (May 2025) | DeepSeek | 65,1 | de 57,2 à 73,1 | 22 % | 2 | 0,43 € / 1,86 € |
| provisoire | o1 | OpenAI | 64,6 | de 57,3 à 72,0 | 11 % | 1 | 13 € / 53 € |
| provisoire | Qwen 3.5 Plus (hosted 397B-A17B) | Alibaba | 64,6 | de 56,5 à 72,8 | 11 % | 1 | 0,35 € / 2,11 € |
| provisoire | Grok 3 | xAI | 63,3 | de 55,2 à 71,5 | 11 % | 1 | 2,63 € / 13 € |
| provisoire | DeepSeek-V3 (Mar 2025) | DeepSeek | 61,8 | de 54,4 à 69,1 | 11 % | 1 | 0,17 € / 0,67 € |
| provisoire | GPT-4o (May 2024) | OpenAI | 60,2 | de 52,0 à 68,4 | 11 % | 1 | 4,39 € / 13 € |
| provisoire | Claude 3.5 Sonnet (October 2024) | Anthropic | 59,4 | de 52,0 à 66,9 | 22 % | 2 | inconnu |
| provisoire | o1-preview | OpenAI | 58,4 | de 51,0 à 65,7 | 11 % | 1 | inconnu |
| provisoire | DeepSeek-V3 | DeepSeek | 58,1 | de 50,7 à 65,5 | 11 % | 1 | inconnu |
| provisoire | Reka Flash 3 | Reka AI | 57,8 | de 49,6 à 66,1 | 11 % | 1 | 0,09 € / 0,18 € |
| provisoire | gpt-oss-120b | OpenAI | 57,6 | de 42,7 à 72,5 | 33 % | 3 | 0,03 € / 0,16 € |
| provisoire | DeepSeek-R1-Distill-Qwen-32B | DeepSeek | 54,7 | de 46,5 à 62,9 | 11 % | 1 | 0,25 € / 0,76 € |
| provisoire | Claude 3.5 Sonnet | Anthropic | 53,9 | de 46,5 à 61,4 | 11 % | 1 | 2,63 € / 13 € |
| provisoire | Llama 3.1-70B | Meta AI | 53,7 | de 45,4 à 61,9 | 11 % | 1 | 0,63 € / 0,63 € |
| provisoire | Gemini 1.5 Pro (Sept 2024) | Google DeepMind | 52,9 | de 44,7 à 61,1 | 11 % | 1 | inconnu |
| provisoire | GPT-4o (Nov 2024) | OpenAI | 52,6 | de 45,1 à 60,1 | 11 % | 1 | 2,19 € / 8,78 € |
| provisoire | Llama 3.2 90B | Meta AI | 52,1 | de 43,9 à 60,3 | 11 % | 1 | 0,31 € / 0,35 € |
| provisoire | Llama 3.3 70B | Meta AI | 51,6 | de 43,4 à 59,8 | 11 % | 1 | 0,09 € / 0,28 € |
| provisoire | GPT-5 mini | OpenAI | 51,3 | de 43,1 à 59,5 | 11 % | 1 | 0,22 € / 1,73 € |
| provisoire | MiniMax-M2.5 | MiniMax | 51,3 | de 43,1 à 59,5 | 11 % | 1 | 0,13 € / 1 € |
| provisoire | GPT-4 Turbo (Apr 2024) | OpenAI | 50,0 | de 42,5 à 57,6 | 11 % | 1 | inconnu |
| provisoire | Qwen3-235B-A22B-Thinking (Jul 2025) | Alibaba | 49,5 | de 41,4 à 57,6 | 11 % | 1 | 0,26 € / 2,55 € |
| provisoire | GPT-4 Turbo (Nov 2023) | OpenAI | 48,7 | de 41,1 à 56,3 | 11 % | 1 | 8,78 € / 26 € |
| provisoire | GPT-4o (Aug 2024) | OpenAI | 48,2 | de 40,6 à 55,8 | 11 % | 1 | 2,19 € / 8,78 € |
| provisoire | Claude 3.5 Haiku | Anthropic | 47,9 | de 39,8 à 56,1 | 11 % | 1 | 0,70 € / 3,51 € |
| provisoire | Qwen2.5-72B | Alibaba | 47,9 | de 40,3 à 55,5 | 22 % | 2 | 2,46 € / 7,37 € |
| provisoire | GPT-4 (Mar 2023) | OpenAI | 47,4 | de 39,7 à 55,1 | 11 % | 1 | 26 € / 53 € |
| provisoire | Claude 3 Opus | Anthropic | 45,0 | de 37,3 à 52,8 | 11 % | 1 | 13 € / 66 € |
| provisoire | GPT-4o mini | OpenAI | 45,0 | de 37,0 à 53,1 | 11 % | 1 | 0,13 € / 0,53 € |
| provisoire | Gemini 1.5 Flash (Sep 2024) | Google DeepMind | 44,8 | de 36,7 à 52,8 | 11 % | 1 | inconnu |
| provisoire | Llama 3.2 11B | Meta AI | 43,0 | de 35,0 à 50,9 | 11 % | 1 | 0,04 € / 0,59 € |
| provisoire | GPT-4 (Jun 2023) | OpenAI | 42,4 | de 34,6 à 50,3 | 11 % | 1 | inconnu |
| provisoire | Qwen2-72B | Alibaba | 41,9 | de 34,0 à 49,8 | 11 % | 1 | inconnu |
| provisoire | Phi-4 | Microsoft | 40,3 | de 32,5 à 48,2 | 11 % | 1 | 0,06 € / 0,12 € |
| provisoire | Mistral NeMo | Mistral AI | 38,5 | de 30,8 à 46,2 | 11 % | 1 | 0,13 € / 0,13 € |
| provisoire | Qwen2-VL-72B-Instruct | Alibaba | 35,7 | de 28,2 à 43,1 | 11 % | 1 | inconnu |
| provisoire | GPT-3.5 Turbo Instruct | OpenAI | 33,6 | de 25,4 à 41,7 | 11 % | 1 | 1,32 € / 1,76 € |
| provisoire | Qwen2.5-7B | Alibaba | 32,8 | de 25,6 à 40,0 | 11 % | 1 | 0,15 € / 0,61 € |
| provisoire | Llama 3.1-8B | Meta AI | 31,5 | de 24,4 à 38,6 | 11 % | 1 | 0,02 € / 0,03 € |
| provisoire | GPT-3 175B (davinci) | OpenAI | 26,5 | de 18,3 à 34,7 | 11 % | 1 | inconnu |
| provisoire | Qwen2-VL-7B-Instruct | Alibaba | 21,6 | de 15,6 à 27,5 | 11 % | 1 | inconnu |
| provisoire | Llama 3.2 3B | Meta AI | 17,4 | de 12,0 à 22,8 | 11 % | 1 | 0,04 € / 0,29 € |
| provisoire | GPT-2 (1.5B) | OpenAI | 16,9 | de 9,2 à 24,5 | 11 % | 1 | inconnu |
| provisoire | Llama 3.2 1B | Meta AI | 0,0 | de 0,0 à 0,3 | 11 % | 1 | 0,02 € / 0,18 € |

## Ce qui compose le score

Le score Agents agrège 9 benchmarks, chacun pesé ci-dessous. 3 benchmarks archivés ne comptent plus. La tâche pèse 15 % du score général.

- APEX-Agents : 11,1 % du score de la tâche (actif)
- BALROG : 11,1 % du score de la tâche (actif)
- DeepResearch Bench : 11,1 % du score de la tâche (actif)
- EBR-bench (Earthborne Rangers) : 11,1 % du score de la tâche (actif)
- METR Time Horizons (taux de réussite) : 11,1 % du score de la tâche (actif)
- OSWorld 2.0 : 11,1 % du score de la tâche (actif)
- PostTrainBench : 11,1 % du score de la tâche (actif)
- Remote Labor Index : 11,1 % du score de la tâche (actif)
- Vending-Bench 2 : 11,1 % du score de la tâche (actif)

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
