# DeepSWE

> Fiche du benchmark DeepSWE sur Quelle IA, édition du 28 septembre 2026. 113 tâches de développement longues et inédites, dans 91 dépôts open source actifs et cinq langages. En tête au 28 septembre 2026 : GPT-6 Astra (74,1 %). Notation, limites et classement des 26 modèles mesurés.

Page : https://quelleia.com/benchmarks/deepswe/
Source du benchmark : https://deepswe.datacurve.ai/
Mainteneur : Datacurve
Tâche : Code
État : actif

## À quoi il sert

Sur Quelle IA, DeepSWE sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 87.

## Comment c'est noté

Part d'essais réussis selon un vérificateur écrit à la main, sur quatre passages avec le harnais mini-SWE-agent.

## Ce qu'il ne dit pas

Epoch le classe « défectueux » : au moins 23 tâches sur 113 échouent à cause du vérificateur lui-même, ce qui pénalise des solutions correctes.

## Qui le tient

Datacurve.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 87. Le meilleur, GPT-6 Astra, atteint 74,1 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : moins de 1 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 21 %
- Score IA 100 (niveau de Claude Opus 5.5) : 85 %

## Son poids dans le score IA

1,15 % du score général. DeepSWE porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

## Classement (26 modèles mesurés · 69 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | Maximale | 74,1 % | 94,5 | https://deepswe.datacurve.ai/ |
| 2 | [Gemini 3.8 Flash](https://quelleia.com/modeles/gemini-3-8-flash.md) | Google DeepMind | Élevée | 73,8 % | 94,4 | https://deepswe.datacurve.ai/ |
| 3 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | Maximale | 73,6 % | 94,3 | https://deepswe.datacurve.ai/ |
| 4 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 72,7 % | 94,0 | https://deepswe.datacurve.ai/ |
| 5 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Maximale | 69,9 % | 92,9 | https://deepswe.datacurve.ai/ |
| 6 | [GPT-5.6 Terra](https://quelleia.com/modeles/gpt-5-6-terra.md) | OpenAI | Maximale | 69,6 % | 92,8 | https://deepswe.datacurve.ai/ |
| 7 | [GLM-5.3](https://quelleia.com/modeles/glm-5-3.md) | Z.ai (Zhipu AI) | Maximale | 69 % | 92,6 | https://deepswe.datacurve.ai/ |
| 8 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | Maximale | 68,5 % | 92,4 | https://deepswe.datacurve.ai/ |
| 9 | [Grok 4.6](https://quelleia.com/modeles/grok-4-6.md) | xAI | Moyenne | 67,5 % | 92,1 | https://deepswe.datacurve.ai/ |
| 10 | [GPT-5.6 Luna](https://quelleia.com/modeles/gpt-5-6-luna.md) | OpenAI | Maximale | 67,2 % | 92,0 | https://deepswe.datacurve.ai/ |
| 11 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Maximale | 67 % | 91,9 | https://deepswe.datacurve.ai/ |
| 12 | [Gemini 3.7 Flash](https://quelleia.com/modeles/gemini-3-7-flash.md) | Google DeepMind | Moyenne | 65,5 % | 91,4 | https://deepswe.datacurve.ai/ |
| 13 | [GLM-5.3-Flash](https://quelleia.com/modeles/glm-5-3-flash.md) | Z.ai (Zhipu AI) | Maximale | 63,4 % | 90,7 | https://deepswe.datacurve.ai/ |
| 14 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Maximale | 59 % | 89,3 | https://deepswe.datacurve.ai/ |
| 15 | [Qwen 3.8 Max](https://quelleia.com/modeles/qwen-3-8-max.md) | Alibaba | Maximale | 57,5 % | 88,8 | https://deepswe.datacurve.ai/ |
| 16 | [Muse Spark 1.2](https://quelleia.com/modeles/muse-spark-1-2.md) | Meta AI | Maximale | 54,9 % | 88,0 | https://deepswe.datacurve.ai/ |
| 17 | [Claude Sonnet 5](https://quelleia.com/modeles/claude-sonnet-5.md) | Anthropic | Maximale | 53,8 % | 87,7 | https://deepswe.datacurve.ai/ |
| 18 | [Grok 4.5](https://quelleia.com/modeles/grok-4-5.md) | xAI | Élevée | 53,8 % | 87,7 | https://deepswe.datacurve.ai/ |
| 19 | [Muse Spark 1.1](https://quelleia.com/modeles/muse-spark-1-1.md) | Meta AI | non précisée | 53,3 % | 87,5 | https://deepswe.datacurve.ai/ |
| 20 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Maximale | 51,8 % | 87,0 | https://deepswe.datacurve.ai/ |
| 21 | [Gemini 3.6 Flash](https://quelleia.com/modeles/gemini-3-6-flash.md) | Google DeepMind | Élevée | 46,7 % | 85,5 | https://deepswe.datacurve.ai/ |
| 22 | [GLM-5.2](https://quelleia.com/modeles/glm-5-2.md) | Z.ai (Zhipu AI) | Maximale | 43,8 % | 84,6 | https://deepswe.datacurve.ai/ |
| 23 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | Moyenne | 37,4 % | 82,6 | https://deepswe.datacurve.ai/ |
| 24 | [Kimi K2.7 Code](https://quelleia.com/modeles/kimi-k2-7-code.md) | Moonshot | non précisée | 30,5 % | 80,3 | https://deepswe.datacurve.ai/ |
| 25 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | Élevée | 29,9 % | 80,0 | https://deepswe.datacurve.ai/ |
| 26 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 11,7 % | 71,1 | https://deepswe.datacurve.ai/ |

## En bref

**Que mesure DeepSWE ?** 113 tâches de développement longues et inédites, dans 91 dépôts open source actifs et cinq langages. Sur Quelle IA, il est rangé dans la tâche Code.

**Comment DeepSWE est-il noté ?** Part d'essais réussis selon un vérificateur écrit à la main, sur quatre passages avec le harnais mini-SWE-agent. Un modèle qui obtient 50 % a un score IA d'environ 87.

**Qui est en tête sur DeepSWE ?** GPT-6 Astra (OpenAI) est en tête de DeepSWE avec 74,1 %, dans l'édition du 28 septembre 2026. Suivent Gemini 3.8 Flash (73,8 %) et Claude Opus 5 (73,6 %). 26 modèles y sont mesurés.

**Quelles sont les limites de DeepSWE ?** Epoch le classe « défectueux » : au moins 23 tâches sur 113 échouent à cause du vérificateur lui-même, ce qui pénalise des solutions correctes. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse DeepSWE dans le score IA ?** DeepSWE compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

**Qui maintient DeepSWE ?** Datacurve. Sa page de référence : deepswe.datacurve.ai.

## Les autres benchmarks de la tâche Code

- [Arena, questions de code](https://quelleia.com/benchmarks/arena_code.md) : 275 modèles · 1,15 % du score
- [WeirdML (v2)](https://quelleia.com/benchmarks/weirdml.md) : 129 modèles · 1,15 % du score
- [SciCode](https://quelleia.com/benchmarks/scicode.md) : 120 modèles · 1,15 % du score
- [Terminal-Bench 2.0](https://quelleia.com/benchmarks/terminal_bench.md) : 45 modèles · 1,15 % du score
- [FrontierCode](https://quelleia.com/benchmarks/frontiercode.md) : 37 modèles · 1,15 % du score
- [SWE-bench Verified](https://quelleia.com/benchmarks/swe_bench_verified.md) : 32 modèles · 1,15 % du score
- [GSO](https://quelleia.com/benchmarks/gso_bench.md) : 26 modèles · 1,15 % du score
- [GBAEval](https://quelleia.com/benchmarks/gbaeval.md) : 23 modèles · 1,15 % du score
- [FrontierSWE](https://quelleia.com/benchmarks/frontierswe.md) : 16 modèles · 1,15 % du score
- [CursorBench](https://quelleia.com/benchmarks/cursorbench.md) : 13 modèles · 1,15 % du score
- [WeirdML v3](https://quelleia.com/benchmarks/weirdml_v3.md) : 11 modèles · 1,15 % du score
- [MirrorCode](https://quelleia.com/benchmarks/mirrorcode.md) : 9 modèles · 1,15 % du score
- [Aider Polyglot](https://quelleia.com/benchmarks/aider_polyglot.md) : 54 modèles · hors score, archivé
- [LiveBench, code](https://quelleia.com/benchmarks/livebench_code.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
