Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

CodeFiche benchmark · Datacurve · deepswe.datacurve.ai

DeepSWE

113 tâches de développement longues et inédites, dans 91 dépôts open source actifs et cinq langages.

À quoi il sert

Sur Quelle IA, DeepSWE sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 87.

Comment c'est noté

Part d'essais réussis selon un vérificateur écrit à la main, sur quatre passages avec le harnais mini-SWE-agent.

Ce qu'il ne dit pas

Epoch le classe « défectueux » : au moins 23 tâches sur 113 échouent à cause du vérificateur lui-même, ce qui pénalise des solutions correctes.

Comment lire le score

26 modèles mesurés · 69 mesures

En tête : GPT-6 Astra, 74,1 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 87. Le meilleur, GPT-6 Astra, atteint 74,1 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
moins de 1 %
Score IA 76niveau de Claude Sonnet 4.5
21 %
Score IA 100niveau de Claude Opus 5.5
85 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,15 %du score général. DeepSWE porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

En couleur, la tâche Code dans le score général. En noir, la part de DeepSWE.

Le classement du benchmark

Scores relevés sur deepswe.datacurve.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-6 AstraOpenAI · 5 configurationsMaximale · mini-SWE-agent74,1 %94,5
2Gemini 3.8 FlashGoogle DeepMind · 2 configurationsÉlevée · mini-SWE-agent73,8 %94,4
3Claude Opus 5Anthropic · 5 configurationsMaximale · mini-SWE-agent73,6 %94,3
4GPT-5.6 SolOpenAI · 5 configurationsMaximale · mini-SWE-agent72,7 %94,0
5Claude Fable 5Anthropic · 5 configurationsMaximale · mini-SWE-agent69,9 %92,9
6GPT-5.6 TerraOpenAI · 5 configurationsMaximale · mini-SWE-agent69,6 %92,8
7GLM-5.3Z.ai (Zhipu AI) · poids ouvertsMaximale · mini-SWE-agent69 %92,6
8Kimi K3Moonshot · poids ouvertsMaximale · mini-SWE-agent68,5 %92,4
9Grok 4.6xAI · 4 configurationsMoyenne · mini-SWE-agent67,5 %92,1
10GPT-5.6 LunaOpenAI · 5 configurationsMaximale · mini-SWE-agent67,2 %92,0
26 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 26 →Replier le classement ↑
11GPT-5.5OpenAI · 4 configurationsMaximale · mini-SWE-agent67 %91,9
12Gemini 3.7 FlashGoogle DeepMind · 3 configurationsMoyenne · mini-SWE-agent65,5 %91,4
13GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsMaximale · mini-SWE-agent63,4 %90,7
14Claude Opus 4.8Anthropic · 5 configurationsMaximale · mini-SWE-agent59 %89,3
15Qwen 3.8 MaxAlibabaMaximale · mini-SWE-agent57,5 %88,8
16Muse Spark 1.2Meta AIMaximale · mini-SWE-agent54,9 %88,0
17Claude Sonnet 5Anthropic · 5 configurationsMaximale · mini-SWE-agent53,8 %87,7
18Grok 4.5xAIÉlevée · mini-SWE-agent53,8 %87,7
19Muse Spark 1.1Meta AINon précisée · mini-SWE-agent53,3 %87,5
20GPT-5.4OpenAIMaximale · mini-SWE-agent51,8 %87,0
21Gemini 3.6 FlashGoogle DeepMindÉlevée · mini-SWE-agent46,7 %85,5
22GLM-5.2Z.ai (Zhipu AI) · poids ouverts · 2 configurationsMaximale · mini-SWE-agent43,8 %84,6
23Gemini 3.5 FlashGoogle DeepMind · 2 configurationsMoyenne · mini-SWE-agent37,4 %82,6
24Kimi K2.7 CodeMoonshot · poids ouvertsNon précisée · mini-SWE-agent30,5 %80,3
25Claude Sonnet 4.6AnthropicÉlevée · mini-SWE-agent29,9 %80,0
26Gemini 3.1 ProGoogle DeepMindNon précisée · mini-SWE-agent11,7 %71,1

En bref

Que mesure DeepSWE ?
113 tâches de développement longues et inédites, dans 91 dépôts open source actifs et cinq langages. Sur Quelle IA, il est rangé dans la tâche Code.
Comment DeepSWE est-il noté ?
Part d'essais réussis selon un vérificateur écrit à la main, sur quatre passages avec le harnais mini-SWE-agent. Un modèle qui obtient 50 % a un score IA d'environ 87.
Qui est en tête sur DeepSWE ?
GPT-6 Astra (OpenAI) est en tête de DeepSWE avec 74,1 %, dans l'édition du 28 septembre 2026. Suivent Gemini 3.8 Flash (73,8 %) et Claude Opus 5 (73,6 %). 26 modèles y sont mesurés.
Quelles sont les limites de DeepSWE ?
Epoch le classe « défectueux » : au moins 23 tâches sur 113 échouent à cause du vérificateur lui-même, ce qui pénalise des solutions correctes. Au 28 septembre 2026, le benchmark est actif.
Combien pèse DeepSWE dans le score IA ?
DeepSWE compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
Qui maintient DeepSWE ?
Datacurve. Sa page de référence : deepswe.datacurve.ai.

Les autres benchmarks de la tâche Code

Tous les benchmarks →Comment le score IA est calculé →