# SWE-bench Verified

> Fiche du benchmark SWE-bench Verified sur Quelle IA, édition du 28 septembre 2026. Corriger de vrais bugs signalés sur GitHub dans des projets Python connus, puis faire passer les tests du projet. En tête au 28 septembre 2026 : Claude Opus 4.7 (83,5 %). Notation, limites et classement des 32 modèles mesurés.

Page : https://quelleia.com/benchmarks/swe_bench_verified/
Source du benchmark : https://epoch.ai/benchmarks/swe-bench-verified
Mainteneur : Epoch AI pour l'évaluation ; sélection validée par OpenAI à partir de SWE-bench
Tâche : Code
État : actif

## À quoi il sert

Sur Quelle IA, SWE-bench Verified sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 62.

## Comment c'est noté

Part des 484 tickets résolus, c'est-à-dire dont les tests passent, dans le harnais d'Epoch (terminal et éditeur de fichiers).

## Ce qu'il ne dit pas

Les dépôts sont publics et anciens, donc en partie mémorisés. Epoch estime que 5 à 10 % des tickets sont ambigus, et le harnais d'un éditeur peut donner d'autres chiffres.

## Qui le tient

Epoch AI pour l'évaluation ; sélection validée par OpenAI à partir de SWE-bench.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 62. Le meilleur, Claude Opus 4.7, atteint 83,5 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 36 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 68 %
- Score IA 100 (niveau de Claude Opus 5.5) : 88 %

## Son poids dans le score IA

1,15 % du score général. SWE-bench Verified porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

## Classement (32 modèles mesurés · 35 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | Maximale | 83,5 % | 92,5 | https://epoch.ai/benchmarks |
| 2 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Maximale | 80,6 % | 88,8 | https://epoch.ai/benchmarks |
| 3 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | Élevée | 79,3 % | 87,4 | https://epoch.ai/benchmarks |
| 4 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | non précisée | 78,7 % | 86,7 | https://epoch.ai/benchmarks |
| 5 | [GLM-5.2](https://quelleia.com/modeles/glm-5-2.md) | Z.ai (Zhipu AI) | Maximale | 78,7 % | 86,6 | https://epoch.ai/benchmarks |
| 6 | [DeepSeek-V4-Pro](https://quelleia.com/modeles/deepseek-v4-pro.md) | DeepSeek | Maximale | 77,6 % | 85,5 | https://epoch.ai/benchmarks |
| 7 | [Qwen3.7-Max](https://quelleia.com/modeles/qwen3-7-max.md) | Alibaba | non précisée | 77,3 % | 85,1 | https://epoch.ai/benchmarks |
| 8 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Élevée | 76,9 % | 84,7 | https://epoch.ai/benchmarks |
| 9 | [Kimi K2.6](https://quelleia.com/modeles/kimi-k2-6.md) | Moonshot | non précisée | 76,7 % | 84,4 | https://epoch.ai/benchmarks |
| 9 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | non précisée | 76,7 % | 84,4 | https://epoch.ai/benchmarks |
| 9 | [Qwen 3.6 Max (Preview)](https://quelleia.com/modeles/qwen-3-6-max-preview.md) | Alibaba | non précisée | 76,7 % | 84,4 | https://epoch.ai/benchmarks |
| 12 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 75,6 % | 83,4 | https://epoch.ai/benchmarks |
| 13 | [Gemini 3 Flash](https://quelleia.com/modeles/gemini-3-flash.md) | Google DeepMind | non précisée | 75,4 % | 83,2 | https://epoch.ai/benchmarks |
| 14 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | non précisée | 75,2 % | 83,0 | https://epoch.ai/benchmarks |
| 15 | [GPT-5.3 Codex](https://quelleia.com/modeles/gpt-5-3-codex.md) | OpenAI | Élevée | 74,8 % | 82,5 | https://epoch.ai/benchmarks |
| 16 | [GLM-5.1](https://quelleia.com/modeles/glm-5-1.md) | Z.ai (Zhipu AI) | non précisée | 74,2 % | 81,9 | https://epoch.ai/benchmarks |
| 17 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | Élevée | 73,8 % | 81,5 | https://epoch.ai/benchmarks |
| 17 | [Kimi K2.5](https://quelleia.com/modeles/kimi-k2-5.md) | Moonshot | non précisée | 73,8 % | 81,5 | https://epoch.ai/benchmarks |
| 19 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Élevée | 73,6 % | 81,3 | https://epoch.ai/benchmarks |
| 20 | [Claude Opus 4.1](https://quelleia.com/modeles/claude-opus-4-1.md) | Anthropic | non précisée | 73,3 % | 81,1 | https://epoch.ai/benchmarks |
| 21 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | non précisée | 72,9 % | 80,7 | https://epoch.ai/benchmarks |
| 22 | [GLM-5](https://quelleia.com/modeles/glm-5.md) | Z.ai (Zhipu AI) | non précisée | 72,1 % | 79,9 | https://epoch.ai/benchmarks |
| 23 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | non précisée | 71,3 % | 79,2 | https://epoch.ai/benchmarks |
| 24 | [Claude Opus 4](https://quelleia.com/modeles/claude-opus-4.md) | Anthropic | non précisée | 70,7 % | 78,6 | https://epoch.ai/benchmarks |
| 25 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | Élevée | 68 % | 76,3 | https://epoch.ai/benchmarks |
| 26 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | Moyenne | 64,7 % | 73,5 | https://epoch.ai/benchmarks |
| 27 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Moyenne | 62,3 % | 71,6 | https://epoch.ai/benchmarks |
| 28 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | non précisée | 61 % | 70,5 | https://epoch.ai/benchmarks |
| 29 | [Qwen 3.6 Plus](https://quelleia.com/modeles/qwen-3-6-plus.md) | Alibaba | non précisée | 57,9 % | 68,1 | https://epoch.ai/benchmarks |
| 30 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 57,6 % | 67,9 | https://epoch.ai/benchmarks |
| 31 | [GPT-4.1](https://quelleia.com/modeles/gpt-4-1.md) | OpenAI | non précisée | 48,5 % | 61,1 | https://epoch.ai/benchmarks |
| 32 | [GPT-4o (Nov 2024)](https://quelleia.com/modeles/gpt-4o-nov-2024.md) | OpenAI | non précisée | 31 % | 47,3 | https://epoch.ai/benchmarks |

## En bref

**Que mesure SWE-bench Verified ?** Corriger de vrais bugs signalés sur GitHub dans des projets Python connus, puis faire passer les tests du projet. Sur Quelle IA, il est rangé dans la tâche Code.

**Comment SWE-bench Verified est-il noté ?** Part des 484 tickets résolus, c'est-à-dire dont les tests passent, dans le harnais d'Epoch (terminal et éditeur de fichiers). Un modèle qui obtient 50 % a un score IA d'environ 62.

**Qui est en tête sur SWE-bench Verified ?** Claude Opus 4.7 (Anthropic) est en tête de SWE-bench Verified avec 83,5 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.5 (80,6 %) et Gemini 3.5 Flash (79,3 %). 32 modèles y sont mesurés.

**Quelles sont les limites de SWE-bench Verified ?** Les dépôts sont publics et anciens, donc en partie mémorisés. Epoch estime que 5 à 10 % des tickets sont ambigus, et le harnais d'un éditeur peut donner d'autres chiffres. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse SWE-bench Verified dans le score IA ?** SWE-bench Verified compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

**Qui maintient SWE-bench Verified ?** Epoch AI pour l'évaluation ; sélection validée par OpenAI à partir de SWE-bench. Sa page de référence : epoch.ai/benchmarks/swe-bench-verified.

## Les autres benchmarks de la tâche Code

- [Arena, questions de code](https://quelleia.com/benchmarks/arena_code.md) : 275 modèles · 1,15 % du score
- [WeirdML (v2)](https://quelleia.com/benchmarks/weirdml.md) : 129 modèles · 1,15 % du score
- [SciCode](https://quelleia.com/benchmarks/scicode.md) : 120 modèles · 1,15 % du score
- [Terminal-Bench 2.0](https://quelleia.com/benchmarks/terminal_bench.md) : 45 modèles · 1,15 % du score
- [FrontierCode](https://quelleia.com/benchmarks/frontiercode.md) : 37 modèles · 1,15 % du score
- [DeepSWE](https://quelleia.com/benchmarks/deepswe.md) : 26 modèles · 1,15 % du score
- [GSO](https://quelleia.com/benchmarks/gso_bench.md) : 26 modèles · 1,15 % du score
- [GBAEval](https://quelleia.com/benchmarks/gbaeval.md) : 23 modèles · 1,15 % du score
- [FrontierSWE](https://quelleia.com/benchmarks/frontierswe.md) : 16 modèles · 1,15 % du score
- [CursorBench](https://quelleia.com/benchmarks/cursorbench.md) : 13 modèles · 1,15 % du score
- [WeirdML v3](https://quelleia.com/benchmarks/weirdml_v3.md) : 11 modèles · 1,15 % du score
- [MirrorCode](https://quelleia.com/benchmarks/mirrorcode.md) : 9 modèles · 1,15 % du score
- [Aider Polyglot](https://quelleia.com/benchmarks/aider_polyglot.md) : 54 modèles · hors score, archivé
- [LiveBench, code](https://quelleia.com/benchmarks/livebench_code.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
