Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

CodeFiche benchmark · Epoch AI pour l'évaluation ; sélection validée par OpenAI à partir de SWE-bench · epoch.ai

SWE-bench Verified

Corriger de vrais bugs signalés sur GitHub dans des projets Python connus, puis faire passer les tests du projet.

À quoi il sert

Sur Quelle IA, SWE-bench Verified sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 62.

Comment c'est noté

Part des 484 tickets résolus, c'est-à-dire dont les tests passent, dans le harnais d'Epoch (terminal et éditeur de fichiers).

Ce qu'il ne dit pas

Les dépôts sont publics et anciens, donc en partie mémorisés. Epoch estime que 5 à 10 % des tickets sont ambigus, et le harnais d'un éditeur peut donner d'autres chiffres.

Comment lire le score

32 modèles mesurés · 35 mesures

En tête : Claude Opus 4.7, 83,5 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 62. Le meilleur, Claude Opus 4.7, atteint 83,5 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
36 %
Score IA 76niveau de Claude Sonnet 4.5
68 %
Score IA 100niveau de Claude Opus 5.5
88 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,15 %du score général. SWE-bench Verified porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

En couleur, la tâche Code dans le score général. En noir, la part de SWE-bench Verified.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Opus 4.7AnthropicMaximale83,5 %92,5
2GPT-5.5OpenAIMaximale80,6 %88,8
3Gemini 3.5 FlashGoogle DeepMindÉlevée79,3 %87,4
4Claude Opus 4.6Anthropic · 2 configurationsNon précisée78,7 %86,7
5GLM-5.2Z.ai (Zhipu AI) · poids ouvertsMaximale78,7 %86,6
6DeepSeek-V4-ProDeepSeek · poids ouvertsMaximale77,6 %85,5
7Qwen3.7-MaxAlibabaNon précisée77,3 %85,1
8GPT-5.4OpenAIÉlevée76,9 %84,7
9Kimi K2.6Moonshot · poids ouvertsNon précisée76,7 %84,4
9Claude Opus 4.5AnthropicNon précisée76,7 %84,4
32 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 32 →Replier le classement ↑
9Qwen 3.6 Max (Preview)AlibabaNon précisée76,7 %84,4
12Gemini 3.1 ProGoogle DeepMindNon précisée75,6 %83,4
13Gemini 3 FlashGoogle DeepMindNon précisée75,4 %83,2
14Claude Sonnet 4.6AnthropicNon précisée75,2 %83,0
15GPT-5.3 CodexOpenAIÉlevée74,8 %82,5
16GLM-5.1Z.ai (Zhipu AI) · poids ouvertsNon précisée74,2 %81,9
17GPT-5.2OpenAIÉlevée73,8 %81,5
17Kimi K2.5Moonshot · poids ouvertsNon précisée73,8 %81,5
19GPT-5OpenAI · 2 configurationsÉlevée73,6 %81,3
20Claude Opus 4.1AnthropicNon précisée73,3 %81,1
21Gemini 3 ProGoogle DeepMindNon précisée72,9 %80,7
22GLM-5Z.ai (Zhipu AI) · poids ouvertsNon précisée72,1 %79,9
23Claude Sonnet 4.5AnthropicNon précisée71,3 %79,2
24Claude Opus 4AnthropicNon précisée70,7 %78,6
25GPT-5.1OpenAI · 2 configurationsÉlevée68 %76,3
26GPT-5 miniOpenAIMoyenne64,7 %73,5
27o3OpenAIMoyenne62,3 %71,6
28Claude 3.7 SonnetAnthropicNon précisée61 %70,5
29Qwen 3.6 PlusAlibabaNon précisée57,9 %68,1
30Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée57,6 %67,9
31GPT-4.1OpenAINon précisée48,5 %61,1
32GPT-4o (Nov 2024)OpenAINon précisée31 %47,3

En bref

Que mesure SWE-bench Verified ?
Corriger de vrais bugs signalés sur GitHub dans des projets Python connus, puis faire passer les tests du projet. Sur Quelle IA, il est rangé dans la tâche Code.
Comment SWE-bench Verified est-il noté ?
Part des 484 tickets résolus, c'est-à-dire dont les tests passent, dans le harnais d'Epoch (terminal et éditeur de fichiers). Un modèle qui obtient 50 % a un score IA d'environ 62.
Qui est en tête sur SWE-bench Verified ?
Claude Opus 4.7 (Anthropic) est en tête de SWE-bench Verified avec 83,5 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.5 (80,6 %) et Gemini 3.5 Flash (79,3 %). 32 modèles y sont mesurés.
Quelles sont les limites de SWE-bench Verified ?
Les dépôts sont publics et anciens, donc en partie mémorisés. Epoch estime que 5 à 10 % des tickets sont ambigus, et le harnais d'un éditeur peut donner d'autres chiffres. Au 28 septembre 2026, le benchmark est actif.
Combien pèse SWE-bench Verified dans le score IA ?
SWE-bench Verified compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
Qui maintient SWE-bench Verified ?
Epoch AI pour l'évaluation ; sélection validée par OpenAI à partir de SWE-bench. Sa page de référence : epoch.ai/benchmarks/swe-bench-verified.

Les autres benchmarks de la tâche Code

Tous les benchmarks →Comment le score IA est calculé →