À quoi il sert
Sur Quelle IA, SWE-bench Verified sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 62.
Sur Quelle IA, SWE-bench Verified sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 62.
Part des 484 tickets résolus, c'est-à-dire dont les tests passent, dans le harnais d'Epoch (terminal et éditeur de fichiers).
Les dépôts sont publics et anciens, donc en partie mémorisés. Epoch estime que 5 à 10 % des tickets sont ambigus, et le harnais d'un éditeur peut donner d'autres chiffres.
Epoch AI pour l'évaluation ; sélection validée par OpenAI à partir de SWE-bench.
epoch.ai/benchmarks/swe-bench-verified · tâche Code · 32 modèles mesurés
En tête : Claude Opus 4.7, 83,5 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 62. Le meilleur, Claude Opus 4.7, atteint 83,5 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,15 %du score général. SWE-bench Verified porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
En couleur, la tâche Code dans le score général. En noir, la part de SWE-bench Verified.