À quoi il sert
Sur Quelle IA, DeepSWE sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 87.
CodeFiche benchmark · Datacurve · deepswe.datacurve.ai
113 tâches de développement longues et inédites, dans 91 dépôts open source actifs et cinq langages.
Sur Quelle IA, DeepSWE sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 87.
Part d'essais réussis selon un vérificateur écrit à la main, sur quatre passages avec le harnais mini-SWE-agent.
Epoch le classe « défectueux » : au moins 23 tâches sur 113 échouent à cause du vérificateur lui-même, ce qui pénalise des solutions correctes.
Datacurve.
deepswe.datacurve.ai · tâche Code · 26 modèles mesurés
En tête : GPT-6 Astra, 74,1 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 87. Le meilleur, GPT-6 Astra, atteint 74,1 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,15 %du score général. DeepSWE porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
En couleur, la tâche Code dans le score général. En noir, la part de DeepSWE.