À quoi il sert
Sur Quelle IA, FrontierSWE sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 96.
CodeFiche benchmark · Proximal · frontierswe.com
34 chantiers logiciels de très longue haleine : réécrire git en Zig, décoder la parole dans des signaux cérébraux, entraîner un modèle météo.
Sur Quelle IA, FrontierSWE sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 96.
Note moyenne sur cinq essais par tâche, avec un budget de 20 heures par essai, dans le harnais maison « proximus ».
34 tâches seulement et un coût élevé, jusqu'à 1 000 dollars en moyenne par tâche. Un seul harnais est utilisé, celui de l'éditeur du benchmark.
Proximal.
frontierswe.com · tâche Code · 16 modèles mesurés
En tête : GPT-6 Astra, 65,5 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 96. Le meilleur, GPT-6 Astra, atteint 65,5 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,15 %du score général. FrontierSWE porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
En couleur, la tâche Code dans le score général. En noir, la part de FrontierSWE.