Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

CodeFiche benchmark · Proximal · frontierswe.com

FrontierSWE

34 chantiers logiciels de très longue haleine : réécrire git en Zig, décoder la parole dans des signaux cérébraux, entraîner un modèle météo.

À quoi il sert

Sur Quelle IA, FrontierSWE sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 96.

Comment c'est noté

Note moyenne sur cinq essais par tâche, avec un budget de 20 heures par essai, dans le harnais maison « proximus ».

Ce qu'il ne dit pas

34 tâches seulement et un coût élevé, jusqu'à 1 000 dollars en moyenne par tâche. Un seul harnais est utilisé, celui de l'éditeur du benchmark.

Comment lire le score

16 modèles mesurés

En tête : GPT-6 Astra, 65,5 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 96. Le meilleur, GPT-6 Astra, atteint 65,5 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
moins de 1 %
Score IA 76niveau de Claude Sonnet 4.5
3 %
Score IA 100niveau de Claude Opus 5.5
66 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,15 %du score général. FrontierSWE porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

En couleur, la tâche Code dans le score général. En noir, la part de FrontierSWE.

Le classement du benchmark

Scores relevés sur frontierswe.com · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-6 AstraOpenAIMaximale · proximus65,5 %99,7
2Claude Opus 5.5AnthropicMaximale · proximus62,3 %98,9
3Claude Sonnet 5.5AnthropicMaximale · proximus61,9 %98,8
4Claude Fable 5.1AnthropicMaximale · proximus56,3 %97,5
5Claude Opus 5AnthropicMaximale · proximus52 %96,5
6Claude Fable 5AnthropicMaximale · proximus47 %95,3
7GPT-5.6 SolOpenAIMaximale · proximus32,2 %91,7
8GLM-5.3Z.ai (Zhipu AI) · poids ouvertsMaximale · proximus30,2 %91,2
9Grok 4.7xAIMaximale · proximus29,5 %91,0
10Kimi K3Moonshot · poids ouvertsMaximale · proximus25,9 %89,9
16 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 16 →Replier le classement ↑
11Grok 4.6xAIMaximale · proximus25,3 %89,8
12Gemini 3.7 FlashGoogle DeepMindÉlevée · proximus20,3 %88,1
13Gemini 3.8 FlashGoogle DeepMindÉlevée · proximus19,6 %87,9
14Qwen 3.8 MaxAlibabaMaximale · proximus15,8 %86,4
15Muse Spark 1.2Meta AIMaximale · proximus12 %84,5
16InklingThinking Machines · poids ouvertsMaximale · proximus4,1 %77,8

En bref

Que mesure FrontierSWE ?
34 chantiers logiciels de très longue haleine : réécrire git en Zig, décoder la parole dans des signaux cérébraux, entraîner un modèle météo. Sur Quelle IA, il est rangé dans la tâche Code.
Comment FrontierSWE est-il noté ?
Note moyenne sur cinq essais par tâche, avec un budget de 20 heures par essai, dans le harnais maison « proximus ». Un modèle qui obtient 50 % a un score IA d'environ 96.
Qui est en tête sur FrontierSWE ?
GPT-6 Astra (OpenAI) est en tête de FrontierSWE avec 65,5 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5.5 (62,3 %) et Claude Sonnet 5.5 (61,9 %). 16 modèles y sont mesurés.
Quelles sont les limites de FrontierSWE ?
34 tâches seulement et un coût élevé, jusqu'à 1 000 dollars en moyenne par tâche. Un seul harnais est utilisé, celui de l'éditeur du benchmark. Au 28 septembre 2026, le benchmark est actif.
Combien pèse FrontierSWE dans le score IA ?
FrontierSWE compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
Qui maintient FrontierSWE ?
Proximal. Sa page de référence : frontierswe.com.

Les autres benchmarks de la tâche Code

Tous les benchmarks →Comment le score IA est calculé →