# FrontierSWE

> Fiche du benchmark FrontierSWE sur Quelle IA, édition du 28 septembre 2026. 34 chantiers logiciels de très longue haleine : réécrire git en Zig, décoder la parole dans des signaux cérébraux, entraîner un modèle météo. En tête au 28 septembre 2026 : GPT-6 Astra (65,5 %). Notation, limites et classement des 16 modèles mesurés.

Page : https://quelleia.com/benchmarks/frontierswe/
Source du benchmark : https://www.frontierswe.com/
Mainteneur : Proximal
Tâche : Code
État : actif

## À quoi il sert

Sur Quelle IA, FrontierSWE sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 96.

## Comment c'est noté

Note moyenne sur cinq essais par tâche, avec un budget de 20 heures par essai, dans le harnais maison « proximus ».

## Ce qu'il ne dit pas

34 tâches seulement et un coût élevé, jusqu'à 1 000 dollars en moyenne par tâche. Un seul harnais est utilisé, celui de l'éditeur du benchmark.

## Qui le tient

Proximal.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 96. Le meilleur, GPT-6 Astra, atteint 65,5 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : moins de 1 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 3 %
- Score IA 100 (niveau de Claude Opus 5.5) : 66 %

## Son poids dans le score IA

1,15 % du score général. FrontierSWE porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

## Classement (16 modèles mesurés, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | Maximale | 65,5 % | 99,7 | https://www.frontierswe.com/ |
| 2 | [Claude Opus 5.5](https://quelleia.com/modeles/claude-opus-5-5.md) | Anthropic | Maximale | 62,3 % | 98,9 | https://www.frontierswe.com/ |
| 3 | [Claude Sonnet 5.5](https://quelleia.com/modeles/claude-sonnet-5-5.md) | Anthropic | Maximale | 61,9 % | 98,8 | https://www.frontierswe.com/ |
| 4 | [Claude Fable 5.1](https://quelleia.com/modeles/claude-fable-5-1.md) | Anthropic | Maximale | 56,3 % | 97,5 | https://www.frontierswe.com/ |
| 5 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | Maximale | 52 % | 96,5 | https://www.frontierswe.com/ |
| 6 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Maximale | 47 % | 95,3 | https://www.frontierswe.com/ |
| 7 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 32,2 % | 91,7 | https://www.frontierswe.com/ |
| 8 | [GLM-5.3](https://quelleia.com/modeles/glm-5-3.md) | Z.ai (Zhipu AI) | Maximale | 30,2 % | 91,2 | https://www.frontierswe.com/ |
| 9 | [Grok 4.7](https://quelleia.com/modeles/grok-4-7.md) | xAI | Maximale | 29,5 % | 91,0 | https://www.frontierswe.com/ |
| 10 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | Maximale | 25,9 % | 89,9 | https://www.frontierswe.com/ |
| 11 | [Grok 4.6](https://quelleia.com/modeles/grok-4-6.md) | xAI | Maximale | 25,3 % | 89,8 | https://www.frontierswe.com/ |
| 12 | [Gemini 3.7 Flash](https://quelleia.com/modeles/gemini-3-7-flash.md) | Google DeepMind | Élevée | 20,3 % | 88,1 | https://www.frontierswe.com/ |
| 13 | [Gemini 3.8 Flash](https://quelleia.com/modeles/gemini-3-8-flash.md) | Google DeepMind | Élevée | 19,6 % | 87,9 | https://www.frontierswe.com/ |
| 14 | [Qwen 3.8 Max](https://quelleia.com/modeles/qwen-3-8-max.md) | Alibaba | Maximale | 15,8 % | 86,4 | https://www.frontierswe.com/ |
| 15 | [Muse Spark 1.2](https://quelleia.com/modeles/muse-spark-1-2.md) | Meta AI | Maximale | 12 % | 84,5 | https://www.frontierswe.com/ |
| 16 | [Inkling](https://quelleia.com/modeles/inkling.md) | Thinking Machines | Maximale | 4,1 % | 77,8 | https://www.frontierswe.com/ |

## En bref

**Que mesure FrontierSWE ?** 34 chantiers logiciels de très longue haleine : réécrire git en Zig, décoder la parole dans des signaux cérébraux, entraîner un modèle météo. Sur Quelle IA, il est rangé dans la tâche Code.

**Comment FrontierSWE est-il noté ?** Note moyenne sur cinq essais par tâche, avec un budget de 20 heures par essai, dans le harnais maison « proximus ». Un modèle qui obtient 50 % a un score IA d'environ 96.

**Qui est en tête sur FrontierSWE ?** GPT-6 Astra (OpenAI) est en tête de FrontierSWE avec 65,5 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5.5 (62,3 %) et Claude Sonnet 5.5 (61,9 %). 16 modèles y sont mesurés.

**Quelles sont les limites de FrontierSWE ?** 34 tâches seulement et un coût élevé, jusqu'à 1 000 dollars en moyenne par tâche. Un seul harnais est utilisé, celui de l'éditeur du benchmark. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse FrontierSWE dans le score IA ?** FrontierSWE compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

**Qui maintient FrontierSWE ?** Proximal. Sa page de référence : frontierswe.com.

## Les autres benchmarks de la tâche Code

- [Arena, questions de code](https://quelleia.com/benchmarks/arena_code.md) : 275 modèles · 1,15 % du score
- [WeirdML (v2)](https://quelleia.com/benchmarks/weirdml.md) : 129 modèles · 1,15 % du score
- [SciCode](https://quelleia.com/benchmarks/scicode.md) : 120 modèles · 1,15 % du score
- [Terminal-Bench 2.0](https://quelleia.com/benchmarks/terminal_bench.md) : 45 modèles · 1,15 % du score
- [FrontierCode](https://quelleia.com/benchmarks/frontiercode.md) : 37 modèles · 1,15 % du score
- [SWE-bench Verified](https://quelleia.com/benchmarks/swe_bench_verified.md) : 32 modèles · 1,15 % du score
- [DeepSWE](https://quelleia.com/benchmarks/deepswe.md) : 26 modèles · 1,15 % du score
- [GSO](https://quelleia.com/benchmarks/gso_bench.md) : 26 modèles · 1,15 % du score
- [GBAEval](https://quelleia.com/benchmarks/gbaeval.md) : 23 modèles · 1,15 % du score
- [CursorBench](https://quelleia.com/benchmarks/cursorbench.md) : 13 modèles · 1,15 % du score
- [WeirdML v3](https://quelleia.com/benchmarks/weirdml_v3.md) : 11 modèles · 1,15 % du score
- [MirrorCode](https://quelleia.com/benchmarks/mirrorcode.md) : 9 modèles · 1,15 % du score
- [Aider Polyglot](https://quelleia.com/benchmarks/aider_polyglot.md) : 54 modèles · hors score, archivé
- [LiveBench, code](https://quelleia.com/benchmarks/livebench_code.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
