# GSO

> Fiche du benchmark GSO sur Quelle IA, édition du 28 septembre 2026. Accélérer un vrai logiciel open source : le modèle reçoit le code et un test de performance, et doit égaler l'optimisation d'un expert. En tête au 28 septembre 2026 : Claude Opus 4.8 (47,1 %). Notation, limites et classement des 26 modèles mesurés.

Page : https://quelleia.com/benchmarks/gso_bench/
Source du benchmark : https://gso-bench.github.io/
Mainteneur : UC Berkeley
Tâche : Code
État : actif

## À quoi il sert

Sur Quelle IA, GSO sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 93.

## Comment c'est noté

Part des 102 tâches où un seul essai atteint au moins 95 % du gain de vitesse humain tout en passant les tests (OPT@1).

## Ce qu'il ne dit pas

Un seul harnais, OpenHands, est utilisé. Certains gains venaient de tricheries sur les tests, d'où un second score corrigé, publié à part depuis fin 2025.

## Qui le tient

UC Berkeley.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 93. Le meilleur, Claude Opus 4.8, atteint 47,1 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : moins de 1 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 9 %
- Score IA 100 (niveau de Claude Opus 5.5) : 73 %

## Son poids dans le score IA

1,15 % du score général. GSO porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

## Classement (26 modèles mesurés · 38 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | non précisée | 47,1 % | 92,0 | https://gso-bench.github.io/index.html |
| 2 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | non précisée | 44,1 % | 91,2 | https://epoch.ai/benchmarks |
| 3 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | Élevée | 41,2 % | 90,3 | https://epoch.ai/benchmarks |
| 4 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Maximale | 40,2 % | 90,0 | https://gso-bench.github.io/index.html |
| 5 | [Claude Sonnet 5](https://quelleia.com/modeles/claude-sonnet-5.md) | Anthropic | non précisée | 37,3 % | 89,1 | https://gso-bench.github.io/index.html |
| 6 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Maximale | 31,4 % | 87,3 | https://gso-bench.github.io/index.html |
| 7 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | Élevée | 27,5 % | 85,9 | https://gso-bench.github.io/index.html |
| 8 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | non précisée | 26,5 % | 85,6 | https://epoch.ai/benchmarks |
| 9 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 22,6 % | 84,1 | https://gso-bench.github.io/index.html |
| 10 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | non précisée | 18,6 % | 82,4 | https://gso-bench.github.io/index.html |
| 11 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | non précisée | 14,7 % | 80,3 | https://epoch.ai/benchmarks |
| 12 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | non précisée | 13,7 % | 79,8 | https://gso-bench.github.io/index.html |
| 13 | [Gemini 3 Flash](https://quelleia.com/modeles/gemini-3-flash.md) | Google DeepMind | non précisée | 9,8 % | 77,0 | https://gso-bench.github.io/index.html |
| 14 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Élevée | 8,8 % | 76,2 | https://epoch.ai/benchmarks |
| 15 | [Claude Opus 4](https://quelleia.com/modeles/claude-opus-4.md) | Anthropic | non précisée | 6,9 % | 74,3 | https://epoch.ai/benchmarks |
| 16 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Élevée | 6,9 % | 74,3 | https://gso-bench.github.io/index.html |
| 17 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | non précisée | 4,9 % | 71,7 | https://epoch.ai/benchmarks |
| 17 | [Kimi K2 (Jul 2025)](https://quelleia.com/modeles/kimi-k2-jul-2025.md) | Moonshot | non précisée | 4,9 % | 71,7 | https://gso-bench.github.io/index.html |
| 17 | [Qwen3-Coder-480B-A35B](https://quelleia.com/modeles/qwen3-coder-480b-a35b.md) | Alibaba | non précisée | 4,9 % | 71,7 | https://gso-bench.github.io/index.html |
| 20 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 4,6 % | 71,3 | https://epoch.ai/benchmarks |
| 21 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 3,9 % | 70,1 | https://epoch.ai/benchmarks |
| 22 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | non précisée | 3,8 % | 69,8 | https://epoch.ai/benchmarks |
| 23 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Élevée | 3,6 % | 69,4 | https://epoch.ai/benchmarks |
| 24 | [GLM-4.5-Air](https://quelleia.com/modeles/glm-4-5-air.md) | Z.ai (Zhipu AI) | non précisée | 2,9 % | 67,9 | https://epoch.ai/benchmarks |
| 25 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Élevée | 1,3 % | 62,0 | https://epoch.ai/benchmarks |
| 26 | [GPT-4o (Nov 2024)](https://quelleia.com/modeles/gpt-4o-nov-2024.md) | OpenAI | non précisée | 0 % | 60,1 | https://epoch.ai/benchmarks |

## En bref

**Que mesure GSO ?** Accélérer un vrai logiciel open source : le modèle reçoit le code et un test de performance, et doit égaler l'optimisation d'un expert. Sur Quelle IA, il est rangé dans la tâche Code.

**Comment GSO est-il noté ?** Part des 102 tâches où un seul essai atteint au moins 95 % du gain de vitesse humain tout en passant les tests (OPT@1). Un modèle qui obtient 50 % a un score IA d'environ 93.

**Qui est en tête sur GSO ?** Claude Opus 4.8 (Anthropic) est en tête de GSO avec 47,1 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 4.7 (44,1 %) et Claude Opus 4.6 (41,2 %). 26 modèles y sont mesurés.

**Quelles sont les limites de GSO ?** Un seul harnais, OpenHands, est utilisé. Certains gains venaient de tricheries sur les tests, d'où un second score corrigé, publié à part depuis fin 2025. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse GSO dans le score IA ?** GSO compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

**Qui maintient GSO ?** UC Berkeley. Sa page de référence : gso-bench.github.io.

## Les autres benchmarks de la tâche Code

- [Arena, questions de code](https://quelleia.com/benchmarks/arena_code.md) : 275 modèles · 1,15 % du score
- [WeirdML (v2)](https://quelleia.com/benchmarks/weirdml.md) : 129 modèles · 1,15 % du score
- [SciCode](https://quelleia.com/benchmarks/scicode.md) : 120 modèles · 1,15 % du score
- [Terminal-Bench 2.0](https://quelleia.com/benchmarks/terminal_bench.md) : 45 modèles · 1,15 % du score
- [FrontierCode](https://quelleia.com/benchmarks/frontiercode.md) : 37 modèles · 1,15 % du score
- [SWE-bench Verified](https://quelleia.com/benchmarks/swe_bench_verified.md) : 32 modèles · 1,15 % du score
- [DeepSWE](https://quelleia.com/benchmarks/deepswe.md) : 26 modèles · 1,15 % du score
- [GBAEval](https://quelleia.com/benchmarks/gbaeval.md) : 23 modèles · 1,15 % du score
- [FrontierSWE](https://quelleia.com/benchmarks/frontierswe.md) : 16 modèles · 1,15 % du score
- [CursorBench](https://quelleia.com/benchmarks/cursorbench.md) : 13 modèles · 1,15 % du score
- [WeirdML v3](https://quelleia.com/benchmarks/weirdml_v3.md) : 11 modèles · 1,15 % du score
- [MirrorCode](https://quelleia.com/benchmarks/mirrorcode.md) : 9 modèles · 1,15 % du score
- [Aider Polyglot](https://quelleia.com/benchmarks/aider_polyglot.md) : 54 modèles · hors score, archivé
- [LiveBench, code](https://quelleia.com/benchmarks/livebench_code.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
