Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

CodeFiche benchmark · UC Berkeley · gso-bench.github.io

GSO

Accélérer un vrai logiciel open source : le modèle reçoit le code et un test de performance, et doit égaler l'optimisation d'un expert.

À quoi il sert

Sur Quelle IA, GSO sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 93.

Comment c'est noté

Part des 102 tâches où un seul essai atteint au moins 95 % du gain de vitesse humain tout en passant les tests (OPT@1).

Ce qu'il ne dit pas

Un seul harnais, OpenHands, est utilisé. Certains gains venaient de tricheries sur les tests, d'où un second score corrigé, publié à part depuis fin 2025.

Comment lire le score

26 modèles mesurés · 38 mesures

En tête : Claude Opus 4.8, 47,1 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 93. Le meilleur, Claude Opus 4.8, atteint 47,1 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
moins de 1 %
Score IA 76niveau de Claude Sonnet 4.5
9 %
Score IA 100niveau de Claude Opus 5.5
73 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,15 %du score général. GSO porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

En couleur, la tâche Code dans le score général. En noir, la part de GSO.

Le classement du benchmark

Scores relevés auprès de 2 sources · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Opus 4.8AnthropicNon précisée · OpenHands47,1 %92,0
2Claude Opus 4.7Anthropic · 2 configurationsNon précisée · OpenHands44,1 %91,2
3Claude Opus 4.6Anthropic · 3 configurationsÉlevée · OpenHands41,2 %90,3
4GPT-5.5OpenAIMaximale · OpenHands40,2 %90,0
5Claude Sonnet 5AnthropicNon précisée · OpenHands37,3 %89,1
6GPT-5.4OpenAI · 2 configurationsMaximale · OpenHands31,4 %87,3
7GPT-5.2OpenAIÉlevée · OpenHands27,5 %85,9
8Claude Opus 4.5Anthropic · 2 configurationsNon précisée · OpenHands26,5 %85,6
9Gemini 3.1 ProGoogle DeepMindNon précisée · OpenHands22,6 %84,1
10Gemini 3 ProGoogle DeepMindNon précisée · OpenHands18,6 %82,4
26 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 26 →Replier le classement ↑
11Claude Sonnet 4.5Anthropic · 2 configurationsNon précisée · OpenHands14,7 %80,3
12GPT-5.1OpenAI · 2 configurationsNon précisée · OpenHands13,7 %79,8
13Gemini 3 FlashGoogle DeepMindNon précisée · OpenHands9,8 %77,0
14o3OpenAIÉlevée · OpenHands8,8 %76,2
15Claude Opus 4Anthropic · 2 configurationsNon précisée · OpenHands6,9 %74,3
16GPT-5OpenAIÉlevée · OpenHands6,9 %74,3
17Claude Sonnet 4Anthropic · 2 configurationsNon précisée · OpenHands4,9 %71,7
17Kimi K2 (Jul 2025)MoonshotNon précisée · OpenHands4,9 %71,7
17Qwen3-Coder-480B-A35BAlibaba · poids ouvertsNon précisée · OpenHands4,9 %71,7
20Claude 3.5 Sonnet (October 2024)AnthropicNon précisée · OpenHands4,6 %71,3
21Gemini 2.5 Pro (Jun 2025)Google DeepMind · 2 configurationsNon précisée · OpenHands3,9 %70,1
22Claude 3.7 SonnetAnthropic · 2 configurationsNon précisée · OpenHands3,8 %69,8
23o4-miniOpenAIÉlevée · OpenHands3,6 %69,4
24GLM-4.5-AirZ.ai (Zhipu AI) · poids ouvertsNon précisée · OpenHands2,9 %67,9
25o3-miniOpenAI · 2 configurationsÉlevée · OpenHands1,3 %62,0
26GPT-4o (Nov 2024)OpenAINon précisée · OpenHands0 %60,1

En bref

Que mesure GSO ?
Accélérer un vrai logiciel open source : le modèle reçoit le code et un test de performance, et doit égaler l'optimisation d'un expert. Sur Quelle IA, il est rangé dans la tâche Code.
Comment GSO est-il noté ?
Part des 102 tâches où un seul essai atteint au moins 95 % du gain de vitesse humain tout en passant les tests (OPT@1). Un modèle qui obtient 50 % a un score IA d'environ 93.
Qui est en tête sur GSO ?
Claude Opus 4.8 (Anthropic) est en tête de GSO avec 47,1 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 4.7 (44,1 %) et Claude Opus 4.6 (41,2 %). 26 modèles y sont mesurés.
Quelles sont les limites de GSO ?
Un seul harnais, OpenHands, est utilisé. Certains gains venaient de tricheries sur les tests, d'où un second score corrigé, publié à part depuis fin 2025. Au 28 septembre 2026, le benchmark est actif.
Combien pèse GSO dans le score IA ?
GSO compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
Qui maintient GSO ?
UC Berkeley. Sa page de référence : gso-bench.github.io.

Les autres benchmarks de la tâche Code

Tous les benchmarks →Comment le score IA est calculé →