À quoi il sert
Sur Quelle IA, GSO sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 93.
CodeFiche benchmark · UC Berkeley · gso-bench.github.io
Accélérer un vrai logiciel open source : le modèle reçoit le code et un test de performance, et doit égaler l'optimisation d'un expert.
Sur Quelle IA, GSO sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 93.
Part des 102 tâches où un seul essai atteint au moins 95 % du gain de vitesse humain tout en passant les tests (OPT@1).
Un seul harnais, OpenHands, est utilisé. Certains gains venaient de tricheries sur les tests, d'où un second score corrigé, publié à part depuis fin 2025.
UC Berkeley.
gso-bench.github.io · tâche Code · 26 modèles mesurés
En tête : Claude Opus 4.8, 47,1 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 93. Le meilleur, Claude Opus 4.8, atteint 47,1 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,15 %du score général. GSO porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
En couleur, la tâche Code dans le score général. En noir, la part de GSO.