À quoi il sert
Sur Quelle IA, SciCode sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 83.
CodeFiche benchmark · Équipe SciCode (collectif de scientifiques) ; mesures d'Artificial Analysis · scicode-bench.github.io
Traduire un savoir scientifique en code Python : des problèmes de recherche en physique, chimie, biologie et mathématiques, découpés en étapes.
Sur Quelle IA, SciCode sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 83.
Part des sous-problèmes dont le code passe les tests.
Le score par sous-problème est plus flatteur que la réussite d'un problème entier. Les chiffres sont mesurés par Artificial Analysis, dans ses propres conditions.
Équipe SciCode (collectif de scientifiques) ; mesures d'Artificial Analysis.
scicode-bench.github.io · tâche Code · 120 modèles mesurés
En tête : Claude Opus 5.5, 66,9 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 83. Le meilleur, Claude Opus 5.5, atteint 66,9 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,15 %du score général. SciCode porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
En couleur, la tâche Code dans le score général. En noir, la part de SciCode.