Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

CodeFiche benchmark · Équipe SciCode (collectif de scientifiques) ; mesures d'Artificial Analysis · scicode-bench.github.io

SciCode

Traduire un savoir scientifique en code Python : des problèmes de recherche en physique, chimie, biologie et mathématiques, découpés en étapes.

À quoi il sert

Sur Quelle IA, SciCode sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 83.

Comment c'est noté

Part des sous-problèmes dont le code passe les tests.

Ce qu'il ne dit pas

Le score par sous-problème est plus flatteur que la réussite d'un problème entier. Les chiffres sont mesurés par Artificial Analysis, dans ses propres conditions.

Qui le tient

Équipe SciCode (collectif de scientifiques) ; mesures d'Artificial Analysis.

scicode-bench.github.io · tâche Code · 120 modèles mesurés

Comment lire le score

120 modèles mesurés · 181 mesures

En tête : Claude Opus 5.5, 66,9 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 83. Le meilleur, Claude Opus 5.5, atteint 66,9 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
25 %
Score IA 76niveau de Claude Sonnet 4.5
44 %
Score IA 100niveau de Claude Opus 5.5
64 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,15 %du score général. SciCode porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

En couleur, la tâche Code dans le score général. En noir, la part de SciCode.

Le classement du benchmark

Scores relevés sur artificialanalysis.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Opus 5.5Anthropic · 2 configurationsMaximale66,9 %103,9
2Claude Fable 5.1Anthropic · 5 configurationsMaximale63,1 %99,0
3Claude Sonnet 5.5Anthropic · 5 configurationsMaximale61 %96,4
3Claude Fable 5AnthropicMaximale61 %96,4
5Gemini 3.7 FlashGoogle DeepMind · 3 configurationsMoyenne59,8 %94,9
6Muse Spark 1.3Meta AI · 2 configurationsMaximale59,7 %94,8
7Kimi K3Moonshot · poids ouverts · 3 configurationsMaximale59,5 %94,5
8GLM-5.3Z.ai (Zhipu AI) · poids ouvertsMaximale59 %94,0
9Step 5 PreviewStepFunNon précisée58,9 %93,8
9Gemini 3.1 ProGoogle DeepMindNon précisée58,9 %93,8
120 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 120 →Replier le classement ↑
11Muse Spark 1.1Meta AINon précisée58,8 %93,7
12Grok 4.7xAIMaximale57,4 %92,0
13GPT-5.6 SolOpenAI · 6 configurationsMaximale57,1 %91,6
14Gemini 3.8 FlashGoogle DeepMind · 3 configurationsÉlevée56,6 %91,0
14GPT-5.4OpenAIMaximale56,6 %91,0
16GPT-6 AstraOpenAI · 6 configurationsMaximale56,5 %90,9
16Grok 4.6xAI · 4 configurationsÉlevée56,5 %90,9
18Claude Opus 5Anthropic · 5 configurationsMaximale56,4 %90,8
18Muse Spark 1.2Meta AIMaximale56,4 %90,8
20GPT-5.5OpenAI · 5 configurationsMaximale56,1 %90,5
21GPT-5.6 TerraOpenAI · 6 configurationsMaximale55 %89,1
22Claude Opus 4.7AnthropicMaximale54,5 %88,5
23Grok 4.5xAIÉlevée54,1 %88,0
24Claude Sonnet 5Anthropic · 2 configurationsMaximale53,6 %87,4
24GPT-5.6 LunaOpenAI · 6 configurationsMaximale53,6 %87,4
26Claude Opus 4.8AnthropicMaximale53,5 %87,3
26Kimi K2.6Moonshot · poids ouvertsNon précisée53,5 %87,3
28Gemini 3.5 FlashGoogle DeepMindÉlevée53,1 %86,9
29Qwen 3.8 MaxAlibabaNon précisée52,9 %86,6
30Gemini 3.6 FlashGoogle DeepMindÉlevée52,7 %86,4
31Qwen3.8 Max (0902)AlibabaNon précisée52,1 %85,7
32DeepSeek V4.1 FlashDeepSeek · poids ouvertsMaximale51,9 %85,4
33GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsNon précisée51,6 %85,1
34Muse SparkMeta AINon précisée51,5 %85,0
35DeepSeek V4 Pro 0813DeepSeek · poids ouvertsMaximale51 %84,4
36GLM-5.2Z.ai (Zhipu AI) · poids ouverts · 2 configurationsMaximale50,5 %83,8
37MiMo-V2.5-ProXiaomi · poids ouvertsNon précisée50,2 %83,5
37Grok Build 0.1xAINon précisée50,2 %83,5
39DeepSeek-V4-ProDeepSeek · poids ouverts · 4 configurationsMaximale50 %83,2
40DeepSeek V4 Flash 0731DeepSeek · poids ouvertsMaximale49,9 %83,1
40GPT-5.4 MiniOpenAIMaximale49,9 %83,1
42Kimi K2.5Moonshot · poids ouvertsNon précisée49 %82,0
43Qwen3.7-MaxAlibabaNon précisée48,8 %81,9
44Inkling-SmallThinking Machines · poids ouvertsNon précisée48,7 %81,7
45GPT-5.5 InstantOpenAINon précisée48,6 %81,6
46Kimi K2.7 CodeMoonshot · poids ouvertsNon précisée47,5 %80,2
47Grok 4.3 BetaxAIÉlevée47,3 %80,1
48MiniMax-M3MiniMax · poids ouvertsNon précisée47,1 %79,8
49InklingThinking Machines · poids ouvertsMaximale47 %79,7
49MiniMax-M2.7MiniMax · poids ouvertsNon précisée47 %79,7
51GPT-5.4 NanoOpenAIMaximale46,9 %79,5
52Claude Sonnet 4.6AnthropicMaximale46,8 %79,4
53Qwen 3.8 27BAlibaba · poids ouverts · 4 configurationsMaximale46,6 %79,3
54Qwen3.7-PlusAlibabaNon précisée45,5 %77,9
55GLM-4.7Z.ai (Zhipu AI) · poids ouvertsNon précisée45,1 %77,5
56DeepSeek-V4-FlashDeepSeek · poids ouverts · 3 configurationsMaximale44,9 %77,2
57Claude Sonnet 4.5AnthropicNon précisée44,7 %76,9
58GLM-5.1Z.ai (Zhipu AI) · poids ouvertsNon précisée43,8 %75,8
59Gemma 4 31B ITGoogle DeepMind · poids ouvertsNon précisée43,4 %75,4
60GPT-5.1OpenAINon précisée43,3 %75,3
60Claude Haiku 4.5AnthropicNon précisée43,3 %75,3
62MiMo-V2.5Xiaomi · poids ouvertsNon précisée43,1 %75,0
63GPT-5OpenAINon précisée42,9 %74,9
64Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée42,8 %74,7
65Nova 2.0 Pro PreviewAmazon · 3 configurationsMoyenne42,7 %74,6
66Ring-2.6-1TAnt GroupNon précisée42,4 %74,2
66Qwen3-235B-A22B-Thinking (Jul 2025)AlibabaNon précisée42,4 %74,2
68Gemini 3.1 Flash-LiteGoogle DeepMindNon précisée41,9 %73,6
69Gemini 3.5 Flash-LiteGoogle DeepMindNon précisée41,3 %72,9
70Cogito v2.1Deep Cogito · poids ouvertsNon précisée41 %72,5
71Qwen 3.6 PlusAlibabaNon précisée40,7 %72,2
72DeepSeek-V3.1-TerminusDeepSeek · poids ouvertsNon précisée40,6 %72,1
73GPT-4.1 miniOpenAINon précisée40,4 %71,8
74Nemotron 3 UltraNVIDIA · poids ouvertsNon précisée40,3 %71,6
75Mistral Medium 3.5Mistral AI · poids ouvertsNon précisée40,2 %71,5
76Gemma 4 26B A4BGoogle DeepMind · poids ouvertsNon précisée40 %71,4
76Claude Sonnet 4AnthropicNon précisée40 %71,4
76Step 3.7 FlashStepFun · poids ouvertsNon précisée40 %71,4
79o3-miniOpenAIÉlevée39,8 %71,0
80GPT-5 miniOpenAINon précisée39,2 %70,4
80Magistral Medium 1.2Mistral AINon précisée39,2 %70,4
82DeepSeek-V3.2-ExpDeepSeekÉlevée38,9 %69,9
83Mercury 2Inception LabsNon précisée38,7 %69,6
84GLM-4.6Z.ai (Zhipu AI) · poids ouvertsNon précisée38,4 %69,4
85Command A+Cohere · poids ouvertsNon précisée37,8 %68,6
86Qwen3.6 27BAlibaba · poids ouvertsSans37,3 %67,9
87Mistral Large 3Mistral AI · poids ouvertsNon précisée36,2 %66,6
88Trinity Large ThinkingArcee AI · poids ouvertsNon précisée36,1 %66,4
89Nemotron 3 SuperNVIDIA · poids ouvertsNon précisée36 %66,3
89gpt-oss-120bOpenAI · poids ouverts · 2 configurationsFaible36 %66,3
91Qwen 3.6 35B-A3BAlibaba · poids ouverts · 2 configurationsNon précisée35,8 %66,0
91DeepSeek-V3 (Mar 2025)DeepSeek · poids ouvertsNon précisée35,8 %66,0
93DeepSeek-R1DeepSeek · poids ouvertsNon précisée35,7 %65,9
94Qwen3.5-122B-A10BAlibaba · poids ouvertsSans35,6 %65,9
95Qwen3-32BAlibaba · poids ouvertsNon précisée35,4 %65,6
95DeepSeek-V3DeepSeek · poids ouvertsNon précisée35,4 %65,6
97Magistral Small 1.2Mistral AI · poids ouvertsNon précisée35,2 %65,3
98gpt-oss-20bOpenAI · poids ouvertsÉlevée34,4 %64,2
99Mistral Medium 3.1Mistral AINon précisée33,8 %63,4
100Qwen3-30B-A3B-Thinking (Jul 2025)Alibaba · poids ouvertsNon précisée33,3 %62,8
101Llama 4 MaverickMeta AI · poids ouvertsNon précisée33,1 %62,5
102qwen3-coder-nextAlibaba · poids ouvertsNon précisée32,3 %61,4
103Qwen3-14BAlibaba · poids ouvertsNon précisée31,6 %60,5
104Qwen3.5-35B-A3BAlibaba · poids ouvertsSans29,3 %57,3
105Devstral Small 2Mistral AI · poids ouvertsNon précisée28,8 %56,6
106Qwen3.5-9BAlibaba · poids ouvertsNon précisée27,5 %54,8
107Claude 3.5 HaikuAnthropicNon précisée27,4 %54,6
108Mistral Small 3.1Mistral AINon précisée26,5 %53,2
109Mistral Small 3.2Mistral AI · poids ouvertsNon précisée26,4 %53,1
110Llama 3.3 70BMeta AI · poids ouvertsNon précisée26 %52,5
111MiMo-V2-FlashXiaomi · poids ouvertsNon précisée25,9 %52,3
111GPT-4.1 nanoOpenAINon précisée25,9 %52,3
113Granite 4.1 30BIBM · poids ouvertsNon précisée25,8 %52,2
114Solar Pro 3UpstageNon précisée24,7 %50,4
115Qwen3-8BAlibaba · poids ouvertsNon précisée22,6 %47,0
116Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée21,2 %44,6
117Gemma 3 12BGoogle DeepMind · poids ouvertsNon précisée17,4 %37,3
118Llama 4 ScoutMeta AI · poids ouvertsNon précisée17 %36,6
119Llama 3.1-8BMeta AI · poids ouvertsNon précisée13,2 %27,8
120Phi-4 MiniMicrosoft · poids ouvertsNon précisée10,8 %21,0

En bref

Que mesure SciCode ?
Traduire un savoir scientifique en code Python : des problèmes de recherche en physique, chimie, biologie et mathématiques, découpés en étapes. Sur Quelle IA, il est rangé dans la tâche Code.
Comment SciCode est-il noté ?
Part des sous-problèmes dont le code passe les tests. Un modèle qui obtient 50 % a un score IA d'environ 83.
Qui est en tête sur SciCode ?
Claude Opus 5.5 (Anthropic) est en tête de SciCode avec 66,9 %, dans l'édition du 28 septembre 2026. Suivent Claude Fable 5.1 (63,1 %) et Claude Sonnet 5.5 (61 %). 120 modèles y sont mesurés.
Quelles sont les limites de SciCode ?
Le score par sous-problème est plus flatteur que la réussite d'un problème entier. Les chiffres sont mesurés par Artificial Analysis, dans ses propres conditions. Au 28 septembre 2026, le benchmark est actif.
Combien pèse SciCode dans le score IA ?
SciCode compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
Qui maintient SciCode ?
Équipe SciCode (collectif de scientifiques) ; mesures d'Artificial Analysis. Sa page de référence : scicode-bench.github.io.

Les autres benchmarks de la tâche Code

Tous les benchmarks →Comment le score IA est calculé →