# SciCode

> Fiche du benchmark SciCode sur Quelle IA, édition du 28 septembre 2026. Traduire un savoir scientifique en code Python : des problèmes de recherche en physique, chimie, biologie et mathématiques, découpés en étapes. En tête au 28 septembre 2026 : Claude Opus 5.5 (66,9 %). Notation, limites et classement des 120 modèles mesurés.

Page : https://quelleia.com/benchmarks/scicode/
Source du benchmark : https://scicode-bench.github.io/
Mainteneur : Équipe SciCode (collectif de scientifiques) ; mesures d'Artificial Analysis
Tâche : Code
État : actif

## À quoi il sert

Sur Quelle IA, SciCode sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 83.

## Comment c'est noté

Part des sous-problèmes dont le code passe les tests.

## Ce qu'il ne dit pas

Le score par sous-problème est plus flatteur que la réussite d'un problème entier. Les chiffres sont mesurés par Artificial Analysis, dans ses propres conditions.

## Qui le tient

Équipe SciCode (collectif de scientifiques) ; mesures d'Artificial Analysis.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 83. Le meilleur, Claude Opus 5.5, atteint 66,9 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 25 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 44 %
- Score IA 100 (niveau de Claude Opus 5.5) : 64 %

## Son poids dans le score IA

1,15 % du score général. SciCode porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

## Classement (120 modèles mesurés · 181 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Claude Opus 5.5](https://quelleia.com/modeles/claude-opus-5-5.md) | Anthropic | Maximale | 66,9 % | 103,9 | https://artificialanalysis.ai/evaluations/scicode |
| 2 | [Claude Fable 5.1](https://quelleia.com/modeles/claude-fable-5-1.md) | Anthropic | Maximale | 63,1 % | 99,0 | https://artificialanalysis.ai/evaluations/scicode |
| 3 | [Claude Sonnet 5.5](https://quelleia.com/modeles/claude-sonnet-5-5.md) | Anthropic | Maximale | 61 % | 96,4 | https://artificialanalysis.ai/evaluations/scicode |
| 3 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Maximale | 61 % | 96,4 | https://artificialanalysis.ai/evaluations/scicode |
| 5 | [Gemini 3.7 Flash](https://quelleia.com/modeles/gemini-3-7-flash.md) | Google DeepMind | Moyenne | 59,8 % | 94,9 | https://artificialanalysis.ai/evaluations/scicode |
| 6 | [Muse Spark 1.3](https://quelleia.com/modeles/muse-spark-1-3.md) | Meta AI | Maximale | 59,7 % | 94,8 | https://artificialanalysis.ai/evaluations/scicode |
| 7 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | Maximale | 59,5 % | 94,5 | https://artificialanalysis.ai/evaluations/scicode |
| 8 | [GLM-5.3](https://quelleia.com/modeles/glm-5-3.md) | Z.ai (Zhipu AI) | Maximale | 59 % | 94,0 | https://artificialanalysis.ai/evaluations/scicode |
| 9 | [Step 5 Preview](https://quelleia.com/modeles/step-5-preview.md) | StepFun | non précisée | 58,9 % | 93,8 | https://artificialanalysis.ai/evaluations/scicode |
| 9 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 58,9 % | 93,8 | https://artificialanalysis.ai/evaluations/scicode |
| 11 | [Muse Spark 1.1](https://quelleia.com/modeles/muse-spark-1-1.md) | Meta AI | non précisée | 58,8 % | 93,7 | https://artificialanalysis.ai/evaluations/scicode |
| 12 | [Grok 4.7](https://quelleia.com/modeles/grok-4-7.md) | xAI | Maximale | 57,4 % | 92,0 | https://artificialanalysis.ai/evaluations/scicode |
| 13 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 57,1 % | 91,6 | https://artificialanalysis.ai/evaluations/scicode |
| 14 | [Gemini 3.8 Flash](https://quelleia.com/modeles/gemini-3-8-flash.md) | Google DeepMind | Élevée | 56,6 % | 91,0 | https://artificialanalysis.ai/evaluations/scicode |
| 14 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Maximale | 56,6 % | 91,0 | https://artificialanalysis.ai/evaluations/scicode |
| 16 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | Maximale | 56,5 % | 90,9 | https://artificialanalysis.ai/evaluations/scicode |
| 16 | [Grok 4.6](https://quelleia.com/modeles/grok-4-6.md) | xAI | Élevée | 56,5 % | 90,9 | https://artificialanalysis.ai/evaluations/scicode |
| 18 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | Maximale | 56,4 % | 90,8 | https://artificialanalysis.ai/evaluations/scicode |
| 18 | [Muse Spark 1.2](https://quelleia.com/modeles/muse-spark-1-2.md) | Meta AI | Maximale | 56,4 % | 90,8 | https://artificialanalysis.ai/evaluations/scicode |
| 20 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Maximale | 56,1 % | 90,5 | https://artificialanalysis.ai/evaluations/scicode |
| 21 | [GPT-5.6 Terra](https://quelleia.com/modeles/gpt-5-6-terra.md) | OpenAI | Maximale | 55 % | 89,1 | https://artificialanalysis.ai/evaluations/scicode |
| 22 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | Maximale | 54,5 % | 88,5 | https://artificialanalysis.ai/evaluations/scicode |
| 23 | [Grok 4.5](https://quelleia.com/modeles/grok-4-5.md) | xAI | Élevée | 54,1 % | 88,0 | https://artificialanalysis.ai/evaluations/scicode |
| 24 | [Claude Sonnet 5](https://quelleia.com/modeles/claude-sonnet-5.md) | Anthropic | Maximale | 53,6 % | 87,4 | https://artificialanalysis.ai/evaluations/scicode |
| 24 | [GPT-5.6 Luna](https://quelleia.com/modeles/gpt-5-6-luna.md) | OpenAI | Maximale | 53,6 % | 87,4 | https://artificialanalysis.ai/evaluations/scicode |
| 26 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Maximale | 53,5 % | 87,3 | https://artificialanalysis.ai/evaluations/scicode |
| 26 | [Kimi K2.6](https://quelleia.com/modeles/kimi-k2-6.md) | Moonshot | non précisée | 53,5 % | 87,3 | https://artificialanalysis.ai/evaluations/scicode |
| 28 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | Élevée | 53,1 % | 86,9 | https://artificialanalysis.ai/evaluations/scicode |
| 29 | [Qwen 3.8 Max](https://quelleia.com/modeles/qwen-3-8-max.md) | Alibaba | non précisée | 52,9 % | 86,6 | https://artificialanalysis.ai/evaluations/scicode |
| 30 | [Gemini 3.6 Flash](https://quelleia.com/modeles/gemini-3-6-flash.md) | Google DeepMind | Élevée | 52,7 % | 86,4 | https://artificialanalysis.ai/evaluations/scicode |
| 31 | [Qwen3.8 Max (0902)](https://quelleia.com/modeles/qwen3-8-max-0902.md) | Alibaba | non précisée | 52,1 % | 85,7 | https://artificialanalysis.ai/evaluations/scicode |
| 32 | [DeepSeek V4.1 Flash](https://quelleia.com/modeles/deepseek-v4-1-flash.md) | DeepSeek | Maximale | 51,9 % | 85,4 | https://artificialanalysis.ai/evaluations/scicode |
| 33 | [GLM-5.3-Flash](https://quelleia.com/modeles/glm-5-3-flash.md) | Z.ai (Zhipu AI) | non précisée | 51,6 % | 85,1 | https://artificialanalysis.ai/evaluations/scicode |
| 34 | [Muse Spark](https://quelleia.com/modeles/muse-spark.md) | Meta AI | non précisée | 51,5 % | 85,0 | https://artificialanalysis.ai/evaluations/scicode |
| 35 | [DeepSeek V4 Pro 0813](https://quelleia.com/modeles/deepseek-v4-pro-0813.md) | DeepSeek | Maximale | 51 % | 84,4 | https://artificialanalysis.ai/evaluations/scicode |
| 36 | [GLM-5.2](https://quelleia.com/modeles/glm-5-2.md) | Z.ai (Zhipu AI) | Maximale | 50,5 % | 83,8 | https://artificialanalysis.ai/evaluations/scicode |
| 37 | [MiMo-V2.5-Pro](https://quelleia.com/modeles/mimo-v2-5-pro.md) | Xiaomi | non précisée | 50,2 % | 83,5 | https://artificialanalysis.ai/evaluations/scicode |
| 37 | [Grok Build 0.1](https://quelleia.com/modeles/grok-build-0-1.md) | xAI | non précisée | 50,2 % | 83,5 | https://artificialanalysis.ai/evaluations/scicode |
| 39 | [DeepSeek-V4-Pro](https://quelleia.com/modeles/deepseek-v4-pro.md) | DeepSeek | Maximale | 50 % | 83,2 | https://artificialanalysis.ai/evaluations/scicode |
| 40 | [DeepSeek V4 Flash 0731](https://quelleia.com/modeles/deepseek-v4-flash-0731.md) | DeepSeek | Maximale | 49,9 % | 83,1 | https://artificialanalysis.ai/evaluations/scicode |
| 40 | [GPT-5.4 Mini](https://quelleia.com/modeles/gpt-5-4-mini.md) | OpenAI | Maximale | 49,9 % | 83,1 | https://artificialanalysis.ai/evaluations/scicode |
| 42 | [Kimi K2.5](https://quelleia.com/modeles/kimi-k2-5.md) | Moonshot | non précisée | 49 % | 82,0 | https://artificialanalysis.ai/evaluations/scicode |
| 43 | [Qwen3.7-Max](https://quelleia.com/modeles/qwen3-7-max.md) | Alibaba | non précisée | 48,8 % | 81,9 | https://artificialanalysis.ai/evaluations/scicode |
| 44 | [Inkling-Small](https://quelleia.com/modeles/inkling-small.md) | Thinking Machines | non précisée | 48,7 % | 81,7 | https://artificialanalysis.ai/evaluations/scicode |
| 45 | [GPT-5.5 Instant](https://quelleia.com/modeles/gpt-5-5-instant.md) | OpenAI | non précisée | 48,6 % | 81,6 | https://artificialanalysis.ai/evaluations/scicode |
| 46 | [Kimi K2.7 Code](https://quelleia.com/modeles/kimi-k2-7-code.md) | Moonshot | non précisée | 47,5 % | 80,2 | https://artificialanalysis.ai/evaluations/scicode |
| 47 | [Grok 4.3 Beta](https://quelleia.com/modeles/grok-4-3-beta.md) | xAI | Élevée | 47,3 % | 80,1 | https://artificialanalysis.ai/evaluations/scicode |
| 48 | [MiniMax-M3](https://quelleia.com/modeles/minimax-m3.md) | MiniMax | non précisée | 47,1 % | 79,8 | https://artificialanalysis.ai/evaluations/scicode |
| 49 | [Inkling](https://quelleia.com/modeles/inkling.md) | Thinking Machines | Maximale | 47 % | 79,7 | https://artificialanalysis.ai/evaluations/scicode |
| 49 | [MiniMax-M2.7](https://quelleia.com/modeles/minimax-m2-7.md) | MiniMax | non précisée | 47 % | 79,7 | https://artificialanalysis.ai/evaluations/scicode |
| 51 | [GPT-5.4 Nano](https://quelleia.com/modeles/gpt-5-4-nano.md) | OpenAI | Maximale | 46,9 % | 79,5 | https://artificialanalysis.ai/evaluations/scicode |
| 52 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | Maximale | 46,8 % | 79,4 | https://artificialanalysis.ai/evaluations/scicode |
| 53 | [Qwen 3.8 27B](https://quelleia.com/modeles/qwen-3-8-27b.md) | Alibaba | Maximale | 46,6 % | 79,3 | https://artificialanalysis.ai/evaluations/scicode |
| 54 | [Qwen3.7-Plus](https://quelleia.com/modeles/qwen3-7-plus.md) | Alibaba | non précisée | 45,5 % | 77,9 | https://artificialanalysis.ai/evaluations/scicode |
| 55 | [GLM-4.7](https://quelleia.com/modeles/glm-4-7.md) | Z.ai (Zhipu AI) | non précisée | 45,1 % | 77,5 | https://artificialanalysis.ai/evaluations/scicode |
| 56 | [DeepSeek-V4-Flash](https://quelleia.com/modeles/deepseek-v4-flash.md) | DeepSeek | Maximale | 44,9 % | 77,2 | https://artificialanalysis.ai/evaluations/scicode |
| 57 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | non précisée | 44,7 % | 76,9 | https://artificialanalysis.ai/evaluations/scicode |
| 58 | [GLM-5.1](https://quelleia.com/modeles/glm-5-1.md) | Z.ai (Zhipu AI) | non précisée | 43,8 % | 75,8 | https://artificialanalysis.ai/evaluations/scicode |
| 59 | [Gemma 4 31B IT](https://quelleia.com/modeles/gemma-4-31b-it.md) | Google DeepMind | non précisée | 43,4 % | 75,4 | https://artificialanalysis.ai/evaluations/scicode |
| 60 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | non précisée | 43,3 % | 75,3 | https://artificialanalysis.ai/evaluations/scicode |
| 60 | [Claude Haiku 4.5](https://quelleia.com/modeles/claude-haiku-4-5.md) | Anthropic | non précisée | 43,3 % | 75,3 | https://artificialanalysis.ai/evaluations/scicode |
| 62 | [MiMo-V2.5](https://quelleia.com/modeles/mimo-v2-5.md) | Xiaomi | non précisée | 43,1 % | 75,0 | https://artificialanalysis.ai/evaluations/scicode |
| 63 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | non précisée | 42,9 % | 74,9 | https://artificialanalysis.ai/evaluations/scicode |
| 64 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 42,8 % | 74,7 | https://artificialanalysis.ai/evaluations/scicode |
| 65 | [Nova 2.0 Pro Preview](https://quelleia.com/modeles/nova-2-0-pro-preview.md) | Amazon | Moyenne | 42,7 % | 74,6 | https://artificialanalysis.ai/evaluations/scicode |
| 66 | [Ring-2.6-1T](https://quelleia.com/modeles/ring-2-6-1t.md) | Ant Group | non précisée | 42,4 % | 74,2 | https://artificialanalysis.ai/evaluations/scicode |
| 66 | [Qwen3-235B-A22B-Thinking (Jul 2025)](https://quelleia.com/modeles/qwen3-235b-a22b-thinking-jul-2025.md) | Alibaba | non précisée | 42,4 % | 74,2 | https://artificialanalysis.ai/evaluations/scicode |
| 68 | [Gemini 3.1 Flash-Lite](https://quelleia.com/modeles/gemini-3-1-flash-lite.md) | Google DeepMind | non précisée | 41,9 % | 73,6 | https://artificialanalysis.ai/evaluations/scicode |
| 69 | [Gemini 3.5 Flash-Lite](https://quelleia.com/modeles/gemini-3-5-flash-lite.md) | Google DeepMind | non précisée | 41,3 % | 72,9 | https://artificialanalysis.ai/evaluations/scicode |
| 70 | [Cogito v2.1](https://quelleia.com/modeles/cogito-v2-1.md) | Deep Cogito | non précisée | 41 % | 72,5 | https://artificialanalysis.ai/evaluations/scicode |
| 71 | [Qwen 3.6 Plus](https://quelleia.com/modeles/qwen-3-6-plus.md) | Alibaba | non précisée | 40,7 % | 72,2 | https://artificialanalysis.ai/evaluations/scicode |
| 72 | [DeepSeek-V3.1-Terminus](https://quelleia.com/modeles/deepseek-v3-1-terminus.md) | DeepSeek | non précisée | 40,6 % | 72,1 | https://artificialanalysis.ai/evaluations/scicode |
| 73 | [GPT-4.1 mini](https://quelleia.com/modeles/gpt-4-1-mini.md) | OpenAI | non précisée | 40,4 % | 71,8 | https://artificialanalysis.ai/evaluations/scicode |
| 74 | [Nemotron 3 Ultra](https://quelleia.com/modeles/nemotron-3-ultra.md) | NVIDIA | non précisée | 40,3 % | 71,6 | https://artificialanalysis.ai/evaluations/scicode |
| 75 | [Mistral Medium 3.5](https://quelleia.com/modeles/mistral-medium-3-5.md) | Mistral AI | non précisée | 40,2 % | 71,5 | https://artificialanalysis.ai/evaluations/scicode |
| 76 | [Gemma 4 26B A4B](https://quelleia.com/modeles/gemma-4-26b-a4b.md) | Google DeepMind | non précisée | 40 % | 71,4 | https://artificialanalysis.ai/evaluations/scicode |
| 76 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | non précisée | 40 % | 71,4 | https://artificialanalysis.ai/evaluations/scicode |
| 76 | [Step 3.7 Flash](https://quelleia.com/modeles/step-3-7-flash.md) | StepFun | non précisée | 40 % | 71,4 | https://artificialanalysis.ai/evaluations/scicode |
| 79 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Élevée | 39,8 % | 71,0 | https://artificialanalysis.ai/evaluations/scicode |
| 80 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | non précisée | 39,2 % | 70,4 | https://artificialanalysis.ai/evaluations/scicode |
| 80 | [Magistral Medium 1.2](https://quelleia.com/modeles/magistral-medium-1-2.md) | Mistral AI | non précisée | 39,2 % | 70,4 | https://artificialanalysis.ai/evaluations/scicode |
| 82 | [DeepSeek-V3.2-Exp](https://quelleia.com/modeles/deepseek-v3-2-exp.md) | DeepSeek | Élevée | 38,9 % | 69,9 | https://artificialanalysis.ai/evaluations/scicode |
| 83 | [Mercury 2](https://quelleia.com/modeles/mercury-2.md) | Inception Labs | non précisée | 38,7 % | 69,6 | https://artificialanalysis.ai/evaluations/scicode |
| 84 | [GLM-4.6](https://quelleia.com/modeles/glm-4-6.md) | Z.ai (Zhipu AI) | non précisée | 38,4 % | 69,4 | https://artificialanalysis.ai/evaluations/scicode |
| 85 | [Command A+](https://quelleia.com/modeles/command-a.md) | Cohere | non précisée | 37,8 % | 68,6 | https://artificialanalysis.ai/evaluations/scicode |
| 86 | [Qwen3.6 27B](https://quelleia.com/modeles/qwen3-6-27b.md) | Alibaba | Sans | 37,3 % | 67,9 | https://artificialanalysis.ai/evaluations/scicode |
| 87 | [Mistral Large 3](https://quelleia.com/modeles/mistral-large-3.md) | Mistral AI | non précisée | 36,2 % | 66,6 | https://artificialanalysis.ai/evaluations/scicode |
| 88 | [Trinity Large Thinking](https://quelleia.com/modeles/trinity-large-thinking.md) | Arcee AI | non précisée | 36,1 % | 66,4 | https://artificialanalysis.ai/evaluations/scicode |
| 89 | [Nemotron 3 Super](https://quelleia.com/modeles/nemotron-3-super.md) | NVIDIA | non précisée | 36 % | 66,3 | https://artificialanalysis.ai/evaluations/scicode |
| 89 | [gpt-oss-120b](https://quelleia.com/modeles/gpt-oss-120b.md) | OpenAI | Faible | 36 % | 66,3 | https://artificialanalysis.ai/evaluations/scicode |
| 91 | [Qwen 3.6 35B-A3B](https://quelleia.com/modeles/qwen-3-6-35b-a3b.md) | Alibaba | non précisée | 35,8 % | 66,0 | https://artificialanalysis.ai/evaluations/scicode |
| 91 | [DeepSeek-V3 (Mar 2025)](https://quelleia.com/modeles/deepseek-v3-mar-2025.md) | DeepSeek | non précisée | 35,8 % | 66,0 | https://artificialanalysis.ai/evaluations/scicode |
| 93 | [DeepSeek-R1](https://quelleia.com/modeles/deepseek-r1.md) | DeepSeek | non précisée | 35,7 % | 65,9 | https://artificialanalysis.ai/evaluations/scicode |
| 94 | [Qwen3.5-122B-A10B](https://quelleia.com/modeles/qwen3-5-122b-a10b.md) | Alibaba | Sans | 35,6 % | 65,9 | https://artificialanalysis.ai/evaluations/scicode |
| 95 | [Qwen3-32B](https://quelleia.com/modeles/qwen3-32b.md) | Alibaba | non précisée | 35,4 % | 65,6 | https://artificialanalysis.ai/evaluations/scicode |
| 95 | [DeepSeek-V3](https://quelleia.com/modeles/deepseek-v3.md) | DeepSeek | non précisée | 35,4 % | 65,6 | https://artificialanalysis.ai/evaluations/scicode |
| 97 | [Magistral Small 1.2](https://quelleia.com/modeles/magistral-small-1-2.md) | Mistral AI | non précisée | 35,2 % | 65,3 | https://artificialanalysis.ai/evaluations/scicode |
| 98 | [gpt-oss-20b](https://quelleia.com/modeles/gpt-oss-20b.md) | OpenAI | Élevée | 34,4 % | 64,2 | https://artificialanalysis.ai/evaluations/scicode |
| 99 | [Mistral Medium 3.1](https://quelleia.com/modeles/mistral-medium-3-1.md) | Mistral AI | non précisée | 33,8 % | 63,4 | https://artificialanalysis.ai/evaluations/scicode |
| 100 | [Qwen3-30B-A3B-Thinking (Jul 2025)](https://quelleia.com/modeles/qwen3-30b-a3b-thinking-jul-2025.md) | Alibaba | non précisée | 33,3 % | 62,8 | https://artificialanalysis.ai/evaluations/scicode |
| 101 | [Llama 4 Maverick](https://quelleia.com/modeles/llama-4-maverick.md) | Meta AI | non précisée | 33,1 % | 62,5 | https://artificialanalysis.ai/evaluations/scicode |
| 102 | [qwen3-coder-next](https://quelleia.com/modeles/qwen3-coder-next.md) | Alibaba | non précisée | 32,3 % | 61,4 | https://artificialanalysis.ai/evaluations/scicode |
| 103 | [Qwen3-14B](https://quelleia.com/modeles/qwen3-14b.md) | Alibaba | non précisée | 31,6 % | 60,5 | https://artificialanalysis.ai/evaluations/scicode |
| 104 | [Qwen3.5-35B-A3B](https://quelleia.com/modeles/qwen3-5-35b-a3b.md) | Alibaba | Sans | 29,3 % | 57,3 | https://artificialanalysis.ai/evaluations/scicode |
| 105 | [Devstral Small 2](https://quelleia.com/modeles/devstral-small-2.md) | Mistral AI | non précisée | 28,8 % | 56,6 | https://artificialanalysis.ai/evaluations/scicode |
| 106 | [Qwen3.5-9B](https://quelleia.com/modeles/qwen3-5-9b.md) | Alibaba | non précisée | 27,5 % | 54,8 | https://artificialanalysis.ai/evaluations/scicode |
| 107 | [Claude 3.5 Haiku](https://quelleia.com/modeles/claude-3-5-haiku.md) | Anthropic | non précisée | 27,4 % | 54,6 | https://artificialanalysis.ai/evaluations/scicode |
| 108 | [Mistral Small 3.1](https://quelleia.com/modeles/mistral-small-3-1.md) | Mistral AI | non précisée | 26,5 % | 53,2 | https://artificialanalysis.ai/evaluations/scicode |
| 109 | [Mistral Small 3.2](https://quelleia.com/modeles/mistral-small-3-2.md) | Mistral AI | non précisée | 26,4 % | 53,1 | https://artificialanalysis.ai/evaluations/scicode |
| 110 | [Llama 3.3 70B](https://quelleia.com/modeles/llama-3-3-70b.md) | Meta AI | non précisée | 26 % | 52,5 | https://artificialanalysis.ai/evaluations/scicode |
| 111 | [MiMo-V2-Flash](https://quelleia.com/modeles/mimo-v2-flash.md) | Xiaomi | non précisée | 25,9 % | 52,3 | https://artificialanalysis.ai/evaluations/scicode |
| 111 | [GPT-4.1 nano](https://quelleia.com/modeles/gpt-4-1-nano.md) | OpenAI | non précisée | 25,9 % | 52,3 | https://artificialanalysis.ai/evaluations/scicode |
| 113 | [Granite 4.1 30B](https://quelleia.com/modeles/granite-4-1-30b.md) | IBM | non précisée | 25,8 % | 52,2 | https://artificialanalysis.ai/evaluations/scicode |
| 114 | [Solar Pro 3](https://quelleia.com/modeles/solar-pro-3.md) | Upstage | non précisée | 24,7 % | 50,4 | https://artificialanalysis.ai/evaluations/scicode |
| 115 | [Qwen3-8B](https://quelleia.com/modeles/qwen3-8b.md) | Alibaba | non précisée | 22,6 % | 47,0 | https://artificialanalysis.ai/evaluations/scicode |
| 116 | [Gemma 3 27B](https://quelleia.com/modeles/gemma-3-27b.md) | Google DeepMind | non précisée | 21,2 % | 44,6 | https://artificialanalysis.ai/evaluations/scicode |
| 117 | [Gemma 3 12B](https://quelleia.com/modeles/gemma-3-12b.md) | Google DeepMind | non précisée | 17,4 % | 37,3 | https://artificialanalysis.ai/evaluations/scicode |
| 118 | [Llama 4 Scout](https://quelleia.com/modeles/llama-4-scout.md) | Meta AI | non précisée | 17 % | 36,6 | https://artificialanalysis.ai/evaluations/scicode |
| 119 | [Llama 3.1-8B](https://quelleia.com/modeles/llama-3-1-8b.md) | Meta AI | non précisée | 13,2 % | 27,8 | https://artificialanalysis.ai/evaluations/scicode |
| 120 | [Phi-4 Mini](https://quelleia.com/modeles/phi-4-mini.md) | Microsoft | non précisée | 10,8 % | 21,0 | https://artificialanalysis.ai/evaluations/scicode |

## En bref

**Que mesure SciCode ?** Traduire un savoir scientifique en code Python : des problèmes de recherche en physique, chimie, biologie et mathématiques, découpés en étapes. Sur Quelle IA, il est rangé dans la tâche Code.

**Comment SciCode est-il noté ?** Part des sous-problèmes dont le code passe les tests. Un modèle qui obtient 50 % a un score IA d'environ 83.

**Qui est en tête sur SciCode ?** Claude Opus 5.5 (Anthropic) est en tête de SciCode avec 66,9 %, dans l'édition du 28 septembre 2026. Suivent Claude Fable 5.1 (63,1 %) et Claude Sonnet 5.5 (61 %). 120 modèles y sont mesurés.

**Quelles sont les limites de SciCode ?** Le score par sous-problème est plus flatteur que la réussite d'un problème entier. Les chiffres sont mesurés par Artificial Analysis, dans ses propres conditions. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse SciCode dans le score IA ?** SciCode compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

**Qui maintient SciCode ?** Équipe SciCode (collectif de scientifiques) ; mesures d'Artificial Analysis. Sa page de référence : scicode-bench.github.io.

## Les autres benchmarks de la tâche Code

- [Arena, questions de code](https://quelleia.com/benchmarks/arena_code.md) : 275 modèles · 1,15 % du score
- [WeirdML (v2)](https://quelleia.com/benchmarks/weirdml.md) : 129 modèles · 1,15 % du score
- [Terminal-Bench 2.0](https://quelleia.com/benchmarks/terminal_bench.md) : 45 modèles · 1,15 % du score
- [FrontierCode](https://quelleia.com/benchmarks/frontiercode.md) : 37 modèles · 1,15 % du score
- [SWE-bench Verified](https://quelleia.com/benchmarks/swe_bench_verified.md) : 32 modèles · 1,15 % du score
- [DeepSWE](https://quelleia.com/benchmarks/deepswe.md) : 26 modèles · 1,15 % du score
- [GSO](https://quelleia.com/benchmarks/gso_bench.md) : 26 modèles · 1,15 % du score
- [GBAEval](https://quelleia.com/benchmarks/gbaeval.md) : 23 modèles · 1,15 % du score
- [FrontierSWE](https://quelleia.com/benchmarks/frontierswe.md) : 16 modèles · 1,15 % du score
- [CursorBench](https://quelleia.com/benchmarks/cursorbench.md) : 13 modèles · 1,15 % du score
- [WeirdML v3](https://quelleia.com/benchmarks/weirdml_v3.md) : 11 modèles · 1,15 % du score
- [MirrorCode](https://quelleia.com/benchmarks/mirrorcode.md) : 9 modèles · 1,15 % du score
- [Aider Polyglot](https://quelleia.com/benchmarks/aider_polyglot.md) : 54 modèles · hors score, archivé
- [LiveBench, code](https://quelleia.com/benchmarks/livebench_code.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
