# CritPt

> Fiche du benchmark CritPt sur Quelle IA, édition du 28 septembre 2026. 71 défis de physique de niveau recherche, comparables à un premier projet de thèse, écrits par plus de 50 physiciens. En tête au 28 septembre 2026 : GPT-5.6 Sol (32,3 %). Notation, limites et classement des 129 modèles mesurés.

Page : https://quelleia.com/benchmarks/critpt/
Source du benchmark : https://artificialanalysis.ai/evaluations/critpt
Mainteneur : Collectif de physiciens mené par le laboratoire d'Argonne et l'université de l'Illinois ; classement Artificial Analysis
Tâche : Sciences et savoir expert
État : actif

## À quoi il sert

Sur Quelle IA, CritPt sert à noter la tâche Sciences et savoir expert : c'est l'un de ses 5 benchmarks.

## Comment c'est noté

Part de défis résolus ; les réponses (nombres, formules, fonctions Python) sont vérifiées automatiquement.

## Ce qu'il ne dit pas

Scores très bas, 32 % au mieux. Les résultats sont mesurés par Artificial Analysis, dans ses propres conditions.

## Qui le tient

Collectif de physiciens mené par le laboratoire d'Argonne et l'université de l'Illinois ; classement Artificial Analysis.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 41 %. Le meilleur, GPT-5.6 Sol, atteint 32,3 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : moins de 1 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 5 %
- Score IA 100 (niveau de Claude Opus 5.5) : 41 %

## Son poids dans le score IA

2 % du score général. CritPt porte 20 % de la tâche Sciences et savoir expert (10 % du score général), que se partagent 5 benchmarks.

## Classement (129 modèles mesurés · 189 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 32,3 % | 96,4 | https://epoch.ai/benchmarks |
| 2 | [Claude Opus 5.5](https://quelleia.com/modeles/claude-opus-5-5.md) | Anthropic | Maximale | 31,7 % | 96,1 | https://epoch.ai/benchmarks |
| 2 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | Maximale | 31,7 % | 96,1 | https://epoch.ai/benchmarks |
| 4 | [Claude Sonnet 5.5](https://quelleia.com/modeles/claude-sonnet-5-5.md) | Anthropic | Maximale | 31,4 % | 96,0 | https://epoch.ai/benchmarks |
| 5 | [Claude Fable 5.1](https://quelleia.com/modeles/claude-fable-5-1.md) | Anthropic | Maximale | 31,1 % | 95,9 | https://epoch.ai/benchmarks |
| 6 | [GPT-5.5 Pro](https://quelleia.com/modeles/gpt-5-5-pro.md) | OpenAI | Maximale | 30,6 % | 95,6 | https://epoch.ai/benchmarks |
| 7 | [GPT-5.4 Pro](https://quelleia.com/modeles/gpt-5-4-pro.md) | OpenAI | Maximale | 30 % | 95,4 | https://epoch.ai/benchmarks |
| 7 | [GPT-5.6 Terra](https://quelleia.com/modeles/gpt-5-6-terra.md) | OpenAI | Maximale | 30 % | 95,4 | https://epoch.ai/benchmarks |
| 9 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | Maximale | 29,1 % | 95,0 | https://epoch.ai/benchmarks |
| 10 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Maximale | 28,6 % | 94,8 | https://epoch.ai/benchmarks |
| 11 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Maximale | 27,1 % | 94,1 | https://epoch.ai/benchmarks |
| 12 | [Gemini 3 Deep Think](https://quelleia.com/modeles/gemini-3-deep-think.md) | Google DeepMind | non précisée | 25,7 % | 93,4 | https://epoch.ai/benchmarks |
| 13 | [Muse Spark 1.3](https://quelleia.com/modeles/muse-spark-1-3.md) | Meta AI | Maximale | 24,9 % | 93,0 | https://epoch.ai/benchmarks |
| 14 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Maximale | 23,4 % | 92,3 | https://epoch.ai/benchmarks |
| 15 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | Maximale | 23,4 % | 92,3 | https://epoch.ai/benchmarks |
| 16 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Maximale | 20,9 % | 90,9 | https://epoch.ai/benchmarks |
| 16 | [Step 5 Preview](https://quelleia.com/modeles/step-5-preview.md) | StepFun | non précisée | 20,9 % | 90,9 | https://epoch.ai/benchmarks |
| 16 | [GLM-5.2](https://quelleia.com/modeles/glm-5-2.md) | Z.ai (Zhipu AI) | Maximale | 20,9 % | 90,9 | https://epoch.ai/benchmarks |
| 19 | [GPT-5.6 Luna](https://quelleia.com/modeles/gpt-5-6-luna.md) | OpenAI | Maximale | 20,6 % | 90,8 | https://epoch.ai/benchmarks |
| 20 | [Qwen 3.8 Max](https://quelleia.com/modeles/qwen-3-8-max.md) | Alibaba | non précisée | 20 % | 90,5 | https://epoch.ai/benchmarks |
| 21 | [Grok 4.6](https://quelleia.com/modeles/grok-4-6.md) | xAI | Maximale | 19,7 % | 90,3 | https://epoch.ai/benchmarks |
| 22 | [GLM-5.3](https://quelleia.com/modeles/glm-5-3.md) | Z.ai (Zhipu AI) | Maximale | 19,1 % | 90,0 | https://epoch.ai/benchmarks |
| 23 | [Gemini 3.8 Flash](https://quelleia.com/modeles/gemini-3-8-flash.md) | Google DeepMind | Élevée | 18,3 % | 89,5 | https://epoch.ai/benchmarks |
| 24 | [DeepSeek V4 Pro 0813](https://quelleia.com/modeles/deepseek-v4-pro-0813.md) | DeepSeek | Maximale | 18 % | 89,3 | https://epoch.ai/benchmarks |
| 25 | [Qwen3.8 Max (0902)](https://quelleia.com/modeles/qwen3-8-max-0902.md) | Alibaba | non précisée | 17,7 % | 89,1 | https://epoch.ai/benchmarks |
| 25 | [Grok 4.7](https://quelleia.com/modeles/grok-4-7.md) | xAI | Maximale | 17,7 % | 89,1 | https://epoch.ai/benchmarks |
| 25 | [Muse Spark 1.2](https://quelleia.com/modeles/muse-spark-1-2.md) | Meta AI | Maximale | 17,7 % | 89,1 | https://epoch.ai/benchmarks |
| 25 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 17,7 % | 89,1 | https://epoch.ai/benchmarks |
| 29 | [Claude Sonnet 5](https://quelleia.com/modeles/claude-sonnet-5.md) | Anthropic | Maximale | 16,9 % | 88,6 | https://epoch.ai/benchmarks |
| 30 | [DeepSeek V4 Flash 0731](https://quelleia.com/modeles/deepseek-v4-flash-0731.md) | DeepSeek | Maximale | 16,6 % | 88,4 | https://epoch.ai/benchmarks |
| 31 | [Grok 4.5](https://quelleia.com/modeles/grok-4-5.md) | xAI | Élevée | 15,4 % | 87,6 | https://epoch.ai/benchmarks |
| 31 | [GLM-5.3-Flash](https://quelleia.com/modeles/glm-5-3-flash.md) | Z.ai (Zhipu AI) | non précisée | 15,4 % | 87,6 | https://epoch.ai/benchmarks |
| 33 | [Muse Spark 1.1](https://quelleia.com/modeles/muse-spark-1-1.md) | Meta AI | non précisée | 15,1 % | 87,4 | https://epoch.ai/benchmarks |
| 34 | [Gemini 3.7 Flash](https://quelleia.com/modeles/gemini-3-7-flash.md) | Google DeepMind | Élevée | 14,3 % | 86,8 | https://epoch.ai/benchmarks |
| 34 | [DeepSeek V4.1 Flash](https://quelleia.com/modeles/deepseek-v4-1-flash.md) | DeepSeek | Maximale | 14,3 % | 86,8 | https://epoch.ai/benchmarks |
| 36 | [Qwen3.7-Max](https://quelleia.com/modeles/qwen3-7-max.md) | Alibaba | non précisée | 13,4 % | 86,1 | https://epoch.ai/benchmarks |
| 37 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | Élevée | 13,1 % | 85,9 | https://epoch.ai/benchmarks |
| 38 | [DeepSeek-V4-Pro](https://quelleia.com/modeles/deepseek-v4-pro.md) | DeepSeek | Maximale | 12,9 % | 85,7 | https://epoch.ai/benchmarks |
| 39 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Élevée | 12,6 % | 85,5 | https://epoch.ai/benchmarks |
| 40 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | Maximale | 12 % | 84,9 | https://epoch.ai/benchmarks |
| 41 | [Muse Spark](https://quelleia.com/modeles/muse-spark.md) | Meta AI | non précisée | 11,3 % | 84,4 | https://epoch.ai/benchmarks |
| 42 | [Gemini 3.6 Flash](https://quelleia.com/modeles/gemini-3-6-flash.md) | Google DeepMind | Élevée | 10,6 % | 83,6 | https://epoch.ai/benchmarks |
| 43 | [Kimi K2.7 Code](https://quelleia.com/modeles/kimi-k2-7-code.md) | Moonshot | non précisée | 10 % | 83,1 | https://epoch.ai/benchmarks |
| 43 | [GPT-5.4 Mini](https://quelleia.com/modeles/gpt-5-4-mini.md) | OpenAI | Maximale | 10 % | 83,1 | https://epoch.ai/benchmarks |
| 45 | [GPT-5.4 Nano](https://quelleia.com/modeles/gpt-5-4-nano.md) | OpenAI | Maximale | 9,3 % | 82,3 | https://epoch.ai/benchmarks |
| 46 | [Grok Build 0.1](https://quelleia.com/modeles/grok-build-0-1.md) | xAI | non précisée | 9,1 % | 82,2 | https://epoch.ai/benchmarks |
| 46 | [Qwen3.7-Plus](https://quelleia.com/modeles/qwen3-7-plus.md) | Alibaba | non précisée | 9,1 % | 82,2 | https://epoch.ai/benchmarks |
| 48 | [Inkling-Small](https://quelleia.com/modeles/inkling-small.md) | Thinking Machines | non précisée | 8,3 % | 81,2 | https://epoch.ai/benchmarks |
| 49 | [Kimi K2.6](https://quelleia.com/modeles/kimi-k2-6.md) | Moonshot | non précisée | 8 % | 80,8 | https://epoch.ai/benchmarks |
| 49 | [Grok 4.3 Beta](https://quelleia.com/modeles/grok-4-3-beta.md) | xAI | Élevée | 8 % | 80,8 | https://epoch.ai/benchmarks |
| 51 | [DeepSeek-V4-Flash](https://quelleia.com/modeles/deepseek-v4-flash.md) | DeepSeek | Maximale | 7,1 % | 79,7 | https://epoch.ai/benchmarks |
| 52 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | non précisée | 6,9 % | 79,4 | https://epoch.ai/benchmarks |
| 53 | [Qwen 3.8 27B](https://quelleia.com/modeles/qwen-3-8-27b.md) | Alibaba | Maximale | 5,4 % | 77,1 | https://epoch.ai/benchmarks |
| 53 | [Inkling](https://quelleia.com/modeles/inkling.md) | Thinking Machines | Maximale | 5,4 % | 77,1 | https://epoch.ai/benchmarks |
| 55 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | non précisée | 4,9 % | 76,0 | https://epoch.ai/benchmarks |
| 56 | [GLM-5.1](https://quelleia.com/modeles/glm-5-1.md) | Z.ai (Zhipu AI) | non précisée | 4,6 % | 75,4 | https://epoch.ai/benchmarks |
| 57 | [MiMo-V2.5-Pro](https://quelleia.com/modeles/mimo-v2-5-pro.md) | Xiaomi | non précisée | 4 % | 74,1 | https://epoch.ai/benchmarks |
| 58 | [MiniMax-M3](https://quelleia.com/modeles/minimax-m3.md) | MiniMax | non précisée | 3,7 % | 73,4 | https://epoch.ai/benchmarks |
| 58 | [MiMo-V2.5](https://quelleia.com/modeles/mimo-v2-5.md) | Xiaomi | non précisée | 3,7 % | 73,4 | https://epoch.ai/benchmarks |
| 58 | [Ring-2.6-1T](https://quelleia.com/modeles/ring-2-6-1t.md) | Ant Group | non précisée | 3,7 % | 73,4 | https://epoch.ai/benchmarks |
| 61 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | Maximale | 3,1 % | 71,9 | https://epoch.ai/benchmarks |
| 61 | [Kimi K2.5](https://quelleia.com/modeles/kimi-k2-5.md) | Moonshot | non précisée | 3,1 % | 71,9 | https://epoch.ai/benchmarks |
| 61 | [Nemotron 3 Ultra](https://quelleia.com/modeles/nemotron-3-ultra.md) | NVIDIA | non précisée | 3,1 % | 71,9 | https://epoch.ai/benchmarks |
| 61 | [Nemotron 3 Super](https://quelleia.com/modeles/nemotron-3-super.md) | NVIDIA | non précisée | 3,1 % | 71,9 | https://epoch.ai/benchmarks |
| 65 | [Qwen 3.6 Plus](https://quelleia.com/modeles/qwen-3-6-plus.md) | Alibaba | non précisée | 2,9 % | 71,0 | https://epoch.ai/benchmarks |
| 65 | [DeepSeek-V3.2-Exp](https://quelleia.com/modeles/deepseek-v3-2-exp.md) | DeepSeek | Élevée | 2,9 % | 71,0 | https://epoch.ai/benchmarks |
| 67 | [Step 3.7 Flash](https://quelleia.com/modeles/step-3-7-flash.md) | StepFun | non précisée | 2,3 % | 68,9 | https://epoch.ai/benchmarks |
| 68 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 2 % | 67,6 | https://epoch.ai/benchmarks |
| 69 | [DeepSeek-V3.1-Terminus](https://quelleia.com/modeles/deepseek-v3-1-terminus.md) | DeepSeek | non précisée | 1,7 % | 66,2 | https://epoch.ai/benchmarks |
| 70 | [GLM-4.7](https://quelleia.com/modeles/glm-4-7.md) | Z.ai (Zhipu AI) | non précisée | 1,7 % | 66,2 | https://epoch.ai/benchmarks |
| 71 | [Gemma 4 31B IT](https://quelleia.com/modeles/gemma-4-31b-it.md) | Google DeepMind | non précisée | 1,4 % | 64,5 | https://epoch.ai/benchmarks |
| 71 | [gpt-oss-20b](https://quelleia.com/modeles/gpt-oss-20b.md) | OpenAI | Élevée | 1,4 % | 64,5 | https://epoch.ai/benchmarks |
| 73 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Élevée | 1,4 % | 64,3 | https://epoch.ai/benchmarks |
| 74 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | non précisée | 1,1 % | 62,5 | https://epoch.ai/benchmarks |
| 74 | [Gemini 3.1 Flash-Lite](https://quelleia.com/modeles/gemini-3-1-flash-lite.md) | Google DeepMind | non précisée | 1,1 % | 62,5 | https://epoch.ai/benchmarks |
| 74 | [GLM-4.6](https://quelleia.com/modeles/glm-4-6.md) | Z.ai (Zhipu AI) | non précisée | 1,1 % | 62,5 | https://epoch.ai/benchmarks |
| 74 | [gpt-oss-120b](https://quelleia.com/modeles/gpt-oss-120b.md) | OpenAI | Élevée | 1,1 % | 62,5 | https://epoch.ai/benchmarks |
| 78 | [Gemini 2.5 Flash (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-flash-jun-2025.md) | Google DeepMind | non précisée | 1,1 % | 62,1 | https://epoch.ai/benchmarks |
| 78 | [DeepSeek-R1](https://quelleia.com/modeles/deepseek-r1.md) | DeepSeek | non précisée | 1,1 % | 62,1 | https://epoch.ai/benchmarks |
| 80 | [Qwen3.6 27B](https://quelleia.com/modeles/qwen3-6-27b.md) | Alibaba | Sans | 0,9 % | 61,2 | https://epoch.ai/benchmarks |
| 80 | [Qwen3.5-122B-A10B](https://quelleia.com/modeles/qwen3-5-122b-a10b.md) | Alibaba | Sans | 0,9 % | 61,2 | https://epoch.ai/benchmarks |
| 80 | [Trinity Large Thinking](https://quelleia.com/modeles/trinity-large-thinking.md) | Arcee AI | non précisée | 0,9 % | 61,2 | https://epoch.ai/benchmarks |
| 83 | [Mercury 2](https://quelleia.com/modeles/mercury-2.md) | Inception Labs | non précisée | 0,8 % | 61,2 | https://epoch.ai/benchmarks |
| 84 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Élevée | 0,6 % | 61,2 | https://epoch.ai/benchmarks |
| 85 | [MiniMax-M2.7](https://quelleia.com/modeles/minimax-m2-7.md) | MiniMax | non précisée | 0,6 % | 61,2 | https://epoch.ai/benchmarks |
| 85 | [Qwen3.5-35B-A3B](https://quelleia.com/modeles/qwen3-5-35b-a3b.md) | Alibaba | Sans | 0,6 % | 61,2 | https://epoch.ai/benchmarks |
| 87 | [Claude Opus 4](https://quelleia.com/modeles/claude-opus-4.md) | Anthropic | non précisée | 0,3 % | 61,2 | https://epoch.ai/benchmarks |
| 88 | [Qwen 3.6 35B-A3B](https://quelleia.com/modeles/qwen-3-6-35b-a3b.md) | Alibaba | non précisée | 0,3 % | 61,2 | https://epoch.ai/benchmarks |
| 88 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | non précisée | 0,3 % | 61,2 | https://epoch.ai/benchmarks |
| 88 | [Magistral Medium 1.2](https://quelleia.com/modeles/magistral-medium-1-2.md) | Mistral AI | non précisée | 0,3 % | 61,2 | https://epoch.ai/benchmarks |
| 88 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Élevée | 0,3 % | 61,2 | https://epoch.ai/benchmarks |
| 88 | [Command A+](https://quelleia.com/modeles/command-a.md) | Cohere | non précisée | 0,3 % | 61,2 | https://epoch.ai/benchmarks |
| 88 | [Qwen3-30B-A3B-Thinking (Jul 2025)](https://quelleia.com/modeles/qwen3-30b-a3b-thinking-jul-2025.md) | Alibaba | non précisée | 0,3 % | 61,2 | https://epoch.ai/benchmarks |
| 88 | [Qwen3.5-9B](https://quelleia.com/modeles/qwen3-5-9b.md) | Alibaba | non précisée | 0,3 % | 61,2 | https://epoch.ai/benchmarks |
| 88 | [Qwen3-32B](https://quelleia.com/modeles/qwen3-32b.md) | Alibaba | non précisée | 0,3 % | 61,2 | https://epoch.ai/benchmarks |
| 88 | [Magistral Small 1.2](https://quelleia.com/modeles/magistral-small-1-2.md) | Mistral AI | non précisée | 0,3 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [GPT-5.5 Instant](https://quelleia.com/modeles/gpt-5-5-instant.md) | OpenAI | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Gemini 3.5 Flash-Lite](https://quelleia.com/modeles/gemini-3-5-flash-lite.md) | Google DeepMind | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Gemma 4 26B A4B](https://quelleia.com/modeles/gemma-4-26b-a4b.md) | Google DeepMind | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Nova 2.0 Pro Preview](https://quelleia.com/modeles/nova-2-0-pro-preview.md) | Amazon | Faible | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Claude Haiku 4.5](https://quelleia.com/modeles/claude-haiku-4-5.md) | Anthropic | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Mistral Medium 3.5](https://quelleia.com/modeles/mistral-medium-3-5.md) | Mistral AI | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Qwen3-235B-A22B-Thinking (Jul 2025)](https://quelleia.com/modeles/qwen3-235b-a22b-thinking-jul-2025.md) | Alibaba | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Cogito v2.1](https://quelleia.com/modeles/cogito-v2-1.md) | Deep Cogito | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [MiMo-V2-Flash](https://quelleia.com/modeles/mimo-v2-flash.md) | Xiaomi | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Mistral Large 3](https://quelleia.com/modeles/mistral-large-3.md) | Mistral AI | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Mistral Medium 3.1](https://quelleia.com/modeles/mistral-medium-3-1.md) | Mistral AI | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [qwen3-coder-next](https://quelleia.com/modeles/qwen3-coder-next.md) | Alibaba | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Qwen3-14B](https://quelleia.com/modeles/qwen3-14b.md) | Alibaba | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [GPT-4.1 mini](https://quelleia.com/modeles/gpt-4-1-mini.md) | OpenAI | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [DeepSeek-V3 (Mar 2025)](https://quelleia.com/modeles/deepseek-v3-mar-2025.md) | DeepSeek | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Qwen3-8B](https://quelleia.com/modeles/qwen3-8b.md) | Alibaba | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Devstral Small 2](https://quelleia.com/modeles/devstral-small-2.md) | Mistral AI | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Llama 4 Maverick](https://quelleia.com/modeles/llama-4-maverick.md) | Meta AI | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Mistral Small 3.2](https://quelleia.com/modeles/mistral-small-3-2.md) | Mistral AI | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [DeepSeek-V3](https://quelleia.com/modeles/deepseek-v3.md) | DeepSeek | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Gemma 3 27B](https://quelleia.com/modeles/gemma-3-27b.md) | Google DeepMind | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Granite 4.1 30B](https://quelleia.com/modeles/granite-4-1-30b.md) | IBM | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [GPT-4.1 nano](https://quelleia.com/modeles/gpt-4-1-nano.md) | OpenAI | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Llama 4 Scout](https://quelleia.com/modeles/llama-4-scout.md) | Meta AI | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Solar Pro 3](https://quelleia.com/modeles/solar-pro-3.md) | Upstage | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Llama 3.3 70B](https://quelleia.com/modeles/llama-3-3-70b.md) | Meta AI | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [GPT-4o (Nov 2024)](https://quelleia.com/modeles/gpt-4o-nov-2024.md) | OpenAI | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Mistral Small 3.1](https://quelleia.com/modeles/mistral-small-3-1.md) | Mistral AI | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Claude 3.5 Haiku](https://quelleia.com/modeles/claude-3-5-haiku.md) | Anthropic | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Gemma 3 12B](https://quelleia.com/modeles/gemma-3-12b.md) | Google DeepMind | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Llama 3.1-8B](https://quelleia.com/modeles/llama-3-1-8b.md) | Meta AI | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |
| 97 | [Phi-4 Mini](https://quelleia.com/modeles/phi-4-mini.md) | Microsoft | non précisée | 0 % | 61,2 | https://epoch.ai/benchmarks |

## En bref

**Que mesure CritPt ?** 71 défis de physique de niveau recherche, comparables à un premier projet de thèse, écrits par plus de 50 physiciens. Sur Quelle IA, il est rangé dans la tâche Sciences et savoir expert.

**Comment CritPt est-il noté ?** Part de défis résolus ; les réponses (nombres, formules, fonctions Python) sont vérifiées automatiquement. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 41 %.

**Qui est en tête sur CritPt ?** GPT-5.6 Sol (OpenAI) est en tête de CritPt avec 32,3 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5.5 (31,7 %) et GPT-6 Astra (31,7 %). 129 modèles y sont mesurés.

**Quelles sont les limites de CritPt ?** Scores très bas, 32 % au mieux. Les résultats sont mesurés par Artificial Analysis, dans ses propres conditions. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse CritPt dans le score IA ?** CritPt compte pour 2 % du score général, dans l'édition du 28 septembre 2026. Il porte 20 % de la tâche Sciences et savoir expert (10 % du score général), que se partagent 5 benchmarks.

**Qui maintient CritPt ?** Collectif de physiciens mené par le laboratoire d'Argonne et l'université de l'Illinois ; classement Artificial Analysis. Sa page de référence : artificialanalysis.ai/evaluations/critpt.

## Les autres benchmarks de la tâche Sciences et savoir expert

- [Arena, questions d'experts](https://quelleia.com/benchmarks/arena_expert.md) : 263 modèles · 2 % du score
- [GPQA Diamond](https://quelleia.com/benchmarks/gpqa_diamond.md) : 208 modèles · 2 % du score
- [Humanity's Last Exam](https://quelleia.com/benchmarks/hle.md) : 44 modèles · 2 % du score
- [Surface Evolver Bench](https://quelleia.com/benchmarks/surface_evolver_bench.md) : 25 modèles · 2 % du score, saturé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
