Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

SciencesFiche benchmark · Collectif de physiciens mené par le laboratoire d'Argonne et l'université de l'Illinois ; classement Artificial Analysis · artificialanalysis.ai

CritPt

71 défis de physique de niveau recherche, comparables à un premier projet de thèse, écrits par plus de 50 physiciens.

À quoi il sert

Sur Quelle IA, CritPt sert à noter la tâche Sciences et savoir expert : c'est l'un de ses 5 benchmarks.

Comment c'est noté

Part de défis résolus ; les réponses (nombres, formules, fonctions Python) sont vérifiées automatiquement.

Ce qu'il ne dit pas

Scores très bas, 32 % au mieux. Les résultats sont mesurés par Artificial Analysis, dans ses propres conditions.

Comment lire le score

129 modèles mesurés · 189 mesures

En tête : GPT-5.6 Sol, 32,3 %

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 41 %. Le meilleur, GPT-5.6 Sol, atteint 32,3 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
moins de 1 %
Score IA 76niveau de Claude Sonnet 4.5
5 %
Score IA 100niveau de Claude Opus 5.5
41 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

2 %du score général. CritPt porte 20 % de la tâche Sciences et savoir expert (10 % du score général), que se partagent 5 benchmarks.

En couleur, la tâche Sciences et savoir expert dans le score général. En noir, la part de CritPt.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-5.6 SolOpenAI · 6 configurationsMaximale32,3 %96,4
2Claude Opus 5.5Anthropic · 2 configurationsMaximale31,7 %96,1
2GPT-6 AstraOpenAI · 6 configurationsMaximale31,7 %96,1
4Claude Sonnet 5.5Anthropic · 5 configurationsMaximale31,4 %96,0
5Claude Fable 5.1Anthropic · 5 configurationsMaximale31,1 %95,9
6GPT-5.5 ProOpenAIMaximale30,6 %95,6
7GPT-5.4 ProOpenAIMaximale30 %95,4
7GPT-5.6 TerraOpenAI · 6 configurationsMaximale30 %95,4
9Claude Opus 5Anthropic · 5 configurationsMaximale29,1 %95,0
10Claude Fable 5AnthropicMaximale28,6 %94,8
129 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 129 →Replier le classement ↑
11GPT-5.5OpenAI · 5 configurationsMaximale27,1 %94,1
12Gemini 3 Deep ThinkGoogle DeepMindNon précisée25,7 %93,4
13Muse Spark 1.3Meta AIMaximale24,9 %93,0
14GPT-5.4OpenAIMaximale23,4 %92,3
15Kimi K3Moonshot · poids ouverts · 2 configurationsMaximale23,4 %92,3
16Claude Opus 4.8AnthropicMaximale20,9 %90,9
16Step 5 PreviewStepFunNon précisée20,9 %90,9
16GLM-5.2Z.ai (Zhipu AI) · poids ouverts · 2 configurationsMaximale20,9 %90,9
19GPT-5.6 LunaOpenAI · 6 configurationsMaximale20,6 %90,8
20Qwen 3.8 MaxAlibabaNon précisée20 %90,5
21Grok 4.6xAI · 4 configurationsMaximale19,7 %90,3
22GLM-5.3Z.ai (Zhipu AI) · poids ouvertsMaximale19,1 %90,0
23Gemini 3.8 FlashGoogle DeepMind · 3 configurationsÉlevée18,3 %89,5
24DeepSeek V4 Pro 0813DeepSeek · poids ouvertsMaximale18 %89,3
25Qwen3.8 Max (0902)AlibabaNon précisée17,7 %89,1
25Grok 4.7xAIMaximale17,7 %89,1
25Muse Spark 1.2Meta AIMaximale17,7 %89,1
25Gemini 3.1 ProGoogle DeepMindNon précisée17,7 %89,1
29Claude Sonnet 5Anthropic · 2 configurationsMaximale16,9 %88,6
30DeepSeek V4 Flash 0731DeepSeek · poids ouvertsMaximale16,6 %88,4
31Grok 4.5xAIÉlevée15,4 %87,6
31GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsNon précisée15,4 %87,6
33Muse Spark 1.1Meta AINon précisée15,1 %87,4
34Gemini 3.7 FlashGoogle DeepMind · 3 configurationsÉlevée14,3 %86,8
34DeepSeek V4.1 FlashDeepSeek · poids ouvertsMaximale14,3 %86,8
36Qwen3.7-MaxAlibabaNon précisée13,4 %86,1
37Gemini 3.5 FlashGoogle DeepMindÉlevée13,1 %85,9
38DeepSeek-V4-ProDeepSeek · poids ouverts · 2 configurationsMaximale12,9 %85,7
39GPT-5OpenAI · 2 configurationsÉlevée12,6 %85,5
40Claude Opus 4.7AnthropicMaximale12 %84,9
41Muse SparkMeta AINon précisée11,3 %84,4
42Gemini 3.6 FlashGoogle DeepMindÉlevée10,6 %83,6
43Kimi K2.7 CodeMoonshot · poids ouvertsNon précisée10 %83,1
43GPT-5.4 MiniOpenAIMaximale10 %83,1
45GPT-5.4 NanoOpenAIMaximale9,3 %82,3
46Grok Build 0.1xAINon précisée9,1 %82,2
46Qwen3.7-PlusAlibabaNon précisée9,1 %82,2
48Inkling-SmallThinking Machines · poids ouvertsNon précisée8,3 %81,2
49Kimi K2.6Moonshot · poids ouvertsNon précisée8 %80,8
49Grok 4.3 BetaxAI · 3 configurationsÉlevée8 %80,8
51DeepSeek-V4-FlashDeepSeek · poids ouverts · 2 configurationsMaximale7,1 %79,7
52Gemini 3 ProGoogle DeepMindNon précisée6,9 %79,4
53Qwen 3.8 27BAlibaba · poids ouverts · 4 configurationsMaximale5,4 %77,1
53InklingThinking Machines · poids ouvertsMaximale5,4 %77,1
55GPT-5.1OpenAINon précisée4,9 %76,0
56GLM-5.1Z.ai (Zhipu AI) · poids ouvertsNon précisée4,6 %75,4
57MiMo-V2.5-ProXiaomi · poids ouvertsNon précisée4 %74,1
58MiniMax-M3MiniMax · poids ouvertsNon précisée3,7 %73,4
58MiMo-V2.5Xiaomi · poids ouvertsNon précisée3,7 %73,4
58Ring-2.6-1TAnt GroupNon précisée3,7 %73,4
61Claude Sonnet 4.6AnthropicMaximale3,1 %71,9
61Kimi K2.5Moonshot · poids ouvertsNon précisée3,1 %71,9
61Nemotron 3 UltraNVIDIA · poids ouvertsNon précisée3,1 %71,9
61Nemotron 3 SuperNVIDIA · poids ouvertsNon précisée3,1 %71,9
65Qwen 3.6 PlusAlibabaNon précisée2,9 %71,0
65DeepSeek-V3.2-ExpDeepSeekÉlevée2,9 %71,0
67Step 3.7 FlashStepFun · poids ouvertsNon précisée2,3 %68,9
68Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée2 %67,6
69DeepSeek-V3.1-TerminusDeepSeek · poids ouvertsNon précisée1,7 %66,2
70GLM-4.7Z.ai (Zhipu AI) · poids ouvertsNon précisée1,7 %66,2
71Gemma 4 31B ITGoogle DeepMind · poids ouvertsNon précisée1,4 %64,5
71gpt-oss-20bOpenAI · poids ouvertsÉlevée1,4 %64,5
73o3OpenAIÉlevée1,4 %64,3
74Claude Sonnet 4.5AnthropicNon précisée1,1 %62,5
74Gemini 3.1 Flash-LiteGoogle DeepMindNon précisée1,1 %62,5
74GLM-4.6Z.ai (Zhipu AI) · poids ouvertsNon précisée1,1 %62,5
74gpt-oss-120bOpenAI · poids ouverts · 2 configurationsÉlevée1,1 %62,5
78Gemini 2.5 Flash (Jun 2025)Google DeepMindNon précisée1,1 %62,1
78DeepSeek-R1DeepSeek · poids ouvertsNon précisée1,1 %62,1
80Qwen3.6 27BAlibaba · poids ouvertsSans0,9 %61,2
80Qwen3.5-122B-A10BAlibaba · poids ouvertsSans0,9 %61,2
80Trinity Large ThinkingArcee AI · poids ouvertsNon précisée0,9 %61,2
83Mercury 2Inception LabsNon précisée0,8 %61,2
84o4-miniOpenAIÉlevée0,6 %61,2
85MiniMax-M2.7MiniMax · poids ouvertsNon précisée0,6 %61,2
85Qwen3.5-35B-A3BAlibaba · poids ouvertsSans0,6 %61,2
87Claude Opus 4AnthropicNon précisée0,3 %61,2
88Qwen 3.6 35B-A3BAlibaba · poids ouverts · 2 configurationsNon précisée0,3 %61,2
88Claude Sonnet 4AnthropicNon précisée0,3 %61,2
88Magistral Medium 1.2Mistral AINon précisée0,3 %61,2
88o3-miniOpenAIÉlevée0,3 %61,2
88Command A+Cohere · poids ouvertsNon précisée0,3 %61,2
88Qwen3-30B-A3B-Thinking (Jul 2025)Alibaba · poids ouvertsNon précisée0,3 %61,2
88Qwen3.5-9BAlibaba · poids ouvertsNon précisée0,3 %61,2
88Qwen3-32BAlibaba · poids ouvertsNon précisée0,3 %61,2
88Magistral Small 1.2Mistral AI · poids ouvertsNon précisée0,3 %61,2
97GPT-5.5 InstantOpenAINon précisée0 %61,2
97Gemini 3.5 Flash-LiteGoogle DeepMindNon précisée0 %61,2
97GPT-5 miniOpenAINon précisée0 %61,2
97Gemma 4 26B A4BGoogle DeepMind · poids ouvertsNon précisée0 %61,2
97Nova 2.0 Pro PreviewAmazon · 3 configurationsFaible0 %61,2
97Claude Haiku 4.5AnthropicNon précisée0 %61,2
97Mistral Medium 3.5Mistral AI · poids ouvertsNon précisée0 %61,2
97Qwen3-235B-A22B-Thinking (Jul 2025)AlibabaNon précisée0 %61,2
97Cogito v2.1Deep Cogito · poids ouvertsNon précisée0 %61,2
97MiMo-V2-FlashXiaomi · poids ouvertsNon précisée0 %61,2
97Mistral Large 3Mistral AI · poids ouvertsNon précisée0 %61,2
97Mistral Medium 3.1Mistral AINon précisée0 %61,2
97qwen3-coder-nextAlibaba · poids ouvertsNon précisée0 %61,2
97Qwen3-14BAlibaba · poids ouvertsNon précisée0 %61,2
97GPT-4.1 miniOpenAINon précisée0 %61,2
97DeepSeek-V3 (Mar 2025)DeepSeek · poids ouvertsNon précisée0 %61,2
97Qwen3-8BAlibaba · poids ouvertsNon précisée0 %61,2
97Devstral Small 2Mistral AI · poids ouvertsNon précisée0 %61,2
97Llama 4 MaverickMeta AI · poids ouverts · 2 configurationsNon précisée0 %61,2
97Mistral Small 3.2Mistral AI · poids ouvertsNon précisée0 %61,2
97DeepSeek-V3DeepSeek · poids ouvertsNon précisée0 %61,2
97Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée0 %61,2
97Granite 4.1 30BIBM · poids ouvertsNon précisée0 %61,2
97GPT-4.1 nanoOpenAINon précisée0 %61,2
97Llama 4 ScoutMeta AI · poids ouvertsNon précisée0 %61,2
97Solar Pro 3UpstageNon précisée0 %61,2
97Llama 3.3 70BMeta AI · poids ouvertsNon précisée0 %61,2
97GPT-4o (Nov 2024)OpenAINon précisée0 %61,2
97Mistral Small 3.1Mistral AINon précisée0 %61,2
97Claude 3.5 HaikuAnthropicNon précisée0 %61,2
97Gemma 3 12BGoogle DeepMind · poids ouvertsNon précisée0 %61,2
97Llama 3.1-8BMeta AI · poids ouvertsNon précisée0 %61,2
97Phi-4 MiniMicrosoft · poids ouvertsNon précisée0 %61,2

En bref

Que mesure CritPt ?
71 défis de physique de niveau recherche, comparables à un premier projet de thèse, écrits par plus de 50 physiciens. Sur Quelle IA, il est rangé dans la tâche Sciences et savoir expert.
Comment CritPt est-il noté ?
Part de défis résolus ; les réponses (nombres, formules, fonctions Python) sont vérifiées automatiquement. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 41 %.
Qui est en tête sur CritPt ?
GPT-5.6 Sol (OpenAI) est en tête de CritPt avec 32,3 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5.5 (31,7 %) et GPT-6 Astra (31,7 %). 129 modèles y sont mesurés.
Quelles sont les limites de CritPt ?
Scores très bas, 32 % au mieux. Les résultats sont mesurés par Artificial Analysis, dans ses propres conditions. Au 28 septembre 2026, le benchmark est actif.
Combien pèse CritPt dans le score IA ?
CritPt compte pour 2 % du score général, dans l'édition du 28 septembre 2026. Il porte 20 % de la tâche Sciences et savoir expert (10 % du score général), que se partagent 5 benchmarks.
Qui maintient CritPt ?
Collectif de physiciens mené par le laboratoire d'Argonne et l'université de l'Illinois ; classement Artificial Analysis. Sa page de référence : artificialanalysis.ai/evaluations/critpt.

Les autres benchmarks de la tâche Sciences et savoir expert

Tous les benchmarks →Comment le score IA est calculé →