Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

RaisonnementFiche benchmark · Redwood Research · conceptualreasoning.ai

LMCA

Juger la qualité d'arguments en philosophie, en théorie de la décision et en sûreté de l'IA, comme le ferait un expert.

À quoi il sert

Sur Quelle IA, LMCA sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 82.

Comment c'est noté

Corrélation entre les notes du modèle et celles des experts, multipliée par 100 ; les auteurs situent le plafond vers 85.

Pour le calcul, ce score est ramené entre 0 et 1 : 0 vaut 0 et 85, le plafond retenu, vaut 1.

Ce qu'il ne dit pas

Le jeu de données est privé et les notes d'experts gardent une part de subjectivité, si bien qu'un score de 100 est hors d'atteinte.

Comment lire le score

130 modèles mesurés · 173 mesures

En tête : Claude Opus 5.5, 68,23

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 42,5 a un score IA d'environ 82. Le meilleur, Claude Opus 5.5, atteint 68,23.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
11,4
Score IA 76niveau de Claude Sonnet 4.5
35,3
Score IA 100niveau de Claude Opus 5.5
63,3

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,67 %du score général. LMCA porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.

En couleur, la tâche Raisonnement dans le score général. En noir, la part de LMCA.

Le classement du benchmark

Scores relevés sur conceptualreasoning.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Opus 5.5AnthropicMaximale68,23105,4
2Claude Fable 5.1Anthropic · 5 configurationsNon précisée65,46102,1
3Claude Opus 5Anthropic · 5 configurationsMaximale64,45101,0
4GPT-6 AstraOpenAI · 5 configurationsMaximale64,37101,0
5Claude Fable 5Anthropic · 5 configurationsÉlevée61,1597,7
6GPT-5.6 SolOpenAI · 7 configurationsMaximale59,2195,9
7Claude Opus 4.8AnthropicMaximale57,5194,3
8Claude Opus 4.6AnthropicMaximale55,7692,8
9GLM-5.3Z.ai (Zhipu AI) · poids ouvertsNon précisée55,5192,6
10GPT-5.6 TerraOpenAI · 6 configurationsMaximale54,9592,1
130 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 130 →Replier le classement ↑
11GPT-5.5OpenAIMaximale54,2791,5
12GPT-5.5 ProOpenAIMaximale53,9491,2
13Muse Spark 1.3Meta AINon précisée53,8791,2
14Gemini 3.1 ProGoogle DeepMind · 3 configurationsÉlevée53,8291,1
15Gemini 3.8 FlashGoogle DeepMind · 3 configurationsMoyenne52,990,4
16Kimi K3Moonshot · poids ouvertsMaximale52,7490,2
17Claude Opus 4.7AnthropicMaximale52,289,8
18GPT-5.4OpenAIMaximale51,9789,6
19Gemini 3.7 FlashGoogle DeepMind · 3 configurationsÉlevée50,3888,3
20Claude Sonnet 5Anthropic · 5 configurationsÉlevée50,0288,0
21Muse Spark 1.1Meta AIÉlevée49,9187,9
22GPT-5.6 LunaOpenAI · 6 configurationsMaximale48,5486,8
23Grok 4.6xAIMaximale48,4586,8
24Muse Spark 1.2Meta AIMaximale48,3586,7
25Gemini 3.5 FlashGoogle DeepMindÉlevée47,1585,7
26DeepSeek V4.1 FlashDeepSeek · poids ouvertsNon précisée46,9785,6
27Claude Sonnet 4.6AnthropicMaximale46,5185,2
28Qwen 3.8 MaxAlibabaMaximale46,2485,0
29GLM-5.2Z.ai (Zhipu AI) · poids ouvertsMaximale45,8284,7
30DeepSeek V4 Pro 0813DeepSeek · poids ouvertsNon précisée45,4584,4
31Grok 4.5xAIÉlevée45,284,2
32Gemini 3.6 FlashGoogle DeepMindÉlevée44,9384,0
33Claude Opus 4.5AnthropicÉlevée44,4683,6
34Qwen3.7-MaxAlibabaNon précisée44,0283,3
35GPT-5.2OpenAIMaximale43,9183,2
36GPT-5.1OpenAIÉlevée43,8983,2
37Gemini 3 FlashGoogle DeepMindÉlevée43,1382,6
38Qwen 3.6 Max (Preview)AlibabaNon précisée42,5382,1
39DeepSeek V4 Flash 0731DeepSeek · poids ouvertsMaximale41,7381,5
40Qwen 3.8 27BAlibaba · poids ouvertsNon précisée41,3681,2
41DeepSeek-V4-ProDeepSeek · poids ouvertsMaximale41,281,1
42GPT-5.4 MiniOpenAIMaximale40,7980,8
43GPT-5OpenAIÉlevée39,9980,1
44o3OpenAIÉlevée39,779,9
45Gemma 4 31B ITGoogle DeepMind · poids ouvertsNon précisée39,2579,5
46Claude Sonnet 4.5AnthropicNon précisée38,7679,2
47Grok 4.20xAINon précisée38,6679,1
48o3-proOpenAIÉlevée38,4878,9
49Grok 4.3 BetaxAIÉlevée38,3378,8
50Qwen3.5 397B-A17BAlibaba · poids ouvertsNon précisée37,8978,5
51Gemini 3.5 Flash-LiteGoogle DeepMindÉlevée37,678,2
52InklingThinking Machines · poids ouvertsMaximale37,5878,2
52Qwen3.7-PlusAlibabaNon précisée37,5878,2
54Claude Opus 4AnthropicNon précisée37,4378,1
55Kimi K2.6Moonshot · poids ouvertsNon précisée37,2678,0
56Claude Opus 4.1AnthropicNon précisée37,0877,8
57Nemotron 3 UltraNVIDIA · poids ouvertsNon précisée36,977,7
58GPT-5.4 NanoOpenAIMaximale36,8677,7
59Qwen 3.5 Plus (hosted 397B-A17B)AlibabaNon précisée36,3677,3
60DeepSeek-V4-FlashDeepSeek · poids ouvertsMaximale35,8876,9
61Gemini 3.1 Flash-LiteGoogle DeepMindÉlevée35,0176,2
62Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée34,7776,0
63Qwen3.6 27BAlibaba · poids ouvertsNon précisée34,5375,8
64GPT-5 miniOpenAIÉlevée34,275,5
65Qwen3.5-27BAlibaba · poids ouvertsNon précisée33,9875,3
66MiniMax-M3MiniMax · poids ouvertsNon précisée33,775,1
67Qwen 3.6 PlusAlibabaNon précisée33,0974,6
68Qwen3.5-122B-A10BAlibaba · poids ouvertsSans32,2373,9
69Qwen 3.6 FlashAlibabaNon précisée30,9872,9
70Claude Haiku 4.5AnthropicNon précisée30,9472,8
71Qwen 3.6 35B-A3BAlibaba · poids ouvertsNon précisée29,771,8
72Gemma 4 26B A4BGoogle DeepMind · poids ouvertsNon précisée29,6871,8
73MiMo-V2.5-ProXiaomi · poids ouvertsNon précisée29,571,6
74Qwen3.5-35B-A3BAlibaba · poids ouvertsNon précisée29,4771,6
75Qwen3-235B-A22B-Thinking (Jul 2025)AlibabaNon précisée29,3171,4
76Qwen 3.5 Flash (hosted 35B-A3B)AlibabaNon précisée29,1471,3
77DeepSeek-V3.2-ExpDeepSeekÉlevée29,1171,3
78Claude Sonnet 4AnthropicNon précisée2971,2
79DeepSeek-V3.2DeepSeek · poids ouverts · 2 configurationsNon précisée28,8271,0
80DeepSeek-V3.1-TerminusDeepSeek · poids ouvertsNon précisée28,5870,8
81Qwen3-MaxAlibabaNon précisée28,2770,5
82Gemini 2.5 Flash (Jun 2025)Google DeepMindNon précisée27,4969,8
83o4-miniOpenAIÉlevée26,569,0
84Mistral Medium 3.5Mistral AI · poids ouvertsNon précisée26,0668,6
85GPT-4.1OpenAINon précisée25,6168,1
86Qwen3-235B-A22BAlibaba · poids ouvertsNon précisée2567,6
87Qwen3.5-9BAlibaba · poids ouvertsNon précisée24,4767,1
88DeepSeek-V3.1DeepSeek · poids ouvertsÉlevée24,2966,9
89Qwen Plus (Apr 2025)AlibabaNon précisée23,9666,6
90Qwen3-235B-A22B-Instruct (Jul 2025)Alibaba · poids ouvertsNon précisée23,5266,2
91Qwen3-30B-A3B-Instruct (Jul 2025)Alibaba · poids ouvertsNon précisée22,3765,0
92o1OpenAIÉlevée22,2764,9
93gpt-oss-120bOpenAI · poids ouvertsÉlevée22,1464,8
94GPT-4.1 miniOpenAINon précisée21,1263,7
95Mistral Small 4Mistral AI · poids ouvertsNon précisée20,6163,2
96Qwen3-30B-A3B-Thinking (Jul 2025)Alibaba · poids ouvertsNon précisée19,5362,0
97Mistral Medium 3.1Mistral AINon précisée19,0561,5
98o3-miniOpenAIÉlevée18,9761,4
99Qwen3-14BAlibaba · poids ouvertsNon précisée18,1960,5
100Gemini 2.5 Flash-Lite (Jun 2025)Google DeepMindNon précisée18,0760,4
101Llama 3.3 70BMeta AI · poids ouvertsNon précisée17,5259,7
102Qwen3-32BAlibaba · poids ouvertsNon précisée17,2859,4
103GPT-4 (Jun 2023)OpenAINon précisée17,0659,2
104Claude 3 OpusAnthropicNon précisée1759,1
105Mistral Large 3Mistral AI · poids ouvertsNon précisée16,758,7
106GPT-4o (May 2024)OpenAINon précisée16,5958,6
107Llama 4 MaverickMeta AI · poids ouvertsNon précisée15,8757,7
108Qwen3-30B-A3BAlibaba · poids ouvertsNon précisée15,8257,6
109DeepSeek-V3 (Mar 2025)DeepSeek · poids ouvertsNon précisée15,4757,2
110Llama 3.1-70BMeta AI · poids ouvertsNon précisée14,8556,3
111gpt-oss-20bOpenAI · poids ouvertsÉlevée14,5155,9
112Qwen2.5-72BAlibaba · poids ouvertsNon précisée13,4254,3
113Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée12,2852,6
114Llama 4 ScoutMeta AI · poids ouvertsNon précisée11,9652,1
115GPT-4o miniOpenAINon précisée10,3749,4
116Cohere Command ACohere · poids ouvertsNon précisée10,2849,2
117GPT-4 Turbo (Nov 2023)OpenAINon précisée9,7848,3
118GPT-3.5 Turbo (Jan 2024)OpenAINon précisée9,6548,0
119c4ai-command-r-08-2024Cohere · poids ouvertsNon précisée9,1947,1
120Claude 3 HaikuAnthropicNon précisée8,8446,4
121Qwen3-8BAlibaba · poids ouvertsNon précisée8,8246,3
122GPT-5 nanoOpenAIÉlevée7,9344,4
123Gemma 2 27BGoogle DeepMindNon précisée7,142,4
124Qwen2.5-7BAlibaba · poids ouvertsNon précisée6,4240,5
125Ministral 3BMistral AI · poids ouvertsNon précisée5,4837,7
126GPT-4.1 nanoOpenAINon précisée5,4637,7
127Llama 3.1-8BMeta AI · poids ouvertsNon précisée5,3737,4
128Command R+Cohere · poids ouvertsNon précisée5,0136,1
129Gemma 3 12BGoogle DeepMind · poids ouvertsNon précisée4,4634,1
130Gemma 3 4BGoogle DeepMind · poids ouvertsNon précisée2,7825,9

En bref

Que mesure LMCA ?
Juger la qualité d'arguments en philosophie, en théorie de la décision et en sûreté de l'IA, comme le ferait un expert. Sur Quelle IA, il est rangé dans la tâche Raisonnement.
Comment LMCA est-il noté ?
Corrélation entre les notes du modèle et celles des experts, multipliée par 100 ; les auteurs situent le plafond vers 85. Un modèle qui obtient 42,5 a un score IA d'environ 82.
Qui est en tête sur LMCA ?
Claude Opus 5.5 (Anthropic) est en tête de LMCA avec 68,23, dans l'édition du 28 septembre 2026. Suivent Claude Fable 5.1 (65,46) et Claude Opus 5 (64,45). 130 modèles y sont mesurés.
Quelles sont les limites de LMCA ?
Le jeu de données est privé et les notes d'experts gardent une part de subjectivité, si bien qu'un score de 100 est hors d'atteinte. Au 28 septembre 2026, le benchmark est actif.
Combien pèse LMCA dans le score IA ?
LMCA compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.
Qui maintient LMCA ?
Redwood Research. Sa page de référence : conceptualreasoning.ai/lmca.

Les autres benchmarks de la tâche Raisonnement

Tous les benchmarks →Comment le score IA est calculé →