Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

RaisonnementFiche benchmark · LiveBench (Abacus.AI, NYU et coauteurs) · livebench.ai

LiveBench, raisonnement

Des énigmes logiques et des déductions dont les questions sont renouvelées régulièrement.

ARCHIVÉ

À quoi il sert

LiveBench, raisonnement servait à noter la tâche Raisonnement. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

Comment c'est noté

La part de bonnes réponses, vérifiée automatiquement, sans juge humain ni modèle juge.

Ce qu'il ne dit pas

Les questions récentes ne sont pas publiées. Dernière édition en juin 2026.

Comment lire le score

48 modèles mesurés · 54 mesures

En tête : GPT-5.1, 95,8 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 52. Le meilleur, GPT-5.1, atteint 95,8 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
49 %
Score IA 76niveau de Claude Sonnet 4.5
89 %
Score IA 100niveau de Claude Opus 5.5
98 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. LiveBench, raisonnement est archivé et ne compte plus : la tâche Raisonnement (15 % du score général) repose sur 9 autres benchmarks.

En couleur, la tâche Raisonnement dans le score général. LiveBench, raisonnement n'y a plus de part.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-5.1OpenAIÉlevée95,8 %87,8
2o1OpenAIÉlevée91,6 %79,4
3Gemini 2.5 Pro (Mar 2025)Google DeepMindNon précisée89,8 %76,9
4o3-miniOpenAI · 3 configurationsÉlevée89,6 %76,6
5Claude 3.7 SonnetAnthropic · 2 configurationsNon précisée87,8 %74,6
6QwQ-32BAlibaba · poids ouvertsNon précisée83,5 %70,5
7DeepSeek-R1DeepSeek · poids ouvertsNon précisée83,2 %70,3
8Gemini 2.0 Flash Thinking (Jan 2025)Google DeepMindNon précisée78,2 %66,5
9o1-miniOpenAIMoyenne72,3 %62,9
10GPT-4.5OpenAINon précisée71,1 %62,2
48 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 48 →Replier le classement ↑
11DeepSeek-R1-Distill-Llama-70BDeepSeek · poids ouvertsNon précisée67,6 %60,3
12DeepSeek-V3 (Mar 2025)DeepSeek · poids ouvertsNon précisée65,8 %59,4
13Gemini 2.0 ProGoogle DeepMindNon précisée60,1 %56,5
14Gemini 2.0 Flash (Dec 2024)Google DeepMind · 2 configurationsNon précisée59,1 %56,0
15QwQ-32B-PreviewAlibaba · poids ouvertsNon précisée57,7 %55,4
16DeepSeek-V3DeepSeek · poids ouvertsNon précisée56,8 %54,9
17Claude 3.5 Sonnet (October 2024)AnthropicNon précisée56,7 %54,9
18GPT-4o (Nov 2024)OpenAINon précisée55,8 %54,5
19Gemini 2.0 Flash (Feb 2025)Google DeepMindNon précisée55,3 %54,2
20Grok-2 (Dec 2024)xAINon précisée54,8 %54,0
21GPT-4o (Aug 2024)OpenAINon précisée53,9 %53,6
22DeepSeek-R1-Distill-Qwen-32BDeepSeekNon précisée52,3 %52,8
23Qwen2.5-MaxAlibabaNon précisée51,4 %52,5
24Llama 3.3 70BMeta AI · poids ouvertsNon précisée50,8 %52,1
25Gemini 2.0 Flash-LiteGoogle DeepMind · 2 configurationsNon précisée50,1 %51,8
26Phi-4Microsoft · poids ouvertsNon précisée47,8 %50,8
27Dracarys2-72B-InstructNon précisée47,4 %50,6
28sonarPerplexityNon précisée46,3 %50,1
29Mistral Small 3.1Mistral AINon précisée44,8 %49,4
30Dracarys2-Llama-3.1-70B-InstructNon précisée44,7 %49,3
31Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée43,8 %48,9
32Mistral Large 2 (Nov 2024)Mistral AI · poids ouvertsNon précisée43,5 %48,8
33learnlm-1.5-pro-experimentalGoogle DeepMindNon précisée43,4 %48,7
34Qwen2.5-Coder-32B-InstructAlibaba · poids ouvertsNon précisée42,1 %48,1
35Claude 3 OpusAnthropicNon précisée40,6 %47,4
36Amazon Nova LiteAmazonNon précisée36,7 %45,5
37Mistral Small 3Mistral AINon précisée36,4 %45,4
38GPT-4o miniOpenAINon précisée32,8 %43,5
39Amazon Nova ProAmazonNon précisée32,6 %43,4
40Claude 3.5 HaikuAnthropicNon précisée28,1 %40,9
40Gemma 2 27BGoogle DeepMindNon précisée28,1 %40,9
42phi-3-mini 3.8BMicrosoft · poids ouverts · 2 configurationsNon précisée26,8 %40,2
43Amazon Nova MicroAmazonNon précisée25,1 %39,2
44Command R+Cohere · poids ouvertsNon précisée24,8 %38,9
45c4ai-command-r-08-2024Cohere · poids ouvertsNon précisée21,9 %37,1
46OLMo 2 Furious 13BAllen Institute for AI · poids ouvertsNon précisée16,3 %32,9
47phi-3-small 7.4BMicrosoft · poids ouvertsNon précisée15,9 %32,6
48Gemma 2 9BGoogle DeepMind · poids ouvertsNon précisée15,2 %31,9

En bref

Que mesure LiveBench, raisonnement ?
Des énigmes logiques et des déductions dont les questions sont renouvelées régulièrement. Sur Quelle IA, il est rangé dans la tâche Raisonnement.
Comment LiveBench, raisonnement est-il noté ?
La part de bonnes réponses, vérifiée automatiquement, sans juge humain ni modèle juge. Un modèle qui obtient 50 % a un score IA d'environ 52.
Qui est en tête sur LiveBench, raisonnement ?
GPT-5.1 (OpenAI) est en tête de LiveBench, raisonnement avec 95,8 %, dans l'édition du 28 septembre 2026. Suivent o1 (91,6 %) et Gemini 2.5 Pro (Mar 2025) (89,8 %). 48 modèles y sont mesurés.
Quelles sont les limites de LiveBench, raisonnement ?
Les questions récentes ne sont pas publiées. Dernière édition en juin 2026. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse LiveBench, raisonnement dans le score IA ?
LiveBench, raisonnement compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Raisonnement (15 % du score général) repose sur 9 autres benchmarks.
Qui maintient LiveBench, raisonnement ?
LiveBench (Abacus.AI, NYU et coauteurs). Sa page de référence : livebench.ai.

Les autres benchmarks de la tâche Raisonnement

Tous les benchmarks →Comment le score IA est calculé →