Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

RaisonnementFiche benchmark · Forecasting Research Institute · forecastbench.org

ForecastBench

Prédire des événements à venir (marchés de prédiction, indicateurs économiques, conflits) en donnant une probabilité.

À quoi il sert

Sur Quelle IA, ForecastBench sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks.

Comment c'est noté

Indice de Brier ajusté à la difficulté, de 0 à 100 : 100 pour des prévisions parfaites, 50 pour une réponse sans information.

Pour le calcul, ce score est ramené entre 0 et 1 : 50 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

Ce qu'il ne dit pas

Aucune fuite possible puisque la réponse n'existe pas encore, mais les écarts sont minces (de 50 à 63) et il faut attendre l'issue des questions.

Comment lire le score

77 modèles mesurés · 82 mesures

En tête : o3, 62,5 %

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 62 %. Le meilleur, o3, atteint 62,5 %. Le benchmark sera dit saturé quand un modèle atteindra 97,5 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
58 %
Score IA 76niveau de Claude Sonnet 4.5
60 %
Score IA 100niveau de Claude Opus 5.5
62 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,67 %du score général. ForecastBench porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.

En couleur, la tâche Raisonnement dans le score général. En noir, la part de ForecastBench.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1o3OpenAINon précisée62,5 %100,6
2Claude Sonnet 4.6Anthropic · 2 configurationsBudget62 %96,0
2Claude Opus 4.1AnthropicNon précisée62 %96,0
4Claude Sonnet 4.5AnthropicNon précisée61,9 %95,1
5o4-miniOpenAINon précisée61,8 %94,2
5Claude 3.7 SonnetAnthropicNon précisée61,8 %94,2
7GPT-4.5OpenAINon précisée61,7 %93,2
8GPT-4.1OpenAINon précisée61,5 %91,3
9Grok 4.20xAI · 2 configurationsNon précisée61,4 %90,4
9GPT-5OpenAINon précisée61,4 %90,4
77 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 77 →Replier le classement ↑
9MiniMax-M3MiniMax · poids ouvertsNon précisée61,4 %90,4
9Claude Haiku 4.5AnthropicNon précisée61,4 %90,4
13Gemini 2.5 Pro (Mar 2025)Google DeepMindNon précisée61,3 %89,4
14Gemini 3 ProGoogle DeepMindNon précisée61,2 %88,5
15Kimi K3Moonshot · poids ouvertsMaximale61,1 %87,5
15Claude Sonnet 5AnthropicBudget61,1 %87,5
15Claude Opus 4AnthropicNon précisée61,1 %87,5
18GLM-5Z.ai (Zhipu AI) · poids ouvertsNon précisée61 %86,5
18GPT-5 miniOpenAINon précisée61 %86,5
18Grok 4.1 FastxAINon précisée61 %86,5
21Grok 4xAINon précisée60,9 %85,5
22Claude Opus 4.5AnthropicNon précisée60,7 %83,5
22Claude 3.5 Sonnet (October 2024)AnthropicNon précisée60,7 %83,5
24GPT-5.5OpenAINon précisée60,6 %82,5
24Gemini 2.5 Flash (Apr 2025)Google DeepMindNon précisée60,6 %82,5
26Grok 4 FastxAINon précisée60,5 %81,5
27Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée60,4 %80,5
28Claude Opus 4.7AnthropicNon précisée60,3 %79,5
28Grok 4.3 BetaxAINon précisée60,3 %79,5
30Claude Sonnet 4AnthropicNon précisée60,2 %78,4
30Kimi K2 (Jul 2025)MoonshotNon précisée60,2 %78,4
32GPT-5.2OpenAINon précisée60,1 %77,4
33Claude Opus 4.6AnthropicNon précisée60 %76,3
33DeepSeek-R1DeepSeek · poids ouvertsNon précisée60 %76,3
35Claude Opus 4.8Anthropic · 2 configurationsBudget59,9 %75,3
35Llama 3.1-405BMeta AI · poids ouvertsNon précisée59,9 %75,3
37Kimi K2 (Sep 2025)MoonshotNon précisée59,8 %74,2
38Qwen3-235B-A22BAlibaba · poids ouvertsNon précisée59,7 %73,2
39o3-miniOpenAINon précisée59,6 %72,1
40GPT-5.4OpenAINon précisée59,5 %71,0
41Claude 3.5 SonnetAnthropicNon précisée59,4 %69,9
41GPT-4 Turbo (Apr 2024)OpenAINon précisée59,4 %69,9
43GLM-4.5-AirZ.ai (Zhipu AI) · poids ouvertsNon précisée59,2 %67,7
44GPT-5 nanoOpenAINon précisée59,1 %66,5
44DeepSeek-V3DeepSeek · poids ouvertsNon précisée59,1 %66,5
46Gemini 3.1 ProGoogle DeepMind · 2 configurationsNon précisée59 %65,4
46Gemini 3.5 FlashGoogle DeepMindNon précisée59 %65,4
46Gemini 2.5 Flash (Jun 2025)Google DeepMindNon précisée59 %65,4
49Llama 3.3 70BMeta AI · poids ouvertsNon précisée58,6 %60,7
49Llama 3-8BMeta AI · poids ouverts · 2 configurationsNon précisée58,6 %60,7
51Gemini 3 FlashGoogle DeepMindNon précisée58,5 %59,6
52Claude 3 OpusAnthropicNon précisée58,4 %58,4
52Gemini 1.5 Pro (May 2024)Google DeepMindNon précisée58,4 %58,4
54QwQ-32B-PreviewAlibaba · poids ouvertsNon précisée58,3 %57,1
55GPT-5.1OpenAINon précisée58,1 %54,7
56DeepSeek-V3.1DeepSeek · poids ouvertsNon précisée58 %53,4
57GPT-4 (Jun 2023)OpenAINon précisée57,8 %50,9
58GPT-4o (May 2024)OpenAINon précisée57,7 %49,6
58Qwen1.5-110BAlibaba · poids ouvertsNon précisée57,7 %49,6
60Llama 4 MaverickMeta AI · poids ouvertsNon précisée57,5 %47,0
60Llama 4 ScoutMeta AI · poids ouvertsNon précisée57,5 %47,0
60Qwen2.5-72BAlibaba · poids ouvertsNon précisée57,5 %47,0
63GPT-5.4 NanoOpenAINon précisée57,3 %44,3
64Gemini 2.0 Flash-LiteGoogle DeepMindNon précisée57,1 %41,6
64Mistral Large 2 (Jul 2024)Mistral AINon précisée57,1 %41,6
64Llama 3-70BMeta AI · poids ouvertsNon précisée57,1 %41,6
67GPT-5.4 MiniOpenAINon précisée57 %40,2
68Mistral Large 2 (Nov 2024)Mistral AI · poids ouvertsNon précisée56,9 %38,8
69Mixtral 8x22BMistral AI · poids ouvertsNon précisée56,3 %30,0
69Mixtral 8x7BMistral AI · poids ouvertsNon précisée56,3 %30,0
71DeepSeek-V4-ProDeepSeek · poids ouvertsNon précisée56,1 %26,9
72Gemini 3.1 Flash-LiteGoogle DeepMindNon précisée54,4 %-3,9
73Claude 2.1AnthropicNon précisée54,2 %-8,1
74Gemini 1.5 Flash (May 2024)Google DeepMindNon précisée53,9 %-14,9
75Claude 3 HaikuAnthropicNon précisée53,2 %-32,9
76Llama 2-70BMeta AI · poids ouvertsNon précisée51,4 %-105,7
77GPT-3.5 Turbo (Jan 2024)OpenAINon précisée50,4 %-194,0

En bref

Que mesure ForecastBench ?
Prédire des événements à venir (marchés de prédiction, indicateurs économiques, conflits) en donnant une probabilité. Sur Quelle IA, il est rangé dans la tâche Raisonnement.
Comment ForecastBench est-il noté ?
Indice de Brier ajusté à la difficulté, de 0 à 100 : 100 pour des prévisions parfaites, 50 pour une réponse sans information. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 62 %.
Qui est en tête sur ForecastBench ?
o3 (OpenAI) est en tête de ForecastBench avec 62,5 %, dans l'édition du 28 septembre 2026. Suivent Claude Sonnet 4.6 (62 %) et Claude Opus 4.1 (62 %). 77 modèles y sont mesurés.
Quelles sont les limites de ForecastBench ?
Aucune fuite possible puisque la réponse n'existe pas encore, mais les écarts sont minces (de 50 à 63) et il faut attendre l'issue des questions. Au 28 septembre 2026, le benchmark est actif.
Combien pèse ForecastBench dans le score IA ?
ForecastBench compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.
Qui maintient ForecastBench ?
Forecasting Research Institute. Sa page de référence : forecastbench.org.

Les autres benchmarks de la tâche Raisonnement

Tous les benchmarks →Comment le score IA est calculé →