# ForecastBench

> Fiche du benchmark ForecastBench sur Quelle IA, édition du 28 septembre 2026. Prédire des événements à venir (marchés de prédiction, indicateurs économiques, conflits) en donnant une probabilité. En tête au 28 septembre 2026 : o3 (62,5 %). Notation, limites et classement des 77 modèles mesurés.

Page : https://quelleia.com/benchmarks/forecastbench/
Source du benchmark : https://www.forecastbench.org/
Mainteneur : Forecasting Research Institute
Tâche : Raisonnement
État : actif

## À quoi il sert

Sur Quelle IA, ForecastBench sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks.

## Comment c'est noté

Indice de Brier ajusté à la difficulté, de 0 à 100 : 100 pour des prévisions parfaites, 50 pour une réponse sans information.

Pour le calcul, ce score est ramené entre 0 et 1 : 50 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

## Ce qu'il ne dit pas

Aucune fuite possible puisque la réponse n'existe pas encore, mais les écarts sont minces (de 50 à 63) et il faut attendre l'issue des questions.

## Qui le tient

Forecasting Research Institute.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 62 %. Le meilleur, o3, atteint 62,5 %. Le benchmark sera dit saturé quand un modèle atteindra 97,5 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 58 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 60 %
- Score IA 100 (niveau de Claude Opus 5.5) : 62 %

## Son poids dans le score IA

1,67 % du score général. ForecastBench porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.

## Classement (77 modèles mesurés · 82 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | non précisée | 62,5 % | 100,6 | https://epoch.ai/benchmarks |
| 2 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | Budget | 62 % | 96,0 | https://epoch.ai/benchmarks |
| 2 | [Claude Opus 4.1](https://quelleia.com/modeles/claude-opus-4-1.md) | Anthropic | non précisée | 62 % | 96,0 | https://epoch.ai/benchmarks |
| 4 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | non précisée | 61,9 % | 95,1 | https://epoch.ai/benchmarks |
| 5 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | non précisée | 61,8 % | 94,2 | https://epoch.ai/benchmarks |
| 5 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | non précisée | 61,8 % | 94,2 | https://epoch.ai/benchmarks |
| 7 | [GPT-4.5](https://quelleia.com/modeles/gpt-4-5.md) | OpenAI | non précisée | 61,7 % | 93,2 | https://epoch.ai/benchmarks |
| 8 | [GPT-4.1](https://quelleia.com/modeles/gpt-4-1.md) | OpenAI | non précisée | 61,5 % | 91,3 | https://epoch.ai/benchmarks |
| 9 | [Grok 4.20](https://quelleia.com/modeles/grok-4-20.md) | xAI | non précisée | 61,4 % | 90,4 | https://epoch.ai/benchmarks |
| 9 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | non précisée | 61,4 % | 90,4 | https://epoch.ai/benchmarks |
| 9 | [MiniMax-M3](https://quelleia.com/modeles/minimax-m3.md) | MiniMax | non précisée | 61,4 % | 90,4 | https://epoch.ai/benchmarks |
| 9 | [Claude Haiku 4.5](https://quelleia.com/modeles/claude-haiku-4-5.md) | Anthropic | non précisée | 61,4 % | 90,4 | https://epoch.ai/benchmarks |
| 13 | [Gemini 2.5 Pro (Mar 2025)](https://quelleia.com/modeles/gemini-2-5-pro-mar-2025.md) | Google DeepMind | non précisée | 61,3 % | 89,4 | https://epoch.ai/benchmarks |
| 14 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | non précisée | 61,2 % | 88,5 | https://epoch.ai/benchmarks |
| 15 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | Maximale | 61,1 % | 87,5 | https://epoch.ai/benchmarks |
| 15 | [Claude Sonnet 5](https://quelleia.com/modeles/claude-sonnet-5.md) | Anthropic | Budget | 61,1 % | 87,5 | https://epoch.ai/benchmarks |
| 15 | [Claude Opus 4](https://quelleia.com/modeles/claude-opus-4.md) | Anthropic | non précisée | 61,1 % | 87,5 | https://epoch.ai/benchmarks |
| 18 | [GLM-5](https://quelleia.com/modeles/glm-5.md) | Z.ai (Zhipu AI) | non précisée | 61 % | 86,5 | https://epoch.ai/benchmarks |
| 18 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | non précisée | 61 % | 86,5 | https://epoch.ai/benchmarks |
| 18 | [Grok 4.1 Fast](https://quelleia.com/modeles/grok-4-1-fast.md) | xAI | non précisée | 61 % | 86,5 | https://epoch.ai/benchmarks |
| 21 | [Grok 4](https://quelleia.com/modeles/grok-4.md) | xAI | non précisée | 60,9 % | 85,5 | https://epoch.ai/benchmarks |
| 22 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | non précisée | 60,7 % | 83,5 | https://epoch.ai/benchmarks |
| 22 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 60,7 % | 83,5 | https://epoch.ai/benchmarks |
| 24 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | non précisée | 60,6 % | 82,5 | https://epoch.ai/benchmarks |
| 24 | [Gemini 2.5 Flash (Apr 2025)](https://quelleia.com/modeles/gemini-2-5-flash-apr-2025.md) | Google DeepMind | non précisée | 60,6 % | 82,5 | https://epoch.ai/benchmarks |
| 26 | [Grok 4 Fast](https://quelleia.com/modeles/grok-4-fast.md) | xAI | non précisée | 60,5 % | 81,5 | https://epoch.ai/benchmarks |
| 27 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 60,4 % | 80,5 | https://epoch.ai/benchmarks |
| 28 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | non précisée | 60,3 % | 79,5 | https://epoch.ai/benchmarks |
| 28 | [Grok 4.3 Beta](https://quelleia.com/modeles/grok-4-3-beta.md) | xAI | non précisée | 60,3 % | 79,5 | https://epoch.ai/benchmarks |
| 30 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | non précisée | 60,2 % | 78,4 | https://epoch.ai/benchmarks |
| 30 | [Kimi K2 (Jul 2025)](https://quelleia.com/modeles/kimi-k2-jul-2025.md) | Moonshot | non précisée | 60,2 % | 78,4 | https://epoch.ai/benchmarks |
| 32 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | non précisée | 60,1 % | 77,4 | https://epoch.ai/benchmarks |
| 33 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | non précisée | 60 % | 76,3 | https://epoch.ai/benchmarks |
| 33 | [DeepSeek-R1](https://quelleia.com/modeles/deepseek-r1.md) | DeepSeek | non précisée | 60 % | 76,3 | https://epoch.ai/benchmarks |
| 35 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Budget | 59,9 % | 75,3 | https://epoch.ai/benchmarks |
| 35 | [Llama 3.1-405B](https://quelleia.com/modeles/llama-3-1-405b.md) | Meta AI | non précisée | 59,9 % | 75,3 | https://epoch.ai/benchmarks |
| 37 | [Kimi K2 (Sep 2025)](https://quelleia.com/modeles/kimi-k2-sep-2025.md) | Moonshot | non précisée | 59,8 % | 74,2 | https://epoch.ai/benchmarks |
| 38 | [Qwen3-235B-A22B](https://quelleia.com/modeles/qwen3-235b-a22b.md) | Alibaba | non précisée | 59,7 % | 73,2 | https://epoch.ai/benchmarks |
| 39 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | non précisée | 59,6 % | 72,1 | https://epoch.ai/benchmarks |
| 40 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | non précisée | 59,5 % | 71,0 | https://epoch.ai/benchmarks |
| 41 | [Claude 3.5 Sonnet](https://quelleia.com/modeles/claude-3-5-sonnet.md) | Anthropic | non précisée | 59,4 % | 69,9 | https://epoch.ai/benchmarks |
| 41 | [GPT-4 Turbo (Apr 2024)](https://quelleia.com/modeles/gpt-4-turbo-apr-2024.md) | OpenAI | non précisée | 59,4 % | 69,9 | https://epoch.ai/benchmarks |
| 43 | [GLM-4.5-Air](https://quelleia.com/modeles/glm-4-5-air.md) | Z.ai (Zhipu AI) | non précisée | 59,2 % | 67,7 | https://epoch.ai/benchmarks |
| 44 | [GPT-5 nano](https://quelleia.com/modeles/gpt-5-nano.md) | OpenAI | non précisée | 59,1 % | 66,5 | https://epoch.ai/benchmarks |
| 44 | [DeepSeek-V3](https://quelleia.com/modeles/deepseek-v3.md) | DeepSeek | non précisée | 59,1 % | 66,5 | https://epoch.ai/benchmarks |
| 46 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 59 % | 65,4 | https://epoch.ai/benchmarks |
| 46 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | non précisée | 59 % | 65,4 | https://epoch.ai/benchmarks |
| 46 | [Gemini 2.5 Flash (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-flash-jun-2025.md) | Google DeepMind | non précisée | 59 % | 65,4 | https://epoch.ai/benchmarks |
| 49 | [Llama 3.3 70B](https://quelleia.com/modeles/llama-3-3-70b.md) | Meta AI | non précisée | 58,6 % | 60,7 | https://epoch.ai/benchmarks |
| 49 | [Llama 3-8B](https://quelleia.com/modeles/llama-3-8b.md) | Meta AI | non précisée | 58,6 % | 60,7 | https://epoch.ai/benchmarks |
| 51 | [Gemini 3 Flash](https://quelleia.com/modeles/gemini-3-flash.md) | Google DeepMind | non précisée | 58,5 % | 59,6 | https://epoch.ai/benchmarks |
| 52 | [Claude 3 Opus](https://quelleia.com/modeles/claude-3-opus.md) | Anthropic | non précisée | 58,4 % | 58,4 | https://epoch.ai/benchmarks |
| 52 | [Gemini 1.5 Pro (May 2024)](https://quelleia.com/modeles/gemini-1-5-pro-may-2024.md) | Google DeepMind | non précisée | 58,4 % | 58,4 | https://epoch.ai/benchmarks |
| 54 | [QwQ-32B-Preview](https://quelleia.com/modeles/qwq-32b-preview.md) | Alibaba | non précisée | 58,3 % | 57,1 | https://epoch.ai/benchmarks |
| 55 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | non précisée | 58,1 % | 54,7 | https://epoch.ai/benchmarks |
| 56 | [DeepSeek-V3.1](https://quelleia.com/modeles/deepseek-v3-1.md) | DeepSeek | non précisée | 58 % | 53,4 | https://epoch.ai/benchmarks |
| 57 | [GPT-4 (Jun 2023)](https://quelleia.com/modeles/gpt-4-jun-2023.md) | OpenAI | non précisée | 57,8 % | 50,9 | https://epoch.ai/benchmarks |
| 58 | [GPT-4o (May 2024)](https://quelleia.com/modeles/gpt-4o-may-2024.md) | OpenAI | non précisée | 57,7 % | 49,6 | https://epoch.ai/benchmarks |
| 58 | [Qwen1.5-110B](https://quelleia.com/modeles/qwen1-5-110b.md) | Alibaba | non précisée | 57,7 % | 49,6 | https://epoch.ai/benchmarks |
| 60 | [Llama 4 Maverick](https://quelleia.com/modeles/llama-4-maverick.md) | Meta AI | non précisée | 57,5 % | 47,0 | https://epoch.ai/benchmarks |
| 60 | [Llama 4 Scout](https://quelleia.com/modeles/llama-4-scout.md) | Meta AI | non précisée | 57,5 % | 47,0 | https://epoch.ai/benchmarks |
| 60 | [Qwen2.5-72B](https://quelleia.com/modeles/qwen2-5-72b.md) | Alibaba | non précisée | 57,5 % | 47,0 | https://epoch.ai/benchmarks |
| 63 | [GPT-5.4 Nano](https://quelleia.com/modeles/gpt-5-4-nano.md) | OpenAI | non précisée | 57,3 % | 44,3 | https://epoch.ai/benchmarks |
| 64 | [Gemini 2.0 Flash-Lite](https://quelleia.com/modeles/gemini-2-0-flash-lite.md) | Google DeepMind | non précisée | 57,1 % | 41,6 | https://epoch.ai/benchmarks |
| 64 | [Mistral Large 2 (Jul 2024)](https://quelleia.com/modeles/mistral-large-2-jul-2024.md) | Mistral AI | non précisée | 57,1 % | 41,6 | https://epoch.ai/benchmarks |
| 64 | [Llama 3-70B](https://quelleia.com/modeles/llama-3-70b.md) | Meta AI | non précisée | 57,1 % | 41,6 | https://epoch.ai/benchmarks |
| 67 | [GPT-5.4 Mini](https://quelleia.com/modeles/gpt-5-4-mini.md) | OpenAI | non précisée | 57 % | 40,2 | https://epoch.ai/benchmarks |
| 68 | [Mistral Large 2 (Nov 2024)](https://quelleia.com/modeles/mistral-large-2-nov-2024.md) | Mistral AI | non précisée | 56,9 % | 38,8 | https://epoch.ai/benchmarks |
| 69 | [Mixtral 8x22B](https://quelleia.com/modeles/mixtral-8x22b.md) | Mistral AI | non précisée | 56,3 % | 30,0 | https://epoch.ai/benchmarks |
| 69 | [Mixtral 8x7B](https://quelleia.com/modeles/mixtral-8x7b.md) | Mistral AI | non précisée | 56,3 % | 30,0 | https://epoch.ai/benchmarks |
| 71 | [DeepSeek-V4-Pro](https://quelleia.com/modeles/deepseek-v4-pro.md) | DeepSeek | non précisée | 56,1 % | 26,9 | https://epoch.ai/benchmarks |
| 72 | [Gemini 3.1 Flash-Lite](https://quelleia.com/modeles/gemini-3-1-flash-lite.md) | Google DeepMind | non précisée | 54,4 % | -3,9 | https://epoch.ai/benchmarks |
| 73 | [Claude 2.1](https://quelleia.com/modeles/claude-2-1.md) | Anthropic | non précisée | 54,2 % | -8,1 | https://epoch.ai/benchmarks |
| 74 | [Gemini 1.5 Flash (May 2024)](https://quelleia.com/modeles/gemini-1-5-flash-may-2024.md) | Google DeepMind | non précisée | 53,9 % | -14,9 | https://epoch.ai/benchmarks |
| 75 | [Claude 3 Haiku](https://quelleia.com/modeles/claude-3-haiku.md) | Anthropic | non précisée | 53,2 % | -32,9 | https://epoch.ai/benchmarks |
| 76 | [Llama 2-70B](https://quelleia.com/modeles/llama-2-70b.md) | Meta AI | non précisée | 51,4 % | -105,7 | https://epoch.ai/benchmarks |
| 77 | [GPT-3.5 Turbo (Jan 2024)](https://quelleia.com/modeles/gpt-3-5-turbo-jan-2024.md) | OpenAI | non précisée | 50,4 % | -194,0 | https://epoch.ai/benchmarks |

## En bref

**Que mesure ForecastBench ?** Prédire des événements à venir (marchés de prédiction, indicateurs économiques, conflits) en donnant une probabilité. Sur Quelle IA, il est rangé dans la tâche Raisonnement.

**Comment ForecastBench est-il noté ?** Indice de Brier ajusté à la difficulté, de 0 à 100 : 100 pour des prévisions parfaites, 50 pour une réponse sans information. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 62 %.

**Qui est en tête sur ForecastBench ?** o3 (OpenAI) est en tête de ForecastBench avec 62,5 %, dans l'édition du 28 septembre 2026. Suivent Claude Sonnet 4.6 (62 %) et Claude Opus 4.1 (62 %). 77 modèles y sont mesurés.

**Quelles sont les limites de ForecastBench ?** Aucune fuite possible puisque la réponse n'existe pas encore, mais les écarts sont minces (de 50 à 63) et il faut attendre l'issue des questions. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse ForecastBench dans le score IA ?** ForecastBench compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.

**Qui maintient ForecastBench ?** Forecasting Research Institute. Sa page de référence : forecastbench.org.

## Les autres benchmarks de la tâche Raisonnement

- [DTBench](https://quelleia.com/benchmarks/dtbench.md) : 168 modèles · 1,67 % du score, saturé
- [Chess Puzzles](https://quelleia.com/benchmarks/chess_puzzles.md) : 136 modèles · 1,67 % du score
- [LMCA](https://quelleia.com/benchmarks/lmca.md) : 130 modèles · 1,67 % du score
- [ARC-AGI-1](https://quelleia.com/benchmarks/arc_agi.md) : 82 modèles · 1,67 % du score, saturé
- [SimpleBench](https://quelleia.com/benchmarks/simplebench.md) : 82 modèles · 1,67 % du score
- [ARC-AGI-2](https://quelleia.com/benchmarks/arc_agi_2.md) : 80 modèles · 1,67 % du score, saturé
- [Mystery Game Puzzles](https://quelleia.com/benchmarks/mystery_game_puzzles.md) : 69 modèles · 1,67 % du score
- [EnigmaEval](https://quelleia.com/benchmarks/enigmaeval.md) : 41 modèles · 1,67 % du score
- [LiveBench, raisonnement](https://quelleia.com/benchmarks/livebench_raisonnement.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
