# DeepResearch Bench

> Fiche du benchmark DeepResearch Bench sur Quelle IA, édition du 28 septembre 2026. 91 tâches de recherche sur le web : trouver un chiffre, compiler un jeu de données, vérifier une affirmation, retrouver une source. En tête au 28 septembre 2026 : Claude Opus 4.6 (55,3 %). Notation, limites et classement des 24 modèles mesurés.

Page : https://quelleia.com/benchmarks/deepresearch_bench/
Source du benchmark : https://evals.futuresearch.ai/
Mainteneur : FutureSearch
Tâche : Agents
État : actif

## À quoi il sert

Sur Quelle IA, DeepResearch Bench sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 93.

## Comment c'est noté

Note moyenne de 0 à 1, selon la tâche (précision, rappel ou réponse juste), sur une copie figée du web et 50 actions au plus.

## Ce qu'il ne dit pas

Les écarts entre modèles sont faibles, de 0,35 à 0,55. Le web figé ne reflète pas une recherche en conditions réelles.

## Qui le tient

FutureSearch.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 93. Le meilleur, Claude Opus 4.6, atteint 55,3 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 38 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 45 %
- Score IA 100 (niveau de Claude Opus 5.5) : 52 %

## Son poids dans le score IA

1,67 % du score général. DeepResearch Bench porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

## Classement (24 modèles mesurés · 41 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | Élevée | 55,3 % | 111,5 | https://evals.futuresearch.ai/#drb |
| 2 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | Élevée | 54,9 % | 110,1 | https://evals.futuresearch.ai/#drb |
| 3 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | Élevée | 54,8 % | 109,7 | https://evals.futuresearch.ai/#drb |
| 4 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Élevée | 54 % | 106,8 | https://evals.futuresearch.ai/#drb |
| 5 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | Budget | 52,6 % | 101,8 | https://epoch.ai/benchmarks |
| 6 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Élevée | 50,2 % | 93,3 | https://evals.futuresearch.ai/#drb |
| 7 | [Gemini 3 Flash](https://quelleia.com/modeles/gemini-3-flash.md) | Google DeepMind | Faible | 49,8 % | 91,9 | https://evals.futuresearch.ai/#drb |
| 8 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Faible | 49,6 % | 91,2 | https://evals.futuresearch.ai/#drb |
| 9 | [Claude Opus 4.1](https://quelleia.com/modeles/claude-opus-4-1.md) | Anthropic | non précisée | 48,3 % | 86,6 | https://evals.futuresearch.ai/#drb |
| 10 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | Élevée | 47,8 % | 84,8 | https://evals.futuresearch.ai/#drb |
| 11 | [Grok 4](https://quelleia.com/modeles/grok-4.md) | xAI | non précisée | 47,3 % | 83,0 | https://evals.futuresearch.ai/#drb |
| 12 | [Claude Opus 4](https://quelleia.com/modeles/claude-opus-4.md) | Anthropic | Budget | 46,8 % | 81,2 | https://evals.futuresearch.ai/#drb |
| 13 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | Budget | 46,6 % | 80,5 | https://evals.futuresearch.ai/#drb |
| 14 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | Faible | 46,3 % | 79,4 | https://evals.futuresearch.ai/#drb |
| 15 | [Claude Haiku 4.5](https://quelleia.com/modeles/claude-haiku-4-5.md) | Anthropic | Faible | 45,5 % | 76,6 | https://evals.futuresearch.ai/#drb |
| 16 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Moyenne | 45,2 % | 75,5 | https://evals.futuresearch.ai/#drb |
| 17 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | Budget | 43,6 % | 69,8 | https://epoch.ai/benchmarks |
| 18 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | Faible | 42,8 % | 66,9 | https://evals.futuresearch.ai/#drb |
| 18 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 42,8 % | 66,9 | https://epoch.ai/benchmarks |
| 20 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | Faible | 41,1 % | 60,7 | https://evals.futuresearch.ai/#drb |
| 21 | [Gemini 3.1 Flash-Lite](https://quelleia.com/modeles/gemini-3-1-flash-lite.md) | Google DeepMind | Faible | 37,3 % | 46,5 | https://evals.futuresearch.ai/#drb |
| 22 | [GPT-5.4 Mini](https://quelleia.com/modeles/gpt-5-4-mini.md) | OpenAI | Faible | 36,3 % | 42,7 | https://evals.futuresearch.ai/#drb |
| 23 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Faible | 35,1 % | 38,1 | https://evals.futuresearch.ai/#drb |
| 23 | [DeepSeek-R1 (May 2025)](https://quelleia.com/modeles/deepseek-r1-may-2025.md) | DeepSeek | non précisée | 35,1 % | 38,1 | https://epoch.ai/benchmarks |

## En bref

**Que mesure DeepResearch Bench ?** 91 tâches de recherche sur le web : trouver un chiffre, compiler un jeu de données, vérifier une affirmation, retrouver une source. Sur Quelle IA, il est rangé dans la tâche Agents.

**Comment DeepResearch Bench est-il noté ?** Note moyenne de 0 à 1, selon la tâche (précision, rappel ou réponse juste), sur une copie figée du web et 50 actions au plus. Un modèle qui obtient 50 % a un score IA d'environ 93.

**Qui est en tête sur DeepResearch Bench ?** Claude Opus 4.6 (Anthropic) est en tête de DeepResearch Bench avec 55,3 %, dans l'édition du 28 septembre 2026. Suivent Claude Sonnet 4.6 (54,9 %) et Claude Opus 4.5 (54,8 %). 24 modèles y sont mesurés.

**Quelles sont les limites de DeepResearch Bench ?** Les écarts entre modèles sont faibles, de 0,35 à 0,55. Le web figé ne reflète pas une recherche en conditions réelles. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse DeepResearch Bench dans le score IA ?** DeepResearch Bench compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

**Qui maintient DeepResearch Bench ?** FutureSearch. Sa page de référence : evals.futuresearch.ai.

## Les autres benchmarks de la tâche Agents

- [Vending-Bench 2](https://quelleia.com/benchmarks/vending_bench_2.md) : 56 modèles · 1,67 % du score
- [METR Time Horizons (taux de réussite)](https://quelleia.com/benchmarks/metr_time_horizons.md) : 41 modèles · 1,67 % du score
- [BALROG](https://quelleia.com/benchmarks/balrog.md) : 37 modèles · 1,67 % du score
- [APEX-Agents](https://quelleia.com/benchmarks/apex_agents.md) : 34 modèles · 1,67 % du score
- [EBR-bench (Earthborne Rangers)](https://quelleia.com/benchmarks/ebr_bench.md) : 23 modèles · 1,67 % du score
- [Remote Labor Index](https://quelleia.com/benchmarks/remote_labor_index.md) : 13 modèles · 1,67 % du score
- [PostTrainBench](https://quelleia.com/benchmarks/posttrainbench.md) : 11 modèles · 1,67 % du score
- [OSWorld 2.0](https://quelleia.com/benchmarks/osworld_2.md) : 9 modèles · 1,67 % du score
- [TheAgentCompany](https://quelleia.com/benchmarks/the_agent_company.md) : 14 modèles · hors score, archivé
- [GDPval](https://quelleia.com/benchmarks/gdpval.md) : 11 modèles · hors score, archivé
- [OSWorld](https://quelleia.com/benchmarks/osworld.md) : 9 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
