Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

AgentsFiche benchmark · FutureSearch · evals.futuresearch.ai

DeepResearch Bench

91 tâches de recherche sur le web : trouver un chiffre, compiler un jeu de données, vérifier une affirmation, retrouver une source.

À quoi il sert

Sur Quelle IA, DeepResearch Bench sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 93.

Comment c'est noté

Note moyenne de 0 à 1, selon la tâche (précision, rappel ou réponse juste), sur une copie figée du web et 50 actions au plus.

Ce qu'il ne dit pas

Les écarts entre modèles sont faibles, de 0,35 à 0,55. Le web figé ne reflète pas une recherche en conditions réelles.

Comment lire le score

24 modèles mesurés · 41 mesures

En tête : Claude Opus 4.6, 55,3 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 93. Le meilleur, Claude Opus 4.6, atteint 55,3 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
38 %
Score IA 76niveau de Claude Sonnet 4.5
45 %
Score IA 100niveau de Claude Opus 5.5
52 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,67 %du score général. DeepResearch Bench porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

En couleur, la tâche Agents dans le score général. En noir, la part de DeepResearch Bench.

Le classement du benchmark

Scores relevés auprès de 2 sources · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Opus 4.6Anthropic · 3 configurationsÉlevée55,3 %111,5
2Claude Sonnet 4.6Anthropic · 2 configurationsÉlevée54,9 %110,1
3Claude Opus 4.5Anthropic · 2 configurationsÉlevée54,8 %109,7
4GPT-5.5OpenAI · 3 configurationsÉlevée54 %106,8
5Claude Sonnet 4.5Anthropic · 2 configurationsBudget52,6 %101,8
6Claude Opus 4.8Anthropic · 3 configurationsÉlevée50,2 %93,3
7Gemini 3 FlashGoogle DeepMind · 3 configurationsFaible49,8 %91,9
8GPT-5OpenAI · 4 configurationsFaible49,6 %91,2
9Claude Opus 4.1AnthropicNon précisée48,3 %86,6
10Gemini 3.1 ProGoogle DeepMind · 2 configurationsÉlevée47,8 %84,8
24 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 24 →Replier le classement ↑
11Grok 4xAINon précisée47,3 %83,0
12Claude Opus 4AnthropicBudget46,8 %81,2
13Claude Sonnet 4AnthropicBudget46,6 %80,5
14Gemini 3 ProGoogle DeepMindFaible46,3 %79,4
15Claude Haiku 4.5AnthropicFaible45,5 %76,6
16o3OpenAIMoyenne45,2 %75,5
17Claude 3.7 SonnetAnthropicBudget43,6 %69,8
18GPT-5.1OpenAIFaible42,8 %66,9
18Gemini 2.5 Pro (Jun 2025)Google DeepMind · 2 configurationsNon précisée42,8 %66,9
20GPT-5.2OpenAIFaible41,1 %60,7
21Gemini 3.1 Flash-LiteGoogle DeepMind · 2 configurationsFaible37,3 %46,5
22GPT-5.4 MiniOpenAIFaible36,3 %42,7
23GPT-5.4OpenAIFaible35,1 %38,1
23DeepSeek-R1 (May 2025)DeepSeek · poids ouvertsNon précisée35,1 %38,1

En bref

Que mesure DeepResearch Bench ?
91 tâches de recherche sur le web : trouver un chiffre, compiler un jeu de données, vérifier une affirmation, retrouver une source. Sur Quelle IA, il est rangé dans la tâche Agents.
Comment DeepResearch Bench est-il noté ?
Note moyenne de 0 à 1, selon la tâche (précision, rappel ou réponse juste), sur une copie figée du web et 50 actions au plus. Un modèle qui obtient 50 % a un score IA d'environ 93.
Qui est en tête sur DeepResearch Bench ?
Claude Opus 4.6 (Anthropic) est en tête de DeepResearch Bench avec 55,3 %, dans l'édition du 28 septembre 2026. Suivent Claude Sonnet 4.6 (54,9 %) et Claude Opus 4.5 (54,8 %). 24 modèles y sont mesurés.
Quelles sont les limites de DeepResearch Bench ?
Les écarts entre modèles sont faibles, de 0,35 à 0,55. Le web figé ne reflète pas une recherche en conditions réelles. Au 28 septembre 2026, le benchmark est actif.
Combien pèse DeepResearch Bench dans le score IA ?
DeepResearch Bench compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.
Qui maintient DeepResearch Bench ?
FutureSearch. Sa page de référence : evals.futuresearch.ai.

Les autres benchmarks de la tâche Agents

Tous les benchmarks →Comment le score IA est calculé →