À quoi il sert
Sur Quelle IA, DeepResearch Bench sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 93.
AgentsFiche benchmark · FutureSearch · evals.futuresearch.ai
91 tâches de recherche sur le web : trouver un chiffre, compiler un jeu de données, vérifier une affirmation, retrouver une source.
Sur Quelle IA, DeepResearch Bench sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 93.
Note moyenne de 0 à 1, selon la tâche (précision, rappel ou réponse juste), sur une copie figée du web et 50 actions au plus.
Les écarts entre modèles sont faibles, de 0,35 à 0,55. Le web figé ne reflète pas une recherche en conditions réelles.
FutureSearch.
evals.futuresearch.ai · tâche Agents · 24 modèles mesurés
En tête : Claude Opus 4.6, 55,3 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 93. Le meilleur, Claude Opus 4.6, atteint 55,3 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,67 %du score général. DeepResearch Bench porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.
En couleur, la tâche Agents dans le score général. En noir, la part de DeepResearch Bench.