À quoi il sert
Sur Quelle IA, DTBench sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 62.
RaisonnementFiche benchmark · Redwood Research · conceptualreasoning.ai
407 questions de théorie de la décision sur des dilemmes de type Newcomb, où le choix d'un agent renseigne sur celui de ses semblables.
Sur Quelle IA, DTBench sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 62.
Part de bonnes réponses ; le hasard donne 40 %.
Pour le calcul, ce score est ramené entre 0 et 1 : 40 %, le niveau du hasard, vaut 0 et 100 % vaut 1.
Domaine très étroit, et les meilleurs modèles frôlent 99 %. Les questions d'opinion du jeu sont exclues du score.
Redwood Research.
conceptualreasoning.ai/dtbench · tâche Raisonnement · 168 modèles mesurés
En tête : Claude Opus 5.5, 98,9 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 70 % a un score IA d'environ 62. Le meilleur, Claude Opus 5.5, atteint 98,9 %. Le seuil de saturation (97 %) est franchi : au sommet, les meilleurs modèles ne se départagent plus.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,67 %du score général. DTBench porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.
En couleur, la tâche Raisonnement dans le score général. En noir, la part de DTBench.