À quoi il sert
Sur Quelle IA, LMCA sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 82.
RaisonnementFiche benchmark · Redwood Research · conceptualreasoning.ai
Juger la qualité d'arguments en philosophie, en théorie de la décision et en sûreté de l'IA, comme le ferait un expert.
Sur Quelle IA, LMCA sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 82.
Corrélation entre les notes du modèle et celles des experts, multipliée par 100 ; les auteurs situent le plafond vers 85.
Pour le calcul, ce score est ramené entre 0 et 1 : 0 vaut 0 et 85, le plafond retenu, vaut 1.
Le jeu de données est privé et les notes d'experts gardent une part de subjectivité, si bien qu'un score de 100 est hors d'atteinte.
Redwood Research.
conceptualreasoning.ai/lmca · tâche Raisonnement · 130 modèles mesurés
En tête : Claude Opus 5.5, 68,23
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 42,5 a un score IA d'environ 82. Le meilleur, Claude Opus 5.5, atteint 68,23.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,67 %du score général. LMCA porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.
En couleur, la tâche Raisonnement dans le score général. En noir, la part de LMCA.