À quoi il sert
Sur Quelle IA, CritPt sert à noter la tâche Sciences et savoir expert : c'est l'un de ses 5 benchmarks.
SciencesFiche benchmark · Collectif de physiciens mené par le laboratoire d'Argonne et l'université de l'Illinois ; classement Artificial Analysis · artificialanalysis.ai
71 défis de physique de niveau recherche, comparables à un premier projet de thèse, écrits par plus de 50 physiciens.
Sur Quelle IA, CritPt sert à noter la tâche Sciences et savoir expert : c'est l'un de ses 5 benchmarks.
Part de défis résolus ; les réponses (nombres, formules, fonctions Python) sont vérifiées automatiquement.
Scores très bas, 32 % au mieux. Les résultats sont mesurés par Artificial Analysis, dans ses propres conditions.
Collectif de physiciens mené par le laboratoire d'Argonne et l'université de l'Illinois ; classement Artificial Analysis.
artificialanalysis.ai/evaluations/critpt · tâche Sciences · 129 modèles mesurés
En tête : GPT-5.6 Sol, 32,3 %
Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 41 %. Le meilleur, GPT-5.6 Sol, atteint 32,3 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
2 %du score général. CritPt porte 20 % de la tâche Sciences et savoir expert (10 % du score général), que se partagent 5 benchmarks.
En couleur, la tâche Sciences et savoir expert dans le score général. En noir, la part de CritPt.