À quoi il sert
Sur Quelle IA, Humanity's Last Exam sert à noter la tâche Sciences et savoir expert : c'est l'un de ses 5 benchmarks. Il départage surtout les modèles dont le score IA approche 96.
SciencesFiche benchmark · Center for AI Safety et Scale AI · lastexam.ai
2 500 questions de niveau expert dans plus de cent disciplines, écrites par près de mille chercheurs pour mettre les modèles en échec.
Sur Quelle IA, Humanity's Last Exam sert à noter la tâche Sciences et savoir expert : c'est l'un de ses 5 benchmarks. Il départage surtout les modèles dont le score IA approche 96.
Part de réponses exactes ; le classement publie aussi l'erreur de calibration, qui mesure l'excès de confiance du modèle.
Pour le calcul, ce score est ramené entre 0 et 1 : 5 %, le niveau du hasard, vaut 0 et 100 % vaut 1.
Epoch le classe « défectueux » : sur 48 questions vérifiées, 22 avaient un énoncé ou un corrigé fautif, ce qui borne le score atteignable.
Center for AI Safety et Scale AI.
lastexam.ai · tâche Sciences · 44 modèles mesurés
En tête : GPT-6 Astra, 54,8 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 52 % a un score IA d'environ 96. Le meilleur, GPT-6 Astra, atteint 54,8 %. Le benchmark sera dit saturé quand un modèle atteindra 95,2 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
2 %du score général. Humanity's Last Exam porte 20 % de la tâche Sciences et savoir expert (10 % du score général), que se partagent 5 benchmarks.
En couleur, la tâche Sciences et savoir expert dans le score général. En noir, la part de Humanity's Last Exam.