À quoi il sert
ExploitBench alimente le dossier Sécurité, suivi pour information : ce dossier n'a pas de score et n'entre pas dans le score général.
SécuritéFiche benchmark · Université Carnegie Mellon · exploitbench.ai
Exploiter de vraies failles déjà corrigées du moteur JavaScript de Chrome, de l'accès au code vulnérable jusqu'à l'exécution de code arbitraire.
ExploitBench alimente le dossier Sécurité, suivi pour information : ce dossier n'a pas de score et n'entre pas dans le score général.
Part moyenne des 16 jalons atteints sur 41 failles, avec plusieurs essais par faille.
Un seul logiciel cible, le moteur V8. Peu de modèles testés, certains en préversion, et les failles sont déjà documentées publiquement.
Université Carnegie Mellon.
exploitbench.ai · dossier Sécurité · 9 modèles mesurés
En tête : Claude Mythos Preview, 73,8 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 95. Le meilleur, Claude Mythos Preview, atteint 73,8 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %. Avec 9 modèles mesurés seulement, cet étalonnage reste fragile.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. Sécurité est un dossier sans score : ses benchmarks sont suivis pour information.
9 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.