À quoi il sert
Sur Quelle IA, Surface Evolver Bench sert à noter la tâche Sciences et savoir expert : c'est l'un de ses 5 benchmarks. Il départage surtout les modèles dont le score IA approche 81.
SciencesFiche benchmark · Yann Henon (projet personnel) · yhenon.github.io
Écrire les fichiers d'entrée du logiciel de physique Surface Evolver pour simuler des surfaces liquides : gouttes, angles de contact, gravité.
Sur Quelle IA, Surface Evolver Bench sert à noter la tâche Sciences et savoir expert : c'est l'un de ses 5 benchmarks. Il départage surtout les modèles dont le score IA approche 81.
Note moyenne avec points partiels sur 16 tâches : fichier valide, simulation qui tourne, grandeurs physiques conformes à la référence.
Seulement 16 tâches, un seul passage par tâche et un projet tenu par une seule personne : les petits écarts ne sont pas significatifs.
Yann Henon (projet personnel).
yhenon.github.io/surface-evolver-llm-eval · tâche Sciences · 25 modèles mesurés
En tête : 2 modèles, 95 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 81. 2 modèles partagent la première place avec 95 %. Le seuil de saturation (95 %) est franchi : au sommet, les meilleurs modèles ne se départagent plus.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
2 %du score général. Surface Evolver Bench porte 20 % de la tâche Sciences et savoir expert (10 % du score général), que se partagent 5 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.
En couleur, la tâche Sciences et savoir expert dans le score général. En noir, la part de Surface Evolver Bench.