Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

SciencesFiche benchmark · Yann Henon (projet personnel) · yhenon.github.io

Surface Evolver Bench

Écrire les fichiers d'entrée du logiciel de physique Surface Evolver pour simuler des surfaces liquides : gouttes, angles de contact, gravité.

SATURÉ

À quoi il sert

Sur Quelle IA, Surface Evolver Bench sert à noter la tâche Sciences et savoir expert : c'est l'un de ses 5 benchmarks. Il départage surtout les modèles dont le score IA approche 81.

Comment c'est noté

Note moyenne avec points partiels sur 16 tâches : fichier valide, simulation qui tourne, grandeurs physiques conformes à la référence.

Ce qu'il ne dit pas

Seulement 16 tâches, un seul passage par tâche et un projet tenu par une seule personne : les petits écarts ne sont pas significatifs.

Comment lire le score

25 modèles mesurés · 28 mesures

En tête : 2 modèles, 95 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 81. 2 modèles partagent la première place avec 95 %. Le seuil de saturation (95 %) est franchi : au sommet, les meilleurs modèles ne se départagent plus.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
3 %
Score IA 76niveau de Claude Sonnet 4.5
38 %
Score IA 100niveau de Claude Opus 5.5
90 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

2 %du score général. Surface Evolver Bench porte 20 % de la tâche Sciences et savoir expert (10 % du score général), que se partagent 5 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.

En couleur, la tâche Sciences et savoir expert dans le score général. En noir, la part de Surface Evolver Bench.

Le classement du benchmark

Scores relevés sur yhenon.github.io · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Fable 5AnthropicÉlevée95 %106,1
1Kimi K3Moonshot · poids ouverts · 2 configurationsNon précisée95 %106,1
3GPT-5.6 SolOpenAIMaximale93,1 %103,2
4GPT-5.5OpenAI · 2 configurationsÉlevée88,1 %98,0
5Claude Opus 4.8Anthropic · 2 configurationsÉlevée87,5 %97,5
6GPT-5.6 TerraOpenAIMaximale83,8 %94,9
7Gemini 3.8 FlashGoogle DeepMindÉlevée76,9 %91,1
8Grok 4.5xAIÉlevée74,4 %89,9
9GPT-5.6 LunaOpenAIMoyenne61,9 %84,9
10Claude Sonnet 5AnthropicMoyenne60 %84,2
25 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 25 →Replier le classement ↑
11Gemini 3.5 FlashGoogle DeepMindMoyenne58,1 %83,5
12GLM-5.2Z.ai (Zhipu AI) · poids ouvertsÉlevée55,6 %82,7
13MiniMax-M3MiniMax · poids ouvertsNon précisée55 %82,4
14Muse Spark 1.1Meta AIÉlevée52,5 %81,6
14GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsMaximale52,5 %81,6
16Kimi K2.7 CodeMoonshot · poids ouvertsNon précisée48,8 %80,3
17DeepSeek V4.1 FlashDeepSeek · poids ouvertsÉlevée46,3 %79,4
18Qwen 3.8 27BAlibaba · poids ouvertsMaximale45 %79,0
19Qwen 3.6 35B-A3BAlibaba · poids ouvertsNon précisée44,4 %78,8
20DeepSeek-V4-ProDeepSeek · poids ouvertsÉlevée40 %77,2
21Gemma 4 31B ITGoogle DeepMind · poids ouvertsNon précisée30,6 %73,6
22Mistral Medium 3.5Mistral AI · poids ouvertsNon précisée26,9 %72,1
23gpt-oss-120bOpenAI · poids ouvertsNon précisée25 %71,2
24Laguna M.1Poolside · poids ouvertsNon précisée15,6 %66,1
24Trinity Large ThinkingArcee AI · poids ouvertsNon précisée15,6 %66,1

En bref

Que mesure Surface Evolver Bench ?
Écrire les fichiers d'entrée du logiciel de physique Surface Evolver pour simuler des surfaces liquides : gouttes, angles de contact, gravité. Sur Quelle IA, il est rangé dans la tâche Sciences et savoir expert.
Comment Surface Evolver Bench est-il noté ?
Note moyenne avec points partiels sur 16 tâches : fichier valide, simulation qui tourne, grandeurs physiques conformes à la référence. Un modèle qui obtient 50 % a un score IA d'environ 81.
Qui est en tête sur Surface Evolver Bench ?
Claude Fable 5 et Kimi K3 sont en tête de Surface Evolver Bench avec 95 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.6 Sol (93,1 %) et GPT-5.5 (88,1 %). 25 modèles y sont mesurés.
Quelles sont les limites de Surface Evolver Bench ?
Seulement 16 tâches, un seul passage par tâche et un projet tenu par une seule personne : les petits écarts ne sont pas significatifs. Au 28 septembre 2026, le benchmark est saturé.
Combien pèse Surface Evolver Bench dans le score IA ?
Surface Evolver Bench compte pour 2 % du score général, dans l'édition du 28 septembre 2026. Il porte 20 % de la tâche Sciences et savoir expert (10 % du score général), que se partagent 5 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.
Qui maintient Surface Evolver Bench ?
Yann Henon (projet personnel). Sa page de référence : yhenon.github.io/surface-evolver-llm-eval.

Les autres benchmarks de la tâche Sciences et savoir expert

Tous les benchmarks →Comment le score IA est calculé →