# Surface Evolver Bench

> Fiche du benchmark Surface Evolver Bench sur Quelle IA, édition du 28 septembre 2026. Écrire les fichiers d'entrée du logiciel de physique Surface Evolver pour simuler des surfaces liquides : gouttes, angles de contact, gravité. En tête au 28 septembre 2026 : 2 modèles ex æquo (95 %). Notation, limites et classement des 25 modèles mesurés.

Page : https://quelleia.com/benchmarks/surface_evolver_bench/
Source du benchmark : https://yhenon.github.io/surface-evolver-llm-eval/
Mainteneur : Yann Henon (projet personnel)
Tâche : Sciences et savoir expert
État : saturé

## À quoi il sert

Sur Quelle IA, Surface Evolver Bench sert à noter la tâche Sciences et savoir expert : c'est l'un de ses 5 benchmarks. Il départage surtout les modèles dont le score IA approche 81.

## Comment c'est noté

Note moyenne avec points partiels sur 16 tâches : fichier valide, simulation qui tourne, grandeurs physiques conformes à la référence.

## Ce qu'il ne dit pas

Seulement 16 tâches, un seul passage par tâche et un projet tenu par une seule personne : les petits écarts ne sont pas significatifs.

## Qui le tient

Yann Henon (projet personnel).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 81. 2 modèles partagent la première place avec 95 %. Le seuil de saturation (95 %) est franchi : au sommet, les meilleurs modèles ne se départagent plus.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 3 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 38 %
- Score IA 100 (niveau de Claude Opus 5.5) : 90 %

## Son poids dans le score IA

2 % du score général. Surface Evolver Bench porte 20 % de la tâche Sciences et savoir expert (10 % du score général), que se partagent 5 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.

## Classement (25 modèles mesurés · 28 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Élevée | 95 % | 106,1 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 1 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | non précisée | 95 % | 106,1 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 3 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 93,1 % | 103,2 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 4 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Élevée | 88,1 % | 98,0 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 5 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Élevée | 87,5 % | 97,5 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 6 | [GPT-5.6 Terra](https://quelleia.com/modeles/gpt-5-6-terra.md) | OpenAI | Maximale | 83,8 % | 94,9 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 7 | [Gemini 3.8 Flash](https://quelleia.com/modeles/gemini-3-8-flash.md) | Google DeepMind | Élevée | 76,9 % | 91,1 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 8 | [Grok 4.5](https://quelleia.com/modeles/grok-4-5.md) | xAI | Élevée | 74,4 % | 89,9 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 9 | [GPT-5.6 Luna](https://quelleia.com/modeles/gpt-5-6-luna.md) | OpenAI | Moyenne | 61,9 % | 84,9 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 10 | [Claude Sonnet 5](https://quelleia.com/modeles/claude-sonnet-5.md) | Anthropic | Moyenne | 60 % | 84,2 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 11 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | Moyenne | 58,1 % | 83,5 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 12 | [GLM-5.2](https://quelleia.com/modeles/glm-5-2.md) | Z.ai (Zhipu AI) | Élevée | 55,6 % | 82,7 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 13 | [MiniMax-M3](https://quelleia.com/modeles/minimax-m3.md) | MiniMax | non précisée | 55 % | 82,4 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 14 | [Muse Spark 1.1](https://quelleia.com/modeles/muse-spark-1-1.md) | Meta AI | Élevée | 52,5 % | 81,6 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 14 | [GLM-5.3-Flash](https://quelleia.com/modeles/glm-5-3-flash.md) | Z.ai (Zhipu AI) | Maximale | 52,5 % | 81,6 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 16 | [Kimi K2.7 Code](https://quelleia.com/modeles/kimi-k2-7-code.md) | Moonshot | non précisée | 48,8 % | 80,3 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 17 | [DeepSeek V4.1 Flash](https://quelleia.com/modeles/deepseek-v4-1-flash.md) | DeepSeek | Élevée | 46,3 % | 79,4 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 18 | [Qwen 3.8 27B](https://quelleia.com/modeles/qwen-3-8-27b.md) | Alibaba | Maximale | 45 % | 79,0 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 19 | [Qwen 3.6 35B-A3B](https://quelleia.com/modeles/qwen-3-6-35b-a3b.md) | Alibaba | non précisée | 44,4 % | 78,8 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 20 | [DeepSeek-V4-Pro](https://quelleia.com/modeles/deepseek-v4-pro.md) | DeepSeek | Élevée | 40 % | 77,2 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 21 | [Gemma 4 31B IT](https://quelleia.com/modeles/gemma-4-31b-it.md) | Google DeepMind | non précisée | 30,6 % | 73,6 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 22 | [Mistral Medium 3.5](https://quelleia.com/modeles/mistral-medium-3-5.md) | Mistral AI | non précisée | 26,9 % | 72,1 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 23 | [gpt-oss-120b](https://quelleia.com/modeles/gpt-oss-120b.md) | OpenAI | non précisée | 25 % | 71,2 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 24 | [Laguna M.1](https://quelleia.com/modeles/laguna-m-1.md) | Poolside | non précisée | 15,6 % | 66,1 | https://yhenon.github.io/surface-evolver-llm-eval/ |
| 24 | [Trinity Large Thinking](https://quelleia.com/modeles/trinity-large-thinking.md) | Arcee AI | non précisée | 15,6 % | 66,1 | https://yhenon.github.io/surface-evolver-llm-eval/ |

## En bref

**Que mesure Surface Evolver Bench ?** Écrire les fichiers d'entrée du logiciel de physique Surface Evolver pour simuler des surfaces liquides : gouttes, angles de contact, gravité. Sur Quelle IA, il est rangé dans la tâche Sciences et savoir expert.

**Comment Surface Evolver Bench est-il noté ?** Note moyenne avec points partiels sur 16 tâches : fichier valide, simulation qui tourne, grandeurs physiques conformes à la référence. Un modèle qui obtient 50 % a un score IA d'environ 81.

**Qui est en tête sur Surface Evolver Bench ?** Claude Fable 5 et Kimi K3 sont en tête de Surface Evolver Bench avec 95 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.6 Sol (93,1 %) et GPT-5.5 (88,1 %). 25 modèles y sont mesurés.

**Quelles sont les limites de Surface Evolver Bench ?** Seulement 16 tâches, un seul passage par tâche et un projet tenu par une seule personne : les petits écarts ne sont pas significatifs. Au 28 septembre 2026, le benchmark est saturé.

**Combien pèse Surface Evolver Bench dans le score IA ?** Surface Evolver Bench compte pour 2 % du score général, dans l'édition du 28 septembre 2026. Il porte 20 % de la tâche Sciences et savoir expert (10 % du score général), que se partagent 5 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.

**Qui maintient Surface Evolver Bench ?** Yann Henon (projet personnel). Sa page de référence : yhenon.github.io/surface-evolver-llm-eval.

## Les autres benchmarks de la tâche Sciences et savoir expert

- [Arena, questions d'experts](https://quelleia.com/benchmarks/arena_expert.md) : 263 modèles · 2 % du score
- [GPQA Diamond](https://quelleia.com/benchmarks/gpqa_diamond.md) : 208 modèles · 2 % du score
- [CritPt](https://quelleia.com/benchmarks/critpt.md) : 129 modèles · 2 % du score
- [Humanity's Last Exam](https://quelleia.com/benchmarks/hle.md) : 44 modèles · 2 % du score

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
