{"source":"Quelle IA, le classement des modèles de langage","page":"https://quelleia.com/benchmarks/surface_evolver_bench/","edition":"2026-W40","date":"2026-09-28","echelle":"score_publie est le score de la source, dans son unité. score_0_1 est ce score ramené entre 0 et 1 pour le calcul. niveau_suggere est le score IA que cette seule mesure indique : 100 pour le meilleur modèle au lancement du site, 50 pour GPT-4o de novembre 2024. difficulte est le score IA d'un modèle qui obtient la moitié (score_0_1 = 0,5), pente la raideur de la courbe.","licence":"Réutilisation libre en citant « Quelle IA, quelleia.com » et la date de l'édition. Les mesures renvoient à leurs sources d'origine.","benchmark":{"id":"surface_evolver_bench","nom":"Surface Evolver Bench","tache":"sciences","etat":"sature","echelle":"unite","modeles":25,"poids_general":2,"difficulte":80.7,"pente":0.1157,"en_une_phrase":"Écrire les fichiers d'entrée du logiciel de physique Surface Evolver pour simuler des surfaces liquides : gouttes, angles de contact, gravité.","notation":"Note moyenne avec points partiels sur 16 tâches : fichier valide, simulation qui tourne, grandeurs physiques conformes à la référence.","limites":"Seulement 16 tâches, un seul passage par tâche et un projet tenu par une seule personne : les petits écarts ne sont pas significatifs.","mainteneur":"Yann Henon (projet personnel)","url":"https://yhenon.github.io/surface-evolver-llm-eval/","verifie":true},"tache":{"id":"sciences","nom":"Sciences et savoir expert","poids_general":10,"benchmarks_actifs":5},"modeles_mesures":25,"mesures":28,"classement":[{"rang":1,"modele":"claude-fable-5","nom":"Claude Fable 5","editeur":"Anthropic","page":"https://quelleia.com/modeles/claude-fable-5/","score_publie":0.95,"score_0_1":0.95,"niveau_suggere":106.1,"reflexion":"elevee","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":1,"modele":"kimi-k3","nom":"Kimi K3","editeur":"Moonshot","page":"https://quelleia.com/modeles/kimi-k3/","score_publie":0.95,"score_0_1":0.95,"niveau_suggere":106.1,"reflexion":"inconnue","harnais":null,"configurations_mesurees":2,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":3,"modele":"gpt-5-6-sol","nom":"GPT-5.6 Sol","editeur":"OpenAI","page":"https://quelleia.com/modeles/gpt-5-6-sol/","score_publie":0.93125,"score_0_1":0.9313,"niveau_suggere":103.2,"reflexion":"maximale","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":4,"modele":"gpt-5-5","nom":"GPT-5.5","editeur":"OpenAI","page":"https://quelleia.com/modeles/gpt-5-5/","score_publie":0.88125,"score_0_1":0.8812,"niveau_suggere":98,"reflexion":"elevee","harnais":null,"configurations_mesurees":2,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":5,"modele":"claude-opus-4-8","nom":"Claude Opus 4.8","editeur":"Anthropic","page":"https://quelleia.com/modeles/claude-opus-4-8/","score_publie":0.875,"score_0_1":0.875,"niveau_suggere":97.5,"reflexion":"elevee","harnais":null,"configurations_mesurees":2,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":6,"modele":"gpt-5-6-terra","nom":"GPT-5.6 Terra","editeur":"OpenAI","page":"https://quelleia.com/modeles/gpt-5-6-terra/","score_publie":0.8375,"score_0_1":0.8375,"niveau_suggere":94.9,"reflexion":"maximale","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":7,"modele":"gemini-3-8-flash","nom":"Gemini 3.8 Flash","editeur":"Google DeepMind","page":"https://quelleia.com/modeles/gemini-3-8-flash/","score_publie":0.76875,"score_0_1":0.7688,"niveau_suggere":91.1,"reflexion":"elevee","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":8,"modele":"grok-4-5","nom":"Grok 4.5","editeur":"xAI","page":"https://quelleia.com/modeles/grok-4-5/","score_publie":0.74375,"score_0_1":0.7438,"niveau_suggere":89.9,"reflexion":"elevee","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":9,"modele":"gpt-5-6-luna","nom":"GPT-5.6 Luna","editeur":"OpenAI","page":"https://quelleia.com/modeles/gpt-5-6-luna/","score_publie":0.61875,"score_0_1":0.6188,"niveau_suggere":84.9,"reflexion":"moyenne","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":10,"modele":"claude-sonnet-5","nom":"Claude Sonnet 5","editeur":"Anthropic","page":"https://quelleia.com/modeles/claude-sonnet-5/","score_publie":0.6,"score_0_1":0.6,"niveau_suggere":84.2,"reflexion":"moyenne","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":11,"modele":"gemini-3-5-flash","nom":"Gemini 3.5 Flash","editeur":"Google DeepMind","page":"https://quelleia.com/modeles/gemini-3-5-flash/","score_publie":0.58125,"score_0_1":0.5813,"niveau_suggere":83.5,"reflexion":"moyenne","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":12,"modele":"glm-5-2","nom":"GLM-5.2","editeur":"Z.ai (Zhipu AI)","page":"https://quelleia.com/modeles/glm-5-2/","score_publie":0.55625,"score_0_1":0.5563,"niveau_suggere":82.7,"reflexion":"elevee","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":13,"modele":"minimax-m3","nom":"MiniMax-M3","editeur":"MiniMax","page":"https://quelleia.com/modeles/minimax-m3/","score_publie":0.5499999999999999,"score_0_1":0.55,"niveau_suggere":82.4,"reflexion":"inconnue","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":14,"modele":"muse-spark-1-1","nom":"Muse Spark 1.1","editeur":"Meta AI","page":"https://quelleia.com/modeles/muse-spark-1-1/","score_publie":0.525,"score_0_1":0.525,"niveau_suggere":81.6,"reflexion":"elevee","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":14,"modele":"glm-5-3-flash","nom":"GLM-5.3-Flash","editeur":"Z.ai (Zhipu AI)","page":"https://quelleia.com/modeles/glm-5-3-flash/","score_publie":0.525,"score_0_1":0.525,"niveau_suggere":81.6,"reflexion":"maximale","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":16,"modele":"kimi-k2-7-code","nom":"Kimi K2.7 Code","editeur":"Moonshot","page":"https://quelleia.com/modeles/kimi-k2-7-code/","score_publie":0.4875,"score_0_1":0.4875,"niveau_suggere":80.3,"reflexion":"inconnue","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":17,"modele":"deepseek-v4-1-flash","nom":"DeepSeek V4.1 Flash","editeur":"DeepSeek","page":"https://quelleia.com/modeles/deepseek-v4-1-flash/","score_publie":0.4625,"score_0_1":0.4625,"niveau_suggere":79.4,"reflexion":"elevee","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":18,"modele":"qwen-3-8-27b","nom":"Qwen 3.8 27B","editeur":"Alibaba","page":"https://quelleia.com/modeles/qwen-3-8-27b/","score_publie":0.45,"score_0_1":0.45,"niveau_suggere":79,"reflexion":"maximale","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":19,"modele":"qwen-3-6-35b-a3b","nom":"Qwen 3.6 35B-A3B","editeur":"Alibaba","page":"https://quelleia.com/modeles/qwen-3-6-35b-a3b/","score_publie":0.44375,"score_0_1":0.4437,"niveau_suggere":78.8,"reflexion":"inconnue","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":20,"modele":"deepseek-v4-pro","nom":"DeepSeek-V4-Pro","editeur":"DeepSeek","page":"https://quelleia.com/modeles/deepseek-v4-pro/","score_publie":0.4,"score_0_1":0.4,"niveau_suggere":77.2,"reflexion":"elevee","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":21,"modele":"gemma-4-31b-it","nom":"Gemma 4 31B IT","editeur":"Google DeepMind","page":"https://quelleia.com/modeles/gemma-4-31b-it/","score_publie":0.3062499999999999,"score_0_1":0.3062,"niveau_suggere":73.6,"reflexion":"inconnue","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":22,"modele":"mistral-medium-3-5","nom":"Mistral Medium 3.5","editeur":"Mistral AI","page":"https://quelleia.com/modeles/mistral-medium-3-5/","score_publie":0.26875,"score_0_1":0.2687,"niveau_suggere":72.1,"reflexion":"inconnue","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":23,"modele":"gpt-oss-120b","nom":"gpt-oss-120b","editeur":"OpenAI","page":"https://quelleia.com/modeles/gpt-oss-120b/","score_publie":0.25,"score_0_1":0.25,"niveau_suggere":71.2,"reflexion":"inconnue","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":24,"modele":"laguna-m-1","nom":"Laguna M.1","editeur":"Poolside","page":"https://quelleia.com/modeles/laguna-m-1/","score_publie":0.15625,"score_0_1":0.1562,"niveau_suggere":66.1,"reflexion":"inconnue","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"},{"rang":24,"modele":"trinity-large-thinking","nom":"Trinity Large Thinking","editeur":"Arcee AI","page":"https://quelleia.com/modeles/trinity-large-thinking/","score_publie":0.15625,"score_0_1":0.1562,"niveau_suggere":66.1,"reflexion":"inconnue","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://yhenon.github.io/surface-evolver-llm-eval/"}]}