# Vending-Bench 2

> Fiche du benchmark Vending-Bench 2 sur Quelle IA, édition du 28 septembre 2026. Gérer seul un distributeur automatique simulé pendant un an : stocks, prix, négociation avec les fournisseurs, imprévus. En tête au 28 septembre 2026 : GPT-6 Astra (15 515 $). Notation, limites et classement des 56 modèles mesurés.

Page : https://quelleia.com/benchmarks/vending_bench_2/
Source du benchmark : https://andonlabs.com/evals/vending-bench-2
Mainteneur : Andon Labs
Tâche : Agents
État : actif

## À quoi il sert

Sur Quelle IA, Vending-Bench 2 sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 88.

## Comment c'est noté

Solde du compte en dollars à la fin de l'année simulée, en moyenne sur cinq parties.

Pour le calcul, le montant passe par son logarithme, centré sur 4 500 $ : doubler le montant compte autant à chaque niveau.

## Ce qu'il ne dit pas

Un seul scénario simulé. Andon Labs estime qu'une bonne stratégie humaine atteindrait environ 63 000 dollars, quatre fois le meilleur modèle.

## Qui le tient

Andon Labs.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 4 500 $ a un score IA d'environ 88. Le meilleur, GPT-6 Astra, atteint 15 515 $.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 0 $
- Score IA 76 (niveau de Claude Sonnet 4.5) : 190 $
- Score IA 100 (niveau de Claude Opus 5.5) : plus de 16 000 $

## Son poids dans le score IA

1,67 % du score général. Vending-Bench 2 porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

## Classement (56 modèles mesurés · 62 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | non précisée | 15 515 $ | 91,9 | https://epoch.ai/benchmarks |
| 2 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | non précisée | 11 182 $ | 90,8 | https://epoch.ai/benchmarks |
| 3 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | non précisée | 10 937 $ | 90,7 | https://epoch.ai/benchmarks |
| 4 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | non précisée | 9 619 $ | 90,2 | https://epoch.ai/benchmarks |
| 5 | [Grok 4.6](https://quelleia.com/modeles/grok-4-6.md) | xAI | non précisée | 9 047 $ | 90,0 | https://epoch.ai/benchmarks |
| 6 | [GLM-5.2](https://quelleia.com/modeles/glm-5-2.md) | Z.ai (Zhipu AI) | non précisée | 8 314 $ | 89,7 | https://epoch.ai/benchmarks |
| 7 | [GLM-5.3](https://quelleia.com/modeles/glm-5-3.md) | Z.ai (Zhipu AI) | non précisée | 8 164 $ | 89,7 | https://epoch.ai/benchmarks |
| 8 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | non précisée | 8 018 $ | 89,6 | https://epoch.ai/benchmarks |
| 9 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | non précisée | 7 524 $ | 89,4 | https://epoch.ai/benchmarks |
| 10 | [GPT-5.6 Terra](https://quelleia.com/modeles/gpt-5-6-terra.md) | OpenAI | non précisée | 7 343 $ | 89,3 | https://epoch.ai/benchmarks |
| 11 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | non précisée | 7 204 $ | 89,2 | https://epoch.ai/benchmarks |
| 12 | [Muse Spark 1.1](https://quelleia.com/modeles/muse-spark-1-1.md) | Meta AI | non précisée | 6 520 $ | 88,9 | https://epoch.ai/benchmarks |
| 13 | [Claude Sonnet 5](https://quelleia.com/modeles/claude-sonnet-5.md) | Anthropic | non précisée | 6 378 $ | 88,8 | https://epoch.ai/benchmarks |
| 14 | [Kimi K2.6](https://quelleia.com/modeles/kimi-k2-6.md) | Moonshot | non précisée | 6 205 $ | 88,7 | https://epoch.ai/benchmarks |
| 15 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | non précisée | 6 144 $ | 88,7 | https://epoch.ai/benchmarks |
| 16 | [GPT-5.3 Codex](https://quelleia.com/modeles/gpt-5-3-codex.md) | OpenAI | non précisée | 5 940 $ | 88,5 | https://epoch.ai/benchmarks |
| 17 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | non précisée | 5 787 $ | 88,4 | https://epoch.ai/benchmarks |
| 18 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Élevée | 5 680 $ | 88,4 | https://epoch.ai/benchmarks |
| 19 | [GLM-5.1](https://quelleia.com/modeles/glm-5-1.md) | Z.ai (Zhipu AI) | non précisée | 5 634 $ | 88,4 | https://epoch.ai/benchmarks |
| 20 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | non précisée | 5 478 $ | 88,3 | https://epoch.ai/benchmarks |
| 21 | [Claude Fable 5.1](https://quelleia.com/modeles/claude-fable-5-1.md) | Anthropic | non précisée | 5 422 $ | 88,2 | https://epoch.ai/benchmarks |
| 22 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | non précisée | 5 396 $ | 88,2 | https://epoch.ai/benchmarks |
| 23 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | non précisée | 5 165 $ | 88,0 | https://epoch.ai/benchmarks |
| 24 | [Qwen 3.6 Plus](https://quelleia.com/modeles/qwen-3-6-plus.md) | Alibaba | non précisée | 5 115 $ | 88,0 | https://epoch.ai/benchmarks |
| 25 | [Gemini 3.8 Flash](https://quelleia.com/modeles/gemini-3-8-flash.md) | Google DeepMind | non précisée | 5 094 $ | 88,0 | https://epoch.ai/benchmarks |
| 26 | [Kimi K2.7 Code](https://quelleia.com/modeles/kimi-k2-7-code.md) | Moonshot | non précisée | 5 083 $ | 88,0 | https://epoch.ai/benchmarks |
| 27 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | non précisée | 4 967 $ | 87,9 | https://epoch.ai/benchmarks |
| 28 | [Grok 4.20](https://quelleia.com/modeles/grok-4-20.md) | xAI | non précisée | 4 663 $ | 87,7 | https://epoch.ai/benchmarks |
| 29 | [GLM-5](https://quelleia.com/modeles/glm-5.md) | Z.ai (Zhipu AI) | non précisée | 4 432 $ | 87,5 | https://epoch.ai/benchmarks |
| 30 | [Qwen 3.6 Max (Preview)](https://quelleia.com/modeles/qwen-3-6-max-preview.md) | Alibaba | non précisée | 4 254 $ | 87,4 | https://epoch.ai/benchmarks |
| 31 | [GPT-5.6 Luna](https://quelleia.com/modeles/gpt-5-6-luna.md) | OpenAI | non précisée | 4 095 $ | 87,2 | https://epoch.ai/benchmarks |
| 32 | [Grok 4.5](https://quelleia.com/modeles/grok-4-5.md) | xAI | non précisée | 3 887 $ | 87,0 | https://epoch.ai/benchmarks |
| 33 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | non précisée | 3 839 $ | 87,0 | https://epoch.ai/benchmarks |
| 34 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 3 774 $ | 86,9 | https://epoch.ai/benchmarks |
| 35 | [Gemini 3 Flash](https://quelleia.com/modeles/gemini-3-flash.md) | Google DeepMind | non précisée | 3 635 $ | 86,8 | https://epoch.ai/benchmarks |
| 36 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | non précisée | 3 591 $ | 86,8 | https://epoch.ai/benchmarks |
| 37 | [DeepSeek-V4-Pro](https://quelleia.com/modeles/deepseek-v4-pro.md) | DeepSeek | non précisée | 3 285 $ | 86,4 | https://epoch.ai/benchmarks |
| 38 | [GLM-4.7](https://quelleia.com/modeles/glm-4-7.md) | Z.ai (Zhipu AI) | non précisée | 2 377 $ | 85,3 | https://epoch.ai/benchmarks |
| 39 | [MiniMax-M3](https://quelleia.com/modeles/minimax-m3.md) | MiniMax | non précisée | 2 158 $ | 85,0 | https://epoch.ai/benchmarks |
| 40 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | non précisée | 1 473 $ | 83,6 | https://epoch.ai/benchmarks |
| 41 | [Kimi K2.5](https://quelleia.com/modeles/kimi-k2-5.md) | Moonshot | non précisée | 1 198 $ | 82,9 | https://epoch.ai/benchmarks |
| 42 | [Grok 4.1 Fast](https://quelleia.com/modeles/grok-4-1-fast.md) | xAI | non précisée | 1 107 $ | 82,6 | https://epoch.ai/benchmarks |
| 43 | [DeepSeek-V3.2-Exp](https://quelleia.com/modeles/deepseek-v3-2-exp.md) | DeepSeek | non précisée | 1 034 $ | 82,4 | https://epoch.ai/benchmarks |
| 44 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 574 $ | 80,3 | https://epoch.ai/benchmarks |
| 45 | [Gemini 2.5 Flash (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-flash-jun-2025.md) | Google DeepMind | non précisée | 549 $ | 80,1 | https://epoch.ai/benchmarks |
| 46 | [Qwen 3.5 Flash (hosted 35B-A3B)](https://quelleia.com/modeles/qwen-3-5-flash-hosted-35b-a3b.md) | Alibaba | non précisée | 463 $ | 79,5 | https://epoch.ai/benchmarks |
| 47 | [Claude Haiku 4.5](https://quelleia.com/modeles/claude-haiku-4-5.md) | Anthropic | non précisée | 459 $ | 79,5 | https://epoch.ai/benchmarks |
| 48 | [Qwen3.5-27B](https://quelleia.com/modeles/qwen3-5-27b.md) | Alibaba | non précisée | 202 $ | 76,6 | https://epoch.ai/benchmarks |
| 49 | [MiniMax-M2](https://quelleia.com/modeles/minimax-m2.md) | MiniMax | non précisée | 161 $ | 75,8 | https://epoch.ai/benchmarks |
| 50 | [Qwen3-Max](https://quelleia.com/modeles/qwen3-max.md) | Alibaba | non précisée | 72 $ | 72,9 | https://epoch.ai/benchmarks |
| 51 | [Grok 4.3 Beta](https://quelleia.com/modeles/grok-4-3-beta.md) | xAI | non précisée | 35 $ | 70,4 | https://epoch.ai/benchmarks |
| 52 | [Qwen 3.5 Plus (hosted 397B-A17B)](https://quelleia.com/modeles/qwen-3-5-plus-hosted-397b-a17b.md) | Alibaba | non précisée | 1 $ | 55,6 | https://epoch.ai/benchmarks |
| 53 | [Qwen3-235B-A22B-Thinking (Jul 2025)](https://quelleia.com/modeles/qwen3-235b-a22b-thinking-jul-2025.md) | Alibaba | non précisée | -11 $ | -15,5 | https://epoch.ai/benchmarks |
| 54 | [gpt-oss-120b](https://quelleia.com/modeles/gpt-oss-120b.md) | OpenAI | non précisée | -22 $ | -15,5 | https://epoch.ai/benchmarks |
| 55 | [MiniMax-M2.5](https://quelleia.com/modeles/minimax-m2-5.md) | MiniMax | non précisée | -23 $ | -15,5 | https://epoch.ai/benchmarks |
| 56 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | non précisée | -31 $ | -15,5 | https://epoch.ai/benchmarks |

## En bref

**Que mesure Vending-Bench 2 ?** Gérer seul un distributeur automatique simulé pendant un an : stocks, prix, négociation avec les fournisseurs, imprévus. Sur Quelle IA, il est rangé dans la tâche Agents.

**Comment Vending-Bench 2 est-il noté ?** Solde du compte en dollars à la fin de l'année simulée, en moyenne sur cinq parties. Un modèle qui obtient 4 500 $ a un score IA d'environ 88.

**Qui est en tête sur Vending-Bench 2 ?** GPT-6 Astra (OpenAI) est en tête de Vending-Bench 2 avec 15 515 $, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5 (11 182 $) et Claude Opus 4.7 (10 937 $). 56 modèles y sont mesurés.

**Quelles sont les limites de Vending-Bench 2 ?** Un seul scénario simulé. Andon Labs estime qu'une bonne stratégie humaine atteindrait environ 63 000 dollars, quatre fois le meilleur modèle. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse Vending-Bench 2 dans le score IA ?** Vending-Bench 2 compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

**Qui maintient Vending-Bench 2 ?** Andon Labs. Sa page de référence : andonlabs.com/evals/vending-bench-2.

## Les autres benchmarks de la tâche Agents

- [METR Time Horizons (taux de réussite)](https://quelleia.com/benchmarks/metr_time_horizons.md) : 41 modèles · 1,67 % du score
- [BALROG](https://quelleia.com/benchmarks/balrog.md) : 37 modèles · 1,67 % du score
- [APEX-Agents](https://quelleia.com/benchmarks/apex_agents.md) : 34 modèles · 1,67 % du score
- [DeepResearch Bench](https://quelleia.com/benchmarks/deepresearch_bench.md) : 24 modèles · 1,67 % du score
- [EBR-bench (Earthborne Rangers)](https://quelleia.com/benchmarks/ebr_bench.md) : 23 modèles · 1,67 % du score
- [Remote Labor Index](https://quelleia.com/benchmarks/remote_labor_index.md) : 13 modèles · 1,67 % du score
- [PostTrainBench](https://quelleia.com/benchmarks/posttrainbench.md) : 11 modèles · 1,67 % du score
- [OSWorld 2.0](https://quelleia.com/benchmarks/osworld_2.md) : 9 modèles · 1,67 % du score
- [TheAgentCompany](https://quelleia.com/benchmarks/the_agent_company.md) : 14 modèles · hors score, archivé
- [GDPval](https://quelleia.com/benchmarks/gdpval.md) : 11 modèles · hors score, archivé
- [OSWorld](https://quelleia.com/benchmarks/osworld.md) : 9 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
