Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

AgentsFiche benchmark · Andon Labs · andonlabs.com

Vending-Bench 2

Gérer seul un distributeur automatique simulé pendant un an : stocks, prix, négociation avec les fournisseurs, imprévus.

À quoi il sert

Sur Quelle IA, Vending-Bench 2 sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 88.

Comment c'est noté

Solde du compte en dollars à la fin de l'année simulée, en moyenne sur cinq parties.

Pour le calcul, le montant passe par son logarithme, centré sur 4 500 $ : doubler le montant compte autant à chaque niveau.

Ce qu'il ne dit pas

Un seul scénario simulé. Andon Labs estime qu'une bonne stratégie humaine atteindrait environ 63 000 dollars, quatre fois le meilleur modèle.

Comment lire le score

56 modèles mesurés · 62 mesures

En tête : GPT-6 Astra, 15 515 $

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 4 500 $ a un score IA d'environ 88. Le meilleur, GPT-6 Astra, atteint 15 515 $.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
0 $
Score IA 76niveau de Claude Sonnet 4.5
190 $
Score IA 100niveau de Claude Opus 5.5
plus de 16 000 $

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,67 %du score général. Vending-Bench 2 porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

En couleur, la tâche Agents dans le score général. En noir, la part de Vending-Bench 2.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-6 AstraOpenAINon précisée15 515 $91,9
2Claude Opus 5AnthropicNon précisée11 182 $90,8
3Claude Opus 4.7AnthropicNon précisée10 937 $90,7
4GPT-5.6 SolOpenAINon précisée9 619 $90,2
5Grok 4.6xAINon précisée9 047 $90,0
6GLM-5.2Z.ai (Zhipu AI) · poids ouvertsNon précisée8 314 $89,7
7GLM-5.3Z.ai (Zhipu AI) · poids ouvertsNon précisée8 164 $89,7
8Claude Opus 4.6AnthropicNon précisée8 018 $89,6
9GPT-5.5OpenAINon précisée7 524 $89,4
10GPT-5.6 TerraOpenAINon précisée7 343 $89,3
56 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 56 →Replier le classement ↑
11Claude Sonnet 4.6AnthropicNon précisée7 204 $89,2
12Muse Spark 1.1Meta AINon précisée6 520 $88,9
13Claude Sonnet 5AnthropicNon précisée6 378 $88,8
14Kimi K2.6Moonshot · poids ouvertsNon précisée6 205 $88,7
15GPT-5.4OpenAINon précisée6 144 $88,7
16GPT-5.3 CodexOpenAINon précisée5 940 $88,5
17Claude Opus 4.8Anthropic · 2 configurationsNon précisée5 787 $88,4
18Claude Fable 5Anthropic · 5 configurationsÉlevée5 680 $88,4
19GLM-5.1Z.ai (Zhipu AI) · poids ouvertsNon précisée5 634 $88,4
20Gemini 3 ProGoogle DeepMindNon précisée5 478 $88,3
21Claude Fable 5.1AnthropicNon précisée5 422 $88,2
22Gemini 3.5 FlashGoogle DeepMindNon précisée5 396 $88,2
23Kimi K3Moonshot · poids ouvertsNon précisée5 165 $88,0
24Qwen 3.6 PlusAlibabaNon précisée5 115 $88,0
25Gemini 3.8 FlashGoogle DeepMindNon précisée5 094 $88,0
26Kimi K2.7 CodeMoonshot · poids ouvertsNon précisée5 083 $88,0
27Claude Opus 4.5AnthropicNon précisée4 967 $87,9
28Grok 4.20xAINon précisée4 663 $87,7
29GLM-5Z.ai (Zhipu AI) · poids ouvertsNon précisée4 432 $87,5
30Qwen 3.6 Max (Preview)AlibabaNon précisée4 254 $87,4
31GPT-5.6 LunaOpenAINon précisée4 095 $87,2
32Grok 4.5xAINon précisée3 887 $87,0
33Claude Sonnet 4.5AnthropicNon précisée3 839 $87,0
34Gemini 3.1 ProGoogle DeepMind · 2 configurationsNon précisée3 774 $86,9
35Gemini 3 FlashGoogle DeepMindNon précisée3 635 $86,8
36GPT-5.2OpenAINon précisée3 591 $86,8
37DeepSeek-V4-ProDeepSeek · poids ouvertsNon précisée3 285 $86,4
38GLM-4.7Z.ai (Zhipu AI) · poids ouvertsNon précisée2 377 $85,3
39MiniMax-M3MiniMax · poids ouvertsNon précisée2 158 $85,0
40GPT-5.1OpenAINon précisée1 473 $83,6
41Kimi K2.5Moonshot · poids ouvertsNon précisée1 198 $82,9
42Grok 4.1 FastxAINon précisée1 107 $82,6
43DeepSeek-V3.2-ExpDeepSeekNon précisée1 034 $82,4
44Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée574 $80,3
45Gemini 2.5 Flash (Jun 2025)Google DeepMindNon précisée549 $80,1
46Qwen 3.5 Flash (hosted 35B-A3B)AlibabaNon précisée463 $79,5
47Claude Haiku 4.5AnthropicNon précisée459 $79,5
48Qwen3.5-27BAlibaba · poids ouvertsNon précisée202 $76,6
49MiniMax-M2MiniMax · poids ouvertsNon précisée161 $75,8
50Qwen3-MaxAlibabaNon précisée72 $72,9
51Grok 4.3 BetaxAINon précisée35 $70,4
52Qwen 3.5 Plus (hosted 397B-A17B)AlibabaNon précisée1 $55,6
53Qwen3-235B-A22B-Thinking (Jul 2025)AlibabaNon précisée-11 $-15,5
54gpt-oss-120bOpenAI · poids ouvertsNon précisée-22 $-15,5
55MiniMax-M2.5MiniMax · poids ouvertsNon précisée-23 $-15,5
56GPT-5 miniOpenAINon précisée-31 $-15,5

En bref

Que mesure Vending-Bench 2 ?
Gérer seul un distributeur automatique simulé pendant un an : stocks, prix, négociation avec les fournisseurs, imprévus. Sur Quelle IA, il est rangé dans la tâche Agents.
Comment Vending-Bench 2 est-il noté ?
Solde du compte en dollars à la fin de l'année simulée, en moyenne sur cinq parties. Un modèle qui obtient 4 500 $ a un score IA d'environ 88.
Qui est en tête sur Vending-Bench 2 ?
GPT-6 Astra (OpenAI) est en tête de Vending-Bench 2 avec 15 515 $, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5 (11 182 $) et Claude Opus 4.7 (10 937 $). 56 modèles y sont mesurés.
Quelles sont les limites de Vending-Bench 2 ?
Un seul scénario simulé. Andon Labs estime qu'une bonne stratégie humaine atteindrait environ 63 000 dollars, quatre fois le meilleur modèle. Au 28 septembre 2026, le benchmark est actif.
Combien pèse Vending-Bench 2 dans le score IA ?
Vending-Bench 2 compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.
Qui maintient Vending-Bench 2 ?
Andon Labs. Sa page de référence : andonlabs.com/evals/vending-bench-2.

Les autres benchmarks de la tâche Agents

Tous les benchmarks →Comment le score IA est calculé →