# APEX-Agents

> Fiche du benchmark APEX-Agents sur Quelle IA, édition du 28 septembre 2026. 480 missions de banque d'affaires, de conseil et de droit des sociétés, à mener dans des outils de bureau : tableurs, présentations, messagerie. En tête au 28 septembre 2026 : Claude Sonnet 5.5 (75,5 %). Notation, limites et classement des 34 modèles mesurés.

Page : https://quelleia.com/benchmarks/apex_agents/
Source du benchmark : https://www.mercor.com/blog/introducing-apex-agents/
Mainteneur : Mercor
Tâche : Agents
État : actif

## À quoi il sert

Sur Quelle IA, APEX-Agents sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 88.

## Comment c'est noté

Part de missions où tous les critères de la grille sont remplis dès le premier essai, selon un modèle correcteur.

## Ce qu'il ne dit pas

La correction est confiée à une IA. Le classement est tenu par Mercor, l'entreprise privée qui a conçu les missions.

## Qui le tient

Mercor.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 88. Le meilleur, Claude Sonnet 5.5, atteint 75,5 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 4 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 28 %
- Score IA 100 (niveau de Claude Opus 5.5) : 73 %

## Son poids dans le score IA

1,67 % du score général. APEX-Agents porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

## Classement (34 modèles mesurés · 36 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Claude Sonnet 5.5](https://quelleia.com/modeles/claude-sonnet-5-5.md) | Anthropic | Maximale | 75,5 % | 101,3 | https://epoch.ai/benchmarks |
| 2 | [Claude Opus 5.5](https://quelleia.com/modeles/claude-opus-5-5.md) | Anthropic | Maximale | 73,5 % | 100,1 | https://epoch.ai/benchmarks |
| 3 | [Claude Fable 5.1](https://quelleia.com/modeles/claude-fable-5-1.md) | Anthropic | non précisée | 68,6 % | 97,2 | https://epoch.ai/benchmarks |
| 4 | [Gemini 3.7 Flash](https://quelleia.com/modeles/gemini-3-7-flash.md) | Google DeepMind | non précisée | 67,8 % | 96,8 | https://epoch.ai/benchmarks |
| 5 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | Maximale | 65,8 % | 95,7 | https://epoch.ai/benchmarks |
| 6 | [Grok 4.6](https://quelleia.com/modeles/grok-4-6.md) | xAI | non précisée | 65,3 % | 95,5 | https://epoch.ai/benchmarks |
| 7 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | non précisée | 64,7 % | 95,1 | https://epoch.ai/benchmarks |
| 8 | [Gemini 3.8 Flash](https://quelleia.com/modeles/gemini-3-8-flash.md) | Google DeepMind | non précisée | 64,3 % | 94,9 | https://epoch.ai/benchmarks |
| 9 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | non précisée | 63,6 % | 94,6 | https://epoch.ai/benchmarks |
| 10 | [GPT-5.6 Terra](https://quelleia.com/modeles/gpt-5-6-terra.md) | OpenAI | Maximale | 58,2 % | 91,9 | https://epoch.ai/benchmarks |
| 11 | [Muse Spark 1.3](https://quelleia.com/modeles/muse-spark-1-3.md) | Meta AI | non précisée | 57,8 % | 91,7 | https://epoch.ai/benchmarks |
| 12 | [GLM-5.3](https://quelleia.com/modeles/glm-5-3.md) | Z.ai (Zhipu AI) | non précisée | 56,6 % | 91,1 | https://epoch.ai/benchmarks |
| 13 | [Grok 4.5](https://quelleia.com/modeles/grok-4-5.md) | xAI | non précisée | 56,2 % | 90,9 | https://epoch.ai/benchmarks |
| 14 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | non précisée | 55,1 % | 90,4 | https://epoch.ai/benchmarks |
| 15 | [Claude Sonnet 5](https://quelleia.com/modeles/claude-sonnet-5.md) | Anthropic | non précisée | 54,5 % | 90,1 | https://epoch.ai/benchmarks |
| 16 | [GLM-5.3-Flash](https://quelleia.com/modeles/glm-5-3-flash.md) | Z.ai (Zhipu AI) | non précisée | 52,8 % | 89,3 | https://epoch.ai/benchmarks |
| 17 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | non précisée | 52,4 % | 89,1 | https://epoch.ai/benchmarks |
| 18 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 51,4 % | 88,6 | https://epoch.ai/benchmarks |
| 19 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | non précisée | 50,6 % | 88,2 | https://epoch.ai/benchmarks |
| 20 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | Maximale | 49,2 % | 87,6 | https://epoch.ai/benchmarks |
| 21 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Maximale | 48,9 % | 87,4 | https://epoch.ai/benchmarks |
| 22 | [DeepSeek V4 Pro 0813](https://quelleia.com/modeles/deepseek-v4-pro-0813.md) | DeepSeek | non précisée | 47,3 % | 86,7 | https://epoch.ai/benchmarks |
| 23 | [Gemini 3.6 Flash](https://quelleia.com/modeles/gemini-3-6-flash.md) | Google DeepMind | non précisée | 46,9 % | 86,5 | https://epoch.ai/benchmarks |
| 24 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | Maximale | 46,3 % | 86,2 | https://epoch.ai/benchmarks |
| 25 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | Élevée | 43 % | 84,6 | https://epoch.ai/benchmarks |
| 26 | [GLM-5.1](https://quelleia.com/modeles/glm-5-1.md) | Z.ai (Zhipu AI) | non précisée | 40,9 % | 83,6 | https://epoch.ai/benchmarks |
| 27 | [MiniMax-M3](https://quelleia.com/modeles/minimax-m3.md) | MiniMax | non précisée | 37,7 % | 82,0 | https://epoch.ai/benchmarks |
| 28 | [Kimi K2.7 Code](https://quelleia.com/modeles/kimi-k2-7-code.md) | Moonshot | non précisée | 37,6 % | 81,9 | https://epoch.ai/benchmarks |
| 29 | [Muse Spark 1.2](https://quelleia.com/modeles/muse-spark-1-2.md) | Meta AI | non précisée | 36,4 % | 81,3 | https://epoch.ai/benchmarks |
| 30 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 35,3 % | 80,8 | https://epoch.ai/benchmarks |
| 31 | [Inkling](https://quelleia.com/modeles/inkling.md) | Thinking Machines | non précisée | 33,8 % | 80,0 | https://epoch.ai/benchmarks |
| 32 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | non précisée | 27,5 % | 76,4 | https://epoch.ai/benchmarks |
| 33 | [Qwen3.5 397B-A17B](https://quelleia.com/modeles/qwen3-5-397b-a17b.md) | Alibaba | non précisée | 24,9 % | 74,8 | https://epoch.ai/benchmarks |
| 34 | [gpt-oss-120b](https://quelleia.com/modeles/gpt-oss-120b.md) | OpenAI | non précisée | 4,4 % | 51,4 | https://epoch.ai/benchmarks |

## En bref

**Que mesure APEX-Agents ?** 480 missions de banque d'affaires, de conseil et de droit des sociétés, à mener dans des outils de bureau : tableurs, présentations, messagerie. Sur Quelle IA, il est rangé dans la tâche Agents.

**Comment APEX-Agents est-il noté ?** Part de missions où tous les critères de la grille sont remplis dès le premier essai, selon un modèle correcteur. Un modèle qui obtient 50 % a un score IA d'environ 88.

**Qui est en tête sur APEX-Agents ?** Claude Sonnet 5.5 (Anthropic) est en tête d'APEX-Agents avec 75,5 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5.5 (73,5 %) et Claude Fable 5.1 (68,6 %). 34 modèles y sont mesurés.

**Quelles sont les limites d'APEX-Agents ?** La correction est confiée à une IA. Le classement est tenu par Mercor, l'entreprise privée qui a conçu les missions. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse APEX-Agents dans le score IA ?** APEX-Agents compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

**Qui maintient APEX-Agents ?** Mercor. Sa page de référence : mercor.com/blog/introducing-apex-agents.

## Les autres benchmarks de la tâche Agents

- [Vending-Bench 2](https://quelleia.com/benchmarks/vending_bench_2.md) : 56 modèles · 1,67 % du score
- [METR Time Horizons (taux de réussite)](https://quelleia.com/benchmarks/metr_time_horizons.md) : 41 modèles · 1,67 % du score
- [BALROG](https://quelleia.com/benchmarks/balrog.md) : 37 modèles · 1,67 % du score
- [DeepResearch Bench](https://quelleia.com/benchmarks/deepresearch_bench.md) : 24 modèles · 1,67 % du score
- [EBR-bench (Earthborne Rangers)](https://quelleia.com/benchmarks/ebr_bench.md) : 23 modèles · 1,67 % du score
- [Remote Labor Index](https://quelleia.com/benchmarks/remote_labor_index.md) : 13 modèles · 1,67 % du score
- [PostTrainBench](https://quelleia.com/benchmarks/posttrainbench.md) : 11 modèles · 1,67 % du score
- [OSWorld 2.0](https://quelleia.com/benchmarks/osworld_2.md) : 9 modèles · 1,67 % du score
- [TheAgentCompany](https://quelleia.com/benchmarks/the_agent_company.md) : 14 modèles · hors score, archivé
- [GDPval](https://quelleia.com/benchmarks/gdpval.md) : 11 modèles · hors score, archivé
- [OSWorld](https://quelleia.com/benchmarks/osworld.md) : 9 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
