Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

AgentsFiche benchmark · Mercor · mercor.com

APEX-Agents

480 missions de banque d'affaires, de conseil et de droit des sociétés, à mener dans des outils de bureau : tableurs, présentations, messagerie.

À quoi il sert

Sur Quelle IA, APEX-Agents sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 88.

Comment c'est noté

Part de missions où tous les critères de la grille sont remplis dès le premier essai, selon un modèle correcteur.

Ce qu'il ne dit pas

La correction est confiée à une IA. Le classement est tenu par Mercor, l'entreprise privée qui a conçu les missions.

Comment lire le score

34 modèles mesurés · 36 mesures

En tête : Claude Sonnet 5.5, 75,5 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 88. Le meilleur, Claude Sonnet 5.5, atteint 75,5 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
4 %
Score IA 76niveau de Claude Sonnet 4.5
28 %
Score IA 100niveau de Claude Opus 5.5
73 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,67 %du score général. APEX-Agents porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

En couleur, la tâche Agents dans le score général. En noir, la part d'APEX-Agents.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Sonnet 5.5Anthropic · 2 configurationsMaximale75,5 %101,3
2Claude Opus 5.5AnthropicMaximale73,5 %100,1
3Claude Fable 5.1Anthropic · 2 configurationsNon précisée68,6 %97,2
4Gemini 3.7 FlashGoogle DeepMindNon précisée67,8 %96,8
5Claude Opus 5AnthropicMaximale65,8 %95,7
6Grok 4.6xAINon précisée65,3 %95,5
7GPT-6 AstraOpenAINon précisée64,7 %95,1
8Gemini 3.8 FlashGoogle DeepMindNon précisée64,3 %94,9
9Claude Fable 5AnthropicNon précisée63,6 %94,6
10GPT-5.6 TerraOpenAIMaximale58,2 %91,9
34 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 34 →Replier le classement ↑
11Muse Spark 1.3Meta AINon précisée57,8 %91,7
12GLM-5.3Z.ai (Zhipu AI) · poids ouvertsNon précisée56,6 %91,1
13Grok 4.5xAINon précisée56,2 %90,9
14GPT-5.5OpenAINon précisée55,1 %90,4
15Claude Sonnet 5AnthropicNon précisée54,5 %90,1
16GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsNon précisée52,8 %89,3
17GPT-5.4OpenAINon précisée52,4 %89,1
18GPT-5.6 SolOpenAIMaximale51,4 %88,6
19Kimi K3Moonshot · poids ouvertsNon précisée50,6 %88,2
20Claude Opus 4.7AnthropicMaximale49,2 %87,6
21Claude Opus 4.8AnthropicMaximale48,9 %87,4
22DeepSeek V4 Pro 0813DeepSeek · poids ouvertsNon précisée47,3 %86,7
23Gemini 3.6 FlashGoogle DeepMindNon précisée46,9 %86,5
24Claude Opus 4.6AnthropicMaximale46,3 %86,2
25Claude Sonnet 4.6AnthropicÉlevée43 %84,6
26GLM-5.1Z.ai (Zhipu AI) · poids ouvertsNon précisée40,9 %83,6
27MiniMax-M3MiniMax · poids ouvertsNon précisée37,7 %82,0
28Kimi K2.7 CodeMoonshot · poids ouvertsNon précisée37,6 %81,9
29Muse Spark 1.2Meta AINon précisée36,4 %81,3
30Gemini 3.1 ProGoogle DeepMindNon précisée35,3 %80,8
31InklingThinking Machines · poids ouvertsNon précisée33,8 %80,0
32Gemini 3.5 FlashGoogle DeepMindNon précisée27,5 %76,4
33Qwen3.5 397B-A17BAlibaba · poids ouvertsNon précisée24,9 %74,8
34gpt-oss-120bOpenAI · poids ouvertsNon précisée4,4 %51,4

En bref

Que mesure APEX-Agents ?
480 missions de banque d'affaires, de conseil et de droit des sociétés, à mener dans des outils de bureau : tableurs, présentations, messagerie. Sur Quelle IA, il est rangé dans la tâche Agents.
Comment APEX-Agents est-il noté ?
Part de missions où tous les critères de la grille sont remplis dès le premier essai, selon un modèle correcteur. Un modèle qui obtient 50 % a un score IA d'environ 88.
Qui est en tête sur APEX-Agents ?
Claude Sonnet 5.5 (Anthropic) est en tête d'APEX-Agents avec 75,5 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5.5 (73,5 %) et Claude Fable 5.1 (68,6 %). 34 modèles y sont mesurés.
Quelles sont les limites d'APEX-Agents ?
La correction est confiée à une IA. Le classement est tenu par Mercor, l'entreprise privée qui a conçu les missions. Au 28 septembre 2026, le benchmark est actif.
Combien pèse APEX-Agents dans le score IA ?
APEX-Agents compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.
Qui maintient APEX-Agents ?
Mercor. Sa page de référence : mercor.com/blog/introducing-apex-agents.

Les autres benchmarks de la tâche Agents

Tous les benchmarks →Comment le score IA est calculé →