Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

AgentsFiche benchmark · Université Carnegie Mellon · the-agent-company.com

TheAgentCompany

175 tâches de bureau dans une fausse entreprise de logiciel : coder, gérer un projet, traiter des dossiers de RH ou de finance.

ARCHIVÉ

À quoi il sert

TheAgentCompany servait à noter la tâche Agents. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

Comment c'est noté

Part de tâches entièrement accomplies ; un second score accorde des points partiels par étape franchie.

Ce qu'il ne dit pas

Peu de modèles testés, et aucun sorti après septembre 2025 dans les données d'Epoch.

Comment lire le score

14 modèles mesurés · 16 mesures

En tête : DeepSeek-V3.2-Exp, 42,9 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 76. Le meilleur, DeepSeek-V3.2-Exp, atteint 42,9 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
7 %
Score IA 76niveau de Claude Sonnet 4.5
50 %
Score IA 100niveau de Claude Opus 5.5
92 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. TheAgentCompany est archivé et ne compte plus : la tâche Agents (15 % du score général) repose sur 9 autres benchmarks.

En couleur, la tâche Agents dans le score général. TheAgentCompany n'y a plus de part.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1DeepSeek-V3.2-ExpDeepSeekNon précisée42,9 %73,5
2Gemini 2.5 Flash (Sep 2025)Google DeepMindNon précisée41,1 %72,8
3Claude Sonnet 4AnthropicNon précisée33,1 %69,4
4Claude 3.7 SonnetAnthropic · 2 configurationsNon précisée30,9 %68,4
5Gemini 2.5 Pro (May 2025)Google DeepMindNon précisée30,3 %68,2
6Claude 3.5 Sonnet (October 2024)AnthropicNon précisée24 %65,0
7Gemini 2.0 Flash (Feb 2025)Google DeepMindNon précisée11,4 %56,3
8GPT-4o (Nov 2024)OpenAINon précisée8,6 %53,2
9Llama 3.1-405BMeta AI · poids ouvertsNon précisée7,4 %51,6
10Llama 3.1-70BMeta AI · poids ouverts · 2 configurationsNon précisée6,9 %50,9
14 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 14 →Replier le classement ↑
11Qwen2.5-72BAlibaba · poids ouvertsNon précisée5,7 %48,9
12Gemini 1.5 Pro (Sept 2024)Google DeepMindNon précisée3,4 %43,6
13Amazon Nova ProAmazonNon précisée1,7 %36,7
14Qwen2-72BAlibaba · poids ouvertsNon précisée1,1 %32,4

En bref

Que mesure TheAgentCompany ?
175 tâches de bureau dans une fausse entreprise de logiciel : coder, gérer un projet, traiter des dossiers de RH ou de finance. Sur Quelle IA, il est rangé dans la tâche Agents.
Comment TheAgentCompany est-il noté ?
Part de tâches entièrement accomplies ; un second score accorde des points partiels par étape franchie. Un modèle qui obtient 50 % a un score IA d'environ 76.
Qui est en tête sur TheAgentCompany ?
DeepSeek-V3.2-Exp (DeepSeek) est en tête de TheAgentCompany avec 42,9 %, dans l'édition du 28 septembre 2026. Suivent Gemini 2.5 Flash (Sep 2025) (41,1 %) et Claude Sonnet 4 (33,1 %). 14 modèles y sont mesurés.
Quelles sont les limites de TheAgentCompany ?
Peu de modèles testés, et aucun sorti après septembre 2025 dans les données d'Epoch. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse TheAgentCompany dans le score IA ?
TheAgentCompany compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Agents (15 % du score général) repose sur 9 autres benchmarks.
Qui maintient TheAgentCompany ?
Université Carnegie Mellon. Sa page de référence : the-agent-company.com.

Les autres benchmarks de la tâche Agents

Tous les benchmarks →Comment le score IA est calculé →