# TheAgentCompany

> Fiche du benchmark TheAgentCompany sur Quelle IA, édition du 28 septembre 2026. 175 tâches de bureau dans une fausse entreprise de logiciel : coder, gérer un projet, traiter des dossiers de RH ou de finance. En tête au 28 septembre 2026 : DeepSeek-V3.2-Exp (42,9 %). Notation, limites et classement des 14 modèles mesurés.

Page : https://quelleia.com/benchmarks/the_agent_company/
Source du benchmark : https://the-agent-company.com/
Mainteneur : Université Carnegie Mellon
Tâche : Agents
État : archivé

## À quoi il sert

TheAgentCompany servait à noter la tâche Agents. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

## Comment c'est noté

Part de tâches entièrement accomplies ; un second score accorde des points partiels par étape franchie.

## Ce qu'il ne dit pas

Peu de modèles testés, et aucun sorti après septembre 2025 dans les données d'Epoch.

## Qui le tient

Université Carnegie Mellon.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 76. Le meilleur, DeepSeek-V3.2-Exp, atteint 42,9 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 7 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 50 %
- Score IA 100 (niveau de Claude Opus 5.5) : 92 %

## Son poids dans le score IA

0 % du score général. TheAgentCompany est archivé et ne compte plus : la tâche Agents (15 % du score général) repose sur 9 autres benchmarks.

## Classement (14 modèles mesurés · 16 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [DeepSeek-V3.2-Exp](https://quelleia.com/modeles/deepseek-v3-2-exp.md) | DeepSeek | non précisée | 42,9 % | 73,5 | https://epoch.ai/benchmarks |
| 2 | [Gemini 2.5 Flash (Sep 2025)](https://quelleia.com/modeles/gemini-2-5-flash-sep-2025.md) | Google DeepMind | non précisée | 41,1 % | 72,8 | https://epoch.ai/benchmarks |
| 3 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | non précisée | 33,1 % | 69,4 | https://epoch.ai/benchmarks |
| 4 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | non précisée | 30,9 % | 68,4 | https://epoch.ai/benchmarks |
| 5 | [Gemini 2.5 Pro (May 2025)](https://quelleia.com/modeles/gemini-2-5-pro-may-2025.md) | Google DeepMind | non précisée | 30,3 % | 68,2 | https://epoch.ai/benchmarks |
| 6 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 24 % | 65,0 | https://epoch.ai/benchmarks |
| 7 | [Gemini 2.0 Flash (Feb 2025)](https://quelleia.com/modeles/gemini-2-0-flash-feb-2025.md) | Google DeepMind | non précisée | 11,4 % | 56,3 | https://epoch.ai/benchmarks |
| 8 | [GPT-4o (Nov 2024)](https://quelleia.com/modeles/gpt-4o-nov-2024.md) | OpenAI | non précisée | 8,6 % | 53,2 | https://epoch.ai/benchmarks |
| 9 | [Llama 3.1-405B](https://quelleia.com/modeles/llama-3-1-405b.md) | Meta AI | non précisée | 7,4 % | 51,6 | https://epoch.ai/benchmarks |
| 10 | [Llama 3.1-70B](https://quelleia.com/modeles/llama-3-1-70b.md) | Meta AI | non précisée | 6,9 % | 50,9 | https://epoch.ai/benchmarks |
| 11 | [Qwen2.5-72B](https://quelleia.com/modeles/qwen2-5-72b.md) | Alibaba | non précisée | 5,7 % | 48,9 | https://epoch.ai/benchmarks |
| 12 | [Gemini 1.5 Pro (Sept 2024)](https://quelleia.com/modeles/gemini-1-5-pro-sept-2024.md) | Google DeepMind | non précisée | 3,4 % | 43,6 | https://epoch.ai/benchmarks |
| 13 | [Amazon Nova Pro](https://quelleia.com/modeles/amazon-nova-pro.md) | Amazon | non précisée | 1,7 % | 36,7 | https://epoch.ai/benchmarks |
| 14 | [Qwen2-72B](https://quelleia.com/modeles/qwen2-72b.md) | Alibaba | non précisée | 1,1 % | 32,4 | https://epoch.ai/benchmarks |

## En bref

**Que mesure TheAgentCompany ?** 175 tâches de bureau dans une fausse entreprise de logiciel : coder, gérer un projet, traiter des dossiers de RH ou de finance. Sur Quelle IA, il est rangé dans la tâche Agents.

**Comment TheAgentCompany est-il noté ?** Part de tâches entièrement accomplies ; un second score accorde des points partiels par étape franchie. Un modèle qui obtient 50 % a un score IA d'environ 76.

**Qui est en tête sur TheAgentCompany ?** DeepSeek-V3.2-Exp (DeepSeek) est en tête de TheAgentCompany avec 42,9 %, dans l'édition du 28 septembre 2026. Suivent Gemini 2.5 Flash (Sep 2025) (41,1 %) et Claude Sonnet 4 (33,1 %). 14 modèles y sont mesurés.

**Quelles sont les limites de TheAgentCompany ?** Peu de modèles testés, et aucun sorti après septembre 2025 dans les données d'Epoch. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse TheAgentCompany dans le score IA ?** TheAgentCompany compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Agents (15 % du score général) repose sur 9 autres benchmarks.

**Qui maintient TheAgentCompany ?** Université Carnegie Mellon. Sa page de référence : the-agent-company.com.

## Les autres benchmarks de la tâche Agents

- [Vending-Bench 2](https://quelleia.com/benchmarks/vending_bench_2.md) : 56 modèles · 1,67 % du score
- [METR Time Horizons (taux de réussite)](https://quelleia.com/benchmarks/metr_time_horizons.md) : 41 modèles · 1,67 % du score
- [BALROG](https://quelleia.com/benchmarks/balrog.md) : 37 modèles · 1,67 % du score
- [APEX-Agents](https://quelleia.com/benchmarks/apex_agents.md) : 34 modèles · 1,67 % du score
- [DeepResearch Bench](https://quelleia.com/benchmarks/deepresearch_bench.md) : 24 modèles · 1,67 % du score
- [EBR-bench (Earthborne Rangers)](https://quelleia.com/benchmarks/ebr_bench.md) : 23 modèles · 1,67 % du score
- [Remote Labor Index](https://quelleia.com/benchmarks/remote_labor_index.md) : 13 modèles · 1,67 % du score
- [PostTrainBench](https://quelleia.com/benchmarks/posttrainbench.md) : 11 modèles · 1,67 % du score
- [OSWorld 2.0](https://quelleia.com/benchmarks/osworld_2.md) : 9 modèles · 1,67 % du score
- [GDPval](https://quelleia.com/benchmarks/gdpval.md) : 11 modèles · hors score, archivé
- [OSWorld](https://quelleia.com/benchmarks/osworld.md) : 9 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
