À quoi il sert
TheAgentCompany servait à noter la tâche Agents. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
AgentsFiche benchmark · Université Carnegie Mellon · the-agent-company.com
175 tâches de bureau dans une fausse entreprise de logiciel : coder, gérer un projet, traiter des dossiers de RH ou de finance.
TheAgentCompany servait à noter la tâche Agents. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
Part de tâches entièrement accomplies ; un second score accorde des points partiels par étape franchie.
Peu de modèles testés, et aucun sorti après septembre 2025 dans les données d'Epoch.
Université Carnegie Mellon.
the-agent-company.com · tâche Agents · 14 modèles mesurés
En tête : DeepSeek-V3.2-Exp, 42,9 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 76. Le meilleur, DeepSeek-V3.2-Exp, atteint 42,9 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. TheAgentCompany est archivé et ne compte plus : la tâche Agents (15 % du score général) repose sur 9 autres benchmarks.
En couleur, la tâche Agents dans le score général. TheAgentCompany n'y a plus de part.