À quoi il sert
Sur Quelle IA, APEX-Agents sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 88.
AgentsFiche benchmark · Mercor · mercor.com
480 missions de banque d'affaires, de conseil et de droit des sociétés, à mener dans des outils de bureau : tableurs, présentations, messagerie.
Sur Quelle IA, APEX-Agents sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 88.
Part de missions où tous les critères de la grille sont remplis dès le premier essai, selon un modèle correcteur.
La correction est confiée à une IA. Le classement est tenu par Mercor, l'entreprise privée qui a conçu les missions.
Mercor.
mercor.com/blog/introducing-apex-agents · tâche Agents · 34 modèles mesurés
En tête : Claude Sonnet 5.5, 75,5 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 88. Le meilleur, Claude Sonnet 5.5, atteint 75,5 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,67 %du score général. APEX-Agents porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.
En couleur, la tâche Agents dans le score général. En noir, la part d'APEX-Agents.