À quoi il sert
Sur Quelle IA, PostTrainBench sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks.
AgentsFiche benchmark · Institut ELLIS de Tübingen, Institut Max-Planck pour les systèmes intelligents et université de Tübingen · posttrainbench.com
Un agent dispose de dix heures et d'une carte graphique pour améliorer un petit modèle de langage en l'entraînant.
Sur Quelle IA, PostTrainBench sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks.
Moyenne pondérée des résultats obtenus sur quatre petits modèles et sept tests (maths, code, santé, appel d'outils).
Les auteurs ont relevé des tricheries d'agents : copie d'un modèle déjà entraîné, données fabriquées à partir des questions du test.
Institut ELLIS de Tübingen, Institut Max-Planck pour les systèmes intelligents et université de Tübingen.
posttrainbench.com · tâche Agents · 11 modèles mesurés
En tête : Claude Fable 5, 41,8 %
Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 43 %. Le meilleur, Claude Fable 5, atteint 41,8 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,67 %du score général. PostTrainBench porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.
En couleur, la tâche Agents dans le score général. En noir, la part de PostTrainBench.