À quoi il sert
Video-MME servait à noter la tâche Vision et multimodal. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
VisionFiche benchmark · Équipe Video-MME (auteurs de l'article de 2024) · video-mme.github.io
2 700 questions à choix multiples sur 900 vidéos, de moins de deux minutes à une heure.
Video-MME servait à noter la tâche Vision et multimodal. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
Part de bonnes réponses sans les sous-titres ; le hasard donne 25 %.
Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.
Beaucoup de lignes concernent des modèles de recherche, et le nombre d'images transmises varie d'un modèle à l'autre. Aucun modèle sorti après juin 2025.
Équipe Video-MME (auteurs de l'article de 2024).
video-mme.github.io/home_page.html · tâche Vision · 50 modèles mesurés
En tête : video-SALMONN 2+, 79,7 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 62 % a un score IA d'environ 39. Le meilleur, video-SALMONN 2+, atteint 79,7 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. Video-MME est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.
En couleur, la tâche Vision et multimodal dans le score général. Video-MME n'y a plus de part.