Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

VisionFiche benchmark · Équipe Video-MME (auteurs de l'article de 2024) · video-mme.github.io

Video-MME

2 700 questions à choix multiples sur 900 vidéos, de moins de deux minutes à une heure.

ARCHIVÉ

À quoi il sert

Video-MME servait à noter la tâche Vision et multimodal. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

Comment c'est noté

Part de bonnes réponses sans les sous-titres ; le hasard donne 25 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

Ce qu'il ne dit pas

Beaucoup de lignes concernent des modèles de recherche, et le nombre d'images transmises varie d'un modèle à l'autre. Aucun modèle sorti après juin 2025.

Comment lire le score

50 modèles mesurés

En tête : video-SALMONN 2+, 79,7 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 62 % a un score IA d'environ 39. Le meilleur, video-SALMONN 2+, atteint 79,7 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
69 %
Score IA 76niveau de Claude Sonnet 4.5
81 %
Score IA 100niveau de Claude Opus 5.5
89 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. Video-MME est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.

En couleur, la tâche Vision et multimodal dans le score général. Video-MME n'y a plus de part.

Le classement du benchmark

Scores relevés auprès de 2 sources · édition du
RangModèleRéflexionScore publiéSuggèreSource
1video-SALMONN 2+ByteDanceNon précisée79,7 %72,7
2Gemini 1.5 Pro (Feb 2024)Google DeepMindNon précisée75 %62,5
2Gemini 1.5 Pro (May 2024)Google DeepMindNon précisée75 %62,5
4Qwen2.5-72BAlibaba · poids ouvertsNon précisée73,5 %59,5
5InternVL2_5-78BShanghai AI Lab · poids ouvertsNon précisée72,1 %56,8
6GPT-4o (Nov 2024)OpenAINon précisée71,9 %56,4
7GPT-4o (Aug 2024)OpenAINon précisée71,9 %56,4
8Qwen2-VL-72B-InstructAlibabaNon précisée71,2 %55,0
9LLaVA-Video-72B-Qwen2Non précisée70,6 %53,9
10LinVTNon précisée70,3 %53,3
50 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 50 →Replier le classement ↑
10Gemini 1.5 Flash (May 2024)Google DeepMindNon précisée70,3 %53,3
12AriaNon précisée67,6 %48,2
13ViLAMP-llava-qwenNon précisée67,5 %48,0
14Oryx-1.5-32BNon précisée67,3 %47,7
15LLaVA-OneVision 72BNon précisée66,3 %45,8
16VideoLLAMA3-7BNon précisée66,2 %45,6
17LLaVA-Video-7B-Qwen2Non précisée65,9 %45,1
18LLaVA-Video-7B-Qwen2-TPONon précisée65,6 %44,5
19VideoChat-Flash-Qwen2-7B_res448Non précisée65,3 %44,0
20GPT-4o miniOpenAINon précisée64,8 %43,1
21ByteVideoLLM-14BByteDanceNon précisée64,6 %42,7
22NVILA 8BNVIDIA · poids ouvertsNon précisée64,2 %42,0
23LiveCC-7B-InstructNon précisée64,1 %41,8
24MiniCPM-o-2_6OpenBMBNon précisée63,9 %41,4
24Qwen2-VL-7B-InstructAlibabaNon précisée63,9 %41,4
26VideoLLAMA2-7BNon précisée62,4 %38,7
27InternVL2-40BShanghai AI Lab · poids ouvertsNon précisée61,2 %36,5
28MiniCPM-V-2_6OpenBMBNon précisée60,9 %36,0
29Claude 3.5 SonnetAnthropicNon précisée60 %34,3
29Claude 3.5 Sonnet (October 2024)AnthropicNon précisée60 %34,3
31GPT-4VOpenAINon précisée59,9 %34,1
32mPLUG-Owl3-7B-241101Non précisée59,3 %33,0
33TimeMarkerNon précisée57,3 %29,4
34VITA-1.5Non précisée56,1 %27,1
35kangarooNon précisée56 %26,9
36VITANon précisée55,8 %26,6
37Video-XL-7BNon précisée55,5 %26,0
38Video-CCAM-7B-v1.2Non précisée53,2 %21,6
39long-llava-qwen2-7bNon précisée52,9 %21,0
40LongVA-7BNon précisée52,6 %20,4
41Qwen-VL-MaxAlibabaNon précisée51,3 %17,9
42InternVL-Chat-V1-5Shanghai AI LaboratoryNon précisée50,7 %16,7
43SliME-Llama3-8BNon précisée45,3 %5,1
44Chat-Uni-Vi-7B-v1.5 + 100k SG-WVNon précisée43,2 %0,1
45Qwen-VL-ChatAlibabaNon précisée41,1 %-5,4
46Chat-UniVi-7B-v1.5 Non précisée40,6 %-6,7
47Video-LLaVA-7BNon précisée39,9 %-8,7
47sharegpt4video-8bNon précisée39,9 %-8,7
49video_chat2_mistralNon précisée39,5 %-9,9
50ST-LLMNon précisée37,9 %-14,7

En bref

Que mesure Video-MME ?
2 700 questions à choix multiples sur 900 vidéos, de moins de deux minutes à une heure. Sur Quelle IA, il est rangé dans la tâche Vision et multimodal.
Comment Video-MME est-il noté ?
Part de bonnes réponses sans les sous-titres ; le hasard donne 25 %. Un modèle qui obtient 62 % a un score IA d'environ 39.
Qui est en tête sur Video-MME ?
video-SALMONN 2+ (ByteDance) est en tête de Video-MME avec 79,7 %, dans l'édition du 28 septembre 2026. Suivent Gemini 1.5 Pro (Feb 2024) (75 %) et Gemini 1.5 Pro (May 2024) (75 %). 50 modèles y sont mesurés.
Quelles sont les limites de Video-MME ?
Beaucoup de lignes concernent des modèles de recherche, et le nombre d'images transmises varie d'un modèle à l'autre. Aucun modèle sorti après juin 2025. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse Video-MME dans le score IA ?
Video-MME compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.
Qui maintient Video-MME ?
Équipe Video-MME (auteurs de l'article de 2024). Sa page de référence : video-mme.github.io/home_page.html.

Les autres benchmarks de la tâche Vision et multimodal

Tous les benchmarks →Comment le score IA est calculé →