# Video-MME

> Fiche du benchmark Video-MME sur Quelle IA, édition du 28 septembre 2026. 2 700 questions à choix multiples sur 900 vidéos, de moins de deux minutes à une heure. En tête au 28 septembre 2026 : video-SALMONN 2+ (79,7 %). Notation, limites et classement des 50 modèles mesurés.

Page : https://quelleia.com/benchmarks/videomme/
Source du benchmark : https://video-mme.github.io/home_page.html#leaderboard
Mainteneur : Équipe Video-MME (auteurs de l'article de 2024)
Tâche : Vision et multimodal
État : archivé

## À quoi il sert

Video-MME servait à noter la tâche Vision et multimodal. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

## Comment c'est noté

Part de bonnes réponses sans les sous-titres ; le hasard donne 25 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

## Ce qu'il ne dit pas

Beaucoup de lignes concernent des modèles de recherche, et le nombre d'images transmises varie d'un modèle à l'autre. Aucun modèle sorti après juin 2025.

## Qui le tient

Équipe Video-MME (auteurs de l'article de 2024).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 62 % a un score IA d'environ 39. Le meilleur, video-SALMONN 2+, atteint 79,7 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 69 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 81 %
- Score IA 100 (niveau de Claude Opus 5.5) : 89 %

## Son poids dans le score IA

0 % du score général. Video-MME est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.

## Classement (50 modèles mesurés, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [video-SALMONN 2+](https://quelleia.com/modeles/video-salmonn-2.md) | ByteDance | non précisée | 79,7 % | 72,7 | https://epoch.ai/benchmarks |
| 2 | [Gemini 1.5 Pro (Feb 2024)](https://quelleia.com/modeles/gemini-1-5-pro-feb-2024.md) | Google DeepMind | non précisée | 75 % | 62,5 | https://epoch.ai/benchmarks |
| 2 | [Gemini 1.5 Pro (May 2024)](https://quelleia.com/modeles/gemini-1-5-pro-may-2024.md) | Google DeepMind | non précisée | 75 % | 62,5 | https://video-mme.github.io/home_page.html#leaderboard |
| 4 | [Qwen2.5-72B](https://quelleia.com/modeles/qwen2-5-72b.md) | Alibaba | non précisée | 73,5 % | 59,5 | https://epoch.ai/benchmarks |
| 5 | [InternVL2_5-78B](https://quelleia.com/modeles/internvl2-5-78b.md) | Shanghai AI Lab | non précisée | 72,1 % | 56,8 | https://epoch.ai/benchmarks |
| 6 | [GPT-4o (Nov 2024)](https://quelleia.com/modeles/gpt-4o-nov-2024.md) | OpenAI | non précisée | 71,9 % | 56,4 | https://epoch.ai/benchmarks |
| 7 | [GPT-4o (Aug 2024)](https://quelleia.com/modeles/gpt-4o-aug-2024.md) | OpenAI | non précisée | 71,9 % | 56,4 | https://epoch.ai/benchmarks |
| 8 | [Qwen2-VL-72B-Instruct](https://quelleia.com/modeles/qwen2-vl-72b-instruct.md) | Alibaba | non précisée | 71,2 % | 55,0 | https://epoch.ai/benchmarks |
| 9 | [LLaVA-Video-72B-Qwen2](https://quelleia.com/modeles/llava-video-72b-qwen2.md) |  | non précisée | 70,6 % | 53,9 | https://epoch.ai/benchmarks |
| 10 | [LinVT](https://quelleia.com/modeles/linvt.md) |  | non précisée | 70,3 % | 53,3 | https://epoch.ai/benchmarks |
| 10 | [Gemini 1.5 Flash (May 2024)](https://quelleia.com/modeles/gemini-1-5-flash-may-2024.md) | Google DeepMind | non précisée | 70,3 % | 53,3 | https://epoch.ai/benchmarks |
| 12 | [Aria](https://quelleia.com/modeles/aria.md) |  | non précisée | 67,6 % | 48,2 | https://epoch.ai/benchmarks |
| 13 | [ViLAMP-llava-qwen](https://quelleia.com/modeles/vilamp-llava-qwen.md) |  | non précisée | 67,5 % | 48,0 | https://epoch.ai/benchmarks |
| 14 | [Oryx-1.5-32B](https://quelleia.com/modeles/oryx-1-5-32b.md) |  | non précisée | 67,3 % | 47,7 | https://epoch.ai/benchmarks |
| 15 | [LLaVA-OneVision 72B](https://quelleia.com/modeles/llava-onevision-72b.md) |  | non précisée | 66,3 % | 45,8 | https://epoch.ai/benchmarks |
| 16 | [VideoLLAMA3-7B](https://quelleia.com/modeles/videollama3-7b.md) |  | non précisée | 66,2 % | 45,6 | https://epoch.ai/benchmarks |
| 17 | [LLaVA-Video-7B-Qwen2](https://quelleia.com/modeles/llava-video-7b-qwen2.md) |  | non précisée | 65,9 % | 45,1 | https://epoch.ai/benchmarks |
| 18 | [LLaVA-Video-7B-Qwen2-TPO](https://quelleia.com/modeles/llava-video-7b-qwen2-tpo.md) |  | non précisée | 65,6 % | 44,5 | https://epoch.ai/benchmarks |
| 19 | [VideoChat-Flash-Qwen2-7B_res448](https://quelleia.com/modeles/videochat-flash-qwen2-7b-res448.md) |  | non précisée | 65,3 % | 44,0 | https://epoch.ai/benchmarks |
| 20 | [GPT-4o mini](https://quelleia.com/modeles/gpt-4o-mini.md) | OpenAI | non précisée | 64,8 % | 43,1 | https://epoch.ai/benchmarks |
| 21 | [ByteVideoLLM-14B](https://quelleia.com/modeles/bytevideollm-14b.md) | ByteDance | non précisée | 64,6 % | 42,7 | https://epoch.ai/benchmarks |
| 22 | [NVILA 8B](https://quelleia.com/modeles/nvila-8b.md) | NVIDIA | non précisée | 64,2 % | 42,0 | https://epoch.ai/benchmarks |
| 23 | [LiveCC-7B-Instruct](https://quelleia.com/modeles/livecc-7b-instruct.md) |  | non précisée | 64,1 % | 41,8 | https://epoch.ai/benchmarks |
| 24 | [MiniCPM-o-2_6](https://quelleia.com/modeles/minicpm-o-2-6.md) | OpenBMB | non précisée | 63,9 % | 41,4 | https://epoch.ai/benchmarks |
| 24 | [Qwen2-VL-7B-Instruct](https://quelleia.com/modeles/qwen2-vl-7b-instruct.md) | Alibaba | non précisée | 63,9 % | 41,4 | https://epoch.ai/benchmarks |
| 26 | [VideoLLAMA2-7B](https://quelleia.com/modeles/videollama2-7b.md) |  | non précisée | 62,4 % | 38,7 | https://epoch.ai/benchmarks |
| 27 | [InternVL2-40B](https://quelleia.com/modeles/internvl2-40b.md) | Shanghai AI Lab | non précisée | 61,2 % | 36,5 | https://epoch.ai/benchmarks |
| 28 | [MiniCPM-V-2_6](https://quelleia.com/modeles/minicpm-v-2-6.md) | OpenBMB | non précisée | 60,9 % | 36,0 | https://epoch.ai/benchmarks |
| 29 | [Claude 3.5 Sonnet](https://quelleia.com/modeles/claude-3-5-sonnet.md) | Anthropic | non précisée | 60 % | 34,3 | https://epoch.ai/benchmarks |
| 29 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 60 % | 34,3 | https://epoch.ai/benchmarks |
| 31 | [GPT-4V](https://quelleia.com/modeles/gpt-4v.md) | OpenAI | non précisée | 59,9 % | 34,1 | https://epoch.ai/benchmarks |
| 32 | [mPLUG-Owl3-7B-241101](https://quelleia.com/modeles/mplug-owl3-7b-241101.md) |  | non précisée | 59,3 % | 33,0 | https://epoch.ai/benchmarks |
| 33 | [TimeMarker](https://quelleia.com/modeles/timemarker.md) |  | non précisée | 57,3 % | 29,4 | https://epoch.ai/benchmarks |
| 34 | [VITA-1.5](https://quelleia.com/modeles/vita-1-5.md) |  | non précisée | 56,1 % | 27,1 | https://epoch.ai/benchmarks |
| 35 | [kangaroo](https://quelleia.com/modeles/kangaroo.md) |  | non précisée | 56 % | 26,9 | https://epoch.ai/benchmarks |
| 36 | [VITA](https://quelleia.com/modeles/vita.md) |  | non précisée | 55,8 % | 26,6 | https://epoch.ai/benchmarks |
| 37 | [Video-XL-7B](https://quelleia.com/modeles/video-xl-7b.md) |  | non précisée | 55,5 % | 26,0 | https://epoch.ai/benchmarks |
| 38 | [Video-CCAM-7B-v1.2](https://quelleia.com/modeles/video-ccam-7b-v1-2.md) |  | non précisée | 53,2 % | 21,6 | https://epoch.ai/benchmarks |
| 39 | [long-llava-qwen2-7b](https://quelleia.com/modeles/long-llava-qwen2-7b.md) |  | non précisée | 52,9 % | 21,0 | https://epoch.ai/benchmarks |
| 40 | [LongVA-7B](https://quelleia.com/modeles/longva-7b.md) |  | non précisée | 52,6 % | 20,4 | https://epoch.ai/benchmarks |
| 41 | [Qwen-VL-Max](https://quelleia.com/modeles/qwen-vl-max.md) | Alibaba | non précisée | 51,3 % | 17,9 | https://epoch.ai/benchmarks |
| 42 | [InternVL-Chat-V1-5](https://quelleia.com/modeles/internvl-chat-v1-5.md) | Shanghai AI Laboratory | non précisée | 50,7 % | 16,7 | https://epoch.ai/benchmarks |
| 43 | [SliME-Llama3-8B](https://quelleia.com/modeles/slime-llama3-8b.md) |  | non précisée | 45,3 % | 5,1 | https://epoch.ai/benchmarks |
| 44 | [Chat-Uni-Vi-7B-v1.5 + 100k SG-WV](https://quelleia.com/modeles/chat-uni-vi-7b-v1-5-100k-sg-wv.md) |  | non précisée | 43,2 % | 0,1 | https://epoch.ai/benchmarks |
| 45 | [Qwen-VL-Chat](https://quelleia.com/modeles/qwen-vl-chat.md) | Alibaba | non précisée | 41,1 % | -5,4 | https://epoch.ai/benchmarks |
| 46 | [Chat-UniVi-7B-v1.5 ](https://quelleia.com/modeles/chat-univi-7b-v1-5.md) |  | non précisée | 40,6 % | -6,7 | https://epoch.ai/benchmarks |
| 47 | [Video-LLaVA-7B](https://quelleia.com/modeles/video-llava-7b.md) |  | non précisée | 39,9 % | -8,7 | https://epoch.ai/benchmarks |
| 47 | [sharegpt4video-8b](https://quelleia.com/modeles/sharegpt4video-8b.md) |  | non précisée | 39,9 % | -8,7 | https://epoch.ai/benchmarks |
| 49 | [video_chat2_mistral](https://quelleia.com/modeles/video-chat2-mistral.md) |  | non précisée | 39,5 % | -9,9 | https://epoch.ai/benchmarks |
| 50 | [ST-LLM](https://quelleia.com/modeles/st-llm.md) |  | non précisée | 37,9 % | -14,7 | https://epoch.ai/benchmarks |

## En bref

**Que mesure Video-MME ?** 2 700 questions à choix multiples sur 900 vidéos, de moins de deux minutes à une heure. Sur Quelle IA, il est rangé dans la tâche Vision et multimodal.

**Comment Video-MME est-il noté ?** Part de bonnes réponses sans les sous-titres ; le hasard donne 25 %. Un modèle qui obtient 62 % a un score IA d'environ 39.

**Qui est en tête sur Video-MME ?** video-SALMONN 2+ (ByteDance) est en tête de Video-MME avec 79,7 %, dans l'édition du 28 septembre 2026. Suivent Gemini 1.5 Pro (Feb 2024) (75 %) et Gemini 1.5 Pro (May 2024) (75 %). 50 modèles y sont mesurés.

**Quelles sont les limites de Video-MME ?** Beaucoup de lignes concernent des modèles de recherche, et le nombre d'images transmises varie d'un modèle à l'autre. Aucun modèle sorti après juin 2025. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse Video-MME dans le score IA ?** Video-MME compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.

**Qui maintient Video-MME ?** Équipe Video-MME (auteurs de l'article de 2024). Sa page de référence : video-mme.github.io/home_page.html.

## Les autres benchmarks de la tâche Vision et multimodal

- [Arena, vision](https://quelleia.com/benchmarks/arena_vision.md) : 121 modèles · 1,67 % du score
- [Furniture Assembly](https://quelleia.com/benchmarks/furniture_assembly.md) : 28 modèles · 1,67 % du score
- [Blueprint-Bench 2](https://quelleia.com/benchmarks/blueprint_bench_2.md) : 26 modèles · 1,67 % du score
- [VPCT (Visual Physics Comprehension Test)](https://quelleia.com/benchmarks/vpct.md) : 28 modèles · hors score, archivé
- [GeoBench](https://quelleia.com/benchmarks/geobench.md) : 27 modèles · hors score, archivé
- [CadEval](https://quelleia.com/benchmarks/cadeval.md) : 15 modèles · hors score, archivé
- [SpatialViz-Bench](https://quelleia.com/benchmarks/spatialviz_bench.md) : 8 modèles · hors score, archivé
- [MindCube](https://quelleia.com/benchmarks/mindcube.md) : 5 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
