| 注册
首页|期刊导航|Computational Visual Media|Video-Bench:A comprehensive benchmark and toolkit for evaluating video-based large language models

Video-Bench:A comprehensive benchmark and toolkit for evaluating video-based large language models

Munan Ning Bin Zhu Yujia Xie Bin Lin Jiaxi Cui Lu Yuan Dongdong Chen Li Yuan

Computational Visual Media2026,Vol.12Issue(1):P.71-84,14.
Computational Visual Media2026,Vol.12Issue(1):P.71-84,14.DOI:10.26599/CVM.2025.9450516

Video-Bench:A comprehensive benchmark and toolkit for evaluating video-based large language models

Munan Ning 1Bin Zhu 2Yujia Xie 3Bin Lin 2Jiaxi Cui 4Lu Yuan 5Dongdong Chen 3Li Yuan1

作者信息

  • 1. Shenzhen Graduate School,Peking University,Shenzhen 518055,China Pengcheng Laboratory,Shenzhen 518000,China
  • 2. Shenzhen Graduate School,Peking University,Shenzhen 518055,China
  • 3. Microsoft Cloud AI,Beijing 100080,China
  • 4. Pandalla.ai,Singapore 048624,Singapore
  • 5. Meta AI,Shanghai 201203,China
  • 折叠

摘要

关键词

multimodal large language model/vision question answering/benchmark/video processing

分类

信息技术与安全科学

引用本文复制引用

Munan Ning,Bin Zhu,Yujia Xie,Bin Lin,Jiaxi Cui,Lu Yuan,Dongdong Chen,Li Yuan..Video-Bench:A comprehensive benchmark and toolkit for evaluating video-based large language models[J].Computational Visual Media,2026,12(1):P.71-84,14.

基金项目

supported in part by grants from the National Natural Science Foundation of China(62202014,62332002,62425101). (62202014,62332002,62425101)

Computational Visual Media

2096-0433

访问量0
|
下载量0
段落导航相关论文