arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-04 至 2026-02-04 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 4 篇

2506.17873 2026-02-04 cs.CV cs.AI 85%

SurgVidLM: Towards Multi-grained Surgical Video Understanding with Large Language Model

SurgVidLM:迈向多粒度外科视频理解的大型语言模型

Guankun Wang, Junyi Wang, Wenjin Mo, Long Bai, Kun Yuan, Ming Hu, Jinlin Wu, Junjun He, Yiming Huang, Nicolas Padoy, Zhen Lei, Hongbin Liu, Nassir Navab, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Sun Yat-sen University(中山大学) University of Strasbourg(斯特拉斯堡大学) Technical University of Munich(慕尼黑技术大学) Monash University(墨尔本大学) Centre for Artificial Intelligence and Robotics, HKISI-CAS(人工智能与机器人中心,HKISI-CAS) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频理解 :video understanding(title,abstract);video language model(abstract);video reasoning(abstract);分类 cs.CV

AI总结 SurgVidLM通过多粒度分析提升外科视频理解能力,结合全局与局部机制实现更精确的手术流程解析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03615 2026-02-04 cs.CV 70%

KTV: Keyframes and Key Tokens Selection for Efficient Training-Free Video LLMs

KTV: 关键帧与关键令牌选择用于高效无训练视频大语言模型

Baiyang Song, Jun Peng, Yuxin Zhang, Guangyao Chen, Feidiao Yang, Jianyuan Guo

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 KTV通过两阶段框架高效选择关键帧和令牌,提升无训练视频理解的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03589 2026-02-04 cs.CV 57%

SlowFocus: Enhancing Fine-grained Temporal Understanding in Video LLM

SlowFocus: 提升视频大语言模型中的细粒度时间理解

Ming Nie, Dan Ding, Chunwei Wang, Yuanfan Guo, Jianhua Han, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Noah’s Ark Lab, Huawei(华为诺亚实验室) Yinwang Intelligent Technology Co., Ltd.(亿万象智能科技有限公司)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 SlowFocus通过提升等效采样频率和引入多频率混合注意力模块,提升视频大语言模型对细粒度时间理解的能力。

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03529 2026-02-04 cs.NI cs.AI cs.MM 57%

Morphe: High-Fidelity Generative Video Streaming with Vision Foundation Model

Morphe: 基于视觉基础模型的高保真生成视频流媒体

Tianyi Gong, Zijian Cao, Zixing Zhang, Jiangkai Wu, Xinggong Zhang, Shuguang Cui, Fangxin Wang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(科学与工程学院,香港中文大学(深圳)) Shenzhen Future Network of Intelligence Institute(深圳未来网络智能研究院) Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.MM

AI总结 Morphe基于视觉基础模型,通过联合训练和智能分组丢弃技术,实现高保真度、低带宽的实时视频流媒体传输。

Comments Accepted by NSDI 2026 Fall

详情

展开后加载摘要…

URL PDF HTML 收藏