arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-25 至 2026-08-25 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 7 篇

2607.14935 2026-08-25 cs.CV 版本更新 83%

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

VideoChat3:用于高效通用视频理解的全开放视频多模态语言模型

Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 研究针对视频理解开源模型局限,提出VideoChat3。通过I3D-ViT等提升效率,利用可扩展视频数据合成管道生成训练数据集提升泛化性,以4B参数在多基准测试中超越同等或更多参数的开源模型,实现泛化与计算效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14659 2026-08-25 cs.CV cs.AI 版本更新 83%

VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting

VisionCoach: 通过视觉感知提示强化视频推理

Daeun Lee, Shoubin Yu, Yue Zhang, Mohit Bansal

专题命中 视频理解 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 VisionCoach通过视觉提示指导强化学习,提升视频推理的时空定位能力,实现无需外部工具的高效推理。

Comments Accepted to ECCV 2026; Project website: this https URL (https://visioncoach.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23329 2026-08-25 cs.CV cs.AI 新提交 79%

Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents

超越视频:统一视频推理与深度研究的开放世界视频智能体

Wenqi Liu, Shijie Ma, Yunxiao Wang, Meng Liu, Qile Su, Han Liu, Bohan Hou, Xuanyu Zheng, Changyi Liu, Tianke Zhang, Haonan Fan, Kaiyu Jiang, Yingxin Li, Jiankang Chen, Xu Wang, Bin Wen, Tingting Gao, Han Li, Jianhua Yin, Yinwei Wei, Xuemeng Song

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北京航空航天大学) City University of Hong Kong(香港城市大学) Nanyang Technological University(南洋理工大学) Kuaishou Technology(快手科技) Southern University of Science and Technology(南方科技大学)

专题命中 视频理解 :video reasoning(title);video understanding(abstract);分类 cs.CV

AI总结 本研究提出统一视频推理与深度研究的VideoRover框架,构建相关数据集与基准,其8B-RL模型在无工具直接回答场景性能接近专有模型,优于同工具套件的更大开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22516 2026-08-25 cs.CV cs.CL 新提交 79%

TRACE: Temporal Retrieval with Anchored and Convergent Evidence for Long-Horizon Video Understanding

TRACE:用于长视频理解的基于锚定收敛证据的时序检索

Pengyiang Liu, Junbo Niu, Xiaoyang Hu, Zhongyue Shi, Zitian Wang, Linjiang Huang, Si Liu

专题命中 视频理解 :video understanding(title);long video(abstract);分类 cs.CV

AI总结 针对长视频理解中证据核查不足的问题,提出VES-Bench基准和无需训练的TRACE智能体,在帧成本更低的情况下实现了高正确率,在多个基准上表现出色。

Comments Accepted to EMNLP 2026 Main Conference. 19 pages, 5 figures, 6 tables. Project page: this https URL (https://buaa-colalab.github.io/TRACE/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04588 2026-08-25 cs.CL 版本更新 78%

VCIFBench: Evaluating Complex Instruction Following for Video Understanding

VCIFBench:评估视频理解中的复杂指令遵循能力

Huangchen Xu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心,吉林大学) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 视频理解 :video understanding(title,abstract)

AI总结 提出VCIFBench基准,通过混合验证流水线评估多模态大模型在视频理解中遵循内容、格式、风格和结构约束的复杂指令能力,实验表明联合约束满足仍具挑战,DPO训练可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23011 2026-08-25 cs.CV cs.AI 新提交 57%

Coarse Indexing, Fine Evidence: Decoupling Temporal Granularity in Long-Video RAG

粗粒度索引,细粒度证据:解耦长视频检索增强生成中的时间粒度

Zhe Jin, Zhimin Lin, Bin Zheng, Junhua Fang, Huihua Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Soochow University(苏州大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 该研究针对长视频RAG中索引与证据粒度耦合的问题,提出无训练的DAGC方法,实现40%-50%节点保留、1.3-1.7倍加速且维持99%问答性能,增益可跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22617 2026-08-25 cs.CV cs.AI cs.HC 新提交 57%

AI-based worker guidance in assembly and disassembly operations using multimodal ego/exo-centric data capture and structured task knowledge

基于多模态自我/外部中心数据采集与结构化任务知识的装配与拆卸作业中基于人工智能的工人指导

Vivek Chavan, Jörg Krüger

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 该研究提出一种从专家演示中提取结构化任务知识的以数据为中心的方法,结合多模态数据推导任务表示,实现装配拆卸作业的工人指导,经案例验证其优于静态图像方法,可用于维修、培训等场景。

Comments 5 pages. Published in CIRP Annals - Manufacturing Technology

详情

展开后加载摘要…

URL PDF HTML 收藏