arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-28 至 2026-01-28 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2601.19686 2026-01-28 cs.CV 83%

Video-KTR: Reinforcing Video Reasoning via Key Token Attribution

Video-KTR: 通过关键令牌 attribution 增强视频推理

Ziyue Wang, Sheng Jin, Zhongrong Zuo, Jiawei Wu, Han Qiu, Qi She, Hao Zhang, Xudong Jiang

机构 * ByteDance(字节跳动) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) National University of Singapore(国立新加坡大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 视频理解 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 Video-KTR通过结合三种attribution信号,提升视频推理的准确性和可解释性,实现状态-of-the-art性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08512 2026-01-28 cs.CV cs.AI 57%

MLVTG: Mamba-Based Feature Alignment and LLM-Driven Purification for Multi-Modal Video Temporal Grounding

MLVTG: 基于Mamba的特征对齐与LLM驱动的多模态视频时间定位

Zhiyi Zhu, Xiaoyu Wu, Zihao Liu, Linlin Yang

机构 * State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 MLVTG通过结合MambaAligner和LLMRefiner,实现了多模态视频时间定位的高精度定位与语义净化。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2506.01943 2026-01-28 cs.CV 83%

Learning Video Generation for Robotic Manipulation with Collaborative Trajectory Control

基于协作轨迹控制的机器人操作视频生成学习

Xiao Fu, Xintao Wang, Xian Liu, Jianhong Bai, Runsen Xu, Pengfei Wan, Di Zhang, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Kuaishou Technology(快手科技) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 RoboMaster通过协作轨迹控制方法,解决多物体交互建模问题,实现机器人操作视频生成的高保真度与多物体交互建模。

Comments ICLR 2026. Project Page: https://fuxiao0719.github.io/projects/robomaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17756 2026-01-28 cs.CV cs.AI cs.GR 79%

MV-S2V: Multi-View Subject-Consistent Video Generation

MV-S2V:多视图主体一致视频生成

Ziyang Song, Xinyu Gong, Bangya Liu, Zelin Zhao

机构 * The Hong Kong Polytechnic University(香港理工大学) The University of Texas at Austin(德克萨斯大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出MV-S2V方法,通过多视角参考生成一致的3D主体视频,解决单视角限制并提升视频生成质量。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2512.08931 2026-01-28 cs.CV cs.AI cs.LG 57%

Astra: General Interactive World Model with Autoregressive Denoising

Astra:通用交互世界模型与自回归去噪

Yixuan Zhu, Jiaqi Feng, Wenzhao Zheng, Yuan Gao, Xin Tao, Pengfei Wan, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 Astra提出了一种通用交互世界模型,通过自回归去噪和动作感知适配器实现长周期视频预测与多样化交互。

Comments Accepted in ICLR 2026. Code is available at: https://github.com/EternalEvan/Astra

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频数据与评测 1 篇

2601.19236 2026-01-28 cs.CV cs.MM 62%

VC-Bench: Pioneering the Video Connecting Benchmark with a Dataset and Evaluation Metrics

VC-Bench:开创视频连接基准的Dataset与评估指标

Zhiyu Yin, Zhipeng Liu, Kehai Chen, Lemao Liu, Jin Liu, Hong-Dong Li, Yang Xiang, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(计算机科学与技术学院,哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 VC-Bench提出一个用于视频连接任务的新型基准,包含多样化视频数据和综合评估指标,评估现有视频生成模型并揭示其在连贯性和流畅性上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏