arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-06 至 2026-01-06 共收录 15 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2509.18754 2026-01-06 cs.CV cs.AI 57%

COLT: Enhancing Video Large Language Models with Continual Tool Usage

COLT: 通过持续工具使用增强视频大语言模型

Yuyang Liu, Meng Cao, Xinyuan Shi, Xiaondan Liang

机构 * University of Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed大学人工智能学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 COLT通过持续工具使用增强视频大语言模型,解决工具数据持续变化的问题,提升视频理解性能。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00887 2026-01-06 cs.CV 57%

VideoCuRL: Video Curriculum Reinforcement Learning with Orthogonal Difficulty Decomposition

VideoCuRL: 通过正交难度分解实现视频课程强化学习

Hongbo Jin, Kuanwei Lin, Wenhao Zhang, Yichen Jin, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 VideoCuRL通过正交分解视频理解中的视觉复杂性和认知复杂性,提出了一种新的课程强化学习框架,提升了视频推理和感知任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 9 篇

2601.02107 2026-01-06 cs.CV 83%

MagicFight: Personalized Martial Arts Combat Video Generation

MagicFight: 个性化武术战斗视频生成

Jiancheng Huang, Mingfu Yan, Songyan Chen, Yi Huang, Shifeng Chen

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院) China Telecom Cloud Technology Co., Ltd.(中国电信云技术有限公司) Shenzhen University of Advanced Technology(深圳大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 MagicFight通过定制数据集和优化模型,解决两人武术战斗视频生成中的身份混淆和动作不匹配问题,生成高保真的战斗视频。

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00943 2026-01-06 cs.CV 83%

PhyEduVideo: A Benchmark for Evaluating Text-to-Video Models for Physics Education

PhyEduVideo: 一个用于评估物理教育中文本到视频模型的基准

Megha Mariam K. M, Aditya Arun, Zakaria Laskar, C. V. Jawahar

机构 * IIIT Hyderabad(印度海得拉巴理工学院) Adobe MDSR IISER Thiruvananthapuram(泰米尔纳德邦土著科学研究所)

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV

AI总结 PhyEduVideo基准评估文本到视频模型在物理教育中的表现,揭示其在概念准确性与视觉质量间的差距,推动更精准的教育视频生成。

Comments Accepted at IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21059 2026-01-06 cs.CV 83%

VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation

VisionReward: 面向图像和视频生成的细粒度多维人类偏好学习

Jiazheng Xu, Yu Huang, Jiale Cheng, Yuanming Yang, Jiajun Xu, Yuan Wang, Wenbo Duan, Shen Yang, Qunlin Jin, Shurun Li, Jiayan Teng, Zhuoyi Yang, Wendi Zheng, Xiao Liu, Dan Zhang, Ming Ding, Xiaohan Zhang, Xiaotao Gu, Shiyu Huang, Minlie Huang, Jie Tang, Yuxiao Dong

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 VisionReward通过细粒度多维人类偏好学习框架,提升图像和视频生成的偏好对齐效果,实验显示其在准确性与胜率上均优于现有方法。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18281 2026-01-06 cs.CV 83%

MotionCharacter: Fine-Grained Motion Controllable Human Video Generation

MotionCharacter: 高精度可调控的人体视频生成

Haopeng Fang, Di Qiu, Binjie Mao, He Tang

机构 * Meituan(美团)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 MotionCharacter通过解耦动作类型与运动强度,实现高保真人体视频生成,提升细粒度运动控制与身份一致性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00996 2026-01-06 cs.CY cs.AI 78%

VEAT Quantifies Implicit Associations in Text-to-Video Generator Sora and Reveals Challenges in Bias Mitigation

VEAT量化文本到视频生成器Sora中的隐含关联并揭示缓解偏见的挑战

Yongxu Sun, Michael Saxon, Ian Yang, Anna-Maria Gueorguieva, Aylin Caliskan

机构 * University of Washington(华盛顿大学)

专题命中 视频生成 :text-to-video(title,abstract)

AI总结 VEAT量化Sora视频生成器中隐含的种族和性别关联,揭示去偏提示可能反噬的问题,强调T2V生成器需严格评估以避免代表性伤害。

Comments The International Association for Safe & Ethical AI (IASEAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01352 2026-01-06 cs.CV cs.AI 74%

Slot-ID: Identity-Preserving Video Generation from Reference Videos via Slot-Based Temporal Identity Encoding

Slot-ID: 通过基于槽的时序身份编码从参考视频中生成身份保持的视频

Yixuan Lai, He Wang, Kun Zhou, Tianjia Shao

机构 * State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室) University College London(伦敦大学学院) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 Slot-ID通过基于槽的时序身份编码从参考视频生成身份保持的视频,提升大姿态变化下的身份保留和视觉真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02204 2026-01-06 cs.CV cs.AI 57%

NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation

NextFlow:统一的序列建模激活多模态理解和生成

Huichao Zhang, Liao Qu, Yiheng Liu, Hang Chen, Yangyang Song, Yongsheng Dong, Shikun Sun, Xian Li, Xu Wang, Yi Jiang, Hu Ye, Bo Chen, Yiming Gao, Peng Liu, Akide Liu, Zhipeng Yang, Qili Deng, Linjie Xing, Jiyang Liu, Zhao Wang, Yang Zhou, Mingcong Liu, Yi Zhang, Qian He, Xiwei Hu, Zhongqi Qi, Jie Shao, Zhiye Fu, Shuai Wang, Fangmin Chen, Xuezhi Chai, Zhihua Wu, Yitong Wang, Zehuan Yuan, Daniel K. Du, Xinglong Wu

机构 * TsingHua University(清华大学) Monash University(墨尔本大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 NextFlow通过统一的自回归架构实现多模态理解和生成,以高效生成高分辨率图像并提升视觉质量。

Comments Project page: https://github.com/ByteVisionLab/NextFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04888 2026-01-06 cs.CV 57%

Training-Free Video Editing via Optical Flow-Enhanced Score Distillation

无需训练的视频编辑 via 光流增强的分数蒸馏

Lianghan Zhu, Yanqi Bao, Jing Huo, Jing Wu, Yu-Kun Lai, Wenbin Li, Yang Gao

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 本研究提出基于预训练文本到视频模型的分数蒸馏方法,通过迭代优化和光流增强技术,解决无需训练视频编辑中的内容保留与时间连续性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02125 2026-01-06 cs.RO cs.AI 50%

SingingBot: An Avatar-Driven System for Robotic Face Singing Performance

SingingBot: 一种由虚拟角色驱动的机器人面部歌唱表演系统

Zhuoxiong Xu, Xuanchen Li, Yuhao Cheng, Fei Xu, Yichao Yan, Xiaokang Yang

专题命中 视频生成 :video generation(abstract)

AI总结 SingingBot通过虚拟角色驱动框架实现机器人面部歌唱的丰富情感表达,提出情感动态范围指标评估情感广度,实验表明其在情感表现和同步性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2601.01914 2026-01-06 cs.CV 57%

Learning Action Hierarchies via Hybrid Geometric Diffusion

通过混合几何扩散学习动作层次结构

Arjun Ramesh Kaushik, Nalini K. Ratha, Venu Govindaraju

专题命中 视频扩散模型 :video understanding(abstract);分类 cs.CV

AI总结 本文提出HybridTAS框架,通过混合欧几里得和双曲几何提升时间动作分割的层次结构建模能力,实验表明其在多个数据集上达到最优性能。

Comments Accepted at WACV-26

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 3 篇

2512.17229 2026-01-06 cs.CV 83%

Video Detective: Seek Critical Clues Recurrently to Answer Question from Long Videos

视频侦探:通过反复寻找关键线索来回答长视频中的问题

Henghui Du, Chunjie Zhang, Xi Chen, Chang Zhou, Di Hu

机构 * Gaoling School of Artificial Intelligence(北京中国人民大学人工智能学院) Renmin University of China(中国人民大学) AI Technology Center Online Video Business Unit(人工智能技术中心在线视频业务部) Tencent PCG(腾讯PCG)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 VideoDetective通过问题感知的记忆机制,使大语言模型能高效处理长视频问答任务,减少计算资源消耗并提升关键信息提取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01322 2026-01-06 cs.CV cs.AI cs.LG cs.MM eess.IV 67%

LinMU: Multimodal Understanding Made Linear

LinMU: 使多模态理解线性化

Hongjie Wang, Niraj K. Jha

机构 * Princeton University(普林斯顿大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV、cs.MM

AI总结 LinMU通过线性复杂度设计实现多模态理解,无需二次注意力模块,提升视频处理效率。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01192 2026-01-06 cs.CV 57%

Crowded Video Individual Counting Informed by Social Grouping and Spatial-Temporal Displacement Priors

受社交分组和时空位移先验信息启发的拥挤视频个体计数

Hao Lu, Xuhui Zhu, Wenjing Zhang, Yanan Li, Xiang Bai

机构 * State Key Laboratory of Multispectral Information Intelligent Processing Technology(多谱信息智能处理技术国家重点实验室;人工智能与自动化学院,华中科技大学) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(湖北省智能机器人重点实验室;计算机科学与工程人工智能学院,武汉理工大学) Hubei Key Laboratory of Intelligent Robot(软件工程学院,华中科技大学) School of Computer Science & Engineering Artificial Intelligence, Wuhan Institute of Technology School of Software Engineering, Huazhong University of Science and Technology

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出OMAN++方法,通过引入社交分组和时空位移先验信息,提升拥挤场景下视频个体计数的准确性。

Comments Journal Extension of arXiv:2506.13067

详情

展开后加载摘要…

URL PDF HTML 收藏