arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-17 至 2026-02-17 共收录 13 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2602.14236 2026-02-17 cs.CV cs.AI cs.LG cs.PF 74%

Dual-Signal Adaptive KV-Cache Optimization for Long-Form Video Understanding in Vision-Language Models

双信号自适应KV缓存优化用于视觉-语言模型中长形式视频理解

Vishnu Sai, Dheeraj Sai, Srinath B, Girish Varma, Priyesh Shukla

机构 * International Institute of Information Technology(国际信息研究所)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 Sali-Cache通过双信号自适应缓存优化,提升视觉-语言模型处理长形式视频的内存效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13332 2026-02-17 cs.CV cs.AI 70%

MedScope: Incentivizing "Think with Videos" for Clinical Reasoning via Coarse-to-Fine Tool Calling

MedScope:通过粗到细的工具调用激励“通过视频思考”以进行临床推理

Wenjie Li, Yujie Zhang, Haoran Sun, Xingqi He, Hongcheng Gao, Chenglong Ma, Ming Hu, Guankun Wang, Shiyi Yao, Renhao Yang, Hongliang Ren, Lei Wang, Junjun He, Yankai Jiang

机构 * College of Health Science and Technology, Shanghai Jiao Tong University School of Medicine, Shanghai, China(上海交通大学医学院健康科学与技术学院) Fudan University, Shanghai, China(复旦大学) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Tsinghua University, Beijing, China(清华大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) Ruijin Hospital, Shanghai Jiaotong University, Shanghai, China(上海交通大学瑞金医院)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 MedScope通过粗到细的工具调用机制,提升临床视频推理的准确性与可信度,实现基于时间局部化视觉证据的医疗AI代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08882 2026-02-17 cs.HC cs.CV 57%

Designing Multi-Robot Ground Video Sensemaking with Public Safety Professionals

设计多机器人地面视频感知以服务于公共安全专业人员

Puqi Zhou, Ali Asgarov, Aafiya Hussain, Wonjoon Park, Amit Paudyal, Sameep Shrestha, Chia-wei Tang, Michael F. Lighthiser, Michael R. Hieb, Xuesu Xiao, Chris Thomas, Sungsoo Ray Hong

机构 * George Mason University(乔治·玛森大学) University of Maryland(马里兰大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出了一种多机器人地面视频感知测试平台和MRVS工具,旨在提升公共安全专业人员的情报意识和工作效率,同时关注假警报和隐私问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 5 篇

2601.13190 2026-02-17 cs.LG physics.flu-dyn 82%

LAViG-FLOW: Latent Autoregressive Video Generation for Fluid Flow Simulations

LAViG-FLOW:用于流体流动模拟的潜在自回归视频生成

Vittoria De Pellegrini, Tariq Alkhalifah

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract)

AI总结 LAViG-FLOW通过潜在自回归视频生成框架高效模拟流体流动,实现比传统方法快百倍的饱和度和压力场生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14941 2026-02-17 cs.CV cs.AI 79%

AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories

AnchorWeave: 通过检索的局部空间记忆实现世界一致的视频生成

Zun Wang, Han Lin, Jaehong Yoon, Jaemin Cho, Yue Zhang, Mohit Bansal

机构 * Department of Computer Science, University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校计算机科学系) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 AnchorWeave通过检索局部空间记忆提升视频生成的长期场景一致性与视觉质量。

Comments Project website: https://zunwang1.github.io/AnchorWeave

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13637 2026-02-17 cs.CV 79%

DCDM: Divide-and-Conquer Diffusion Models for Consistency-Preserving Video Generation

DCDM:分而治之扩散模型用于保持一致性视频生成

Haoyu Zhao, Yuang Zhang, Junqi Cheng, Jiaxi Gu, Zenghui Lu, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent(腾讯)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 DCDM通过分而治之的扩散模型,解决视频生成中的语义、几何和身份一致性问题,提升视频生成的连贯性和可控性。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03796 2026-02-17 cs.CV 79%

3D-Aware Implicit Motion Control for View-Adaptive Human Video Generation

面向视图自适应的人体视频生成的3D感知隐式运动控制

Zhixue Fang, Xu He, Songlin Tang, Haoxian Zhang, Qingfeng Li, Xiaoqiang Liu, Pengfei Wan, Kun Gai

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队) Tsinghua University(清华大学) CASIA

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 3DiMo通过隐式运动表示和视图丰富监督,提升视频生成中的人体运动保真度和视觉质量。

Comments Project Page: https://hjrphoebus.github.io/3DiMo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14902 2026-02-17 cs.IR cs.CV 57%

U-MARVEL: Unveiling Key Factors for Universal Multimodal Retrieval via Embedding Learning with MLLMs

通过嵌入学习与大语言模型揭示通用多模态检索的关键因素:U-MARVEL

Xiaojie Li, Chu Li, Shi-Zhe Chen, Xi Chen

机构 * Tencent PCG(腾讯PCG) Nanjing University(南京大学) ByteDance(字节跳动)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 U-MARVEL通过嵌入学习与大语言模型揭示通用多模态检索的关键因素,实现超越现有方法的性能。

Comments Accepted to ICLR 2026

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 3 篇

2602.14381 2026-02-17 cs.CV cs.AI 79%

Adapting VACE for Real-Time Autoregressive Video Diffusion

为实时自回归视频扩散适应VACE

Ryan Fosdick

机构 * Daydream

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 VACE被适配用于实时自回归视频生成,通过调整参考帧路径以兼容因果注意力,保留固定分块大小和KV缓存,同时增加20-30%的延迟开销,但显存成本低,参考到视频的保真度下降。

Comments 10 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08431 2026-02-17 cs.CV cs.LG 57%

Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency

大规模扩散蒸馏的连续时间一致性 via 分数正则化

Kaiwen Zheng, Yuji Wang, Qianli Ma, Huayu Chen, Jintao Zhang, Yogesh Balaji, Jianfei Chen, Ming-Yu Liu, Jun Zhu, Qinsheng Zhang

机构 * Dept. of Comp. Sci. & Tech., BNRist Center, THU-Bosch ML Center, AI Institute, Tsinghua(清华大学计算机科学与技术系,BNRist中心,THU-Bosch机器学习中心,人工智能研究院) NVIDIA

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出分数正则化的连续时间一致性模型(rCM),通过引入分数蒸馏作为长跳正则化器,改进了sCM在细节生成和多样性方面的性能,适用于大规模图像和视频扩散任务。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13515 2026-02-17 cs.CV cs.LG 57%

SpargeAttention2: Trainable Sparse Attention via Hybrid Top-k+Top-p Masking and Distillation Fine-Tuning

SpargeAttention2: 通过混合Top-k+Top-p掩码和蒸馏微调实现可训练稀疏注意力

Jintao Zhang, Kai Jiang, Chendong Xiang, Weiqi Feng, Yuezhou Hu, Haocheng Xi, Jianfei Chen, Jun Zhu

机构 * Tsinghua University(清华大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 SpargeAttention2通过混合Top-k+Top-p掩码和蒸馏微调,实现高稀疏性且不降低生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2602.12063 2026-02-17 cs.RO 50%

VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model

VLAW: 视觉-语言-动作策略与世界模型的迭代共改进

Yanjiang Guo, Tony Lee, Lucy Xiaoyang Shi, Jianyu Chen, Percy Liang, Chelsea Finn

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 动作与事件理解 :video generation(abstract)

AI总结 本文提出通过迭代改进视觉-语言-动作策略与世界模型,提升真实机器人任务的性能和可靠性。

Comments Project Page: https://sites.google.com/view/vlaw-arxiv

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 1 篇

2602.13633 2026-02-17 cs.CV 57%

A generalizable foundation model for intraoperative understanding across surgical procedures

一种可泛化的术中理解基础模型用于不同手术程序

Kanggil Park, Yongjun Jeon, Soyoung Lim, Seonmin Park, Jongmin Shin, Jung Yong Kim, Sehyeon An, Jinsoo Rhu, Jongman Kim, Gyu-Seong Choi, Namkee Oh, Kyu-Hwan Jung

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 ZEN是一种基于自监督多教师蒸馏框架训练的术中手术视频理解基础模型,通过大规模数据集训练实现了跨手术程序的泛化能力,优于现有手术基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏