arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-31 至 2026-08-31 共收录 9 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2406.10221 2026-08-31 cs.CV cs.AI cs.CL 版本更新 79%

Long Story Short: Story-level Video Understanding from 20K Short Films

长话短说:基于2万部短片的故事级视频理解

Ridouane Ghermi, Xi Wang, Vicky Kalogeiton, Ivan Laptev

机构 * Ecole Polytechnique(巴黎综合理工学院) IP Paris(巴黎理工学院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 针对现有视频理解数据集的局限,本文构建了2万部业余电影组成的SF20K数据集及配套问答基准,验证其数据泄露有限,证明指令微调可提升VLMs在长期视频理解上的性能。

Comments International Journal of Computer Vision (IJCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13569 2026-08-31 cs.CV cs.AI 版本更新 57%

GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning

GHR-VLM:通过基于视觉基础的混合推理实现零样本公交视频分析

Kaicong Huang, Weiheng Oh, Jack M. Reilly, Thomas Guggisberg, Ruimin Ke

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 研究旨在实现零样本公交视频分析,提出GHR-VLM框架,利用边缘-云设计,通过轻量级边缘监视器跟踪门状态、分割乘客片段,后端VLM经两阶段细化识别乘客与支付行为,减少云推理,评估显示其在公交支付分析中有潜力且面临视频条件挑战。

Comments Accepted by 2026 IEEE/ACM Symposium on Edge Computing (SEC)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2603.21366 2026-08-31 cs.CV 版本更新 88%

Relax Forcing: Relaxed KV-Memory for Consistent Long Video Generation

放松强制:用于一致长视频生成的放松KV内存

Zengqun Zhao, Yanzuo Lu, Ziquan Liu, Jifei Song, Jiankang Deng, Ioannis Patras

机构 * Queen Mary University of London(伦敦玛丽女王大学) Imperial College London(伦敦帝国学院)

专题命中 视频生成 :video generation(title,abstract);long video(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Relax Forcing机制,通过结构化时间内存提升长视频生成的运动动态和时间一致性,减少注意力开销。

Comments Accepted at BMVC 2026. Project page: see this https URL (https://zengqunzhao.github.io/Relax-Forcing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26971 2026-08-31 cs.CV cs.MM 版本更新 81%

TempJail: Temporal Jailbreak Attacks against Image-to-Video Generation Models

TempJail:针对图像到视频生成模型的时序越狱攻击

Qi Lu, Zehui Guo, David Yuanda Gan, Zijing Li, Hengda Zhang, Weijun Xu, Qiankun Zhang

机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间科学与工程学院) School of Mathematical Sciences, Peking University(北京大学数学科学学院) School of Software and engineering, Huazhong University of Science and Technology(华中科技大学软件学院) School of Computer Science, Nanjing University(南京大学计算机学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出TempJail时序越狱框架,针对图像到视频生成模型的时序漏洞,通过分解恶意提示、受控潜在扰动等方式提升攻击成功率,在Kling等模型上获显著效果。

Comments Accepted by ACM Multimedia 2026 (ACM MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27345 2026-08-31 cs.CV cs.AI 版本更新 57%

PAWBench: How Far Are We from Probabilistically Aligned World Modeling?

PAWBench:我们离概率对齐的世界建模还有多远?

Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević, Shiyang Li, Yifan Zhou, Bin Fu, Wenlong Zhang, Junjun He, Yu Qiao, Yihao Liu, Jinbo Xing, Xi Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Krea AI Huggingface Shanghai Innovation Institute(上海创新研究院) Tongyi Lab(通义实验室) The University of Hong Kong(香港大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本研究针对当前视频生成器未满足概率对齐世界建模要求的问题,提出PAWBench基准与PAWEval协议,经50种场景和11个系统测试发现无模型达要求,为相关研究奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 3 篇

2608.27073 2026-08-31 cs.CV cs.RO 版本更新 57%

SpatialCrafter: Single Image World Modeling with Generative 3D Proxies

SpatialCrafter:基于生成式3D代理的单图像世界建模

Chuan Fang, Lingteng Qiu, Yixun Liang, Rui Chen, Kunming Luo, Zhaohua Zheng, Tongyuan Bai, Feipeng Tian, Zilong Dong, Zihan Zhou, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) ManyCore Tech Inc.(ManyCore科技公司) Jilin University(吉林大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 SpatialCrafter是解决图像到场景生成问题的两阶段框架,通过3D代理及相关策略提升3D一致性,构建了115K场景的新数据集,性能优于现有方法且鲁棒性强。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07572 2026-08-31 cs.CV cs.AI 版本更新 57%

BRACE: Taming Sharp Irregularities via Barycentric Rational Forecasting for Fast Diffusion Transformers Inference

BRACE:利用重心有理预测控制快速扩散Transformer推理中的尖锐不规则性

Jinlong Yang, Jinke Wu, Lizilin, Yao Zhou

机构 * Sichuan University(四川大学) School of Artificial Intelligence, Sichuan University(四川大学人工智能学院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本研究针对扩散Transformer(DiTs)高加速推理时的质量下降问题,提出带切比雪夫增强的重心有理预测方法BRACE,通过特征驱动的有理预测实现最优质量-效率权衡,且计算开销极低。

Comments Accepted at ACM MM 2026. Project page: this https URL (https://youngkinlon.github.io/BRACE-Taming-Sharp-Irregularities-via-Barycentric-Rational-Forecasting-for-Fast-DiT-Inference/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27443 2026-08-31 cs.LG cs.AI 版本更新 50%

ABC: Any-Subset Autoregression via Non-Markovian Diffusion Bridges in Continuous Time and Space

ABC:通过非马尔可夫扩散桥实现连续时间和空间中的任意子集自回归

Gabe Guo, Thanawat Sornwanee, Lutong Hao, Elon Litman, Stefano Ermon, Jose Blanchet

机构 * Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文提出ABC模型,通过非马尔可夫扩散桥在连续时间和空间中实现任意子集的自回归,解决了传统方法在结构相似性捕捉、噪声注入和条件化任意子集方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 1 篇

2606.05917 2026-08-31 cs.CV cs.CL 版本更新 57%

MemoryCard: Topic-Aware Multi-Modal Clue Compression for Long-Video Question Answering

MemoryCard: 面向长视频问答的主题感知多模态线索压缩

Qing Yang, Pengcheng Huang, Xinze Li, Zhenghao Liu, Yukun Yan, Yu Gu, Ge Yu, Gang Li, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Digital China Group(数字中国集团)

专题命中 视频问答 :long video(abstract);分类 cs.CV

AI总结 提出MemoryCard框架,通过将长视频分割为主题事件单元并生成事件级摘要和代表性视觉时刻,以记忆卡形式增强VLMs的长视频问答能力,在相同视觉令牌预算下准确率提升高达21.8%。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏