arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-28 至 2026-08-28 共收录 17 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2608.27065 2026-08-28 cs.CV 新提交 77%

Video-OPSD: Exploiting Privileged Visual Evidence for On-Policy Self-Distillation in Video Large Language Models

Video-OPSD:利用特权视觉证据实现视频大语言模型中的在线自蒸馏

Ziyue Wang, Shiqi Huang, Weiwen Xu, Bihan Wen, Xudong Jiang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);long video(abstract);分类 cs.CV

AI总结 该研究提出Video-OPSD框架,利用视频内特权视觉证据构建自教师并优化令牌级蒸馏,在多个视频基准上优于标准OPSD,性能接近GRPO且训练时间大幅缩短,为Video-LLMs提供高效后训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 11 篇

2608.26671 2026-08-28 cs.CV 新提交 88%

RECAP-Forcing: Retaining Content Appearances for Long Video Generation

RECAP-Forcing:保留内容外观以实现长视频生成

Haiyang Xu, Zheng Ding, Zhuowen Tu

机构 * UC San Diego(加州大学圣迭戈分校)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 针对长自回归视频生成的内存挑战,提出按外观新颖性组织内存的RECAP-Forcing方法,通过注意力汇和光流新颖性库统一机制,免训练且无额外参数,提升视频质量与语义保真度,优于现有内存方法。

Comments Project page: this https URL (https://xxuhaiyang.github.io/RECAP-Forcing/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26971 2026-08-28 cs.CV cs.MM 新提交 81%

TempJail: Temporal Jailbreak Attacks against Image-to-Video Generation Models

TempJail:针对图像到视频生成模型的时序越狱攻击

Qi Lu, Zehui Guo, David Yuanda Gan, Zijing Li, Hengda Zhang, Weijun Xu, Qiankun Zhang

机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间科学与工程学院) School of Mathematical Sciences, Peking University(北京大学数学科学学院) School of Software and engineering, Huazhong University of Science and Technology(华中科技大学软件学院) School of Computer Science, Nanjing University(南京大学计算机学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出TempJail时序越狱框架,针对图像到视频生成模型的时序漏洞,通过分解恶意提示、受控潜在扰动等方式提升攻击成功率,在Kling等模型上获显著效果。

Comments Accepted by ACM Multimedia 2026 (ACM MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26336 2026-08-28 cs.SD cs.CV cs.MM 新提交 81%

StreamAV-Bench: A Comprehensive Benchmark for Streaming Audio-Video Generation

StreamAV-Bench:面向流式音视频生成的综合基准测试集

Kaiqi Liu, Haoxuan Zeng, Jingqi Liu, Jiacong Fang, Ziqi Cai, Yunyao Mao, Henglin Liu, Yu Sheng, Shuchen Weng, Boxin Shi

机构 * BAAI(北京智源人工智能研究院) PKU(北京大学) Kling THU(清华大学) USTC(中国科学技术大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 该研究针对现有基准无法捕捉流式音视频生成特性的问题,推出首个综合基准StreamAV-Bench,构建含双赛道的评估框架并评估13个系统,揭示当前模型的缺陷并给出模型开发见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26902 2026-08-28 cs.CV 新提交 79%

Tether the Subject, Release the Scene: Query-Aware Memory Routing for Long-Horizon Autoregressive Video Generation

绑定主体,释放场景:面向长时序自回归视频生成的查询感知记忆路由

Chen Li, Peng Zhang, Hanyu Zhou, Jialong Zuo, Fei Wang, Daiguo Zhou, Nong Sang, Changxin Gao

机构 * Huazhong University of Science and Technology(华中科技大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

专题命中 视频生成 :video generation(title);long video(abstract);分类 cs.CV

AI总结 针对流式自回归视频生成中记忆锚定的场景欠进展问题,提出无需训练的查询感知时空记忆路由器 TetherMem,分离主体与场景查询调节历史访问,在长视频生成的整体质量与场景进展指标上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26214 2026-08-28 cs.CV 新提交 79%

Surgical Video Generation From Diffusion to World Models: A Survey

手术视频生成:从扩散模型到世界模型:综述

Fuxiang Huang, Chenxu Zhang, Liang Han, Lei Zhang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 该综述梳理2024-2026年手术视频生成领域文献,分三类总结方法,指出生成任务从合成帧转向建模场景因果动态,分析瓶颈并提供实验参考,为相关交叉领域研究者提供参考。

Comments 4 pages, 1 figures, 3 tables. Accepted for oral presentation at the 2026 3rd International Conference on Intelligent Perception and Pattern Recognition (IPPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26535 2026-08-28 cs.AI 新提交 78%

Multi2AV-Safety: Benchmarking Safety in Multimodal-to-Audio-Video Generation

Multi2AV-Safety:多模态到音视频生成的安全性基准测试

Kaichao Jiang, Changtao Miao, Baiqi Wu, Zhiyuan Lu, Kang Yang, Peiwei Zhao, Junchi Chen, Yunfeng Diao, He Liu, Qi Chu, Tao Gong, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Hefei University of Technology(合肥工业大学)

专题命中 视频生成 :video generation(title,abstract)

AI总结 本研究推出首个覆盖11种非单例多模态条件配置的音视频生成安全性基准Multi2AV-Safety,发现现有安全守卫存在组合风险感知不足的系统性弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26809 2026-08-28 cs.CV cs.MM 新提交 62%

Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning

思考镜头:基于智能体推理的一致多镜头视频编辑

Chenyang Wu, Fuchen Long, Binyuan Huang, Xinlong Sun, Xi Chen, Chun-Le Guo, Chongyi Li

机构 * Nankai University(南开大学) Tencent(腾讯)

专题命中 视频生成 :long video(abstract);分类 cs.CV、cs.MM

AI总结 本文针对多指令编辑长视频的挑战,提出MMLVE任务与智能体编辑框架,构建MMLVE-Bench数据集及评估指标,所提MMLVE-Agent优于Seedance 2.0等闭源SOTA方法,可实现一致且无幻觉的长视频编辑。

Comments Project Page: this https URL (https://wucy0519.github.io/MMLVE/) and see source codes at this https URL (https://github.com/Wucy0519/MMLVE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27406 2026-08-28 cs.RO cs.AI cs.CV 新提交 57%

CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators

CLAP:跨具身视频世界模型是零样本物理模拟器

Kechen Liu, Ola Shorinwa

机构 * Princeton University(普林斯顿大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 CLAP是跨具身动作条件视频生成框架,可在人类与机器人的多样化视频上训练,能接近或超越单具身视频模型性能,开源代码与模型,为训练单具身视频世界模型提供新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27345 2026-08-28 cs.CV cs.AI 新提交 57%

PAWBench: How Far Are We from Probabilistically Aligned World Modeling?

PAWBench:我们离概率对齐的世界建模还有多远?

Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević, Shiyang Li, Yifan Zhou, Bin Fu, Wenlong Zhang, Junjun He, Yu Qiao, Yihao Liu, Jingbo Xing, Xi Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Krea AI Huggingface Shanghai Innovation Institute(上海创新研究院) Tongyi Lab(通义实验室) The University of Hong Kong(香港大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本研究针对当前视频生成器未满足概率对齐世界建模要求的问题,提出PAWBench基准与PAWEval协议,经50种场景和11个系统测试发现无模型达要求,为相关研究奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26965 2026-08-28 cs.LG cs.CV 新提交 57%

ClusterAttention: A training-free speedup of bidirectional attention

ClusterAttention:一种无需训练的双向注意力加速方法

Kasper Nordenram, Amelie Dittmann

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出无需训练的ClusterAttention,通过适配键查询几何的快速递归聚类实现双向注意力加速,在表格数据上提速2-6倍、精度保留≥99%,在视频生成上比SVOO加速效果更好。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26581 2026-08-28 cs.LG 新提交 50%

Activation Outliers Matter: Robust Recovery for Quantized Multimodal LLMs

激活异常值很重要:量化多模态大语言模型的鲁棒恢复

Tanzila Rahman, Mehran Taghian Jazi, Yunke Peng, Zhuang Ma, Anandharaju Durai Raju, Yao Wang, Xing Huang, Hei Yi Mak, Shadan Golestan, Hoang Le, Yonghan Dong, Wei Guo, Yaoyuan Wang

机构 * Huawei(华为)

专题命中 视频生成 :video generation(abstract)

AI总结 本研究针对多模态大语言模型超低比特量化的性能损失问题,提出Residual Fallback Quantization框架,可有效恢复MXFP4、HiF4量化下的性能,缩小与BF16基线的差距。

Comments 14 Pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2608.26794 2026-08-28 cs.CV 新提交 83%

Ring Forcing: Towards Precise Long-Term Memory for Autoregressive Video Diffusion

环强制法:面向自回归视频扩散模型的精准长期记忆

Bowen Xue, Brandon Y. Feng, Chenguo Lin, Yuchen Lin, Yujia Zeng, Lvmin Zhang, Maneesh Agrawala, Honglei Yan, Panwang Pan

机构 * Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) Peking University(北京大学) University of California, Berkeley(加州大学伯克利分校) ByteDance(字节跳动)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 针对自回归视频扩散模型的长期记忆瓶颈,提出Ring Forcing框架,通过环形训练策略、压缩与时间步组合策略及稀疏RoPE机制,实现分钟级视频生成的优异连贯性与物体恒常性,性能优于现有方法。

Comments Project page: this https URL (https://ringforcing.com)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27073 2026-08-28 cs.CV cs.RO 新提交 57%

SpatialCrafter: Single Image World Modeling with Generative 3D Proxies

SpatialCrafter:基于生成式3D代理的单图像世界建模

Chuan Fang, Lingteng Qiu, Yixun Liang, Rui Chen, Kunming Luo, Zhaohua Zheng, Tongyuan Bai, Feipeng Tian, Zilong Dong, Zihan Zhou, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) ManyCore Tech Inc.(ManyCore科技公司) Jilin University(吉林大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 SpatialCrafter是解决图像到场景生成问题的两阶段框架,通过3D代理及相关策略提升3D一致性,构建了115K场景的新数据集,性能优于现有方法且鲁棒性强。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 1 篇

2608.26355 2026-08-28 cs.CV cs.LG 新提交 74%

Finding the Right Evidence: Factor-Guided Coarse-to-Fine Reasoning for Long Videos

寻找合适的证据:因子引导的长视频由粗到细推理

Baixuan Xu, Yinyui Xu, Tianshi Zheng, Zhaowei Wang, Weiqi Wang, Haochen Shi, Jiayu Liu, Qing Zong, Xiyu Ren, Xinyu Geng, Zhitao He, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程学系)

专题命中 视频问答 :long video(title);分类 cs.CV

AI总结 针对长视频问答的证据稀疏、选项区分困难问题,提出因子引导的PACE框架,经实验在多基准数据集上优于现有方法,实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 1 篇

2608.26517 2026-08-28 cs.CV 新提交 57%

HUG-VIS: A Multimodal Benchmark for Human-centered Understanding and Generation in Visual Intelligence

HUG-VIS:面向视觉智能中以人为中心的理解与生成的多模态基准

Fei Ma, Zebang Cheng, Minghui Li, Hongbo Xu, Yuyong Tan, Yihua Shao, Hanling Wang, Zhou Liu, Yuqing Gao, Dong Wang, Long Ma, Laizhong Cui, Nicu Sebe, Qi Tian

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Shenzhen University(深圳大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Pengcheng Laboratory(鹏城实验室) Tongji University(同济大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) University of Trento(特伦托大学) Huawei(华为)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 该研究构建了HUG-VIS多模态基准,包含30名演员的8400段同步多模态视频等数据,评估了四类任务的模型,揭示了情感识别、生成等任务的关键特性与现存问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他视频模型 1 篇

2608.26684 2026-08-28 cs.CV 新提交 57%

Reason in the Words You Speak: Idiolectal Paraphrasing Off-Policy Traces for Reasoning Distillation in VideoLLMs

用你所说的语言推理:为VideoLLM中的推理蒸馏进行个人习语式的离线策略轨迹改写

Ji Soo Lee, Jinyoung Park, Seohyun Lee, Jongha Kim, Joonmyung Choi, Jinsung Yoon, Hyunwoo J. Kim

机构 * KAIST(韩国科学技术院) Korea University(高丽大学) Google Cloud AI Research(谷歌云人工智能研究院)

专题命中 其他视频模型 :video reasoning(abstract);分类 cs.CV

AI总结 该研究针对VideoLLM的推理蒸馏提出Echo-GRPO框架,通过改写教师特权轨迹为学生自身习语实现策略对齐,实例化的VideoEcho-R1在多骨干和基准测试中均获性能提升,且作为插件模块适配多种训练框架。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏