arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-25 至 2026-08-25 共收录 18 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 4 篇

2608.23329 2026-08-25 cs.CV cs.AI 新提交 79%

Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents

超越视频:统一视频推理与深度研究的开放世界视频智能体

Wenqi Liu, Shijie Ma, Yunxiao Wang, Meng Liu, Qile Su, Han Liu, Bohan Hou, Xuanyu Zheng, Changyi Liu, Tianke Zhang, Haonan Fan, Kaiyu Jiang, Yingxin Li, Jiankang Chen, Xu Wang, Bin Wen, Tingting Gao, Han Li, Jianhua Yin, Yinwei Wei, Xuemeng Song

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北京航空航天大学) City University of Hong Kong(香港城市大学) Nanyang Technological University(南洋理工大学) Kuaishou Technology(快手科技) Southern University of Science and Technology(南方科技大学)

专题命中 视频理解 :video reasoning(title);video understanding(abstract);分类 cs.CV

AI总结 本研究提出统一视频推理与深度研究的VideoRover框架,构建相关数据集与基准,其8B-RL模型在无工具直接回答场景性能接近专有模型,优于同工具套件的更大开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22516 2026-08-25 cs.CV cs.CL 新提交 79%

TRACE: Temporal Retrieval with Anchored and Convergent Evidence for Long-Horizon Video Understanding

TRACE:用于长视频理解的基于锚定收敛证据的时序检索

Pengyiang Liu, Junbo Niu, Xiaoyang Hu, Zhongyue Shi, Zitian Wang, Linjiang Huang, Si Liu

专题命中 视频理解 :video understanding(title);long video(abstract);分类 cs.CV

AI总结 针对长视频理解中证据核查不足的问题,提出VES-Bench基准和无需训练的TRACE智能体,在帧成本更低的情况下实现了高正确率,在多个基准上表现出色。

Comments Accepted to EMNLP 2026 Main Conference. 19 pages, 5 figures, 6 tables. Project page: this https URL (https://buaa-colalab.github.io/TRACE/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23011 2026-08-25 cs.CV cs.AI 新提交 57%

Coarse Indexing, Fine Evidence: Decoupling Temporal Granularity in Long-Video RAG

粗粒度索引,细粒度证据:解耦长视频检索增强生成中的时间粒度

Zhe Jin, Zhimin Lin, Bin Zheng, Junhua Fang, Huihua Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Soochow University(苏州大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 该研究针对长视频RAG中索引与证据粒度耦合的问题,提出无训练的DAGC方法,实现40%-50%节点保留、1.3-1.7倍加速且维持99%问答性能,增益可跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22617 2026-08-25 cs.CV cs.AI cs.HC 新提交 57%

AI-based worker guidance in assembly and disassembly operations using multimodal ego/exo-centric data capture and structured task knowledge

基于多模态自我/外部中心数据采集与结构化任务知识的装配与拆卸作业中基于人工智能的工人指导

Vivek Chavan, Jörg Krüger

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 该研究提出一种从专家演示中提取结构化任务知识的以数据为中心的方法,结合多模态数据推导任务表示,实现装配拆卸作业的工人指导,经案例验证其优于静态图像方法,可用于维修、培训等场景。

Comments 5 pages. Published in CIRP Annals - Manufacturing Technology

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 6 篇

2608.21424 2026-08-25 cs.CV cs.GR cs.HC cs.LG cs.MM 新提交 84%

EditStream: A Unified Autoregressive Framework for Interactive Video Generation and Editing

EditStream:用于交互式视频生成与编辑的统一自回归框架

Yuqian Zhou, Zhenghong Zhou, Zongze Wu, Cameron Smith, Richard Zhang, Jiebo Luo, Eli Shechtman, Zhe Lin

机构 * Adobe Research(Adobe研究院) University of Rochester(罗切斯特大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 本研究提出EditStream框架,整合多类视频生成编辑任务,通过两阶段蒸馏方法优化自回归模型,实现高质量交互式视频创作,填补了扩散模型与创意工作流的衔接空白。

Comments 25 pages, 12 figures, Project page: this https URL (https://real-time-video-research.github.io/editstream/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22819 2026-08-25 cs.CV 新提交 79%

Direct, Parallel, or Sequential? A Comparative Study of Training-Free Multi-Subject Image-to-Video Generation

直接式、并行式还是顺序式?无训练多主体图像到视频生成的对比研究

Yanliang Qi, Kexi Chen, Muchao Ye, Haomiao Ni

机构 * University of Memphis(孟菲斯大学) University of Pennsylvania(宾夕法尼亚大学) University of Iowa(爱荷华大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文对比研究直接、并行、顺序三种无训练多主体图像到视频生成范式,通过实证评估明确各范式的优劣势,为可控多主体视频生成系统设计提供实用见解。

Comments ACM Multimedia Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21839 2026-08-25 cs.CV 新提交 79%

FIRM-Video: Check Before You Score for Reliable Text-to-Video Reward Modeling

FIRM-Video:可靠文本到视频奖励建模的评分前检查机制

Peiyuan Zhang, Xiangyu Zhao, Hongbo Liu, Xiaoxing Hu, Mingxin Liu, Shuran Ma, Yunhang Shen, Jian Hu, Haihan Gao, Haoyu Cao, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) Tongji University(同济大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出基于“评分前检查”的FIRM-Video框架,构建相关数据集与基准,其衍生模型在文本到视频奖励建模相关任务上取得最优表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21425 2026-08-25 cs.CV cs.AI 新提交 79%

Aligning Human Sense: Calibrated Distributional Reward Learning for Video Generation

对齐人类感知:用于视频生成的校准分布奖励学习

Nai-Xin Zhai, Weihua Cheng, Dexu Yu, Yikai Gu, Hanwen Du, Junchen Fu, Chenxi Huang, Yingwei Song, Liyuan Lillian Ma, Yang Ran, Youhua Li, Yongxin Ni

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文针对视频生成中奖励信号不可靠、偏好维度权衡丢失、KL散度难捕捉偏好全局结构的问题,提出统一偏好感知学习框架,通过精英过滤、分布建模与Wasserstein对齐改进,提升了奖励可靠性与视频感知一致性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23090 2026-08-25 cs.CV 新提交 57%

Loopy: Seamless Video Loop Generation via Anchored Looping Shift of Positional Embedding

Loopy:通过位置嵌入的锚定循环偏移实现无缝视频生成

Haotian Dong, Wenjing Wang, Chen Li, Jing Lyu, Xin Wang, Di Lin

机构 * Tianjin University(天津大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 该研究针对现有循环视频生成质量差的问题,提出Loopy框架,通过锚定DiT的位置嵌入偏移策略,实现高质量、支持多格式及高级AIGC功能的循环视频生成,提升了时间一致性与视觉保真度。

Comments 15 pages, 21 figures, accepted by ACM TOG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23070 2026-08-25 cs.AI cs.CV 新提交 57%

From Generation to Simulation: How Far Are World Models from Being True Simulators?

从生成到模拟:世界模型距离真正的模拟器还有多远?

Tong Wang, Huan Deng, Mucheng Yang, Yang He, Xiaohui Kuang, Gang Zhao

机构 * Institute of Systems Engineering, Academy of Military Sciences(军事科学院系统工程研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本研究通过系统评估200篇相关成果,分析了潜在动力学等3条技术路线的世界模型在传统模拟器8项能力上的表现,指出其在状态反馈等方面的缺陷并提出6个研究方向。

Comments 42 pages, 23 figures, 2 tables. Project page: this https URL (https://github.com/AtongWang/world-model-simulators)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2608.21849 2026-08-25 cs.CV 新提交 83%

GaussVid: Sparse-View Gaussian Splatting with 3D-Aware Video Diffusion Priors

GaussVid:结合3D感知视频扩散先验的稀疏视图高斯溅射

Xinhui Liu, Can Wang, Wei Jiang, Wei Wang, Dong Xu

机构 * The University of Hong Kong(香港大学) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Futurewei Technologies Inc(华为主流技术公司)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本研究提出结合3D感知视频扩散先验的GaussVid框架,构建3DGS视频数据集并引入相机条件几何先验,提升稀疏视图3DGS重建的像素、结构保真度与多视图一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21812 2026-08-25 physics.ao-ph 新提交 71%

Video Diffusion for Satellite-based High-Dynamical-Fidelity Precipitation (HiDFiP) Field Generation

用于卫星基高动态保真降水(HiDFiP)场生成的视频扩散模型

Runze Li, Yan Xia, Yongquan Qu, Dongwei Fu, Clement Guilloteau, Judy Hoffman, Stephan Mandt, Pierre Gentine, Efi Foufoula-Georgiou

专题命中 视频扩散模型 :video diffusion(title)

AI总结 本研究提出一种视频扩散框架,以IMERG为数据源、ERA5/ERA5-Land补充环境信息,生成卫星基HiDFiP降水场,其时空保真度优于基线方法,可泛化至新区域,为全球雷达级降水记录提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 2 篇

2608.23330 2026-08-25 cs.CV 新提交 57%

IntentQA: Intent Question Answering in Videos by Cognitive Context Reasoning

IntentQA:基于认知上下文推理的视频意图问答

Jiapeng Li, Ping Wei, Wenjuan Han, Song-Chun Zhu, Lifeng Fan

机构 * Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Beijing Jiaotong University(北京交通大学)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 本文提出视频意图问答任务 IntentQA,构建相关大规模数据集,提出 X-CaVIR 框架并引入对比性能下降指标,实验验证其有效性、优越性与稳定性。

Comments 18 pages, 7 figures. Accepted manuscript of an article published in IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22279 2026-08-25 cs.CV cs.AI 新提交 57%

OVIBench: Benchmarking Online Video Question Answering under Interruption

OVIBench:面向中断场景的在线视频问答基准测试

Naiming Liu, Zhiheng Wu, Shuning Wang, Tie Zhang, Bowen Liu, Tong Wang

机构 * HIT(哈尔滨工业大学) CASIA(中国科学院自动化研究所) ZJU(浙江大学) UESTC(电子科技大学) HKUST(香港科技大学)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 该研究针对现有视频问答基准未考虑用户中断的问题,提出首个面向中断场景的在线视频问答基准OVIBench,开发模拟协议与指标集,构建训练集OVI-Train,验证了其有效性。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 动作与事件理解 3 篇

2608.22067 2026-08-25 cs.RO cs.AI cs.CV cs.LG 新提交 57%

Inferring Action from Future Latent State for Robotic Manipulation

从未来隐状态推断机器人操纵动作

Fenghao Lei, Zhixiong Huang, Long Yang, Jiabao Chen, Jie Cheng, Peilin Huang, Han Fu, Zhuo Li, Xiaoxue Ren

机构 * DeepLeap Research(DeepLeap研究院)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出无需视频生成的机器人操纵模型DELE-w0.5,通过从捕获动作相关物理结果的未来隐状态推断动作,在4项长程操纵任务的480次试验中,其性能优于最强基线47.5和30.7个百分点,实现最优表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21439 2026-08-25 cs.CV 新提交 57%

WorldMind: Decoupled Game World Model for State-Aware NPC Behavior

WorldMind:用于状态感知NPC行为的解耦游戏世界模型

Zhiyang Deng, Boran Zhang, Danze Chen, Yeying Jin

机构 * Tencent(腾讯)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本研究针对现有游戏世界模型中NPC行为与视频生成绑定的问题,提出首个解耦框架WorldMind,构建BOSS-140K数据集,实验显示其NPC行为更优。

Comments Project page: this https URL (https://teawhite.cn/worldmind_projectpage/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22403 2026-08-25 cs.RO 新提交 50%

LD4WAM: Learning Latent Dynamics from Human Videos for World Action Models

LD4WAM:从人类视频学习世界动作模型的潜在动力学

Zhenhao Shen, Jiaqi Liang, Jasper Lu, Feng Jiang, Yuran Wang, Chuanbo Wei, Jiayi Liu, Jianchun Yang, Qize Yu, Jiadi You, Ce Hao, Guanqi He, Chen Xie, Ruihai Wu

专题命中 动作与事件理解 :video generation(abstract)

AI总结 LD4WAM通过运动对齐的潜在动力学,结合语义重建与真实运动对齐训练的潜在动力学模型和MoT架构的世界动力学动作模型,在RoboTwin仿真及真实机器人上表现良好,可泛化到未见物体与背景。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 长视频与时序推理 1 篇

2608.23383 2026-08-25 cs.CV 新提交 57%

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

面向持续故事与交互世界的长时序视听生成

Nan Duan, Haoyang Huang, Weiyang Jin, Haoran Li, Yaowei Li, Yuming Li, Yijun Liu, Xin Lu, Xiaoxiao Ma, Yanwen Ma, Yaofeng Su, Yilang Sun, Haoyu Wang, Zeyue Xue, Songchun Zhang, Junhao Zhuang

机构 * Joy Future Academy, JD(京东探索研究院)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 研究针对长时序视听生成的需求,提出JoyAI-Echo-1.5系统,含长视频与世界模型变体,通过专用技术实现跨镜头一致性等性能,在相关基准上取得领先结果,为生成连贯内容提供基础。

Comments Project page: this https URL (https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/)

详情

展开后加载摘要…

URL PDF HTML 收藏