arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-25 至 2026-08-25 共收录 35 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 7 篇

2607.14935 2026-08-25 cs.CV 版本更新 83%

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

VideoChat3:用于高效通用视频理解的全开放视频多模态语言模型

Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 研究针对视频理解开源模型局限,提出VideoChat3。通过I3D-ViT等提升效率,利用可扩展视频数据合成管道生成训练数据集提升泛化性,以4B参数在多基准测试中超越同等或更多参数的开源模型,实现泛化与计算效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14659 2026-08-25 cs.CV cs.AI 版本更新 83%

VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting

VisionCoach: 通过视觉感知提示强化视频推理

Daeun Lee, Shoubin Yu, Yue Zhang, Mohit Bansal

专题命中 视频理解 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 VisionCoach通过视觉提示指导强化学习,提升视频推理的时空定位能力,实现无需外部工具的高效推理。

Comments Accepted to ECCV 2026; Project website: this https URL (https://visioncoach.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23329 2026-08-25 cs.CV cs.AI 新提交 79%

Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents

超越视频:统一视频推理与深度研究的开放世界视频智能体

Wenqi Liu, Shijie Ma, Yunxiao Wang, Meng Liu, Qile Su, Han Liu, Bohan Hou, Xuanyu Zheng, Changyi Liu, Tianke Zhang, Haonan Fan, Kaiyu Jiang, Yingxin Li, Jiankang Chen, Xu Wang, Bin Wen, Tingting Gao, Han Li, Jianhua Yin, Yinwei Wei, Xuemeng Song

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北京航空航天大学) City University of Hong Kong(香港城市大学) Nanyang Technological University(南洋理工大学) Kuaishou Technology(快手科技) Southern University of Science and Technology(南方科技大学)

专题命中 视频理解 :video reasoning(title);video understanding(abstract);分类 cs.CV

AI总结 本研究提出统一视频推理与深度研究的VideoRover框架,构建相关数据集与基准,其8B-RL模型在无工具直接回答场景性能接近专有模型,优于同工具套件的更大开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22516 2026-08-25 cs.CV cs.CL 新提交 79%

TRACE: Temporal Retrieval with Anchored and Convergent Evidence for Long-Horizon Video Understanding

TRACE:用于长视频理解的基于锚定收敛证据的时序检索

Pengyiang Liu, Junbo Niu, Xiaoyang Hu, Zhongyue Shi, Zitian Wang, Linjiang Huang, Si Liu

专题命中 视频理解 :video understanding(title);long video(abstract);分类 cs.CV

AI总结 针对长视频理解中证据核查不足的问题,提出VES-Bench基准和无需训练的TRACE智能体,在帧成本更低的情况下实现了高正确率,在多个基准上表现出色。

Comments Accepted to EMNLP 2026 Main Conference. 19 pages, 5 figures, 6 tables. Project page: this https URL (https://buaa-colalab.github.io/TRACE/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04588 2026-08-25 cs.CL 版本更新 78%

VCIFBench: Evaluating Complex Instruction Following for Video Understanding

VCIFBench:评估视频理解中的复杂指令遵循能力

Huangchen Xu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心,吉林大学) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 视频理解 :video understanding(title,abstract)

AI总结 提出VCIFBench基准,通过混合验证流水线评估多模态大模型在视频理解中遵循内容、格式、风格和结构约束的复杂指令能力,实验表明联合约束满足仍具挑战,DPO训练可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23011 2026-08-25 cs.CV cs.AI 新提交 57%

Coarse Indexing, Fine Evidence: Decoupling Temporal Granularity in Long-Video RAG

粗粒度索引,细粒度证据:解耦长视频检索增强生成中的时间粒度

Zhe Jin, Zhimin Lin, Bin Zheng, Junhua Fang, Huihua Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Soochow University(苏州大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 该研究针对长视频RAG中索引与证据粒度耦合的问题,提出无训练的DAGC方法,实现40%-50%节点保留、1.3-1.7倍加速且维持99%问答性能,增益可跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22617 2026-08-25 cs.CV cs.AI cs.HC 新提交 57%

AI-based worker guidance in assembly and disassembly operations using multimodal ego/exo-centric data capture and structured task knowledge

基于多模态自我/外部中心数据采集与结构化任务知识的装配与拆卸作业中基于人工智能的工人指导

Vivek Chavan, Jörg Krüger

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 该研究提出一种从专家演示中提取结构化任务知识的以数据为中心的方法,结合多模态数据推导任务表示,实现装配拆卸作业的工人指导,经案例验证其优于静态图像方法,可用于维修、培训等场景。

Comments 5 pages. Published in CIRP Annals - Manufacturing Technology

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 12 篇

2602.24289 2026-08-25 cs.CV cs.LG 版本更新 88%

Mode Seeking meets Mean Seeking for Fast Long Video Generation

模式寻求与均值寻求的结合用于快速长视频生成

Shengqu Cai, Weili Nie, Chao Liu, Julius Berner, Lvmin Zhang, Nanye Ma, Hansheng Chen, Maneesh Agrawala, Leonidas Guibas, Gordon Wetzstein, Arash Vahdat

机构 * Stanford University, California, USA(斯坦福大学) NVIDIA Research, California, USA(NVIDIA研究)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出一种结合模式寻求与均值寻求的解耦扩散变换器,通过监督学习生成快速长视频,提升长距离连贯性和局部真实感。

Comments Project website: this https URL (https://primecai.github.io/mmm/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21424 2026-08-25 cs.CV cs.GR cs.HC cs.LG cs.MM 新提交 84%

EditStream: A Unified Autoregressive Framework for Interactive Video Generation and Editing

EditStream:用于交互式视频生成与编辑的统一自回归框架

Yuqian Zhou, Zhenghong Zhou, Zongze Wu, Cameron Smith, Richard Zhang, Jiebo Luo, Eli Shechtman, Zhe Lin

机构 * Adobe Research(Adobe研究院) University of Rochester(罗切斯特大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 本研究提出EditStream框架,整合多类视频生成编辑任务,通过两阶段蒸馏方法优化自回归模型,实现高质量交互式视频创作,填补了扩散模型与创意工作流的衔接空白。

Comments 25 pages, 12 figures, Project page: this https URL (https://real-time-video-research.github.io/editstream/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22819 2026-08-25 cs.CV 新提交 79%

Direct, Parallel, or Sequential? A Comparative Study of Training-Free Multi-Subject Image-to-Video Generation

直接式、并行式还是顺序式?无训练多主体图像到视频生成的对比研究

Yanliang Qi, Kexi Chen, Muchao Ye, Haomiao Ni

机构 * University of Memphis(孟菲斯大学) University of Pennsylvania(宾夕法尼亚大学) University of Iowa(爱荷华大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文对比研究直接、并行、顺序三种无训练多主体图像到视频生成范式,通过实证评估明确各范式的优劣势,为可控多主体视频生成系统设计提供实用见解。

Comments ACM Multimedia Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21839 2026-08-25 cs.CV 新提交 79%

FIRM-Video: Check Before You Score for Reliable Text-to-Video Reward Modeling

FIRM-Video:可靠文本到视频奖励建模的评分前检查机制

Peiyuan Zhang, Xiangyu Zhao, Hongbo Liu, Xiaoxing Hu, Mingxin Liu, Shuran Ma, Yunhang Shen, Jian Hu, Haihan Gao, Haoyu Cao, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) Tongji University(同济大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出基于“评分前检查”的FIRM-Video框架,构建相关数据集与基准,其衍生模型在文本到视频奖励建模相关任务上取得最优表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21425 2026-08-25 cs.CV cs.AI 新提交 79%

Aligning Human Sense: Calibrated Distributional Reward Learning for Video Generation

对齐人类感知:用于视频生成的校准分布奖励学习

Nai-Xin Zhai, Weihua Cheng, Dexu Yu, Yikai Gu, Hanwen Du, Junchen Fu, Chenxi Huang, Yingwei Song, Liyuan Lillian Ma, Yang Ran, Youhua Li, Yongxin Ni

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文针对视频生成中奖励信号不可靠、偏好维度权衡丢失、KL散度难捕捉偏好全局结构的问题,提出统一偏好感知学习框架,通过精英过滤、分布建模与Wasserstein对齐改进,提升了奖励可靠性与视频感知一致性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19583 2026-08-25 cs.CV cs.AI 版本更新 79%

VGI-Bench: Probing Visual Intelligence in Video Generation Models

VGI-BENCH:探究视频生成模型的视觉智能

Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao Wen, Jize Jiang, Zeyi Liu, Yuren Hao, Songcheng Cai, Keming Wu, Penghui Du, Kai Zou, Rui Yang, Chenkai Sun, Ke Yang, Ping Nie, Kelsey R Allen, Chenglong Wang, Michel Galley, Jianfeng Gao, ChengXiang Zhai

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) University of Waterloo(滑铁卢大学) Massachusetts Institute of Technology(麻省理工学院) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(矢量研究所) Microsoft Research(微软研究院) Etude AI

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本研究推出VGI-bench基准,含27项任务810个实例,评估视频生成模型视觉推理能力,发现最强模型Seedance~2.0仅达51.0%,将推动下一代视频生成模型发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08712 2026-08-25 cs.CV 版本更新 79%

From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation

从运动学至路由视觉控制:用于动作条件化外科视频生成

Bohan Li, Shuojue Yang, Baorui Peng, Xianda Guo, Erli Zhang, Youqi Tao, Junfeng Duan, Daguang Xu, Qi Dou, Xin Jin, Wenjun Zeng, Hao Zhao, Yueming Jin

机构 * SJTU(上海交通大学) NUS(国立新加坡大学) THU(清华大学) EIT(欧洲研究所) WHU(武汉大学) Harvard(哈佛大学) NVIDIA(NVIDIA公司) CUHK(香港大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一种运动学至视觉提升范式,通过五种图像对齐的控制模态生成动作条件化外科视频,采用分层路由框架提升控制精度与效率,构建新基准并验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18422 2026-08-25 cs.CV 版本更新 79%

Generated Reality: Human-centric World Simulation using Interactive Video Generation with Hand and Camera Control

生成现实:基于交互式视频生成的人本世界模拟

Linxi Xie, Lisong C. Sun, Ashley Neall, Tong Wu, Shengqu Cai, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) NYU Shanghai(纽约大学上海分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于交互式视频生成的人本世界模拟系统,通过结合头部和手部姿态控制,提升虚拟环境的交互性和用户控制感。

Comments Project page here: this https URL (https://codeysun.github.io/generated-reality)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05076 2026-08-25 cs.CV 版本更新 79%

BulletTime: Decoupled Control of Time and Camera Pose for Video Generation

BulletTime: 分离时间与相机姿态的视频生成控制

Yiming Wang, Qihang Zhang, Shengqu Cai, Tong Wu, Jan Ackermann, Zhengfei Kuang, Yang Zheng, Frano Rajič, Siyu Tang, Gordon Wetzstein

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 BulletTime通过分离时间与相机姿态,实现了视频生成的精细控制与高质量生成。

Comments CVPR 2026, Project Page: this https URL (https://19reborn.github.io/Bullet4D/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23090 2026-08-25 cs.CV 新提交 57%

Loopy: Seamless Video Loop Generation via Anchored Looping Shift of Positional Embedding

Loopy:通过位置嵌入的锚定循环偏移实现无缝视频生成

Haotian Dong, Wenjing Wang, Chen Li, Jing Lyu, Xin Wang, Di Lin

机构 * Tianjin University(天津大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 该研究针对现有循环视频生成质量差的问题,提出Loopy框架,通过锚定DiT的位置嵌入偏移策略,实现高质量、支持多格式及高级AIGC功能的循环视频生成,提升了时间一致性与视觉保真度。

Comments 15 pages, 21 figures, accepted by ACM TOG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23070 2026-08-25 cs.AI cs.CV 新提交 57%

From Generation to Simulation: How Far Are World Models from Being True Simulators?

从生成到模拟:世界模型距离真正的模拟器还有多远?

Tong Wang, Huan Deng, Mucheng Yang, Yang He, Xiaohui Kuang, Gang Zhao

机构 * Institute of Systems Engineering, Academy of Military Sciences(军事科学院系统工程研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本研究通过系统评估200篇相关成果,分析了潜在动力学等3条技术路线的世界模型在传统模拟器8项能力上的表现,指出其在状态反馈等方面的缺陷并提出6个研究方向。

Comments 42 pages, 23 figures, 2 tables. Project page: this https URL (https://github.com/AtongWang/world-model-simulators)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11421 2026-08-25 cs.CV 版本更新 57%

ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation

ShotVerse: 提升文本驱动多镜头视频创作的电影级摄像机控制

Songlin Yang, Zhe Wang, Xuyi Yang, Songchun Zhang, Xianghao Kong, Taiyi Wu, Xiaotong Zhao, Ran Zhang, Alan Zhao, Anyi Rao

机构 * Tencent Video AI Center, PCG, Tencent(腾讯视频AI中心)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 ShotVerse通过'计划然后控制'框架,结合视觉语言模型和摄像机适配器,实现多镜头视频创作中精准的摄像机控制与高保真电影效果。

Comments SIGGRAPH Asia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 6 篇

2608.21849 2026-08-25 cs.CV 新提交 83%

GaussVid: Sparse-View Gaussian Splatting with 3D-Aware Video Diffusion Priors

GaussVid:结合3D感知视频扩散先验的稀疏视图高斯溅射

Xinhui Liu, Can Wang, Wei Jiang, Wei Wang, Dong Xu

机构 * The University of Hong Kong(香港大学) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Futurewei Technologies Inc(华为主流技术公司)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本研究提出结合3D感知视频扩散先验的GaussVid框架,构建3DGS视频数据集并引入相机条件几何先验,提升稀疏视图3DGS重建的像素、结构保真度与多视图一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17825 2026-08-25 cs.CV 版本更新 83%

Steering Video Diffusion Transformers with Massive Activations

通过大规模激活引导视频扩散变换器

Xianhang Cheng, Yujian Zheng, Zhenyu Xie, Tingting Liao, Hao Li

机构 * MBZUAI

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 研究视频扩散变换器中大规模激活的作用,提出STAS方法通过引导首帧和边界token的激活值提升视频生成质量与时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26203 2026-08-25 cs.CV 版本更新 79%

WildShadowRemover: In-the-Wild Video Shadow Removal via Detail-Preserving Video Diffusion Models

WildShadowRemover:基于细节保留视频扩散模型的野外视频阴影去除方法

Jiamin Xu, Cong Wang, Zheng Dong, Chi Wang, Renshu Gu, Weiwei Xu, Gang Xu

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 针对野外视频阴影去除难题,提出WildShadowRemover框架,通过LoRA微调适配视频扩散模型,结合细节注入、频率分解调制及Depth Anything 3深度先验,构建对应数据集,在阴影去除质量与时间一致性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21812 2026-08-25 physics.ao-ph 新提交 71%

Video Diffusion for Satellite-based High-Dynamical-Fidelity Precipitation (HiDFiP) Field Generation

用于卫星基高动态保真降水(HiDFiP)场生成的视频扩散模型

Runze Li, Yan Xia, Yongquan Qu, Dongwei Fu, Clement Guilloteau, Judy Hoffman, Stephan Mandt, Pierre Gentine, Efi Foufoula-Georgiou

专题命中 视频扩散模型 :video diffusion(title)

AI总结 本研究提出一种视频扩散框架,以IMERG为数据源、ERA5/ERA5-Land补充环境信息,生成卫星基HiDFiP降水场,其时空保真度优于基线方法,可泛化至新区域,为全球雷达级降水记录提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17445 2026-08-25 cs.CV 版本更新 57%

LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents

LangDriveCTRL: 通过多模态代理实现自然语言可控的驾驶场景编辑

Yun He, Francesco Pittaluga, Ziyu Jiang, Matthias Zwicker, Manmohan Chandraker, Zaid Tasneem

机构 * University of Maryland, College Park(马里兰大学帕克分校) NEC Labs America(NEC美国实验室) UC San Diego(加州大学圣迭戈分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 LangDriveCTRL通过多模态代理实现驾驶视频的自然语言可控编辑,生成多样化的交通场景,提升真实感和交通场景的真实性。

Comments Accepted by ECCV 2026. Project Page: this https URL (https://yunhe24.github.io/langdrivectrl/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20756 2026-08-25 cs.CV 版本更新 57%

StereoDiff: Stereo-Diffusion Synergy for Video Depth Estimation

StereoDiff:用于视频深度估计的立体-扩散协同框架

Haodong Li, Chen Wang, Jiahui Lei, Kostas Daniilidis, Lingjie Liu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Pennsylvania(宾夕法尼亚大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 StereoDiff将立体匹配与视频深度扩散协同,针对视频静态和动态区域分别采用对应技术,在真实世界动态视频深度基准上实现了当前最优的零样本估计性能。

Comments We no longer wish this manuscript to stand as an active preprint and will not be maintaining or updating it further; we would prefer it not be cited as current work. It has not been published or accepted at any journal or conference, so the request is not motivated by publication elsewhere. We are requesting a standard withdrawal, not a full removal

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 2 篇

2608.23330 2026-08-25 cs.CV 新提交 57%

IntentQA: Intent Question Answering in Videos by Cognitive Context Reasoning

IntentQA:基于认知上下文推理的视频意图问答

Jiapeng Li, Ping Wei, Wenjuan Han, Song-Chun Zhu, Lifeng Fan

机构 * Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Beijing Jiaotong University(北京交通大学)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 本文提出视频意图问答任务 IntentQA,构建相关大规模数据集,提出 X-CaVIR 框架并引入对比性能下降指标,实验验证其有效性、优越性与稳定性。

Comments 18 pages, 7 figures. Accepted manuscript of an article published in IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22279 2026-08-25 cs.CV cs.AI 新提交 57%

OVIBench: Benchmarking Online Video Question Answering under Interruption

OVIBench:面向中断场景的在线视频问答基准测试

Naiming Liu, Zhiheng Wu, Shuning Wang, Tie Zhang, Bowen Liu, Tong Wang

机构 * HIT(哈尔滨工业大学) CASIA(中国科学院自动化研究所) ZJU(浙江大学) UESTC(电子科技大学) HKUST(香港科技大学)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 该研究针对现有视频问答基准未考虑用户中断的问题,提出首个面向中断场景的在线视频问答基准OVIBench,开发模拟协议与指标集,构建训练集OVI-Train,验证了其有效性。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 动作与事件理解 5 篇

2608.22067 2026-08-25 cs.RO cs.AI cs.CV cs.LG 新提交 57%

Inferring Action from Future Latent State for Robotic Manipulation

从未来隐状态推断机器人操纵动作

Fenghao Lei, Zhixiong Huang, Long Yang, Jiabao Chen, Jie Cheng, Peilin Huang, Han Fu, Zhuo Li, Xiaoxue Ren

机构 * DeepLeap Research(DeepLeap研究院)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出无需视频生成的机器人操纵模型DELE-w0.5,通过从捕获动作相关物理结果的未来隐状态推断动作,在4项长程操纵任务的480次试验中,其性能优于最强基线47.5和30.7个百分点,实现最优表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21439 2026-08-25 cs.CV 新提交 57%

WorldMind: Decoupled Game World Model for State-Aware NPC Behavior

WorldMind:用于状态感知NPC行为的解耦游戏世界模型

Zhiyang Deng, Boran Zhang, Danze Chen, Yeying Jin

机构 * Tencent(腾讯)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本研究针对现有游戏世界模型中NPC行为与视频生成绑定的问题,提出首个解耦框架WorldMind,构建BOSS-140K数据集,实验显示其NPC行为更优。

Comments Project page: this https URL (https://teawhite.cn/worldmind_projectpage/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27504 2026-08-25 cs.CV 版本更新 57%

ReWorld: Representation Learning for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Zhenxin Zhu, Haiyang Sun, Bing Wang, Guang Chen, Wenyu Liu, Hangjun Ye, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 15 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏