arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-24 至 2026-08-24 共收录 9 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2608.20814 2026-08-24 cs.CV 新提交 88%

Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision

通过高效的段级到视频级监督增强长视频理解的局部推理能力

Beibei Zhang, Chao Xu, Jun Lan, Zongyi Li, Lai Wei, Huijia Zhu, Tongwei Ren

机构 * Ant Group(蚂蚁集团)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 针对长视频理解中MLLMs易受干扰噪声影响的问题,提出S2V方法,通过段级VQA训练模型,提升了LVU性能与训练推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20805 2026-08-24 cs.CV 新提交 79%

Routing Before Looking: Query-Adaptive Evidence Acquisition for Long-form Video Understanding

先路由后查看:面向长视频理解的查询自适应证据获取

Tianyue Wang, Xuying Wu, Yuxiang Ma, Ruiming Liang, Jiaxuan Kang, Yanchao Hao, Zheng Wei, Leigang Qu, Haiyun Guo, Jinqiao Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tencent(腾讯) Wuhan University(武汉大学) Southeast University(东南大学) National University of Singapore(新加坡国立大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 针对长视频理解中查询需求与证据获取策略不匹配的问题,提出Route2Look框架,通过查询自适应路由策略选择证据获取工具,实现最优性能与帧效率。

Comments Accept to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20473 2026-08-24 cs.CV 新提交 57%

Aggregating Visual Information with Optimal Transport for VideoLM Token Compression

基于最优传输的视觉信息聚合用于视频语言模型的令牌压缩

Wenti Yin, Xiaotian Han, Junyuan Shang, Yuchen Ding, Shuohuan Wang, Dianhai Yu, Changxin Gao, Nong Sang

专题命中 视频理解 :video language model(abstract);分类 cs.CV

AI总结 该研究针对视频语言模型的视觉令牌冗余问题,提出AVIOT方法,将视频令牌压缩转化为最优传输问题,沿任务和空间轴调整表示构造,在多基准上实现了与未压缩基线相当或更优的性能,且高压缩率下表现稳定。

Comments Code: this https URL (https://github.com/ernie-research/AVIOT)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2608.20749 2026-08-24 cs.CV 新提交 86%

Identity-Preserving Text-to-Video Generation via Agentic Enhancement and Semantic Repair

通过智能体增强与语义修复实现身份保留的文本到视频生成

Jiayi Gao, Changcheng Hua, Jiaqi Tang, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV

AI总结 针对现有商业视频生成模型的身份漂移等缺陷,提出AESR轻量级框架,含智能体提示增强与视觉语义修复模块,搭配混合专家选择策略,其系统MIPL_Video在ACM MM 2026挑战赛赛道1获第一

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20534 2026-08-24 cs.CV 新提交 79%

Grounded-Exo2Ego: Structured Semantic Grounding for Robust Exocentric-to-Egocentric Video Generation

Grounded-Exo2Ego:用于鲁棒外部视角到自我视角视频生成的结构化语义 grounding

Shengze Wang, Michael Stengel, Tianye Li, Seonwook Park, Amrita Mazumdar, Koki Nagano, Alex Trevithick, Shalini De Mello

机构 * NVIDIA(英伟达)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Grounded-Exo2Ego框架,通过双分支视频扩散模型、相机重定位算法和自动合成数据引擎,在EgoExo4D数据集上大幅提升了外部视角到自我视角视频生成的性能。

Comments website url: this https URL (https://research.nvidia.com/labs/amri/projects/grounded-exo2ego/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20770 2026-08-24 cs.CV 新提交 57%

MotionPhys: Detecting AI-Generated Videos via Physical Consistency of Optical-Flow Trajectories

MotionPhys:基于光流轨迹物理一致性检测AI生成视频

Haojin He, Hao Tan, Zichang Tan, Ajian Liu, Jun Wan

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 MotionPhys是基于光流轨迹物理一致性的轻量可解释框架,可检测AI生成视频的物理运动不一致性,且对不同视频生成器泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2608.20515 2026-08-24 cs.CV 新提交 83%

DiffVC-ONE: Diffusion-based Generative Video Compression with One-Step Video Diffusion Transformer

DiffVC-ONE:基于扩散模型的生成式视频压缩,采用单步视频扩散Transformer

Wenzhuo Ma, Zhenzhong Chen

机构 * school of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感信息工程学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 DiffVC-ONE是基于扩散模型的生成式视频压缩框架,采用单步视频扩散Transformer,通过三类组件实现低推理成本下的高感知质量与时间一致性,在多基准上达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 1 篇

2608.20481 2026-08-24 cs.CR cs.AI 新提交 50%

AEGIS: Preventing Cross-Domain Resource Abuse in MCP

AEGIS:防止MCP中的跨域资源滥用

Shriti Priya, Teryl Taylor, Frederico Araujo

专题命中 长视频与时序推理 :long video(abstract)

AI总结 本文提出AEGIS,该组件借助LLM将MCP工具调用归一化为统一表示,结合Open Policy Agent与ContextForge AI Gateway,可防止跨异构MCP工具和模态的资源滥用。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 1 篇

2608.21360 2026-08-24 cs.CV 新提交 57%

OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs

OmniAssistBench:面向全模态大语言模型(Omni-LLMs)的助手式交互基准

Xianyun Sun, Chaoyou Fu, Zhengye Zhang, Feiyang Duan, Qingyuan Cao, Yonghui Niu, Sihang Yuan, Ge Zhang, Caifeng Shan

机构 * Nankai University(南开大学) University of Waterloo(滑铁卢大学) Nanjing University(南京大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 针对全模态大语言模型助手式交互的评估瓶颈,构建OmniAssistBench数据集,实验显示Gemini-3-Pro、Qwen3-Omni-Instruct表现存在差距,当前模型在多轮交互等方面仍有不足。

Comments Project page: this https URL (https://xianyunsun.github.io/OmniAssistBench/)

详情

展开后加载摘要…

URL PDF HTML 收藏