2608.20814 2026-08-24 cs.CV 新提交 88% Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision 通过高效的段级到视频级监督增强长视频理解的局部推理能力 Beibei Zhang, Chao Xu, Jun Lan, Zongyi Li, Lai Wei, Huijia Zhu, Tongwei Ren 机构 * Ant Group(蚂蚁集团) 纠错 专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV AI总结 针对长视频理解中MLLMs易受干扰噪声影响的问题,提出S2V方法,通过段级VQA训练模型,提升了LVU性能与训练推理效率。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.20805 2026-08-24 cs.CV 新提交 79% Routing Before Looking: Query-Adaptive Evidence Acquisition for Long-form Video Understanding 先路由后查看:面向长视频理解的查询自适应证据获取 Tianyue Wang, Xuying Wu, Yuxiang Ma, Ruiming Liang, Jiaxuan Kang, Yanchao Hao, Zheng Wei, Leigang Qu, Haiyun Guo, Jinqiao Wang 机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Tencent(腾讯) ; Wuhan University(武汉大学) ; Southeast University(东南大学) ; National University of Singapore(新加坡国立大学) 纠错 专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV AI总结 针对长视频理解中查询需求与证据获取策略不匹配的问题,提出Route2Look框架,通过查询自适应路由策略选择证据获取工具,实现最优性能与帧效率。 Comments Accept to EMNLP 2026 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.20473 2026-08-24 cs.CV 新提交 57% Aggregating Visual Information with Optimal Transport for VideoLM Token Compression 基于最优传输的视觉信息聚合用于视频语言模型的令牌压缩 Wenti Yin, Xiaotian Han, Junyuan Shang, Yuchen Ding, Shuohuan Wang, Dianhai Yu, Changxin Gao, Nong Sang 专题命中 视频理解 :video language model(abstract);分类 cs.CV AI总结 该研究针对视频语言模型的视觉令牌冗余问题,提出AVIOT方法,将视频令牌压缩转化为最优传输问题,沿任务和空间轴调整表示构造,在多基准上实现了与未压缩基线相当或更优的性能,且高压缩率下表现稳定。 Comments Code: this https URL (https://github.com/ernie-research/AVIOT) 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.20749 2026-08-24 cs.CV 新提交 86% Identity-Preserving Text-to-Video Generation via Agentic Enhancement and Semantic Repair 通过智能体增强与语义修复实现身份保留的文本到视频生成 Jiayi Gao, Changcheng Hua, Jiaqi Tang, Yuxin Peng, Yang Liu 机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) 纠错 专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV AI总结 针对现有商业视频生成模型的身份漂移等缺陷,提出AESR轻量级框架,含智能体提示增强与视觉语义修复模块,搭配混合专家选择策略,其系统MIPL_Video在ACM MM 2026挑战赛赛道1获第一 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.20534 2026-08-24 cs.CV 新提交 79% Grounded-Exo2Ego: Structured Semantic Grounding for Robust Exocentric-to-Egocentric Video Generation Grounded-Exo2Ego:用于鲁棒外部视角到自我视角视频生成的结构化语义 grounding Shengze Wang, Michael Stengel, Tianye Li, Seonwook Park, Amrita Mazumdar, Koki Nagano, Alex Trevithick, Shalini De Mello 机构 * NVIDIA(英伟达) 纠错 专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV AI总结 本文提出Grounded-Exo2Ego框架,通过双分支视频扩散模型、相机重定位算法和自动合成数据引擎,在EgoExo4D数据集上大幅提升了外部视角到自我视角视频生成的性能。 Comments website url: this https URL (https://research.nvidia.com/labs/amri/projects/grounded-exo2ego/) 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.20770 2026-08-24 cs.CV 新提交 57% MotionPhys: Detecting AI-Generated Videos via Physical Consistency of Optical-Flow Trajectories MotionPhys:基于光流轨迹物理一致性检测AI生成视频 Haojin He, Hao Tan, Zichang Tan, Ajian Liu, Jun Wan 专题命中 视频生成 :video generation(abstract);分类 cs.CV AI总结 MotionPhys是基于光流轨迹物理一致性的轻量可解释框架,可检测AI生成视频的物理运动不一致性,且对不同视频生成器泛化性良好。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.20515 2026-08-24 cs.CV 新提交 83% DiffVC-ONE: Diffusion-based Generative Video Compression with One-Step Video Diffusion Transformer DiffVC-ONE:基于扩散模型的生成式视频压缩,采用单步视频扩散Transformer Wenzhuo Ma, Zhenzhong Chen 机构 * school of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感信息工程学院) 纠错 专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV AI总结 DiffVC-ONE是基于扩散模型的生成式视频压缩框架,采用单步视频扩散Transformer,通过三类组件实现低推理成本下的高感知质量与时间一致性,在多基准上达最优性能。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.20481 2026-08-24 cs.CR cs.AI 新提交 50% AEGIS: Preventing Cross-Domain Resource Abuse in MCP AEGIS:防止MCP中的跨域资源滥用 Shriti Priya, Teryl Taylor, Frederico Araujo 专题命中 长视频与时序推理 :long video(abstract) AI总结 本文提出AEGIS,该组件借助LLM将MCP工具调用归一化为统一表示,结合Open Policy Agent与ContextForge AI Gateway,可防止跨异构MCP工具和模态的资源滥用。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.21360 2026-08-24 cs.CV 新提交 57% OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs OmniAssistBench:面向全模态大语言模型(Omni-LLMs)的助手式交互基准 Xianyun Sun, Chaoyou Fu, Zhengye Zhang, Feiyang Duan, Qingyuan Cao, Yonghui Niu, Sihang Yuan, Ge Zhang, Caifeng Shan 机构 * Nankai University(南开大学) ; University of Waterloo(滑铁卢大学) ; Nanjing University(南京大学) 纠错 专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV AI总结 针对全模态大语言模型助手式交互的评估瓶颈,构建OmniAssistBench数据集,实验显示Gemini-3-Pro、Qwen3-Omni-Instruct表现存在差距,当前模型在多轮交互等方面仍有不足。 Comments Project page: this https URL (https://xianyunsun.github.io/OmniAssistBench/) 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图