arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1388 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1388 篇

2608.06930 2026-08-10 cs.CV 新提交 57%

AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward

AVCap:用细节感知奖励强化音视频联合字幕

Mingyang Wu, Kaituo Feng, Bohao Li, Kaixiong Gong, Zihao Yin, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MMLab) Peking University(北京大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 针对音视频联合字幕的数据集、奖励信号、评估基准的局限,提出AVCap-100K数据集、AVCap模型及专用基准指标,通过Da-GRPO优化的AVCap模型性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11183 2026-08-07 cs.CV 版本更新 57%

Versatile Video Representation via Feed-Forward 2D Gaussian Splatting Tokenization

基于前馈二维高斯溅射标记化的通用视频表示

Zhenghao Chen, Zicong Chen, Lei Liu, Yiming Wu, Dong Xu

专题命中 视频理解 :video generation(abstract);分类 cs.CV

AI总结 本研究提出基于前馈2DGS标记化的GVT框架,通过STGE与GSP策略实现通用视频表示,在四项视频任务的多数据集评估中,其重建、压缩性能达先进水平,动作识别提升,生成性能可与MAGVIT-v2媲美。

Comments Accepted by ACM MM 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04501 2026-08-06 cs.CV 新提交 57%

Privacy-Preserving Action Recognition: Taxonomy, Methods, and Privacy-Utility Trade-offs

隐私保护动作识别:分类、方法与隐私-效用权衡

Sareer Ul Amin, Muhammad Ayaz, Muhammad Munsif, Sanghyun Seo

机构 * Chung-Ang University(中央大学) Ulsan National Institute of Science and Technology (UNIST)(蔚山科学技术院) College of Art and Technology, Chung-Ang University(中央大学艺术与技术学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 该研究通过PRISMA指导的综述,梳理32篇PPAR论文,提出分类法、评估协议等,分析各方法权衡,指出评估不足,推动PPAR从原型向部署发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02039 2026-08-05 cs.CV 版本更新 57%

RSVideo: Are Your Vision-Language Models Ready for Remote Sensing Videos?

RSVideo:你的视觉-语言模型准备好应对遥感视频了吗?

Hongjie Zhou, Shiqin Wang, Haoyang Chen, Haonan Guo, Di Wang, Juhua Liu, Fu Lin, Yong Luo

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 该研究构建了遥感视频数据集RSVideo-10K与评估基准RSVideo-Bench,发现现有视觉-语言模型在遥感视频理解上存在不足,提出强化学习框架RSVideo提升小目标时空聚焦能力,取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01644 2026-08-04 cs.CV cs.AI 新提交 57%

CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models

CRAFT:面向视觉语言模型的基于视频令牌递归自适应融合的压缩方法

Yu Chen, Xiaohong Li, Xiaole Wang, Jianjin Zhang, Jun Sun, Yafeng Deng

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 针对视觉语言模型视频令牌压缩效率与适应性的权衡问题,提出CRAFT方法,通过解耦令牌选择与融合实现高效压缩,在8倍压缩时保留97%主干准确率且性能优于现有方法。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01271 2026-08-04 cs.CV cs.AI 新提交 57%

Rethinking Video Token Compression with a Global Codebook: Learning Once, Compressing Everywhere

重新思考基于全局码本的视频令牌压缩:一次学习,处处压缩

Jiayang He, Tianling Xu, Diancheng Kang, Huaide Jiang, Junyan Bai, Shaoming Zheng, Xuan Song

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 该研究提出即插即用框架ONCE,通过离线学习全局码本实现视频令牌的高效压缩,在保持性能的同时降低推理延迟,提升了视频大语言模型的效率与通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00235 2026-08-04 cs.CV 新提交 57%

Attention-Steered Vision-Language Models for Sign Language Translation

用于手语翻译的注意力引导视觉-语言模型

Meibo Hu, Guohao Sun, Annemarie D. Ross, Sheng Li, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工学院) University of Virginia(弗吉尼亚大学) National Technical Institute for the Deaf(国家聋人技术学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 针对视觉-语言模型在手语翻译中时空视觉定位差的问题,提出AttnSign框架,通过空间注意力监督和RL运动节奏引导提升性能,在How2Sign和OpenASL基准上表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15846 2026-07-30 cs.CV 版本更新 57%

A Closer Look at Dynamic Scene Graph Generation In the Era of Multimodal Large Language Models

多模态大语言模型时代的动态场景图生成研究

Xuanming Cui, Jaiminkumar Ashokbhai Bhoi, Chionh Wei Peng, Adriel Kuek, Ser Nam Lim

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本研究针对多模态大语言模型时代动态场景图生成的局限,从任务设置优化评估指标、基于MLLM改进模型设计,在多个数据集上实现了最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24904 2026-07-29 cs.CV cs.CL 新提交 57%

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

Mage-VL:一种高效的编解码器原生流式多模态基础模型

Senqiao Yang, Kaichen Zhang, Zhaoyang Jia, Jinghao Guo, Yifei Shen, Xinjie Zhang, Xiaoyi Zhang, Haoqing Wang, Xiao Li, Peng Zhang, Xiang An, Yin Xie, Zhening Liu, Xun Guo, Jiahao Li, Shicheng Zheng, Jinglu Wang, Zongyu Guo, Wenxuan Xie, Zihan Zheng, Yuxuan Luo, Bin Li, Yan Lu

机构 * Microsoft(微软)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 研究针对标准视觉语言模型在流式感知任务的不足,提出Mage-VL。核心方法是用Mage-ViT选择性编码关键区域,减少视觉令牌消耗。该模型在多模态理解和交互上表现出色,推理速度加快,还有多项关键实证发现。

Comments Project page: https://microsoft.github.io/Mage

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00435 2026-07-29 cs.CV cs.AI 版本更新 57%

Detect Before You Leap: Mirage Detection in Vision-Language Models

在跳跃前检测:视觉语言模型中的幻象检测

Sayeed Shafayet Chowdhury, Md. Shaown Miah, S. M. Taiabul Haque, Syed Ishtiaque Ahmed

机构 * Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 针对视觉语言模型在缺乏视觉证据时产生自信但无根据回答的幻象问题,提出文本条件层内对齐方法,通过分析视觉编码器各层补丁令牌与问题嵌入的对齐轨迹,结合像素统计、零样本域路由和结构化自评估,实现高精度预响应幻象检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22726 2026-07-28 cs.CV 新提交 57%

PCA: Persistence-Aware Compression and Aggregation for Fast Video Large Language Models

PCA:用于快速视频大语言模型的持久性感知压缩与聚合

Zihan Song, Shuo Ye, Bo Zhao, Ruixin Zhang, Jiayu Zhang, Shouhong Ding, Zitong Yu

机构 * Institute for Artificial Intelligence, Great Bay University(大湾区大学人工智能研究院) Sun Yat-sen University(中山大学) Youtu Lab, Tencent(腾讯优图实验室) Shenzhen University(深圳大学) Dongguan Key Laboratory for Intelligence and Information Technology(东莞市智能信息技术重点实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 研究视频大语言模型长时帧冗余问题,提出PCA方法,含动态下采样和持久性感知运动增强模块,能在编码前保留视觉信息,提升效率与准确性,优于现有方法,速度有显著提升。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20868 2026-07-24 cs.CV 新提交 57%

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?

ViSTR-Bench:多模态大语言模型能否从动态场景中的连续视觉线索进行推理?

Han Li, Si Liu, Zehao Huang, Dongxin Lyu, Longfei Xu, Jiahui Fu, Daxin Tian, Yuliang Xiu, Naiyan Wang

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhongguancun Academy(中关村科学城) School of Engineering, Westlake University(西湖大学工学院) School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 研究聚焦多模态大语言模型在动态场景中从连续视觉线索推理的能力,提出ViSTR-Bench评估套件,基于相关原则建立四维评估,含15个子任务和1340个问答对,经评估发现当前模型在复杂时空推理上有瓶颈,远不及人类。

Comments 37 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09080 2026-07-23 cs.CV 版本更新 57%

GeoTrace: Geometry-Aware Trajectory Token Compression for Video Large Language Models

GeoTrace:用于视频大语言模型的几何感知轨迹令牌压缩

Guohuan Xie, Mengqi Lei, Chuan Shi, Wei Bao, Yue Gao, Siqi Li

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 研究针对Video LLMs视觉令牌多致效率受限问题,提出GeoTrace框架,通过CFPA和TCRC分别处理骨架与残差令牌,经实验评估证明该框架在多模型架构和场景下有效,能在大幅减少计算量时保留高比例性能。

Comments Withdrawn by the authors due to an incomplete internal approval process

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18716 2026-07-22 cs.CV 新提交 57%

Continual Video-MLLM Adaptation over Evolving Domains

在不断演变的领域上进行连续视频 - MLLM 适应

Rui Cheng, Meixing Shi, Yuxiang Cai, Jingcai Guo, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Hong Kong Polytechnic University(香港理工大学) The University of Southern Queensland(南昆士兰大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 研究视频多模态大语言模型对不断演变领域的适应问题,提出分布感知专家路由框架 DAER,通过保持领域隔离的轻量级专家、引入多种路由和优化机制,在域增量基准上评估,结果优于现有方法。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17625 2026-07-21 cs.CV cs.LG 新提交 57%

Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection

具有稀疏自选择的脑对齐多流视频变换器

Amir Hosein Fadaei, Mahyar Maleki, Mohammad-Reza A. Dehaqani

机构 * University of Tehran(德黑兰大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 研究针对现代视频变换器忽视灵长类视觉原理及缺乏神经数据评估的问题,提出含稀疏胜者全得令牌选择模块的脑对齐多流视频变换器,经实验其在精度与推理时间上表现优且鲁棒性强,脑模型相关性高,优于基线。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13569 2026-07-21 cs.CV cs.AI 版本更新 57%

GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning

GHR-VLM:通过基于视觉基础的混合推理实现零样本公交视频分析

Kaicong Huang, Weiheng Oh, Jack M. Reilly, Thomas Guggisberg, Ruimin Ke

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 研究旨在实现零样本公交视频分析,提出GHR-VLM框架,利用边缘-云设计,通过轻量级边缘监视器跟踪门状态、分割乘客片段,后端VLM经两阶段细化识别乘客与支付行为,减少云推理,评估显示其在公交支付分析中有潜力且面临视频条件挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12262 2026-07-20 cs.CV 版本更新 57%

Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously

视频流思考:VideoLLMs可以同时观看和思考

Yiran Guan, Liang Yin, Dingkang Liang, Jianzhong Ju, Zhenbo Luo, Jian Luan, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) MiLM Plus Xiaomi Inc.(小米公司)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 VST提出了一种视频流理解的新范式,通过在流式过程中激活推理,提高实时响应和理解能力,同时在多个基准测试中表现出更高的效率和泛化能力。

Comments Accepted by ECCV 2026, project page https://1ranguan.github.io/VST/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14968 2026-07-17 cs.CV 新提交 57%

Stitch-Inferencer: Enhance Endoscopic Video Segmentation and Tracking via Panoramic Reconstruction

Stitch-Inferencer:通过全景重建增强内窥镜视频分割和跟踪

Shunsuke Kikuchi, Atsushi Kouno, Hiroki Matsuzaki

机构 * Jmees Inc(Jmees公司)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 针对内窥镜视频理解中视野受限和遮挡问题,提出Stitch-Inferencer框架,用全景画布取代隐式特征记忆,跨帧拼接观察以扩大视野,让现有模型利用长程上下文,实验证明其能在保持实时性的同时提升分割和跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13792 2026-07-16 cs.CV 新提交 57%

EgoProceVQA: A Novel Egocentric Procedural Understanding Task with Self-Skill-Exploration Agent

EgoProceVQA:一种具有自我技能探索代理的新型自我中心程序理解任务

Junlong Li, Junxi Li, Yuxiang Yang, Wenbin Zou, Lap-Pui Chau, Yi Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) South China University of Technology(华南理工大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 研究针对现有自我中心视频理解评估忽视程序理解的问题,引入EgoProceVQA任务,开发EgoProceGen数据生成平台并构建基准。通过评估发现模型不足,进而提出EgoProceAgent框架,设计相关工具库,使其在多任务上获最优性能,为该任务奠定统一基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16918 2026-07-15 cs.CV cs.AI 版本更新 57%

Xray-Visual Models: Scaling Vision models on Industry Scale Data

Xray-Visual模型:在产业级数据上扩展视觉模型

Shlok Mishra, Tsung-Yu Lin, Linda Wang, Hongli Xu, Yimin Liu, Michael Hsu, Chaitanya Ahuja, Hao Yuan, Jianpeng Cheng, Hong-You Chen, Haoyuan Xu, Chao Li, Sreya Dutta Roy, Abhijeet Awasthi, Jihye Moon, Don Husa, Michael Ge, Sumedha Singla, Arkabandhu Chowdhury, Phong Dingh, Satya Narayan Shukla, Yonghuan Yang, David Jacobs, Qi Guo, Jun Xiao, Xiangjun Fan, Aashu Singh

机构 * Meta-AI MIT(麻省理工学院) University of Maryland(马里兰大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 Xray-Visual通过三阶段训练流程和LLM2CLIP技术,在产业级数据上实现高效多模态视觉模型,取得最佳性能并提升鲁棒性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08745 2026-07-10 cs.AI cs.CV 新提交 57%

AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding

自动驾驶视觉问答:以事件为中心的行车记录仪理解视觉语言模型基准测试

Siddharth Damodharan, Radhika Gupta, Ali Alshami, Ryan Rabinowitz, Jugal Kalita

机构 * University of Colorado Colorado Springs(科罗拉多大学科罗拉多斯普林斯分校) University of Michigan(密歇根大学) University of Notre Dame(圣母大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 针对评估视觉语言模型对安全关键事件推理能力的挑战,提出AUTOPILOT-VQA基准,通过围绕真实驾驶事件的结构化问题评估系统,涵盖多安全相关类别,推动向安全意识推理发展,为自动驾驶系统评估提供标准,助力相关视觉语言系统开发。

Comments CVPR Autopilot Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07320 2026-07-09 cs.CV 新提交 57%

SoccerNet 2026 Challenges Results

SoccerNet 2026挑战结果

Anthony Cioppa, Silvio Giancola, Håkan Ardö, Mohamad Dalal, Jan Held, Jérémie Ochin, Jiayuan Rao, Karen Sanchez, Renaud Vandeghen, Artur Xarles, Olivier Barnich, Albert Clapés, Mathieu Delvaux, Sergio Escalera, Bernard Ghanem, Cédric Hons, Antoine Houet, Sotiris Manitsaris, Tom Michel, Pierre Miralles, Thomas B. Moeslund, Mikael Nilsson, Bogdan Stanciulescu, Marc Van Droogenbroeck, Yanfeng Wang, Weidi Xie, Faisal Altawijri, Mohamed Atef, Semen Budennyy, Vasiliy Chelpanov, Puhua Chen, Yixin Chen, Lechao Cheng, Jianling Chu, Ju-Seong Do, Oleg Durygin, Omar Fetouh, Mirco Fuchs, Youssef Ghallab, Falguni Ghosh, Wonjun Heo, Yufeng Hu, Weixuan Huang, Phuong-Linh Huynh-Ha, Matvey Isupov, Yangguang Ji, Siyuan Jiang, Zhenxiang Jiang, Wonyong Jo, Ho-Young Jung, SeongHeon Kang, MinJae Kim, Youngseon Kim, Jakub Komosa, Artem Konshin, Trung-Hoang Le, Jongmin Lee, Lingling Li, Litao Li, Vadim Linkov, Fang Liu, Haoxuan Ma, Shun Makino, Ismail Mathkour, Konstantin Mitin, Mikhail Moiseev, Takumi Nagaya, Yuki Nakamura, Thanh-Khoi Nguyen, Hoang-Phuc Nguyen, Trong-Thuan Nguyen, Christian Orduz, Kwanyong Park, Fabian Perez, Parthsarthi Rawat, SuHyun Rim, Hoover Rueda-Chacón, Atom Scott, Minori Sugimura, Yuyang Sun, Shengeng Tang, Minh-Triet Tran, Ikuma Uchida, Juan Vanegas, Thanh-Nhan Vo, Jiangtao Wang, Yaxiong Wang, Xiaogang Wang, Ruifeng Wang, Rio Watanabe, Jiali Wen, Yongliang Wu, Di Yang, Xu Yang, Zhuo Yang, Xinyu Ye, Yibo Yu, Zihan Zhai, Yu Zhang, Zhenyu Zhao, Zhun Zhong, Yixi Zhou, Xingyu Zhu, Wenbo Zhu, Julian Ziegler

机构 * University of Liège(列日大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Spiideo(斯皮迪奥公司) Aalborg University(奥尔堡大学) SpAItial(斯帕蒂亚尔公司) Center for Robotics, Mines Paris, PSL(巴黎矿业学院机器人中心(巴黎文理研究大学)) Footovision(Footovision公司) Shanghai Jiao Tong University(上海交通大学) Universitat de Barcelona(巴塞罗那大学) Computer Vision Center(计算机视觉中心) EVS Broadcast Equipment(EVS广播设备公司) Pioneer Center for Artificial Intelligence(先锋人工智能中心) Lund University(隆德大学) TAHAKOM(TAHAKOM公司) Mohamed Bin Zayed University for Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Sber AI(Sber人工智能公司) Salute For Business(Salute For Business公司) Intelligent Perception and Image Understanding Lab, Xidian University(西安电子科技大学智能感知与图像理解实验室) South China University of Technology(华南理工大学) Hefei University of Technology(合肥工业大学) Kyungpook National University(庆北国立大学) Leipzig University of Applied Sciences(莱比锡应用科学大学) Friedrich-Alexander University Erlangen-Nuremberg(埃尔朗根-纽伦堡大学) University of Seoul(首尔大学) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院) Nanjing University(南京大学) University of Science, Ho Chi Minh City(胡志明市科技大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 SoccerNet 2026挑战涵盖五项体育视频理解视觉任务,为每项任务提供数据、协议和基线。众多团队参与,本文介绍任务、评估协议,展示排行榜并总结领先提交内容,记录各任务当前状态。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07230 2026-07-09 cs.CV 新提交 57%

`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation

用于自监督视频对象分割的注意力引导跨时间聚类

Waqas Arshid, Mohammad Awrangjeb, Alan Wee-Chung Liew, Yongsheng Gao

机构 * Griffith University(格里菲斯大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 针对视频对象分割任务,现有自监督方法存在问题。本文提出跨时间一致性和聚类框架,结合注意力引导令牌选择与轻量级时间聚类,通过显著性加权目标对齐软部分分配,利用冻结变压器主干实现有效扩展,提升自监督视频对象分割性能。

Comments Accepted for publication in Machine Intelligence Research journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05711 2026-07-09 cs.CV 版本更新 57%

From My View to Yours: Learning Egocentric Cues from Exocentric Video using Privileged Egocentric Supervision

从我的视角到你的视角:利用特权自我中心监督从外中心视频中学习自我中心线索

Dominick Reilly, Manish Kumar Govind, Le Xue, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Elorian AI

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 研究针对视觉语言模型难以从外中心视频推断自我中心属性的问题,提出Ego2ExoVLM框架,利用时间同步视频对及特权监督,通过两个组件实现此能力,在多任务评估中取得领先性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05093 2026-07-08 cs.CV 新提交 57%

Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing

通过多尺度卷积和动态路由实现下一代网络的语义视频通信

Gengtian Shi, Jinze Yu, Chenhao Wu, Shaofei Wang, Eiji Fukuzawa, Junjie Tang, Hiroshi Onoda, Jiang Liu

机构 * Graduate School of Fundamental Science and Engineering, Waseda University(早稻田大学基础科学与工程研究生院) Generative AI Innovation Center, Amazon Web Services(亚马逊网络服务生成人工智能创新中心) Amazon(亚马逊)

专题命中 视频理解 :video-language(abstract);分类 cs.CV

AI总结 针对视频流量增长需求,提出语义视频通信框架,用多尺度时间卷积编码器捕捉运动模式,基于胶囊的动态路由机制优化关联,多任务学习统一组件,在实验中取得显著改进。

Comments Accepted at the AAAI 2026 Workshop on AI for Time Series (AI4TS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02991 2026-07-07 cs.CV 新提交 57%

GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video

GuideMe:流视频中的多域任务指导与干预

Fang Liu, Jinpeng Chen, Ke Xu, Yuhao Liu, Huankang Guan, Xudong Lu, Bo Yang, Gerhard Hancke, Rui Liu, Rynson W. H. Lau

机构 * City University of Hong Kong(香港城市大学) Huawei Research(华为研究院) University of Science and Technology of China(中国科学技术大学) Chinese University of Hong Kong(香港中文大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 构建流视频多域基准GuideMe,支持训练和评估用于闭环交互任务指导的MLLMs,设计评估框架衡量模型能力,实验发现现有MLLMs虽擅提供指令,但难识别执行错误并反馈。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02551 2026-07-07 cs.CV cs.AI 新提交 57%

DELTAVID: Enhancing Fine-Grained Spatiotemporal Perception with Cross-Video Differences

DELTAVID:利用跨视频差异增强细粒度时空感知

Yankai Yang, Yancheng Long, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Kuaishou Technology(快手科技)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 研究针对视频多模态大语言模型缺乏精确局部时空感知问题,提出DELTAVID框架,将跨视频找差异转化为可训练感知信号,还引入相关数据集,提升了跨视频差异理解性能并能迁移到通用视频理解基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10805 2026-07-07 cs.CV cs.AI cs.LG cs.RO 版本更新 57%

Learning to Visually Connect Actions and their Effects

学习在视觉上连接动作及其效果

Paritosh Parmar, Eric Peh, Basura Fernando

机构 * Institute of High-Performance Computing, Agency for Science, Technology and Research, Singapore(高性能计算研究所,科技研究局,新加坡)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 该研究引入视觉连接动作及其效果(CATE)概念,探索其动作选择和效果亲和力评估两方面,设计基线模型,发现模型在该任务中表现不佳,人类远超模型,还表明CATE可作为自监督任务学习视频表征。

Comments WACV 2025 (Two Reviewer Nominations for Best Paper Candidate; Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02504 2026-07-03 cs.CL cs.AI cs.CV 新提交 57%

Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas

推理大模型提升长篇电视剧中的说话人识别

Yuxuan Li, Lingxi Xie, Xinyue Huo, Jihao Qiu, Jiacheng Shao, Pengfei Chen, Jiannan Ge, Kaiwen Duan, Qi Tian

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出DramaSR-532K大规模基准和基于推理大模型的DramaSR-LRM方法,通过多模态工具使用聚合上下文证据,显著提升长篇电视剧中说话人识别准确率,尤其对短话语效果显著。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02425 2026-07-03 cs.CV 新提交 57%

Learning to Evolve Scenes: Reasoning about Human Activities with Scene Graphs

学习演化场景:用场景图推理人类活动

Francesca Pistilli, Simone Alberto Peirone, Giuseppe Averta

机构 * Politecnico di Torino(托斯托大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出SG-Ego标注集和GLEN模型,通过时空场景图显式建模人-环境交互的动态演化,实现活动驱动的场景变化推理与预测。

Comments Project page at https://francescapistilli.github.io/GLEN

详情

展开后加载摘要…

URL PDF HTML 收藏