Unified Video-Language Pre-training with Synchronized Audio
专题命中 其他视频模型 :video-language(title,abstract);分类 cs.CV、cs.MM
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 其他视频模型 :video-language(title,abstract);分类 cs.CV、cs.MM
专题命中 其他视频模型 :video language model(title,abstract);分类 cs.CV、cs.MM
Comments 6 pages
专题命中 其他视频模型 :video-language(title,abstract);分类 cs.CV、cs.MM
Comments Accepted by ACM MM 2023 as Oral representation
Journal ref In International Conference on Multimedia. ACM, 557--566 (2023)
AdaThinkV:面向令牌高效视频推理的自适应思维
专题命中 其他视频模型 :video reasoning(title,abstract);分类 cs.CV
AI总结 本研究提出AdaThinkV自适应视频推理框架,通过ThinkGain与VRPO解决CoT推理的令牌浪费问题,在视频推理任务中以更少令牌实现优于最强自适应基线的准确率。
STAC:用于视频推理分割的选择性时空聚合与压缩
机构 * School of EEE, Nanyang Technological University, Singapore(新加坡南洋理工大学电气与电子工程学院) ; Institute for Infocomm Research, A*STAR, Singapore(新加坡资讯通信研究院) ; VCIP, CS, Nankai University, Tianjin, China(中国天津南开大学计算机科学学院视觉计算与模式识别实验室) ; AAIS, Nankai University, Tianjin, China(中国天津南开大学人工智能学院) ; NKIARI, Shenzhen Futian, China(中国深圳福田国家知识创新工程研究院) ; Guizhou University, Guizhou, China(中国贵州大学) ; Fudan University, Shanghai, China(中国上海复旦大学)
专题命中 其他视频模型 :video reasoning(title,abstract);分类 cs.CV
AI总结 视频推理分割面临高成本问题,现有方法有局限。基于状态空间模型,STAC通过解耦的空间和时间扫描丰富特征,利用冗余进行分层压缩,在零样本流兼容设置下减少令牌、加速并超越基线。
用于视频推理的潜在视觉缓存
机构 * Tencent Youtu Lab(腾讯优图实验室) ; Tsinghua University(清华大学) ; University of Illinois at Chicago(伊利诺伊大学芝加哥分校)
专题命中 其他视频模型 :video reasoning(title,abstract);分类 cs.CV
AI总结 研究视频推理中视觉锚定衰减问题,提出潜在视频缓存Latent-VC插入解码器,通过监督对比缓存对齐等训练,在多视频基准测试中表现优于基线,能保留视觉证据提升推理。
寻找、修复、推理:视频推理中的上下文修复
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
专题命中 其他视频模型 :video reasoning(title,abstract);分类 cs.CV
AI总结 本文提出了一种上下文修复方法,通过冻结的教师模型提供最小证据补丁,帮助学生模型在保持问题不变的情况下快速定位目标区域,提升视频推理的准确性和泛化能力。
Comments 22 pages, 7 figures, 17 tables. Accepted by ICML 2026
基于几何的3D视觉标记修剪用于视频-语言模型
机构 * Beihang University(北京航空航天大学)
专题命中 其他视频模型 :video-language(title,abstract);分类 cs.CV
AI总结 本文提出Geo3DPruner框架,通过几何感知全局注意力建模跨帧相关性,并采用两阶段修剪过程,保留90%的视觉标记同时保持90%原始性能,优于现有文本引导和视觉引导修剪方法。
Comments Accepted by CVPR 2026
强化以学习,选择以推理:视频推理的双范式
机构 * National University of Defense Technology(国防科技大学) ; Sun Yat-sen University(中山大学)
专题命中 其他视频模型 :video reasoning(title,abstract);分类 cs.CV
AI总结 本文提出RLER双范式,通过强化学习生成证据并验证推理一致性,提升视频推理的可靠性和可解释性,实验表明其在多个基准上均取得最佳性能。
Comments Accepted at CVPR 2026. Camera-ready version
机构 * CASIA(中国科学院自动化研究所) ; UCAS(中国科学院自动化研究所) ; ZGCA(中钢集团自动化研究所) ; NTU(国立台湾大学)
专题命中 其他视频模型 :video reasoning(title,abstract);分类 cs.CV
Comments Preprint, Under review
机构 * Beijing Institute of Technology(北京理工大学) ; Shenzhen University(深圳大学)
专题命中 其他视频模型 :video reasoning(title,abstract);分类 cs.CV
Comments Accepted by NeurIPS 2025. Code: https://github.com/QiWang98/VideoRFT
专题命中 其他视频模型 :video-language(title,abstract);分类 cs.CV
Comments Accepted by IEEE TPAMI 2024
Journal ref [J].IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024
专题命中 其他视频模型 :video-language(title,abstract);分类 cs.CV
Comments 16 pages, 6 figures, European Conference on Computer Vision, 2020
专题命中 其他视频模型 :video-language(title,abstract);分类 cs.CV
Comments Published in ICCV 2023
专题命中 其他视频模型 :video-language(title,abstract);分类 cs.CV
Comments To appear in CVPR 2023; The code will be released at https://github.com/XudongLinthu/upgradable-multimodal-intelligence
专题命中 其他视频模型 :video-language(title,abstract);分类 cs.CV
Comments Accepted by ICLR 2023
专题命中 其他视频模型 :video-language(title,abstract);分类 cs.CV
视频-语言理解:从模型架构、模型训练和数据视角的综述
机构 * National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学)
专题命中 其他视频模型 :video-language(title,abstract)
AI总结 本文综述了视频-语言理解系统的关键任务与挑战,从模型架构、训练和数据角度总结方法,并比较性能,探讨未来研究方向。
Comments Accepted at ACL 2024 (Findings). Code is available at https://github.com/nguyentthong/video-language-understanding
专题命中 其他视频模型 :video language model(title);分类 cs.CV、eess.IV、cs.MM
GA2-CLIP:通用属性锚点用于视频-语言模型高效提示微调
机构 * Shandong Provincial Key Laboratory of New Power Distribution & Utilization Technology and Equipment, School of Electrical and Electronic Engineering, Shandong University of Technology(山东省新型电力分布与利用技术及设备重点实验室,山东理工大学电气与电子工程学院) ; School of Computer Science and Technology, Shandong University of Technology(山东理工大学计算机科学与技术学院) ; School of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) ; Pillar of Information Systems Technology and Design, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计 pillar) ; School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院)
专题命中 其他视频模型 :video-language(title);分类 cs.CV
AI总结 GA2-CLIP通过引入外部监督提示和无关视频集,优化视频任务中V-L模型的泛化性能,防止语义空间过拟合,提升模型在新类别预测上的表现。
Comments Technical Report
专题命中 其他视频模型 :video-language(title);分类 cs.CV
博物馆视频下的资源与监管约束下的目录引导多模态归因
机构 * University of Surrey(萨里大学)
专题命中 其他视频模型 :video language model(abstract);分类 cs.CV、cs.MM
AI总结 本文提出一种目录引导的多模态归因方法,用于博物馆视频内容的自动化元数据生成,以提高档案馆发现性并满足资源和监管要求。
Comments Demo video url: https://jn00767.pages.surrey.ac.uk/catalogue-grounded-multimodal-attribution-for-museum-video/
Fre-Res: 频率-残差视频令牌压缩用于高效的视频多模态大语言模型
机构 * College of Computer Science, National University of Defense Technology(计算机科学学院,国防科技大学) ; Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程谢民明伍学院,华南理工大学)
专题命中 其他视频模型 :video reasoning(abstract);分类 cs.CV
AI总结 Fre-Res通过分离空间和时间信息,实现视频令牌压缩,在保持细节精度的同时提升效率,适用于短时事件和长视频推理。
Comments 24 pages, 5 figures
MACD:基于反事实数据的模型感知对比解码
机构 * University of Michigan, Ann Arbor, MI, USA(密歇根大学,安娜堡分校) ; University of California San Diego, La Jolla, CA, USA(加州大学圣地亚哥分校)
专题命中 其他视频模型 :video language model(abstract);分类 cs.CV
AI总结 提出MACD方法,利用视频语言模型自身反馈识别导致幻觉的目标区域,生成目标级反事实输入,结合对比解码减少幻觉,提升多模型在复杂场景下的准确性。
面向不完整多模态输入的统一视觉-语言模型
机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) ; Nanyang Technological University, Singapore(新加坡南洋理工大学) ; University College London(伦敦大学学院) ; Guangzhou University(广州大学) ; Wuhan University(武汉大学) ; Nanjing University(南京大学)
专题命中 其他视频模型 :video-language(abstract);分类 cs.CV
AI总结 针对视频-语言模型在传感器失效导致模态不完整数据下的训练-测试不一致问题,提出首个统一的不完整视频-语言模型作为即插即用模块,提升多模态任务性能。
Comments Published in AAAI 2026
SteerSeg: 基于注意力引导的视频分割
机构 * Macquarie University(麦考瑞大学) ; York University(约克大学) ; CSIRO Data61(CSIRO数据61) ; UTS(UTS大学)
专题命中 其他视频模型 :video reasoning(abstract);分类 cs.CV
AI总结 SteerSeg通过输入级条件引导解决注意力对齐问题,结合可学习软提示和推理引导的CoT提示,提升视频分割的时空定位能力。
Comments Project page: https://steerseg.github.io
MM-TS: 多模态温度和边距调度用于长尾数据的对比学习
机构 * University of Bonn(波恩大学) ; MPI for Informatics, SIC(信息研究所) ; Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学) ; MIT-IBM Watson AI Lab(麻省理工-IBM Watson人工智能实验室)
专题命中 其他视频模型 :video-language(abstract);分类 cs.CV
AI总结 MM-TS通过动态温度和边距调度提升多模态对比学习在长尾数据上的性能,实现InfoNCE和最大边距方法的统一。
Comments 18 pages, 11 figures. Accepted at WACV 2026
DeepVideo-R1: 通过难度感知的回归GRPO实现视频强化微调
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) ; Korea University(韩国大学)
专题命中 其他视频模型 :video reasoning(abstract);分类 cs.CV
AI总结 DeepVideo-R1通过回归GRPO和难度感知数据增强,提升视频大语言模型的推理能力。
Comments NeurIPS 2025
在跨模态冲突下分析大型多模态模型的推理一致性
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Peng Cheng Laboratory(鹏城实验室) ; National University of Singapore(新加坡国立大学)
专题命中 其他视频模型 :video reasoning(abstract);分类 cs.CV
AI总结 本文提出逻辑图扰动协议,通过主动视觉上下文细化方法,解决大型多模态模型在跨模态冲突下的推理一致性问题,提升推理鲁棒性。
Comments 10 pages, 5 figures
VideoSeg-R1: 通过强化学习进行视频对象分割的推理
专题命中 其他视频模型 :video reasoning(abstract);分类 cs.CV
AI总结 VideoSeg-R1通过引入强化学习,首次实现了视频对象分割的推理任务,采用解耦架构和显式推理链提升效率与准确性。