A Nonparametric Model for Multimodal Collaborative Activities Summarization
专题命中 视频多模态 :multimodal(title);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :multimodal(title);分类 cs.CV
专题命中 视频多模态 :multimodal(title);分类 cs.CV
Comments Total of 17 pages: 1-12 (body), 13-16 (result figures), and 17(references) Number of figures: 21
专题命中 视频多模态 :multi-modal(title);分类 cs.CV
Comments 10 pages
专题命中 视频多模态 :multimodal(title);分类 cs.CV
专题命中 视频多模态 :multimodal(title);分类 cs.CV
专题命中 视频多模态 :multi-modal(title);分类 cs.AI
DIMOS: 解耦实例级运动目标分割
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出双解耦特征提取框架分离图像与事件模态的外观和运动信息,并通过多粒度跨模态对齐实现有效融合,在运动实例分割任务中尤其对快速运动和低光下的小目标取得最优性能。
我在视频中寻找你:面向以人为中心的视频推理的身份条件查询
机构 * Beijing Jiaotong University(北京交通大学) ; HUJING Digital Media & Entertainment Group(汇晶数字媒体与娱乐集团) ; MAIS Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 该研究提出了身份条件查询(ICQ)任务,构建了ISYV基准、训练集与框架,实验显示主流多模态大语言模型在该任务上表现不佳,ISYV模型性能优于强基线且接近闭源模型。
Comments Accepted to ACM Multimedia 2026 (MM '26). 6 figures, 5 tables
ViSAGE:为长视频理解构建自修正记忆
机构 * Zhejiang University(浙江大学) ; Xidian University(西安电子科技大学)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 ViSAGE是一种多模态智能体记忆框架,通过跨模态绑定、双向记忆精调及多智能体交叉验证解决长视频理解中的实体混淆等问题,较最强基线准确率提升5.9%。
Comments Accept by ACMMM 2026
Ouroboros-Spatial:闭环数据-模型循环的空间推理
机构 * Peking University(北京大学) ; Ant International(蚂蚁国际) ; The University of Hong Kong(香港大学)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 提出Ouroboros-Spatial自演化框架,通过提议器与求解器闭环交互,动态生成与模型能力匹配的训练样本,在六个空间推理基准上以十分之一数据量显著提升Qwen3-VL性能。
VideoAgent: 视频理解与编辑的全能框架
机构 * South China University of Technology(华南理工大学) ; The University of Hong Kong(香港大学) ; Snap Inc(Snap公司) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出VideoAgent,一种基于多智能体编排的全能框架,通过自动镜头创建和30多个专业编辑智能体,解决现有系统在长视频理解和多样化编辑操作上的局限,在VideoEdit基准上实现87-95%编排成功率并降低60% API成本。
Comments Preprint. Code available at https://github.com/HKUDS/VideoAgent
增强工具的时空推理用于视频问答任务的优化
机构 * BNRist, Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系,北京信息科学与技术国家研究中心)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 本文提出STAR框架和视频工具包,提升多模态大语言模型的时空推理能力,在VideoMME和LongVideoBench上分别提升8.2%和4.6%。
Comments Accepted by NeurIPS 2025 main track
现代视频大语言模型需要听觉吗?基准审计与可扩展补救措施
机构 * NAVER Cloud AI(NAVER云AI) ; KAIST AI(韩国国立庆北大学AI)
专题命中 视频多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM
AI总结 通过审计10个视频基准发现多数任务仅凭视觉即可解决,音频未被充分利用;提出在LLaVA-OneVision上附加语音/音频编码器,采用25倍令牌压缩,实验证明音频在需要语音理解或跨模态对齐的任务上带来显著提升。
Comments Accepted to Interspeech 2026
PhotoCraft: 具有层次自进化记忆的深度图像搜索代理推理
机构 * Pattern Recognition Center, WeChat AI, Tencent Inc.(微信AI模式识别中心,腾讯公司) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Zhongguancun Academy(中关村学院) ; Nanyang Technological University(南洋理工大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CL、cs.AI
AI总结 提出PhotoCraft,一种无需训练的分层记忆系统,通过工作、情景和语义记忆增强多模态大语言模型,实现深度图像搜索中的多步推理和知识迁移,在DISBench上提升检索性能达18.5%。
RoboTrustBench:机器人操作视频世界模型的可信度基准测试
机构 * Singapore Management University(新加坡国立管理学院) ; Fudan University(复旦大学) ; Princeton University(普林斯顿大学)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL
AI总结 针对视频世界模型在机器人操作中的可信度问题,提出RoboTrustBench基准,包含正常、约束敏感、反事实和对抗四种场景,通过专家验证的指令-图像对和六维评估协议,发现当前模型在约束推理、反事实基础、物理交互和不安全指令抑制方面存在不足。
Comments Project: https://huiqiongli.github.io/RoboTrustBench/
挖掘多模态时空线索用于视频重要人物识别
机构 * School of Computer Science and Technology, Wuhan University of Science and Technology(武汉科技大学计算机科学与技术学院) ; Hubei Province Key Laboratory of Intelligent Information Processing and Real-time Industrial System, Wuhan University of Science and Technology(湖北省智能信息处理与实时工业系统重点实验室) ; School of Computer Science, National Engineering Research Center for Multimedia Software, Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University(计算机科学学院,国家多媒体软件工程技术研究中心,湖北省多媒体与网络通信工程重点实验室,武汉大学) ; College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 针对视频中人物重要性随时间变化的问题,提出VIP-Net框架,通过多模态时空线索融合与时间重要性矫正,在Temporal-VIP数据集上达到67.3%准确率。
RMPL:基于关系感知的多任务渐进学习与分阶段训练的多媒体事件抽取
机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
AI总结 提出RMPL框架,通过分阶段训练结合单模态事件抽取和多模态关系抽取的异构监督,在低资源条件下实现多媒体事件抽取,并在M2E2基准上取得一致改进。
Comments Accepted by ACM ICMR 2026
See What I Mean: 对齐视觉与语言表示以实现视频细粒度物体理解
机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) ; Tongyi Lab, Alibaba Group(阿里云实验室) ; NKIARI, Shenzhen Futian(深圳福田国家信息研究所)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出SWIM方法,通过对齐视觉和语言表示,仅从文本提示中实现细粒度物体理解,解决了传统方法需要显式视觉提示的问题,通过构建NL-Refer数据集和多层交叉注意力图提升文本-视觉对齐性能。
Journal ref CVPR 2026
视觉代理记忆:通过在线索引、分层记忆和代理检索实现在线长视频理解
机构 * University College London(伦敦大学学院)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 本文提出视觉代理记忆框架,通过在线索引、分层记忆和代理检索实现长视频理解,实验显示其在OVO-Bench和MM-Lifelong数据集上均取得优异成绩。
ReTool-Video:具有元增强工具定位的递归工具使用视频代理
机构 * Chongqing University(重庆大学) ; Tianjin University(天津大学) ; MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院MAIS) ; Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局高性能计算研究所) ; Chongqing National Data AI Research Institute, AI Research Lab(重庆国家数据AI研究院,AI研究实验室)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出ReTool-Video,通过构建元增强视频工具库和递归工具使用方法,提升视频理解的稳定性和效果,实验表明其在多个基准测试中优于现有方法。
VideoSEAL: 通过解耦答案权威性来缓解代理长视频理解中的证据错位
机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 本文提出VideoSEAL框架,通过解耦规划与答案权威性,解决长视频理解中证据错位问题,提升回答准确性和证据对齐度,实验结果显示在多个基准上表现优异。
Comments Accepted to ICML 2026. 33 pages, 13 figures. Code and models are available at https://github.com/Echochef/VideoSEAL
跨模态、跨时间:结构化记忆用于超长代理视频推理
机构 * University of Connecticut(康涅狄格大学) ; Northwestern University(西北大学) ; University of Virginia(弗吉尼亚大学)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出MAGIC-Video框架,通过多模态记忆图和交织叙事链,实现超长视频的跨模态检索与长时序推理,优于现有基线模型。
当文本劫持视觉:基准测试与减轻文本叠加引起的视觉语言模型幻觉
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; University of Birmingham(伯明翰大学)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出VisualTextTrap基准测试,通过大规模人工验证样本和定制评估指标,减轻文本叠加引起的幻觉问题,并提出VTHM-MoE框架以提升视觉-文本解耦能力。
事件自适应状态转移与门控融合用于RGB-事件对象跟踪
机构 * Dalian University of Technology(大连理工大学)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出MambaTrack框架,通过动态状态空间模型解决RGB-事件跟踪中静态状态转移矩阵导致的跨模态融合鲁棒性下降问题,引入事件自适应状态转移和门控投影融合模块,提升稀疏与密集事件流的建模能力。
HumanVBench: 通过自动合成基准测试探测多模态大语言模型中的以人为本的视频理解
机构 * Sun Yat-Sen University(中山大学) ; Alibaba Group(阿里巴巴集团) ; Peng Cheng Laboratory(鹏城实验室) ; Guangdong Provincial Key Laboratory of Fire Science and Intelligent Emergency Technology(广东省消防科学与智能应急技术重点实验室)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出HumanVBench,一个针对多模态大语言模型(MLLMs)中以人为本的视频理解能力的综合基准测试,通过自动化流程生成高质量视频注释和挑战性问题,揭示30个领先MLLMs在感知细微情绪和对齐语音与视觉线索方面的不足。
Comments Accepted as a conference paper at CVPR 2026
基于全局视频上下文的视频引导机器翻译
机构 * Shenzhen University(深圳大学) ; Shenzhen Technology University(深圳技术大学)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
AI总结 本文提出一种全局视频引导的多模态翻译框架,通过预训练语义编码器和向量数据库实现视频片段与字幕的语义关联,结合注意力机制提升翻译效果,在大规模纪录片数据集上验证了其在长视频场景中的有效性。
GazeQwen: 轻量级 gaze-条件 LLM 调制用于流视频理解
机构 * University of Arkansas(阿肯色大学) ; University of Houston(休斯顿大学)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 GazeQwen 通过隐藏状态调制使开源 MLLM 获得 gaze 意识,采用紧凑的 gaze resampler 和可选 LoRA 调整,在 StreamGaze 基准上达到 63.9% 准确率,优于其他模型。
VTAM:用于复杂物理交互的视频-触觉-动作模型超越VLAs
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Stanford University(斯坦福大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 VTAM通过整合触觉感知提升复杂物理交互的稳定性,其多模态框架在接触密集任务中表现优异,成功率达到90%。
Leum-VL 技术报告
机构 * Hainan Sihe Data Technology Co., Ltd.(海南世和数据技术有限公司)
专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.AI、cs.MM
AI总结 本文提出SV6D框架,通过六维结构化表示解析视频内容,构建Leum-VL-8B模型,在多个基准测试中取得优异成绩,强调视频AI需关注结构表示而非像素生成。
Comments 27 pages, 5 figures
基于合成监督的学习问题感知关键帧选择用于视频问答
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种问题感知的关键帧选择框架,通过伪关键帧标签和覆盖正则化提升视频问答的准确率,尤其在时间与因果问题上表现突出。