Decompose the Sounds and Pixels, Recompose the Events
专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted at AAAI 2022
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted at AAAI 2022
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accept at TCSVT
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments accepted for publication as a REGULAR paper in the IEEE Transactions on Multimedia
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 27 pages, 5 figures, 19 tables. To be published in the 34th conference on Neural Information Processing Systems (NeurIPS 2020). The first two authors contributed equally to this work
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments EMNLP 2020 (17 pages)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 12 pages
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted to CVPR2020
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments EMNLP 2018 (14 pages) (fixed Table5 typo in v2)
专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Published in ECCV 2018; Project Page: http://vision.cs.utexas.edu/projects/separating_object_sounds/
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments EMNLP 2015
Journal ref Conference on Empirical Methods in Natural Language Processing (EMNLP), 2015, pages 1477--1487
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments To appear in CVPR 2014
无交互行动:通过接触-释放检测探测视频LMMs的物理基础
机构 * Weizmann Institute of Science(魏茨曼科学研究所) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI;multimodal(journal_ref)
AI总结 研究探讨了视频LMMs在实际视觉输入中语义理解的深度,通过接触-释放检测发现模型在物理基础方面的不足。
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026 workshop on Cognitive Foundations for Multimodal Models (CogVL)
依意图行动:为视觉-语言-动作模型提炼行为意图
机构 * POSTECH(浦项科技大学) ; GSAI, POSTECH(浦项科技大学人工智能学院) ; IME, POSTECH(浦项科技大学工程学院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文针对视觉-语言-动作(VLA)模型动作解码器未明确行为语义目标的问题,提出INDI方法提炼行为级意图,在多个基准及真实任务中显著提升了GR00T-N1.7的性能。
Comments Project page: https://leesangoh.github.io/indi-project-page/
超越视频:统一视频推理与深度研究的开放世界视频智能体
机构 * Shandong University(山东大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beihang University(北京航空航天大学) ; City University of Hong Kong(香港城市大学) ; Nanyang Technological University(南洋理工大学) ; Kuaishou Technology(快手科技) ; Southern University of Science and Technology(南方科技大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出统一视频推理与深度研究的VideoRover框架,构建相关数据集与基准,其8B-RL模型在无工具直接回答场景性能接近专有模型,优于同工具套件的更大开源模型。
打造更安全的社交媒体平台:基于大语言模型的可扩展且高效的少样本有害内容审核
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 针对社交媒体有害内容审核的可扩展性与动态性不足问题,研究人员利用大语言模型通过上下文学习提出少样本审核方法,实验显示其优于现有基线与少样本方法,纳入视觉信息可提升性能,为线上审核提供新方案。
Comments Accepted to ICWSM 2027 Main Conference
TTSD-FAR:用于大视频语言模型中缺失模态情感识别的带Fisher锚定恢复的测试时自蒸馏
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对大视频语言模型测试时的模态缺失问题,提出带Fisher锚定恢复的测试时自蒸馏框架,在多数据集模态缺失场景下性能优于基线方法且保持稳定。
AVA-Encoder:面向智能体原生的视频表示学习
机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) ; ShanghaiTech University(上海科技大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Institute of Computing Technology(中国科学院计算技术研究所) ; Southeast University(东南大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 针对创意智能体缺乏从高质量电影学习的有效方式的问题,提出AVA-Encoder框架,其视频表示经重构优化后,在相关基准上性能优于现有方法,还发布了配套框架、基准及数据集。
VideoGAIA:面向通用人工智能助手的智能体视频理解基准
机构 * The Chinese University of Hong Kong(香港中文大学) ; Ant Group(蚂蚁集团) ; Tsinghua University(清华大学) ; Tongji University(同济大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 VideoGAIA是面向通用AI助手的智能体视频理解基准,构建多轮工具增强交互任务,现有MLLMs在其上准确率不足60%,可评估下一代模型并推动相关转型。
追踪真相:面向视频大语言模型的物体感知时空监控
机构 * National University of Singapore(新加坡国立大学) ; VinUniversity(文大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出STEMO-Bench基准测试,通过分解查询验证时空监控能力,改进视频大语言模型的时空推理一致性。
Comments The authors are withdrawing this manuscript due to errors identified in the experimental evaluation and result aggregation, which affect several reported quantitative results and some conclusions. These issues require substantial re-evaluation of the experiments and analysis
层次间推理:通过层选择性融合恢复视频-语言模型中的时间推理
机构 * National University of Singapore(新加坡国立大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 本文提出MERIT框架,通过层选择性融合提升视频-语言模型的时间推理能力,同时保持时间感知能力,优于全模型融合和随机层选择。
EgoMonth:面向长期时空记忆的月级自我中心视频基准
机构 * Nanjing University(南京大学) ; Huawei Technologies Co., Ltd.(华为技术有限公司) ; Tianjin University(天津大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究人员推出首个月级自我中心视频基准EgoMonth,评估发现当前主流MLLMs的长期时空记忆能力远逊于人类,仅为有损总结器而非忠实记忆器。
Comments 21 pages, 4 figures, 6 tables, including appendices
扫视、审视与思考:将视频异常检测从无训练推进到智能体推理
机构 * Beijing Jiaotong University(北京交通大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对视频异常检测的“何时-何事”脱节问题,提出无训练框架GtS及工具增强型智能体方法,扩展基准并引入联合评估指标,实现了更高的异常检测准确性与推理速度。
Comments 34 pages, 8 figures, 8 tables. Journal extension of our AAAI 2026 paper (arXiv:2507.21507)
StreamFlow:用于流视频理解的动态内存流
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 StreamFlow是一种动态视觉内存框架,通过中期内存过滤冗余、长期内存整合潜变量及注意力检索,在流视频理解任务中实现最优性能,同时提升视觉依据性并降低延迟与内存。
基于几何知识蒸馏的时序锚定组合式相机运动理解
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Tencent(腾讯)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出CamDistill方法,通过几何知识蒸馏实现时序锚定的组合式相机运动理解,推出含4229个片段的CamChoreo基准,提升了相机运动识别的细粒度与效率。
顺序很重要:LVLMs作为图像序列时间推理的评判者
机构 * University of Bologna(博洛尼亚大学) ; NOVA School of Science and Technology(NOVA科技学院) ; NOVA Laboratory for Computer Science and Informatics(NOVA计算机科学与信息实验室)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 本研究发现大视觉语言模型(LVLMs)作为多模态评判者存在时间顺序判别缺陷,受首因、近因等结构性偏差影响,呼吁构建时间感知的视觉序列评估范式。
Comments 34 pages, camera-ready
REVEAL:用于长视频问答的基于 rubric(评分标准)的显式证据充分性验证智能体
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对长视频问答中现有方法割裂事件、忽略证据充分性的问题,提出REVEAL框架,通过自适应分块的结构化记忆与rubric引导的证据验证,实现更可靠的推理且性能优于现有SOTA方法。
你的视觉语言模型(VLM)已经知道时间:通过提问“是/否”实现无需训练的时间定位
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM
AI总结 针对VLM时间定位任务的自信错误问题,提出无需训练的FV-Action方法,通过从粗到细的二元问题扫描替代时间戳回归,在多个基准数据集上大幅提升了时间定位性能。
EgoBrain:协同心智与视觉以实现人类行为理解
机构 * The University of Tokyo(东京大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究人员构建了全球首个同步脑电与第一人称视觉的大规模多模态数据集EgoBrain,开发多模态学习框架实现行为理解,跨参与者与环境验证达66.70%准确率,为脑机接口研究提供新范式。
Comments Accepted to ICLR 2026. Camera-ready version. Project page: https://lin-nie.github.io/EgoBrain/
TransSLR:用于手语识别的轻量级Transformer
机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对CASL手语识别的低准确率问题,提出轻量级Transformer模型TransSLR,在CASL-W60基准上取得80.39%的最新准确率,且计算开销低,适用于资源受限环境。
Comments This paper has been accepted for oral presentation at Deep Learning Indaba 2026 which will be hosted on the IJCAI hosting platform. paper link: https://chairingtool.com/conferences/dli2026/main-track/submissions/356