OVC-Net: Object-Oriented Video Captioning with Temporal Graph and Detail Enhancement
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments EMNLP 2017
专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
专题命中 视频多模态 :multi-modal(abstract,comments);分类 cs.CV、cs.AI、cs.MM
Comments Keywords: Multi-Modal Neural Networks, Deep Learning, Large Language Models, Depression Diagnosis, Biomedical Informatics, DAIC-WOZ
HT-Bench:基于自我中心视觉的灵巧全手触觉表示基准与学习
机构 * Beihang University(北航) ; Rimbot ; BUPT(北邮) ; ShanghaiTech University(上海科技大学) ; Tsinghua University(清华大学) ; CAS(中国科学院)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)
AI总结 提出HT-Bench多任务基准和HandTouch编码器,通过大规模自我中心视觉与全手触觉数据,在触觉相似性检索、掩码修复、视觉到触觉合成等任务上验证了触觉表示的有效性。
Comments 9pages, 4figures
EgoMemReason:一种基于记忆的推理基准,用于长时间的以自身为中心的视频理解
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; NTU Singapore(新加坡国立大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 EgoMemReason通过记忆驱动推理评估一周的自身中心视频理解,包含500个问题和六个核心挑战,揭示长时间记忆仍面临挑战。
Comments Accepted by COLM2026. The first two authors contributed equally. Project website: https://egomemreason.github.io/
EEG2MOTION:面向基于无创脑信号的开放词汇人体动作合成
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)
AI总结 研究人员推出首个EEG-动作-文本数据集EEG2MOTION,提出EEG条件掩码动作模型EMMM,实现从无创脑信号生成多样连贯的全身体人体动作,为生成式开放词汇运动BCI开辟新方向。
深度思维对齐:面向视频推理的轨迹级潜在知识蒸馏
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 针对视频推理LMMs的高计算成本问题,提出Latent-OPD方法,通过轨迹级潜在知识蒸馏与渐进式教师前瞻策略提升轻量模型性能,在6个基准上优于仅输出监督的OPD。
MobileMem:从一年的移动体验中学习
机构 * OPPO ; OpenKG
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM
AI总结 该研究推出MobileMem基准与框架,基于一年移动体验构建,用于设备端长期记忆研究,支持多类推理,推动智能体从信息检索向体验智能发展。
Comments Technical Report; Project Page: http://mobilemem.openkg.cn/
从提示到路面通过时间:代理场景到计划推理中的时间定位
机构 * Computer Science & Engineering Department, German University in Cairo (GUC), Egypt(德国亚历山大大学(GUC)计算机科学与工程系,埃及) ; C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt(认知驾驶系统实验室,埃及开罗,C-DRiVeS) ; M.Eng. Robotics Candidate at Deggendorf Institute of Technology, Germany(德国德格多夫技术学院机器人硕士候选人) ; IAV GmbH, Berlin, Germany(德国柏林IAV GmbH公司)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本研究探讨了在代理间通信中引入时间条件是否能保持或增强推理的一致性,而不会降低语义或逻辑一致性,并通过BDD-X数据集的curated子集评估了三种具有递增时间整合的规划器架构。结果表明,时间条件改变了推理风格,但并未在标准NLP正确性指标上产生统计显著改进,但定性分析揭示了预测危险推理、稳定纠正行为和战略分歧。
面向专家级的实时视频问诊医疗AI
机构 * Google Research(谷歌研究院) ; Google DeepMind(谷歌DeepMind)
专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本研究开发了基于Gemini的多智能体系统AMIE(视频版),在随机OSCE研究中其临床问诊表现与初级保健医生相当或更优,为专家级实时视频问诊医疗AI的发展奠定了重要基础。
BioKD:通过可靠性门实现面向情感识别的选择性生理信号到视频的知识蒸馏
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; New York University(纽约大学)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)
AI总结 本文提出BioKD框架,以生理信号为训练特权信息指导视频学生模型,通过可靠性门控抑制负迁移,在DEAP、AMIGOS数据集上的情感识别任务中优于基线,且推理无额外开销。
一种混合确定性框架用于广播新闻视频中的命名实体提取
机构 * Dept. of Artificial Intelligence University of Malta Msida, Malta(人工智能系 马耳他大学 Msida)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本文提出一种混合确定性框架,用于自动提取广播新闻视频中的个人姓名,通过可解释的模块化管道实现高精度和可追溯性,适用于新闻媒体信息提取任务。
Comments 7 pages, 5 figures. Accepted for publication at the 2026 IEEE Conference on Artificial Intelligence (CAI)
Journal ref 2026 IEEE Conference on Artificial Intelligence (CAI), 2026, pp. 1134-1139
VisTR:将可视化作为时间序列表推理的表示
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)
AI总结 针对时间序列表推理难题,VisTR框架以可视化核心,利用其连接数据与认知,通过多模态大语言模型对齐输入,集成机制处理大数据,实现交互式可视化,经评估和案例验证了其在时间序列推理任务中的有效性和适用性。
Comments 15 pages, 10 figures
视频中的思考:视频生成器真的能对现实世界进行推理吗?
机构 * Central South University(中南大学) ; Tencent(腾讯) ; Tsinghua University(清华大学)
专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 探讨视频生成器能否对现实世界推理,引入因果生成双判断(CGDJ)评估,发现开源模型无明确因果感知却有合理动态,先进闭源系统推理与生成一致性有限,还揭示了视听失调问题。
VIGIL:通过门控间歇似然性进行连续生物特征认证的身份验证
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract)
AI总结 针对连续多模态认证中现有技术在低信号强度下难以区分真实用户与攻击者的问题,提出VIGIL框架,通过可配置跨模态融合、改进时间融合及采用三区验证决策模型等方法,有效解决现有局限并减少入侵检测时间。
Comments 16 pages, 6 figures, Supplementary Material Included
移动-然后-操作:用于类人机器人操作的行为相位
机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou, China.(杭州高等研究院,中国科学院大学,中国杭州) ; University of Science and Technology of China, Hefei, China.(中国科学技术大学,中国合肥) ; School of Aritificial intelligence, Institute of Artificial Intelligence, University of Science and Technology Beijing, Beijing, China(人工智能学院,人工智能研究院,北京科技大学,中国北京)
专题命中 视频多模态 :MLLM(abstract,abstract_cn)
AI总结 本文提出Move-Then-Operate框架,将机器人操作分为粗略移动和接触关键交互两个阶段,通过双专家策略提升操作精度与效率。
Comments 15 pages, 10 figures
InCoM:基于意图的感知与结构化协调用于移动操作
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) ; AnyverseDynamics
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)
AI总结 InCoM通过意图驱动的感知和结构化协调框架,解决移动操作中基座与机械臂动作耦合及感知注意力分配问题,提升任务成功率。
让动力学流动:稳定的流匹配动力系统
机构 * Department of Robotics, Perception, and Learning, KTH Royal Institute of Technology(机器人、感知与学习系,皇家理工学院) ; Advanced Mining Technology Center (AMTC) and Department of Electrical Engineering, Universidad de Chile(先进采矿技术中心(AMTC)和电气工程系,智利大学) ; Bosch Center for Artificial Intelligence, Renningen, Germany(博世人工智能中心,德国Renningen) ; Italian Institute of Artificial Intelligence (AI4I), Turin, Italy(意大利人工智能研究所(AI4I),意大利都灵)
专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract)
AI总结 提出稳定流匹配动力系统(SFMDS)框架,通过流匹配参数化动力系统并施加李雅普诺夫稳定性约束,实现稳定、可扩展、多模态的机器人运动生成。
DynaVieW:用于理解分层视觉动态的模式引导世界建模
机构 * EPFL, Switzerland(瑞士联邦理工学院) ; Harvard University(哈佛大学) ; Sony Group Corporation(索尼集团) ; ETH Zurich, Switzerland(瑞士苏黎世联邦理工学院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 针对多模态语言模型难以系统建模视频视觉场景时间演变的问题,提出DynaVieW模型,通过学习交错状态转换序列理解视觉动态,在多架构下联合建模,提升下游视觉叙事创作等任务表现。
Comments ICML 2026
荷马:通过分层记忆和智能推理理解长视频
机构 * Soochow University(苏州大学) ; Tencent Hunyuan Multimodal Department(腾讯混元多模态部)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究长视频理解问题,提出荷马分层在线记忆探索与推理框架,其记忆反映视频多尺度结构,智能推理器按人类方式探索记忆,通过多轮检索组合答案,性能优于此前最佳方法。
Comments under review
SpikeVLA:基于脉冲神经网络的视觉-语言-动作模型
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract)
AI总结 提出SpikeVLA,一种脉冲VLA架构,通过事件驱动稀疏计算降低能耗,在导航和机器人控制任务中保持竞争力,适用于低功耗实时具身智能。
Comments Accepted by ICML 2026. 16 pages, 9 figures
Journal ref Proceedings of the 43rd International Conference on Machine Learning, 2026
MemDreamer: 通过分层图记忆和智能体检索机制解耦感知与推理以实现长视频理解
机构 * Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学) ; Central South University(中南大学) ; HKUST(GZ)(香港科技大学(广州))
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出MemDreamer框架,通过分层图记忆和智能体检索机制解耦感知与推理,将长视频理解转化为智能体探索过程,在四个基准上达到SOTA,推理上下文窗口仅占全量2%且准确率提升12.5点。
立场:感知之后推理意味着无视觉推理
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; National University of Singapore(新加坡国立大学) ; Zhongguancun Academy(中关村学院) ; Nanjing University(南京大学) ; Nankai University(南开大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文质疑多模态研究中语言推理能弥补视觉缺陷的假设,提出“感知-推理”范式导致视觉推理退化为文本空间推理,并通过图灵眼测试验证文本推理无法修复感知失败,主张转向感知内的推理。
当没有正确答案时:诊断视频理解中多模态大语言模型的缺失答案检测
机构 * Duke University(杜克大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究多模态大语言模型在视频理解中检测缺失答案的能力,发现模型倾向于选择干扰项而非识别无正确答案,时间推理任务中问题更严重,链式思维提示虽提升检测率但仍不理想。
Comments Under review
LongSpace: 从感知到回忆的视频长程空间记忆探索
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Zhongguancun Academy(中关村学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; The Chinese University of Hong Kong(香港中文大学) ; Xi’an Jiaotong University(西安交通大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 针对长视频中空间记忆的挑战,提出LongSpace框架,通过分块建模、3D结构线索注入和层级感知记忆实现长程空间推理,并在LongSpace-Bench等基准上验证其有效性。
AdaCodec: 面向视频多模态大语言模型的预测性视觉编码
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; JD.com(京东公司)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 针对视频帧间冗余问题,提出预测性视觉编码AdaCodec,通过条件预测代价决定是否发送完整参考帧或紧凑P-令牌,在匹配视觉令牌预算下提升性能,并大幅降低首令牌延迟。
Comments 23 pages
APB-V: 通过序列并行感知的近似注意力加速长视频理解
机构 * NLP Group, DCST, IAI, BNRIST, Tsinghua University, Beijing, China(清华大学北京校区自然语言处理组、国防科技大学、人工智能研究院、北京理工大学、清华大学) ; Department of CS&T, Central South University, Changsha, China(中南大学计算机与技术系,长沙,中国) ; BUPT, Beijing, China(北京邮电大学,北京,中国) ; Pattern Recognition Center, WeChat AI, Tencent Inc.(腾讯公司微信人工智能研究院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出APB-V,一种序列并行框架,通过分布式近似注意力在多GPU上加速长视频推理,显著提升速度且不损失性能。
Comments ACL 2026 main
STaT: 通过三模态协同解决非平稳时间序列中的形状失真
机构 * Hefei University of Technology(合肥工业大学)
专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract)
AI总结 提出STaT多模态架构,通过符号-时间-文本三模态对齐,在降低平均误差的同时减少形状失真,在8个基准上提升幅度指标达8.9%并降低形状失真达8.5%。
PhysBrain 1.0 技术报告
机构 * PhysBrain Team(PhysBrain团队)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 PhysBrain 1.0 通过将大规模人类自体视频转化为结构化的物理常识监督,提升机器人适应能力,在多模态问答和具身控制基准测试中取得SOTA结果,尤其在SimplerEnv中表现突出。
Comments Project Page: https://phys-brain.github.io