UNeMo: Collaborative Visual-Language Reasoning and Navigation via a Multimodal World Model
UNeMo:通过多模态世界模型实现协作的视觉-语言推理与导航
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 UNeMo通过多模态世界模型实现视觉-语言推理与导航的协作优化,提升导航准确率。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
UNeMo:通过多模态世界模型实现协作的视觉-语言推理与导航
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 UNeMo通过多模态世界模型实现视觉-语言推理与导航的协作优化,提升导航准确率。
弱到强:基于VLM的伪标签作为多模态视频隐藏情绪理解任务中的弱监督训练策略
机构 * The University of New South Wales, Sydney, New South Wales, Australia(新南威尔士大学) ; The University of Sydney, Sydney, New South Wales, Australia(悉尼大学) ; School of Software and Microelectronics, Peking University, Zibo, Shandong, China(北京大学软件与微电子学院) ; Shandong University of Technology, Beijing, China(山东理工大学)
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出基于VLM的伪标签弱监督方法,用于多模态视频隐藏情绪识别,提升准确率至0.69并建立新基准。
TiFRe: 基于文本的视频帧减少用于高效视频多模态大语言模型
机构 * Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学)
专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV
AI总结 TiFRe通过文本引导的帧采样和帧匹配机制,有效减少视频输入帧数,同时保留关键信息,提升视频多模态大语言模型的效率和性能。
具有门控注意力和可学习采样的状态空间分层压缩用于大多模态模型中的小时级视频理解
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出了一种基于状态空间模型和门控注意力的高效压缩方法,用于减少大模型中小时级视频的token消耗,同时保持性能。
Comments AAAI 2026 (Oral). Project page: https://github.com/naver-ai/mambamia
面向长时程机器人操作的多模态动作消歧的轨迹聚焦扩散策略
机构 * MARS Lab, Nanyang Technological University(MARS实验室,南洋理工大学)
专题命中 视频多模态 :multi-modal(title,abstract)
AI总结 TF-DP通过轨迹聚焦解决长时程机器人操作中的多模态动作模糊问题,提升时间一致性和鲁棒性,实验结果优于普通扩散策略。
Demo-ICL: 用于过程视频知识获取的上下文学习
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; Shanghai AI Lab(上海人工智能实验室) ; CUHK-MMLab(香港大学多媒体实验室)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 Demo-ICL通过两阶段训练策略提升模型从上下文示例中学习的能力,针对视频理解中的新挑战提出Demo-ICL-Bench基准测试。
EgoLife:迈向以自身为中心的生活助手
机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学新加坡分校) ; LMMs-Lab(LMMs实验室) ; IMDEA Networks, Spain(西班牙IMDEA网络) ; University of Brescia, Italy(意大利布雷西亚大学) ; Politecnico di Milano, Italy(意大利米兰理工学院)
专题命中 视频多模态 :multimodal(abstract);omni-modal(abstract);分类 cs.CV
AI总结 EgoLife旨在通过AI赋能的可穿戴设备开发以自身为中心的生活助手,通过多模态数据集和EgoButler系统提升日常效率与个性化服务。
Comments This version corrects the author affiliation to reflect the accurate institutional information at the time of publication. No technical content of the paper has been changed
Vista:面向事后查询的场景感知流视频问答优化
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 Vista通过场景感知分割、压缩和召回技术,实现了高效且可扩展的流视频问答,提升了长上下文推理能力,同时保持低延迟和内存效率。
Comments Accepted to AAAI 2026 (Main Technical Track)
AD-MIR:通过结构化推理弥合从感知到说服的广告视频理解鸿沟
机构 * Peking University, Beijing, China(北京大学) ; Tsinghua University, Beijing, China(清华大学) ; Xi'an Jiaotong University, Xi'an, China(西安交通大学) ; South China University of Technology, Guangzhou, China(华南理工大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 AD-MIR通过结构化推理框架,结合语义检索与精确关键词匹配,有效解码广告意图,提升广告视频理解的准确性与说服策略分析能力。
VideoVeritas:通过感知预设强化学习实现AI生成视频检测
机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究所)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 VideoVeritas通过感知预设强化学习提升AI生成视频检测性能,整合细粒度感知与事实推理,采用时空定位和自监督计数提升检测效果。
Comments Project: https://github.com/EricTan7/VideoVeritas
理想情感识别技术的科技社会风险:对情感表达(社会)价值的辩护
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文探讨理想情感识别技术可能带来的科技社会风险,指出其对情感表达的社会功能的误解可能导致社会凝聚力和个体自主性的削弱,主张以功能为导向的监管方法保护社会利益。
Comments 12 pages
基于生成回归的超声心动图视频左室射血分数估计
机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算机与人工智能学院,西南交通大学) ; Manufacturing Industry Chain Collaboration Industrial Software Key Laboratory of Sichuan Province(四川省制造业产业链协同工业软件重点实验室) ; School of Medicine, University of Electronic Science and Technology(医学院,电子科技大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出MCSDR模型,通过生成回归方法提升超声心动图视频中左室射血分数估计的准确性与解释性。
Comments 11 pages, 5 tables, 10 figures. Under peer review
MARC: 用于高效视频理解的记忆增强强化学习令牌压缩
机构 * University of Bristol(布里斯托大学) ; Memories.ai Research(Memories.ai研究)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 MARC通过结合结构化检索和强化学习知识蒸馏,实现高效视频理解,显著减少视觉令牌、GPU内存和延迟。
Comments Accepted at ICLR 2026
ST-Raptor:一个用于半结构化表格问答的智能系统
机构 * Tsinghua University(清华大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 ST-Raptor通过结合视觉编辑、树形结构建模和代理驱动查询解决,提升半结构化表格问答的准确性和易用性。
自适应时间动态用于个性化情绪识别:一种液态神经网络方法
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文提出了一种基于液态神经网络的多模态框架,用于提升基于EEG的情绪识别准确率,通过结合卷积特征提取、可学习时间常数和注意力引导融合,实现高准确率和可解释性。
为自动驾驶车辆设计外部接口的协作众包方法
专题命中 视频多模态 :multimodal(abstract)
AI总结 本文提出一种协作众包方法,通过结合大众创意、结构化原则和专家反馈,提升自动驾驶车辆接口设计的可扩展性和用户体验。
Comments Paper accepted for publication at the 2026 CHI Conference on Human Factors in Computing Systems (CHI'26), April 13-17, 2026, Barcelona, Spain
基于帕累托最优的流水线:在移动MOBA游戏中蒸馏轻量级AI代理
机构 * School of Computer Science Peking University Beijing China(计算机科学系 首都大学 北京 中国) ; TiMi L1 Studio Tencent Chengdu China(TiMi L1工作室 腾讯 成都 中国) ; Peking University(首都大学) ; Tencent(腾讯)
专题命中 视频多模态 :multi-modal(abstract)
AI总结 本文提出基于帕累托最优的流水线,设计高效学生架构搜索空间,在移动MOBA游戏中实现轻量级AI代理的蒸馏,提升推断速度与能效。
秒数如何计数:通过机器学习分析视频内容理解TikTok上的算法-用户互动
专题命中 视频多模态 :multimodal(abstract)
AI总结 通过机器学习分析TikTok视频内容,研究算法与用户互动的时间演变及用户体验影响。
Comments To contact, email maleeha2@illinois.edu