arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-10 至 2026-02-10 共收录 18 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 18 篇

2511.18845 2026-02-10 cs.AI 83%

UNeMo: Collaborative Visual-Language Reasoning and Navigation via a Multimodal World Model

UNeMo:通过多模态世界模型实现协作的视觉-语言推理与导航

Changxin Huang, Lv Tang, Zhaohuan Zhan, Lisha Yu, Runhao Zeng, Zun Liu, Zhengjie Wang, Jianqiang Li

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 UNeMo通过多模态世界模型实现视觉-语言推理与导航的协作优化,提升导航准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08057 2026-02-10 cs.CV cs.AI 81%

Weak to Strong: VLM-Based Pseudo-Labeling as a Weakly Supervised Training Strategy in Multimodal Video-based Hidden Emotion Understanding Tasks

弱到强:基于VLM的伪标签作为多模态视频隐藏情绪理解任务中的弱监督训练策略

Yufei Wang, Haixu Liu, Tianxiang Xu, Chuancheng Shi, Hongsheng Xing

机构 * The University of New South Wales, Sydney, New South Wales, Australia(新南威尔士大学) The University of Sydney, Sydney, New South Wales, Australia(悉尼大学) School of Software and Microelectronics, Peking University, Zibo, Shandong, China(北京大学软件与微电子学院) Shandong University of Technology, Beijing, China(山东理工大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于VLM的伪标签弱监督方法,用于多模态视频隐藏情绪识别,提升准确率至0.69并建立新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08861 2026-02-10 cs.CV 79%

TiFRe: Text-guided Video Frame Reduction for Efficient Video Multi-modal Large Language Models

TiFRe: 基于文本的视频帧减少用于高效视频多模态大语言模型

Xiangtian Zheng, Zishuo Wang, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 TiFRe通过文本引导的帧采样和帧匹配机制,有效减少视频输入帧数,同时保留关键信息,提升视频多模态大语言模型的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13564 2026-02-10 cs.CV 79%

State-Space Hierarchical Compression with Gated Attention and Learnable Sampling for Hour-Long Video Understanding in Large Multimodal Models

具有门控注意力和可学习采样的状态空间分层压缩用于大多模态模型中的小时级视频理解

Geewook Kim, Minjoon Seo

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于状态空间模型和门控注意力的高效压缩方法,用于减少大模型中小时级视频的token消耗,同时保持性能。

Comments AAAI 2026 (Oral). Project page: https://github.com/naver-ai/mambamia

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07388 2026-02-10 cs.RO 78%

Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation

面向长时程机器人操作的多模态动作消歧的轨迹聚焦扩散策略

Yuxuan Hu, Xiangyu Chen, Chuhao Zhou, Yuxi Liu, Gen Li, Jindou Jia, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(MARS实验室,南洋理工大学)

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 TF-DP通过轨迹聚焦解决长时程机器人操作中的多模态动作模糊问题,提升时间一致性和鲁棒性,实验结果优于普通扩散策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08439 2026-02-10 cs.CV 70%

Demo-ICL: In-Context Learning for Procedural Video Knowledge Acquisition

Demo-ICL: 用于过程视频知识获取的上下文学习

Yuhao Dong, Shulin Tian, Shuai Liu, Shuangrui Ding, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Jiaqi Wang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Lab(上海人工智能实验室) CUHK-MMLab(香港大学多媒体实验室)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 Demo-ICL通过两阶段训练策略提升模型从上下文示例中学习的能力,针对视频理解中的新挑战提出Demo-ICL-Bench基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03803 2026-02-10 cs.CV 70%

EgoLife: Towards Egocentric Life Assistant

EgoLife:迈向以自身为中心的生活助手

Jingkang Yang, Shuai Liu, Hongming Guo, Yuhao Dong, Xiamengwei Zhang, Sicheng Zhang, Pengyun Wang, Zitang Zhou, Binzhu Xie, Ziyue Wang, Bei Ouyang, Zhengyu Lin, Marco Cominelli, Zhongang Cai, Yuanhan Zhang, Peiyuan Zhang, Fangzhou Hong, Joerg Widmer, Francesco Gringoli, Lei Yang, Bo Li, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学新加坡分校) LMMs-Lab(LMMs实验室) IMDEA Networks, Spain(西班牙IMDEA网络) University of Brescia, Italy(意大利布雷西亚大学) Politecnico di Milano, Italy(意大利米兰理工学院)

专题命中 视频多模态 :multimodal(abstract);omni-modal(abstract);分类 cs.CV

AI总结 EgoLife旨在通过AI赋能的可穿戴设备开发以自身为中心的生活助手,通过多模态数据集和EgoButler系统提升日常效率与个性化服务。

Comments This version corrects the author affiliation to reflect the accurate institutional information at the time of publication. No technical content of the paper has been changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08448 2026-02-10 cs.CV cs.AI 62%

Vista: Scene-Aware Optimization for Streaming Video Question Answering under Post-Hoc Queries

Vista:面向事后查询的场景感知流视频问答优化

Haocheng Lu, Nan Zhang, Wei Tao, Xiaoyang Qu, Guokuan Li, Jiguang Wan, Jianzong Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Vista通过场景感知分割、压缩和召回技术,实现了高效且可扩展的流视频问答,提升了长上下文推理能力,同时保持低延迟和内存效率。

Comments Accepted to AAAI 2026 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07625 2026-02-10 cs.CV cs.AI 62%

AD-MIR: Bridging the Gap from Perception to Persuasion in Advertising Video Understanding via Structured Reasoning

AD-MIR:通过结构化推理弥合从感知到说服的广告视频理解鸿沟

Binxiao Xu, Junyu Feng, Xiaopeng Lin, Haodong Li, Zhiyuan Feng, Bohan Zeng, Shaolin Lu, Ming Lu, Qi She, Wentao Zhang

机构 * Peking University, Beijing, China(北京大学) Tsinghua University, Beijing, China(清华大学) Xi'an Jiaotong University, Xi'an, China(西安交通大学) South China University of Technology, Guangzhou, China(华南理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 AD-MIR通过结构化推理框架,结合语义检索与精确关键词匹配,有效解码广告意图,提升广告视频理解的准确性与说服策略分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08828 2026-02-10 cs.CV 57%

VideoVeritas: AI-Generated Video Detection via Perception Pretext Reinforcement Learning

VideoVeritas:通过感知预设强化学习实现AI生成视频检测

Hao Tan, Jun Lan, Senyuan Shi, Zichang Tan, Zijian Yu, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 VideoVeritas通过感知预设强化学习提升AI生成视频检测性能,整合细粒度感知与事实推理,采用时空定位和自监督计数提升检测效果。

Comments Project: https://github.com/EricTan7/VideoVeritas

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08706 2026-02-10 cs.HC cs.AI cs.ET 57%

Technosocial risks of ideal emotion recognition technologies: A defense of the (social) value of emotional expressions

理想情感识别技术的科技社会风险:对情感表达(社会)价值的辩护

Alexandra Pregent

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨理想情感识别技术可能带来的科技社会风险,指出其对情感表达的社会功能的误解可能导致社会凝聚力和个体自主性的削弱,主张以功能为导向的监管方法保护社会利益。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08202 2026-02-10 cs.CV 57%

Generative Regression for Left Ventricular Ejection Fraction Estimation from Echocardiography Video

基于生成回归的超声心动图视频左室射血分数估计

Jinrong Lv, Xun Gong, Zhaohuan Li, Weili Jiang

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算机与人工智能学院,西南交通大学) Manufacturing Industry Chain Collaboration Industrial Software Key Laboratory of Sichuan Province(四川省制造业产业链协同工业软件重点实验室) School of Medicine, University of Electronic Science and Technology(医学院,电子科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MCSDR模型,通过生成回归方法提升超声心动图视频中左室射血分数估计的准确性与解释性。

Comments 11 pages, 5 tables, 10 figures. Under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07915 2026-02-10 cs.CV 57%

MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding

MARC: 用于高效视频理解的记忆增强强化学习令牌压缩

Peiran Wu, Zhuorui Yu, Yunze Liu, Chi-Hao Wu, Enmin Zhou, Junxiao Shen

机构 * University of Bristol(布里斯托大学) Memories.ai Research(Memories.ai研究)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 MARC通过结合结构化检索和强化学习知识蒸馏,实现高效视频理解,显著减少视觉令牌、GPU内存和延迟。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07034 2026-02-10 cs.AI 57%

ST-Raptor: An Agentic System for Semi-Structured Table QA

ST-Raptor:一个用于半结构化表格问答的智能系统

Jinxiu Qu, Zirui Tang, Hongzhang Huang, Boyu Niu, Wei Zhou, Jiannan Wang, Yitong Song, Guoliang Li, Xuanhe Zhou, Fan Wu

机构 * Tsinghua University(清华大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 ST-Raptor通过结合视觉编辑、树形结构建模和代理驱动查询解决,提升半结构化表格问答的准确性和易用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06997 2026-02-10 eess.SP cs.AI cs.LG cs.NE 57%

Adaptive Temporal Dynamics for Personalized Emotion Recognition: A Liquid Neural Network Approach

自适应时间动态用于个性化情绪识别:一种液态神经网络方法

Anindya Bhattacharjee, Nittya Ananda Biswas, K. A. Shahriar, Adib Rahman

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种基于液态神经网络的多模态框架,用于提升基于EEG的情绪识别准确率,通过结合卷积特征提取、可学习时间常数和注意力引导融合,实现高准确率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08090 2026-02-10 cs.HC 50%

A Collaborative Crowdsourcing Method for Designing External Interfaces for Autonomous Vehicles

为自动驾驶车辆设计外部接口的协作众包方法

Ronald Cumbal, Marcus Göransson, Alexandros Rouchitsas, Didem Gürdür Broo, Ginevra Castellano

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出一种协作众包方法,通过结合大众创意、结构化原则和专家反馈,提升自动驾驶车辆接口设计的可扩展性和用户体验。

Comments Paper accepted for publication at the 2026 CHI Conference on Human Factors in Computing Systems (CHI'26), April 13-17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07521 2026-02-10 cs.LG 50%

Pareto-guided Pipeline for Distilling Featherweight AI Agents in Mobile MOBA Games

基于帕累托最优的流水线:在移动MOBA游戏中蒸馏轻量级AI代理

Xionghui Yang, Bozhou Chen, Yunlong Lu, Yongyi Wang, Lingfeng Li, Lanxiao Huang, Lin Liu, Wenjun Wang, Meng Meng, Xia Lin, Wenxin Li

机构 * School of Computer Science Peking University Beijing China(计算机科学系 首都大学 北京 中国) TiMi L1 Studio Tencent Chengdu China(TiMi L1工作室 腾讯 成都 中国) Peking University(首都大学) Tencent(腾讯)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出基于帕累托最优的流水线,设计高效学生架构搜索空间,在移动MOBA游戏中实现轻量级AI代理的蒸馏,提升推断速度与能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20030 2026-02-10 cs.SI 50%

Counting How the Seconds Count: Understanding Algorithm-User Interplay in TikTok via ML-driven Analysis of Video Content

秒数如何计数:通过机器学习分析视频内容理解TikTok上的算法-用户互动

Maleeha Masood, Shreya Kannan, Zikun Liu, Deepak Vasisht, Indranil Gupta

专题命中 视频多模态 :multimodal(abstract)

AI总结 通过机器学习分析TikTok视频内容,研究算法与用户互动的时间演变及用户体验影响。

Comments To contact, email maleeha2@illinois.edu

详情

展开后加载摘要…

URL PDF HTML 收藏