arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4729 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4729 篇

2604.05303 2026-04-08 cs.LG cs.NA math.NA physics.comp-ph stat.ML 50%

Jeffreys Flow: Robust Boltzmann Generators for Rare Event Sampling via Parallel Tempering Distillation

Jeffreys 流:通过并行退火蒸馏实现鲁棒的玻尔兹曼生成器用于稀有事件采样

Guang Lin, Christian Moya, Di Qi, Xuda Ye

机构 * Department of Mathematics, Purdue University(普渡大学数学系)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出Jeffreys流,通过并行退火轨迹蒸馏数据,利用对称Jeffreys散度缓解玻尔兹曼生成器的模式崩溃问题,提升多模分布的采样精度与全局模式覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20685 2026-04-07 cs.RO 50%

C-NAV: Towards Self-Evolving Continual Object Navigation in Open World

C-NAV:迈向开放世界中的自进化持续物体导航

Ming-Ming Yu, Fei Zhu, Wenzhuo Liu, Yirong Yang, Qunbo Wang, Wenjun Wu, Jing Liu

机构 * Beihang University(北京航空航天大学) Centre for Artificial Intelligence and Robotics, HKISI-CAS(香港智能科学与工业研究院人工智能与机器人中心) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) Beijing Jiaotong University(北京交通大学)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出C-Nav框架,通过双路径抗遗忘机制和自适应采样策略,解决持续物体导航中的灾难性遗忘问题,实验表明其在多个模型架构上均优于现有方法,且内存需求显著降低。

Comments Accepted at NeurIPS 2025

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03451 2026-04-07 cs.RO cs.CY cs.HC 50%

Do Robots Need Body Language? Comparing Communication Modalities for Legible Motion Intent in Human-Shared Spaces

机器人需要肢体语言吗?比较不同沟通方式以实现人类共享空间中运动意图的可理解性

Jonathan Albert Cohen, Kye Shimizu, Allen Song, Vishnu Bharath, Kent Larson, Pattie Maes

机构 * MIT Media Lab(麻省理工学院媒体实验室) New England Innovation Academy(新英格兰创新学院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究探讨不同沟通方式对理解四足机器人导航意图的影响,评估表达性动作、灯光、文本和音频等模态对预测准确性、信心和信任度的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01860 2026-04-03 cs.RO 50%

Posterior Optimization with Clipped Objective for Bridging Efficiency and Stability in Generative Policy Learning

后验优化与截断目标:在生成策略学习中平衡效率与稳定性

Yuhui Chen, Haoran Li, Zhennan Jiang, Yuxing Qin, Yuxuan Wan, Weiheng Liu, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CFCS, School of Computer Science, Peking University(北京大学计算机学院前沿计算研究中心) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出POCO框架,通过后验推断方法改进策略,结合离线到在线范式,提升生成模型在机器人操控中的稳定性和效率,实验证明其在多个任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00832 2026-04-02 cs.HC 50%

Steering through Time: Blending Longitudinal Data with Simulation to Rethink Human-Autonomous Vehicle Interaction

穿越时间:将纵向数据与模拟结合以重新思考人-自动驾驶车辆交互

Yasaman Hakiminejad, Shiva Azimi, Luis Gomero, Elizabeth Pantesco, Irene P. Kan, Meltem Izzetoglu, Arash Tavakoli

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文通过结合纵向移动传感与高保真驾驶模拟,研究半自动化情境下驾驶员准备状态,揭示基线与任务测量中的个体差异,为个性化驾驶员监控提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25353 2026-03-27 cs.RO 50%

SafeGuard ASF: SR Agentic Humanoid Robot System for Autonomous Industrial Safety

SafeGuard ASF:基于SR代理的人形机器人自主工业安全系统

Thanh Nguyen Canh, Thang Tran Viet, Thanh Tuan Tran, Ben Wei Lim

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出SafeGuard ASF系统,利用人形机器人结合多模态感知与ReAct代理推理框架,实现工业环境中的火灾烟雾、管道异常温度及禁区入侵检测,通过训练多种运动策略实现自主巡逻与避障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23779 2026-03-26 eess.IV physics.geo-ph 50%

Sentinel-2 for Crop Yield Estimation: A Systematic Review

哨兵-2用于作物产量估计:系统综述

Mohammadreza Narimani, Alireza Pourreza, Ali Moghimi, Parastoo Farajpoor

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文综述了利用哨兵-2卫星进行作物产量估计的最新进展,重点探讨了基于经验模型、作物生长模型融合和多源数据融合的方法,指出机器学习和深度学习在解释田间产量变异方面有显著效果,但受限于地面数据不足和云遮蔽问题。

Comments 29 pages, 5 figures, review paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00571 2026-03-25 eess.SP 50%

Delay Bound Relaxation with Deep Learning-based Haptic Estimation for Tactile Internet

基于深度学习的触觉估计用于触觉互联网的延迟放宽

Georgios Kokkinis, Alexandros Iosifidis, Qi Zhang

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出一种基于深度学习的触觉估计方法,通过多模态输入估计力反馈,从而放宽触觉互联网中对延迟的要求,提高资源利用效率和可靠性。

Comments 6 pages, 6 figures, 1 table, conference paper accepted in GLOBECOM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23232 2026-03-25 cs.LG 50%

GEM: Guided Expectation-Maximization for Behavior-Normalized Candidate Action Selection in Offline RL

GEM:用于离线强化学习中行为归一化的候选动作选择的引导期望最大化

Haoyu Wang, Jingcheng Wang, Shunyu Wu, Xinwei Xiao

机构 * School of Automation and Intelligent Sensing(自动化与智能感知学院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 GEM通过引导期望最大化框架,在离线强化学习中实现多模态且可控的动作选择,通过高斯混合模型和行为归一化支持提升决策稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22760 2026-03-25 cs.RO 50%

SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation

SG-VLA:学习空间接地的视觉-语言-动作模型用于移动操作

Ruisen Tu, Arth Shukla, Sohyun Yoo, Xuanlin Li, Junxi Li, Jianwen Xie, Hao Su, Zhuowen Tu

机构 * UC San Diego(南加洲大学) Lambda, Inc(Lambda公司)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出SG-VLA模型,通过辅助任务协同训练和多模态输入增强,提升移动操作中视觉-语言-动作模型的空间感知与表征能力,实现在家庭环境中更高效的物体抓取与操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10448 2026-03-24 cs.RO 50%

DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control

DiT4DiT:联合建模视频动态与动作以实现通用机器人控制

Teli Ma, Jia Zheng, Zifan Wang, Chunli Jiang, Andy Cui, Junwei Liang, Shuo Yang

机构 * Mondo Robotics(Mondo机器人公司) HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学)

专题命中 视频多模态 :image-text(abstract)

AI总结 本文提出DiT4DiT模型,通过结合视频扩散变换器与动作扩散变换器,实现视频动态与动作的联合建模,提升机器人控制的泛化能力与样本效率。

Comments https://dit4dit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19564 2026-03-23 cs.LG 50%

Wearable Foundation Models Should Go Beyond Static Encoders

可穿戴基础模型应超越静态编码器

Yu Yvonne Wu, Yuwei Zhang, Hyungjun Yoon, Ting Dang, Dimitris Spathis, Tong Xia, Qiang Yang, Jing Han, Dong Ma, Sung-Ju Lee, Cecilia Mascolo

机构 * Dartmouth College, USA(达特茅斯学院) University of Cambridge, UK(剑桥大学) The University of Melbourne, Australia(墨尔本大学) Google Research, UK(谷歌研究) Tsinghua University, China(清华大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出可穿戴基础模型需超越静态编码器,通过结构丰富数据、纵向感知多模态建模和代理推理系统实现连续性健康支持。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17653 2026-03-19 cs.RO 50%

REAL: Robust Extreme Agility via Spatio-Temporal Policy Learning and Physics-Guided Filtering

REAL:通过时空策略学习和物理引导过滤实现鲁棒极端敏捷

Jialong Liu, Dehan Shen, Yanbo Wen, Zeyu Jiang, Changhao Chen

机构 * PEAK-Lab, The Hong Kong University of Science and Technology (Guangzhou)(高峰实验室,香港科学与技术大学(广州))

专题命中 视频多模态 :cross-modal(abstract)

AI总结 REAL通过结合时空策略学习和物理引导过滤,提升在动态环境下极端敏捷的鲁棒性,能够在视觉干扰下实现可靠攀爬。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14397 2026-03-17 cs.RO 50%

eNavi: Event-based Imitation Policies for Low-Light Indoor Mobile Robot Navigation

eNavi:基于事件的模仿策略用于低光室内移动机器人导航

Prithvi Jai Ramesh, Kaustav Chanda, Krishna Vinod, Joseph Raj Vishal, Yezhou Yang, Bharatesh Chakravarthi

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出eNavi,通过结合RGB和事件数据的多模态策略提升低光环境下机器人导航的鲁棒性,实验显示融合模型在未见低光条件下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14388 2026-03-17 eess.SY cs.SY 50%

Context-Aware Adaptive Shared Control for Magnetically-Driven Bimanual Dexterous Micromanipulation

具有情境感知的自适应共享控制用于磁驱动双臂灵巧微 manipulation

Yongchen Wang, Kangyi Lu, Lan Wei, Dandan Zhang

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出Bi-CAST框架,通过融合多模态信息实现双臂磁力微 manipulation的自适应共享控制,提升复杂结构中的导航精度与效率,减少碰撞和工作负荷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14182 2026-03-17 cs.RO cs.HC 50%

Towards Equitable Robotic Furnishing Agents for Aging-in-Place: ADL-Grounded Design Exploration

迈向老年人独立生活中的公平机器人家具代理:基于日常活动的设计探索

Hansoo Lee, Changhee Seo, Subin Park, Sonya S. Kwak

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文探讨了在老年人独立生活背景下,通过基于日常活动的设计探索,开发公平的机器人家具代理,以减少认知和身体负担,提升老年人福祉。

Comments Accepted at the ACM/IEEE International Conference on Human-Robot Interaction (HRI) 2026 Workshop: Equitable Robotics for Wellbeing (Eq-RW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01116 2026-03-17 cs.LG 50%

Eliciting Chain-of-Thought Reasoning for Time Series Analysis using Reinforcement Learning

通过强化学习激发时间序列分析的链式推理

Felix Parker, Nimeesha Chan, Chi Zhang, Kimia Ghobadi

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出COUNTS框架,通过强化学习训练LLM进行时间序列任务的链式推理,提升复杂时间数据处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13781 2026-03-17 cs.RO 50%

KoopmanFlow: Spectrally Decoupled Generative Control Policy via Koopman Structural Bias

KoopmanFlow: 通过Koopman结构偏差实现谱解耦的生成控制策略

Chengsi Yao, Ge Wang, Kai Kang, Shenhao Yan, Jiahao Yang, Fan Feng, Honghao Cai, Xianxian Zeng, Rongjun Chen, Yiming Zhao, Yatong Han, Xi Li

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出KoopmanFlow,一种基于Koopman结构偏差的生成控制策略,通过统一多模态潜在空间和视觉上下文,分离全局稳定运动与高频局部修正,提升接触密集任务中的控制精度和参数效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10089 2026-03-12 stat.ME stat.AP 50%

Trajectory-informed graph-based clustering for longitudinal cancer subtyping

基于轨迹的图基团分析用于纵向癌症亚型分类

Lara Cavinato, Marco Rocchi, Luca Viganò, Francesca Ieva

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出了一种基于轨迹的图聚类方法,用于纵向癌症亚型分类,整合多模态临床数据和患者轨迹,以发现具有不同预后轨迹的亚型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09482 2026-03-11 cs.RO 50%

StyleVLA: Driving Style-Aware Vision Language Action Model for Autonomous Driving

StyleVLA: 驾驶风格感知的视觉语言动作模型用于自动驾驶

Yuan Gao, Dengyuan Hua, Mattia Piccinini, Finn Rasmus Schäfer, Korbinian Moller, Lin Li, Johannes Betz

专题命中 视频多模态 :multimodal(abstract)

AI总结 StyleVLA通过引入物理约束和混合损失,生成多样且物理合理的驾驶行为,优于现有专有和先进模型。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09070 2026-03-11 cs.RO 50%

3D UAV Trajectory Estimation and Classification from Internet Videos via Language Model

通过语言模型从互联网视频中估计和分类3D无人机轨迹

Haoxiang Lei, Daotong Wang, Shenghai Yuan, Jianbo Su

专题命中 视频多模态 :cross-modal(abstract)

AI总结 本文提出通过语言模型从互联网视频中估计和分类无人机3D轨迹,无需人工标注,实现了高效的数据采集与轨迹推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08060 2026-03-10 cs.HC 50%

CinemaWorld: Generative Augmented Reality with LLMs and 3D Scene Generation for Movie Augmentation

CinemaWorld: 基于 LLM 和 3D 场景生成的生成增强现实用于电影增强

Keiichi Ihara, DaeHo Lee, Manato Abe, Hye-Young Jo, Ryo Suzuki

专题命中 视频多模态 :multimodal(abstract)

AI总结 CinemaWorld 利用 LLM 和 3D 场景生成技术,通过增强现实将电影内容与现实环境结合,提升观影沉浸感和娱乐性。

Comments 13 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07279 2026-03-10 q-bio.QM 50%

Learning When to Look: On-Demand Keypoint-Video Fusion for Animal Behavior Analysis

学习何时观察:按需关键点-视频融合用于动物行为分析

Weihan Li, Jingyang Ke, Yule Wang, Chengrui Li, Anqi Wu

专题命中 视频多模态 :multimodal(abstract)

AI总结 LookAgain通过按需视觉定位结合关键点与视频数据,实现高效且低计算成本的动物行为分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00919 2026-03-10 cs.RO 50%

Green-VLA: Staged Vision-Language-Action Model for Generalist Robots

Green-VLA: 通用机器人中的分阶段视觉-语言-动作模型

I. Apanasevich, M. Artemyev, R. Babakyan, P. Fedotova, D. Grankin, E. Kupryashin, A. Misailidi, D. Nerus, A. Nutalapati, G. Sidorov, I. Efremov, M. Gerasyov, D. Pikurov, Y. Senchenko, S. Davidenko, D. Kulikov, M. Sultankin, K. Askarbek, O. Shamanin, D. Statovoy, E. Zalyaev, I. Zorin, A. Letkin, E. Rusakov, A. Silchenko, V. Vorobyov, S. Sobolnikov, A. Postnikov

专题命中 视频多模态 :multimodal(abstract)

AI总结 Green-VLA是一种面向真实环境的分阶段视觉-语言-动作模型,通过多阶段训练和强化学习对齐,提升机器人在多样化形态上的泛化能力和性能。

Comments 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21039 2026-03-06 cs.IR cs.LG 50%

Agentic Multi-Persona Framework for Evidence-Aware Fake News Detection

代理多角色框架用于证据感知的虚假新闻检测

Roopa Bukke, Soumya Pandey, Suraj Kumar, Soumi Chattopadhyay, Chandranath Adak

机构 * Dept. of CSE, Indian Institute of Technology Indore(计算机科学与工程系,印度理工学院印度奥尔德分校) Dept. of CSE, Indian Institute of Technology Patna(计算机科学与工程系,印度理工学院帕纳分校)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出AMPEND-LS框架,通过LLM与SLM协同作用,实现多模态虚假新闻检测,提升准确率和鲁棒性,增强信息安全性。

Comments 10 pages, 3 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03957 2026-03-05 cs.RO 50%

ArthroCut: Autonomous Policy Learning for Robotic Bone Resection in Knee Arthroplasty

ArthroCut:膝关节置换术中机器人骨切除的自主策略学习

Xu Lu, Yiling Zhang, Wenquan Cheng, Longfei Ma, Fang Chen, Hongen Liao

机构 * School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程学院) School of Biomedical Engineering, Shanghai Jiao Tong University(上海交通大学生物医学工程学院) Longwood Valley MedTech

专题命中 视频多模态 :multimodal(abstract)

AI总结 ArthroCut通过结合术前和术中数据,实现膝关节置换术中骨切除的自主策略学习,提升机器人手术的自主性和可解释性。

Comments Accepted for publication at the 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21684 2026-02-26 cs.RO cs.LG 50%

Primary-Fine Decoupling for Action Generation in Robotic Imitation

动作生成中的主-细分离

Xiaohan Lei, Min Wang, Wengang Zhou, Xingyu Lu, Houqiang Li

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知国家重点实验室,中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究院,合肥综合性国家科学中心)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 PF-DAG通过两阶段框架实现动作生成中的主-细分离,提升机器人模仿学习的多模态建模与闭环控制性能。

Comments The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01809 2026-02-24 cs.RO cs.LG 50%

Much Ado About Noising: Dispelling the Myths of Generative Robotic Control

许多关于噪声的争论:消解生成机器人控制的神话

Chaoyi Pan, Giri Anantharaman, Nai-Chieh Huang, Claire Jin, Daniel Pfrommer, Chenyang Yuan, Frank Permenter, Guannan Qu, Nicholas Boffi, Guanya Shi, Max Simchowitz

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文通过评估生成控制策略在行为克隆基准上的表现,发现其成功主要源于迭代计算和监督训练,而非多模态捕捉或复杂映射表达。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15567 2026-02-18 cs.RO 50%

Constraining Streaming Flow Models for Adapting Learned Robot Trajectory Distributions

约束流式流模型以适应学习的机器人轨迹分布

Jieting Long, Dechuan Liu, Weidong Cai, Ian Manchester, Weiming Zhi

机构 * School of Computer Science, The University of Sydney, Australia(计算机科学学院,悉尼大学,澳大利亚) School of Aerospace, Mechanical and Mechatronic Engineering, The University of Sydney, Australia(航空航天、机械与机电工程学院,悉尼大学,澳大利亚) Australian Center For Robotics, The University of Sydney, Australia(机器人研究中心,悉尼大学,澳大利亚) College of Connected Computing, Vanderbilt University, TN, USA(连接计算学院,范德比尔特大学,美国)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 CASF通过约束感知流式流模型在实时中适应机器人轨迹,确保安全性和可行性,优于传统方法。

Comments 8 pages, 8 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14255 2026-02-17 cs.RO 50%

A Latency-Aware Framework for Visuomotor Policy Learning on Industrial Robots

面向工业机器人视觉-运动策略学习的延迟感知框架

Daniel Ruan, Salma Mozaffari, Sigrid Adriaenssens, Arash Adel

机构 * Princeton University(普林斯顿大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出了一种面向工业机器人视觉-运动策略学习的延迟感知框架,通过优化执行策略以应对延迟问题,提升策略在现实环境中的可靠性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏