arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4757 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4757 篇

2512.19010 2026-04-07 eess.SP cs.RO 78%

PalpAid: Multimodal Pneumatic Tactile Sensor for Tissue Palpation

PalpAid:多模态气压触觉传感器用于组织触诊

Devi Yuliarti, Ravi Prakash, Hiu Ching Cheung, Amy Strong, Patrick J. Codd, Shan Lin

机构 * Duke University(杜克大学) Arizona State University(亚利桑那州立大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 PalpAid通过气压和声音传感器恢复机器人手术中的触觉信息,能区分不同硬度的3D打印物体和离体组织。

Comments IEEE-RAS RoboSoft 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02248 2026-04-03 stat.ML cs.LG 78%

BVFLMSP : Bayesian Vertical Federated Learning for Multimodal Survival with Privacy

BVFLMSP:基于贝叶斯垂直联邦学习的多模态生存预测

Abhilash Kar, Basisth Saha, Tanmay Sen, Biswabrata Pradhan

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出BVFLMSP框架,通过贝叶斯神经网络处理多模态数据,实现隐私保护下的生存预测,提升预测可靠性并提供不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01659 2026-04-03 cs.RO 78%

AURA: Multimodal Shared Autonomy for Real-World Urban Navigation

AURA:多模态共享自主控制用于真实世界城市导航

Yukai Ma, Honglin He, Selina Song, Wayne Wu, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Zhejiang University(浙江大学)

专题命中 视频多模态 :multimodal(title);multi-modal(abstract)

AI总结 AURA通过将城市导航分解为高层人类指令和低层AI控制,减少人工操作负担,提升导航稳定性,并在真实世界中实现44%的接管减少。

Comments 17 pages, 18 figures, 4 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11797 2026-04-02 cs.HC cs.ET 78%

MURMR: A Multimodal Sensing Framework for Automated Group Behavior Analysis in Mixed Reality

MURMR:一种用于混合现实环境中自动化群体行为分析的多模态传感框架

Diana Romero, Yasra Chandio, Fatima Anwar, Salma Elmalaki

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出MURMR框架,通过头显原生数据自动分析团队协作动态,无需外部设备或人工标注,揭示了会话内结构分析和时间模块在捕捉群体行为中的互补作用。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29903 2026-04-01 q-bio.NC eess.SP 78%

Multimodal Higher-Order Brain Networks: A Topological Signal Processing Perspective

多模态高阶脑网络:拓扑信号处理视角

Breno C. Bispo, Stefania Sardellitti, Juliano B. Lima, Fernando A. N. Santos

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出基于拓扑信号处理的多模态框架,通过高阶拓扑域建模脑部,利用扩散MRI和静息态fMRI学习个体化脑细胞复合体,揭示高阶相互作用的拓扑特征及其与行为的关联。

Comments This paper has been sumbmitted to IEEE Transactions on Medical Imaging (TMI), March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29624 2026-04-01 cs.SE 78%

EcoScratch: Cost-Effective Multimodal Repair for Scratch Using Execution Feedback

EcoScratch: 低成本多模态修复用于刮痕使用执行反馈

Yuan Si, Ming Wang, Daming Li, Hanyuan Shi, Jialu Zhang

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 EcoScratch通过轻量级运行时信号决定是否保持纯文本修复或升级到多模态提示,结合JSON补丁预算和验证努力,提升Scratch修复效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24975 2026-03-31 cs.IR 78%

Unbiased Multimodal Reranking for Long-Tail Short-Video Search

长尾短视频搜索的无偏多模态重排序

Wenyi Xu, Feiran Zhu, Songyang Li, Renzhe Zhou, Chao Zhang, Chenglei Dai, Yuren Mao, Yunjun Gao, Yi Zhang

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出基于LLM的多模态重排序框架,通过多阶段训练提升长尾查询内容质量,实验显示在AUC、NDCG@K和用户偏好判断等指标上优于基线方法,线上A/B测试验证了其在用户体验和消费指标上的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13315 2026-03-27 cs.RO 78%

Bi-HIL: Bilateral Control-Based Multimodal Hierarchical Imitation Learning via Subtask-Level Progress Rate and Keyframe Memory for Long-Horizon Contact-Rich Robotic Manipulation

双侧控制基于多模态分层模仿学习的长时程接触丰富机械臂操作

Thanpimon Buamanee, Masato Kobayashi, Yuki Uranishi

机构 * The University of Osaka(大阪大学) Kobe University(神户大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出Bi-HIL框架,通过子任务级进度率和关键帧记忆实现长时程接触丰富机械臂操作的稳定分层协调,验证了显式建模子任务进展与力感知控制的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22371 2026-03-25 eess.IV 78%

Multimodal Fusion of Skeleton Dynamics and Clinical Gait Features for Video-Based Cerebral Palsy Severity Assessment

基于骨骼动力学和临床步态特征的多模态融合用于视频基于的脑瘫严重程度评估

Kaiyuan Yang, Xupeng Chen, Jiangpeng He

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出一种多模态融合框架,结合骨骼动力学和临床有意义的步态特征,提升视频脑瘫严重程度评估的预测性能和生物力学可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17611 2026-03-24 nucl-th astro-ph.SR cond-mat.supr-con nucl-ex quant-ph 78%

Evidence for Multimodal Superfluidity of Neutrons

中子的多模超流性证据

Yuan-Zhuo Ma, Georgios Palkanoglou, Joseph Carlson, Stefano Gandolfi, Alexandros Gezerlis, Gabriel Given, Ashe Hicks, Dean Lee, Kevin E. Schmidt, Jiabin Yu

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 研究通过理论和实验证据揭示了中子富集系统中一种新物相——多模超流性,探讨其在不同维度模型中的表现及对中子星结构的影响。

Comments 61 pages, 37 figures; Minor revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11403 2026-03-20 quant-ph physics.optics 78%

Bidimensional measurements of photon statistics within a multimodal temporal framework

双维光子统计的多模时域测量

C. Hainaut, K. Ouahrouche, A. Rancon, G. Patera, C. Ouarkoub, M. Le Parquier, P. Suret, A. Amo

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出一种双维光子统计测量方法,利用DFG在非线性BBO晶体中实现高时间分辨率的单次成像,区分相干与热光子统计,并通过时间模式分解框架解释测量偏差原因。

Journal ref Phys. Rev. Research 8, 013286 (16 March, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26642 2026-03-20 cs.RO 78%

MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation

MLA:一种多感官语言-动作模型,用于机器人操作中的多模态理解和预测

Zhuoyang Liu, Jiaming Liu, Jiadong Xu, Nuowei Han, Chenyang Gu, Hao Chen, Kaichen Zhou, Renrui Zhang, Kai Chin Hsieh, Kun Wu, Zhengping Che, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京类人机器人创新中心(X-Humanoid)) The Chinese University of Hong Kong (CUHK)(香港中文大学(CUHK))

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出MLA模型,通过多感官融合与未来目标预测,提升机器人在复杂接触任务中的操控能力,实验显示其在2D和3D任务中性能优于现有方法。

Comments Project page: https://robotic-mla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16685 2026-03-12 cs.LG cs.DC 78%

Communication-Efficient Multimodal Federated Learning: Joint Modality and Client Selection

高效多模态联邦学习:联合模态与客户端选择

Liangqi Yuan, Dong-Jun Han, Su Wang, Devesh Upadhyay, Christopher G. Brinton

机构 * School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院) Department of Computer Science and Engineering, Yonsei University(延世大学计算机科学与工程系) School of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程学院) Saab Inc.(Saab公司)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出MFedMC框架,通过解耦架构和联合选择算法,实现高效多模态联邦学习,减少通信开销并提升模型泛化能力。

Comments arXiv admin note: text overlap with arXiv:2310.07048

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22295 2026-03-10 cs.LG 78%

Aurora: Towards Universal Generative Multimodal Time Series Forecasting

Aurora:迈向通用生成多模态时间序列预测

Xingjian Wu, Jianxin Jin, Wanghui Qiu, Peng Chen, Yang Shu, Bin Yang, Chenjuan Guo

机构 * East China Normal University(东华师范大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 Aurora通过多模态输入和零样本推理,提升跨领域时间序列预测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09095 2026-03-09 cs.LG 78%

Temporal Misalignment Attacks against Multimodal Perception in Autonomous Driving

针对自动驾驶多模态感知的时序错位攻击

Md Hasan Shahriar, Md Mohaimin Al Barat, Harshavardhan Sundar, Ning Zhang, Naren Ramakrishnan, Y. Thomas Hou, Wenjing Lou

机构 * Amazon.com, Inc.(亚马逊公司) Washington University in St. Louis(华盛顿大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出DejaVu攻击,通过制造时序错位破坏自动驾驶多模态感知,导致目标检测和跟踪性能显著下降。

Comments 19 pages, 18 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02569 2026-03-04 cs.HC 78%

An LLM-Assisted Toolkit for Inspectable Multimodal Emotion Data Annotation

一种辅助多模态情绪数据标注的工具包

Zheyuan Kuang, Weiwei Jiang, Nicholas Koemel, Matthew Ahmadi, Emmanuel Stamatakis, Benjamin Tag, Anusha Withana, Zhanna Sarsenbayeva

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出一种LLM辅助的多模态情绪数据标注工具包,通过可检查的工作流实现细粒度标注,提升跨模态一致性检查效率。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00110 2026-03-03 cs.RO 78%

Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation

从预训练视频模型中学习物理:一种多模态连续和序列世界交互模型用于机器人操作

Zijian Song, Qichang Li, Sihan Qin, Yuhao Chen, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 PhysGen通过预训练视频模型学习物理知识,实现机器人操作的连续和序列世界交互,优于现有基线方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17068 2026-02-20 cs.LG cs.SY eess.SY 78%

Spatio-temporal dual-stage hypergraph MARL for human-centric multimodal corridor traffic signal control

时空双阶段超图多智能体强化学习用于以人为中心的多模式走廊交通信号控制

Xiaocai Zhang, Neema Nassir, Milad Haghani

机构 * Department of Infrastructure Engineering, Faculty of Engineering and Information Technology, The University of Melbourne, VIC 3010, Australia(工程与信息技术学院基础设施工程系,墨尔本大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出STDSH-MARL方法,通过时空双阶段超图注意力机制和混合动作空间,提升走廊交通信号对多模式旅行者和公共交通的适应性与优先级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18891 2026-02-18 cs.LG 78%

CAAT-EHR: Cross-Attentional Autoregressive Transformer for Multimodal Electronic Health Record Embeddings

CAAT-EHR: 多模态电子健康记录嵌入的交叉注意力自回归变压器

Mohammad Al Olaimat, Shaika Chowdhury, Serdar Bozdag

机构 * Department of Computer Science and Engineering, University of North Texas(计算机科学与工程系,北卡罗来纳大学达顿分校) BioDiscovery Institute, University of North Texas(生物发现研究所,北卡罗来纳大学达顿分校) Center for Computational Life Sciences, University of North Texas(计算生命科学中心,北卡罗来纳大学达顿分校)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 CAAT-EHR通过多模态嵌入和自回归机制提升EHR分析的通用性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.12433 2026-02-17 cs.RO cs.SY eess.SY 78%

Model Predictive Control with Gaussian Processes for Flexible Multi-Modal Physical Human Robot Interaction

基于高斯过程的模型预测控制用于柔性多模态人机协作交互

Kevin Haninger, Christian Hegeler, Luka Peternel

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 本文提出基于高斯过程的模型预测控制方法,用于多模态人机协作交互,通过贝叶斯推断和在线控制提升任务灵活性和效率。

Comments Submitted, ICRA 2022. Video: https://youtu.be/0GT1pPpXvt8 Data and code: https://owncloud.fraunhofer.de/index.php/s/kmCZvlKOghclHy9

Journal ref 2022 IEEE International Conference on Robotics and Automation (ICRA), May 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13459 2026-02-17 eess.SP 78%

Towards Causality-Aware Modeling for Multimodal Brain-Muscle Interactions

迈向因果意识的多模态脑-肌相互作用建模

Farwa Abbas, Wei Dai, Zoran Cvetkovic, Verity McClelland

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出一种结合几何流形重建与概率时间建模的DBN启发CCM框架,用于多模态脑-肌交互的因果建模,揭示了肌张力障碍中特定频率的通路重组织,并展示了其在生物标志物开发和神经调节干预中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10897 2026-02-12 hep-ex 78%

Multi-Modal Track Reconstruction using Graph Neural Networks at Belle II

利用图神经网络进行多模态轨迹重建:Belle II实验

Lea Reuter, Tristan Brandes, Giacomo De Pietro, Torben Ferber

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 Belle II实验利用图神经网络和多模态输入提升轨迹重建效率和纯度,通过模拟验证效果。

Comments proceedings for ACAT25

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06303 2026-02-11 cs.LG 78%

Multimodal Graph Neural Networks for Prognostic Modeling of Brain Network Reorganization

多模态图神经网络用于脑网络重组的预后建模

Preksha Girish, Rachana Mysore, Kiran K. N., Hiranmayee R., Shipra Prashanth, Shrey Kumar

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出多模态图神经网络用于脑网络重组的预后建模,通过整合多种影像数据,生成可解释的生物标志物以预测认知下降风险。

Comments Fundamental methodological error invalidating results

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07388 2026-02-10 cs.RO 78%

Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation

面向长时程机器人操作的多模态动作消歧的轨迹聚焦扩散策略

Yuxuan Hu, Xiangyu Chen, Chuhao Zhou, Yuxi Liu, Gen Li, Jindou Jia, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(MARS实验室,南洋理工大学)

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 TF-DP通过轨迹聚焦解决长时程机器人操作中的多模态动作模糊问题,提升时间一致性和鲁棒性,实验结果优于普通扩散策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14550 2026-01-22 cs.RO 78%

TacUMI: A Multi-Modal Universal Manipulation Interface for Contact-Rich Tasks

TacUMI: 一种多模态通用操控接口用于接触密集型任务

Tailai Cheng, Kejia Chen, Lingyun Chen, Liding Zhang, Yue Zhang, Yao Ling, Mahdi Hamad, Zhenshan Bing, Fan Wu, Karan Sharma, Alois Knoll

机构 * School of Computation, Information and Technology, Technical University of Munich(技术大学慕尼黑计算、信息与技术学院) Agile Robots SE(敏捷机器人公司) State Key Laboratory for Novel Software Technology and the School of Science and Technology, Nanjing University (Suzhou Campus)(南京大学软件新技术国家重点实验室及科学与技术学院(苏州校区)) Shanghai University(上海大学)

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 TacUMI通过整合多种传感器,提供了一种多模态数据采集系统,用于提高接触密集型任务中多模态演示的分割和收集效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04299 2026-01-09 cs.LG q-bio.QM 78%

Transformer-Based Multi-Modal Temporal Embeddings for Explainable Metabolic Phenotyping in Type 1 Diabetes

基于Transformer的多模态时间嵌入用于1型糖尿病的可解释代谢表型分析

Pir Bakhsh Khokhar, Carmine Gravino, Fabio Palomba, Sule Yildrim Yayilgan, Sarang Shaikh

专题命中 视频多模态 :multi-modal(title);multimodal(abstract)

AI总结 本研究提出基于Transformer的多模态时间嵌入框架,用于1型糖尿病的可解释代谢表型分析,识别出5种代谢亚组并揭示其与心血管风险的关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18785 2026-01-01 cs.LG 78%

ALF: Advertiser Large Foundation Model for Multi-Modal Advertiser Understanding

ALF:多模态广告商基础模型用于多模态广告商理解

Santosh Rajagopalan, Jonathan Vronsky, Songbai Yan, S. Alireza Golestaneh, Shubhra Chandra, Min Zhou

机构 * Google(谷歌)

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 ALF通过多模态Transformer架构和多任务优化,实现了广告商行为理解的高精度和高召回率,显著提升了欺诈检测和政策识别的性能。

Comments KDD 2026 ADS Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20538 2025-12-24 cs.RO 78%

Uni-Mapper: Unified Mapping Framework for Multi-modal LiDARs in Complex and Dynamic Environments

Uni-Mapper:多模态激光雷达在复杂动态环境中的统一映射框架

Gilhwan Kang, Hogyun Kim, Byunghee Choi, Seokhwan Jeong, Young-Sik Shin, Younggun Cho

机构 * Hyundai Motor Company(现代汽车公司) Inha University(inha大学) Korea Institute of Machinery and Materials(韩国机械材料研究院)

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 Uni-Mapper通过动态感知和多模态激光雷达融合技术,实现复杂动态环境下的统一地图构建与回环检测。

Comments 18 pages, 14 figures

Journal ref 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01882 2025-12-02 cs.LG 78%

New Spiking Architecture for Multi-Modal Decision-Making in Autonomous Vehicles

多模态决策中自动驾驶车辆的新脉冲架构

Aref Ghoreishee, Abhishek Mishra, Lifeng Zhou, John Walsh, Nagarajan Kandasamy

机构 * Electrical and Computer Engineering Department(电子与计算机工程系)

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 本文提出了一种基于脉冲神经元的高效多模态决策架构,用于提升自动驾驶车辆的实时决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22362 2025-12-01 cs.LG 78%

Efficient-Husformer: Efficient Multimodal Transformer Hyperparameter Optimization for Stress and Cognitive Loads

Efficient-Husformer: 高效多模态Transformer超参数优化用于压力和认知负荷检测

Merey Orazaly, Fariza Temirkhanova, Jurn-Gyu Park

机构 * The School of Engineering and Digital Sciences, Nazarbayev University(工程与数字科学学院,纳扎尔拜耶夫大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 Efficient-Husformer通过超参数优化提升多模态生理信号分析的效率和准确性,实现压力和认知负荷检测的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏