arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6903 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6903 篇

2607.17033 2026-07-21 cs.LG physics.chem-ph 新提交 71%

ChemFusion: A Multimodal Cross-Attention Network for Reaction Yield Prediction

ChemFusion:用于反应产率预测的多模态交叉注意力网络

Qiwei Han, Chi Zhou

机构 * Duke University(杜克大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态训练与对齐 :multimodal(title)

AI总结 研究过渡金属催化反应产率预测难题,提出ChemFusion多模态交叉注意力网络,融合电子特征与3D原子坐标,用交叉注意力机制,在交叉偶联库基准测试中性能出色,还能自主学习识别和惩罚空间位阻,提供物理可解释性。

Comments 10 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06305 2026-07-08 astro-ph.IM 新提交 71%

Exploring Image-Text Alignment for Radio Galaxy Morphologies

探索射电星系形态的图像-文本对齐

Erica Lastufka, Mariia Drozdova, Svyatoslav Volosynovskiy

专题命中 多模态训练与对齐 :image-text(title)

AI总结 研究射电星系图像与文本描述的对齐,利用MiraBest数据集及SigLIP-2模型,经特定提示生成描述并评估。结果显示基于描述的星系分类与图像类似,微调改善局部连贯性,此为射电星系形态研究提供新方法。

Comments Accepted at the AI in Science (AIS) Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02600 2026-07-07 eess.SP 新提交 71%

A Unified Multi-Modal Sensing and Active-Stabilization Framework for Autonomous IoT Nodes in Connectivity-Denied Environments: From Perimeter Sentinel to High-Value Cargo Protection

用于连接受限环境中自主物联网节点的统一多模态传感与主动稳定框架:从周边哨兵到高价值货物保护

Naahi Mumtaj Rihan

专题命中 多模态训练与对齐 :multi-modal(title)

AI总结 探讨连接受限环境下自主物联网节点需求,提出广义节点架构,扩展其传感与通信模态,通过复合风险指数耦合遥测与地理信息系统,统一两种部署模式并给出分析与实例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04378 2026-07-07 cs.RO 新提交 71%

SurgAM: Surgical Affordance Map Prediction with Multimodal Feature Fusion for Robot Autonomy

SurgAM:用于机器人自主的多模态特征融合手术能力地图预测

Lei Song, Yonghao Long, Mengya Xu, Jiayi Geng, Xiuyuan Chen, Qi Dou

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Department of Thoracic Surgery, Peking University People’s Hospital(北京大学人民医院胸外科) Thoracic Oncology Institute, Peking University People’s Hospital(北京大学人民医院胸部肿瘤研究所) Research Unit of Intelligence Diagnosis and Treatment in Early Non-small Cell Lung Cancer, Chinese Academy of Medical Sciences(中国医学科学院早期非小细胞肺癌智能诊断与治疗研究组) Institute of Advanced Clinical Medicine, Peking University(北京大学先进临床医学院) Beijing Key Laboratory of Innovative Application of Big Data in Lung Cancer, Peking University People’s Hospital(北京大学人民医院肺癌大数据创新应用北京市重点实验室)

专题命中 多模态训练与对齐 :multimodal(title)

AI总结 研究如何通过视觉数据识别手术可操作区域,提出自适应特征融合框架、分层提示学习机制和场景引导注意力解码器,建立新数据集验证,在真实模型上验证框架对下游自动化的适用性。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23534 2026-06-23 eess.SP 新提交 71%

Sensor-Stack Limits on Contactless In-Bed Body Position: A 20-Subject Multimodal Radar + Thermal LOSO Characterization

传感器堆栈对非接触式床上身体位置的限制:20名受试者多模态雷达+热成像LOSO表征

Dovy Paukstys

专题命中 多模态训练与对齐 :multimodal(title)

AI总结 通过20名受试者的多模态雷达与热成像数据,研究非接触式床上体位推断的传感器表示限制,发现融合雷达与热成像的Logistic回归在床内/外分类中达到0.871中位平衡准确率,但俯卧检测性能不足(召回率0.50,精确率0.41),指出原始距离-FFT访问是下一步硬件实验方向。

Comments 11 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18576 2026-04-28 cs.RO 71%

DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment

DriVerse:通过多模态轨迹提示和运动对齐实现驾驶模拟的导航世界模型

Xiaofan Li, Chenming Wu, Zhao Yang, Zhihao Xu, Dingkang Liang, Yumeng Zhang, Ji Wan, Jun Wang

机构 * Baidu Inc.(百度公司)

专题命中 多模态训练与对齐 :multimodal(title)

AI总结 DriVerse通过多模态轨迹提示和运动对齐技术,实现从单张图像和未来轨迹生成导航驱动的驾驶场景,提升了动态对象的生成精度和时间一致性。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08559 2026-02-10 cs.IR 71%

QARM V2: Quantitative Alignment Multi-Modal Recommendation for Reasoning User Sequence Modeling

QARM V2:量化对齐多模态推荐用于推理用户序列建模

Tian Xia, Jiaqi Zhang, Yueyang Liu, Hongjian Dou, Tingya Yin, Jiangxia Cao, Xulei Liang, Tianlu Xie, Lihao Liu, Xiang Chen, Shen Wang, Changxin Lao, Haixiang Gan, Jinkai Yu, Keting Cen, Lu Hao, Xu Zhang, Qiqiang Zhong, Zhongbo Sun, Yiyu Wang, Shuang Yang, Mingxin Wen, Xiangyu Wu, Shaoguo Liu, Tingting Gao, Zhaojie Liu, Han Li, Kun Gai

专题命中 多模态训练与对齐 :multi-modal(title)

AI总结 QARM V2通过量化对齐多模态推荐方法,解决推荐系统中用户序列建模的语义理解与业务需求不匹配问题。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22406 2026-02-02 cs.RO 71%

Accurate Pedestrian Tracking in Urban Canyons: A Multi-Modal Fusion Approach

城市峡谷中精确的人行道跟踪:一种多模态融合方法

Shahar Dubiner, Peng Ren, Roberto Manduchi

专题命中 多模态训练与对齐 :multi-modal(title)

AI总结 本文提出一种多模态融合方法,通过融合GNSS和惯性数据提升城市峡谷中行人定位精度,优于单独使用GNSS或惯性导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15246 2025-12-18 eess.SP 71%

Enhancing Alzheimer's Detection through Late Fusion of Multi-Modal EEG Features

通过多模态EEG特征晚融合增强阿尔茨海默病检测

Nguyen Thanh Vinh, Manoj Vishwanath, Thinh Nguyen-Quang, Nguyen Viet Ha, Bui Thanh Tung, Huy-Dung Han, Nguyen Quang Linh, Nguyen Hai Linh, Hung Cao

专题命中 多模态训练与对齐 :multi-modal(title)

AI总结 本研究提出一种基于多模态EEG特征晚融合的深度学习框架,用于提高阿尔茨海默病的早期检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21452 2025-11-27 eess.IV 71%

Semantic-Enhanced Feature Matching with Learnable Geometric Verification for Cross-Modal Neuron Registration

语义增强的特征匹配与可学习几何验证用于跨模态神经元配准

Wenwei Li, Lingyi Cai, Hui Gong, Qingming Luo, Anan Li

专题命中 多模态训练与对齐 :cross-modal(title)

AI总结 本文提出一种结合语义增强和可学习几何验证的深度学习框架,用于解决跨模态神经元配准中的模态差距、数据稀缺和组织形变问题,提升生物医学影像配准精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16816 2025-11-24 stat.AP stat.CO 71%

Trust-Aware Multimodal Data Fusion for Yield Estimation: A Case Study of the 2020 Beirut Explosion

具有信任意识的多模态数据融合用于产量估计:贝鲁特2020爆炸的案例研究

Lekha Patel, Craig Ulmer, Stephen J. Verzi, Daniel J. Krofcheck, Indu Manickam, Asmeret Naugle, Jaideep Ray

专题命中 多模态训练与对齐 :multimodal(title)

AI总结 本文提出一种基于贝叶斯分数后验框架的多模态数据融合方法,用于估计爆炸产量,通过信任权重校准不同观测数据,提升不确定性量化和抗偏差能力。

Comments 19 pages, 4 figures, supplementary material, journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23579 2025-10-27 cs.LG 71%

BioReason: Incentivizing Multimodal Biological Reasoning within a DNA-LLM Model

Adibvafa Fallahpour, Andrew Magnuson, Purav Gupta, Shihao Ma, Jack Naimer, Arnav Shah, Haonan Duan, Omar Ibrahim, Hani Goodarzi, Chris J. Maddison, Bo Wang

专题命中 多模态训练与对齐 :multimodal(title)

Comments 28 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20347 2025-10-24 cs.RO cs.MA 71%

Multi-Modal Decentralized Reinforcement Learning for Modular Reconfigurable Lunar Robots

Ashutosh Mishra, Shreya Santra, Elian Neppel, Edoardo M. Rossi Lombardi, Shamistan Karimov, Kentaro Uno, Kazuya Yoshida

机构 * Space Robotics Lab. (SRL) in Department of Aerospace Engineering, Graduate School of Engineering, Tohoku University(太空机器人实验室(SRL)位于东东北大学航空航天工程系研究生院) Politecnico di Milano(米兰理工大学)

专题命中 多模态训练与对齐 :multi-modal(title)

Comments Accepted in IEEE iSpaRo 2025. Awaiting Publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26223 2025-10-01 q-bio.GN 71%

Nephrobase Cell+: Multimodal Single-Cell Foundation Model for Decoding Kidney Biology

Chenyu Li, Elias Ziyadeh, Yash Sharma, Bernhard Dumoulin, Jonathan Levinsohn, Eunji Ha, Siyu Pan, Vishwanatha Rao, Madhav Subramaniyam, Mario Szegedy, Nancy Zhang, Katalin Susztak

专题命中 多模态训练与对齐 :multimodal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10139 2025-09-15 cs.RO 71%

CaR1: A Multi-Modal Baseline for BEV Vehicle Segmentation via Camera-Radar Fusion

Santiago Montiel-Marín, Angel Llamazares, Miguel Antunes-García, Fabio Sánchez-García, Luis M. Bergasa

机构 * Department of Electronics. University of Alcalá, Community of Madrid, Spain(电子系。阿尔卡拉大学,马德里社区)

专题命中 多模态训练与对齐 :multi-modal(title)

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14707 2025-09-12 cs.CY 71%

Information Fusion in Multimodal IoT Systems for physical activity level monitoring

Mohsen Shirali, Zahra Ahmadi, Jose-Luis Bayo-Monton, Zoe Valero-Ramon, Carlos Fernandez-Llatas

专题命中 多模态训练与对齐 :multimodal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16008 2025-08-25 cs.RO 71%

Self-Aligning EPM Connector: A Versatile Solution for Adaptive and Multi-Modal Interfaces

Bingchao Wang, Adam A. Stokes

机构 * Soft Systems Group, The School of Engineering, The University of Edinburgh(软系统组、工程学院、爱丁堡大学)

专题命中 多模态训练与对齐 :multi-modal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09485 2025-08-07 cs.LG cs.AR 71%

GenEDA: Towards Generative Netlist Functional Reasoning via Cross-Modal Circuit Encoder-Decoder Alignment

Wenji Fang, Jing Wang, Yao Lu, Shang Liu, Zhiyao Xie

机构 * Hong Kong University of Science and Technology(香港理工大学)

专题命中 多模态训练与对齐 :cross-modal(title)

Comments Accepted by ICCAD'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17262 2025-07-22 cs.RO 71%

CROSS-GAiT: Cross-Attention-Based Multimodal Representation Fusion for Parametric Gait Adaptation in Complex Terrains

Gershom Seneviratne, Kasun Weerakoon, Mohamed Elnoor, Vignesh Rajgopal, Harshavarthan Varatharajan, Mohamed Khalid M Jaffar, Jason Pusey, Dinesh Manocha

专题命中 多模态训练与对齐 :multimodal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15696 2025-06-23 cs.LG 71%

CoC: Chain-of-Cancer based on Cross-Modal Autoregressive Traction for Survival Prediction

Haipeng Zhou, Sicheng Yang, Sihan Yang, Jing Qin, Lei Chen, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Xi'an Jiaotong University(西安交通大学) The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态训练与对齐 :cross-modal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08388 2025-05-14 cs.RO 71%

MDF: Multi-Modal Data Fusion with CNN-Based Object Detection for Enhanced Indoor Localization Using LiDAR-SLAM

Saqi Hussain Kalan, Boon Giin Lee, Wan-Young Chung

机构 * Department of Artificial Intelligence Convergence, Pukyong National University(人工智能融合系,浦项国立大学) School of Computer Science, University of Nottingham Ningbo China(计算机科学学院,诺丁汉国际大学)

专题命中 多模态训练与对齐 :multi-modal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12994 2025-05-08 cs.SI 71%

Conversation-Based Multimodal Abuse Detection Through Text and Graph Embeddings

Noé Cecillon, Vincent Labatut, Richard Dufour

专题命中 多模态训练与对齐 :multimodal(title)

Journal ref Computing, 2025, 107, pp.124

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19762 2025-04-29 cond-mat.mtrl-sci 71%

St4DeM: A software suite for multi-modal 4D-STEM acquisition techniques

Toni Uusimaeki, Cheuk-Wai Tai, Tom Willhammar, Thomas Thersleff, Hasan Ali, Seda Ulusoy, Meltem Sezen, Bora Derin

专题命中 多模态训练与对齐 :multi-modal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13049 2025-04-18 q-bio.GN 71%

Multi-modal single-cell foundation models via dynamic token adaptation

Wenmin Zhao, Ana Solaguren-Beascoa, Grant Neilson, Louwai Muhammed, Liisi Laaniste, Sera Aylin Cakiroglu

专题命中 多模态训练与对齐 :multi-modal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07552 2025-03-11 cs.LG 71%

Federated Multimodal Learning with Dual Adapters and Selective Pruning for Communication and Computational Efficiency

Duy Phuong Nguyen, J. Pablo Munoz, Tanya Roosta, Ali Jannesari

专题命中 多模态训练与对齐 :multimodal(title)

Comments Accepted at CCGrid 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13887 2025-02-18 cs.IR 71%

Cross-domain Recommender Systems via Multimodal Domain Adaptation

Adamya Shyam, Ramya Kamani, Venkateswara Rao Kagita, Vikas Kumar

专题命中 多模态训练与对齐 :multimodal(title)

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01102 2024-12-13 cs.LG eess.SP 71%

Personalized Coupled Tensor Decomposition for Multimodal Data Fusion: Uniqueness and Algorithms

Ricardo Augusto Borsoi, Konstantin Usevich, David Brie, Tülay Adali

专题命中 多模态训练与对齐 :multimodal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07851 2024-10-11 cs.LG 71%

Scalable Representation Learning for Multimodal Tabular Transactions

Natraj Raman, Sumitra Ganesh, Manuela Veloso

专题命中 多模态训练与对齐 :multimodal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00047 2024-10-02 eess.IV cs.LG q-bio.NC 71%

Looking through the mind's eye via multimodal encoder-decoder networks

Arman Afrasiyabi, Erica Busch, Rahul Singh, Dhananjay Bhaskar, Laurent Caplette, Nicholas Turk-Browne, Smita Krishnaswamy

专题命中 多模态训练与对齐 :multimodal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15660 2024-08-23 cs.RO cs.LG 71%

MuTT: A Multimodal Trajectory Transformer for Robot Skills

Claudius Kienle, Benjamin Alt, Onur Celik, Philipp Becker, Darko Katic, Rainer Jäkel, Gerhard Neumann

专题命中 多模态训练与对齐 :multimodal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏