arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6918 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6918 篇

2508.16054 2025-08-25 cs.AI cs.CL 79%

Generative Foundation Model for Structured and Unstructured Electronic Health Records

Sonish Sivarajkumar, Hang Zhang, Yuelyu Ji, Maneesh Bilalpur, Xizhi Wu, Chenyu Li, Min Gu Kwak, Shyam Visweswaran, Yanshan Wang

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20518 2025-07-29 cs.CV cs.MM 79%

T2VParser: Adaptive Decomposition Tokens for Partial Alignment in Text to Video Retrieval

Yili Li, Gang Xiong, Gaopeng Gou, Xiangyan Qu, Jiamin Zhuang, Zhen Li, Junzheng Shi

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11515 2025-06-16 cs.CV cs.CL cs.LG 79%

Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs

Xiao Xu, Libo Qin, Wanxiang Che, Min-Yen Kan

机构 * Research Center for Social Computing and Information Retrieval, Harbin Institute of Technology(社会计算与信息检索研究中心,哈尔滨工业大学) School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学) School of Computing, National University of Singapore(计算学院,新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT). June 2025. DOI: https://doi.org/10.1109/TCSVT.2025.3578266

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02476 2025-03-05 cs.CV cs.AI 79%

BioD2C: A Dual-level Semantic Consistency Constraint Framework for Biomedical VQA

Zhengyang Ji, Shang Gao, Li Liu, Yifan Jia, Yutao Yue

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00695 2025-02-04 cs.CV cs.AI 79%

TMI-CLNet: Triple-Modal Interaction Network for Chronic Liver Disease Prognosis From Imaging, Clinical, and Radiomic Data Fusion

Linglong Wu, Xuhao Shan, Ruiquan Ge, Ruoyu Liang, Chi Zhang, Yonghong Li, Ahmed Elazab, Huoling Luo, Yunbi Liu, Changmiao Wang

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments 6 pages, 3 figures, accepted by IEEE ISBI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15368 2025-01-28 cs.CL cs.SD eess.AS 79%

Baichuan-Omni-1.5 Technical Report

Yadong Li, Jun Liu, Tao Zhang, Tao Zhang, Song Chen, Tianpeng Li, Zehuan Li, Lijun Liu, Lingfeng Ming, Guosheng Dong, Da Pan, Chong Li, Yuanbo Fang, Dongdong Kuang, Mingrui Wang, Chenglin Zhu, Youwei Zhang, Hongyu Guo, Fengyu Zhang, Yuran Wang, Bowen Ding, Wei Song, Xu Li, Yuqi Huo, Zheng Liang, Shusen Zhang, Xin Wu, Shuai Zhao, Linchu Xiong, Yozhen Wu, Jiahui Ye, Wenhao Lu, Bowen Li, Yan Zhang, Yaqi Zhou, Xin Chen, Lei Su, Hongda Zhang, Fuzhong Chen, Xuezhen Dong, Na Nie, Zhiying Wu, Bin Xiao, Ting Li, Shunya Dang, Ping Zhang, Yijia Sun, Jincheng Wu, Jinjie Yang, Xionghai Lin, Zhi Ma, Kegeng Wu, Jia li, Aiyuan Yang, Hui Liu, Jianqiang Zhang, Xiaoxi Chen, Guangwei Ai, Wentao Zhang, Yicong Chen, Xiaoqin Huang, Kun Li, Wenjing Luo, Yifei Duan, Lingling Zhu, Ran Xiao, Zhe Su, Jiani Pu, Dian Wang, Xu Jia, Tianyu Zhang, Mengyu Ai, Mang Wang, Yujing Qiao, Lei Zhang, Yanjun Shen, Fan Yang, Miao Zhen, Yijie Zhou, Mingyang Chen, Fei Li, Chenzheng Zhu, Keer Lu, Yaqi Zhao, Hao Liang, Youquan Li, Yanzhao Qin, Linzhuang Sun, Jianhua Xu, Haoze Sun, Mingan Lin, Zenan Zhou, Weipeng Chen

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);omni-modal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10319 2024-10-15 cs.CV cs.MM 79%

Spatial-Aware Efficient Projector for MLLMs via Multi-Layer Feature Aggregation

Shun Qian, Bingquan Liu, Chengjie Sun, Zhen Xu, Baoxun Wang

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.MM

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16476 2024-02-21 cs.CV cs.AI 79%

LANS: A Layout-Aware Neural Solver for Plane Geometry Problem

Zhong-Zhi Li, Ming-Liang Zhang, Fei Yin, Cheng-Lin Liu

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02503 2024-02-07 cs.CV cs.CL 79%

GeReA: Question-Aware Prompt Captions for Knowledge-based Visual Question Answering

Ziyu Ma, Shutao Li, Bin Sun, Jianfei Cai, Zuxiang Long, Fuyan Ma

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.CL

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.07651 2021-10-08 cs.CV cs.AI 79%

Align before Fuse: Vision and Language Representation Learning with Momentum Distillation

Junnan Li, Ramprasaath R. Selvaraju, Akhilesh Deepak Gotmare, Shafiq Joty, Caiming Xiong, Steven Hoi

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19492 2026-08-21 cs.LG cs.RO 新提交 78%

Beyond Multimodal Alignment: Certifying Physical Language through Response Substitution and Ordered Execution

超越多模态对齐:通过响应替换与有序执行验证物理语言

Kaizhen Tan, Xin Xu, Siru Tao, Yixiao Li, Hanzhe Hong, Yang Feng, Heqing Du

机构 * New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出DBOSC方法,在Cluster Haptic数据集与弹塑性系统中验证了多模态物理表示的可执行含义,明确了执行器、图表等因素对动作组合的影响,区分了多项可测试的操作能力成就。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19052 2026-08-20 cs.CR 新提交 78%

Malformer: A Multi-Modal Malware Detector Using Transformers

Malformer:一种基于Transformer的多模态恶意软件检测器

Samuel Howard, Kshitiz Aryal, Mahmoud Abdelsalam, Maanak Gupta, Andrew Wheeler, Pradip Kunwar

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract)

AI总结 本研究提出四模态恶意软件检测模型Malformer,融合文本、图像、图形、音频表示,采用多模态Transformer融合,在201549个样本数据集上准确率98.3%,优于单/双模态检测器,为恶意软件防御提供稳健基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18396 2026-08-20 eess.SY cs.SY 新提交 78%

LiDAR-Derived Surface Priors for Multimodal Sensing-Assisted NLoS Beam Search in Indoor 60-GHz Networks

室内60GHz网络中多模态传感辅助非视距波束搜索的激光雷达衍生表面先验

Amod Ashtekar, Dalton Davis, Rafaela Lomboy, Omar Ibrahim, Raj Sai Sohel Bandari, Mohammed E. Eltayeb

专题命中 多模态训练与对齐 :multimodal(title);cross-modal(abstract)

AI总结 该研究提出用激光雷达衍生的局部表面结构作为先验,结合射频测量,可将60GHz网络的波束对探测减少72%,同时保持74.5%位置的波束在详尽搜索的3dB范围内,降低毫米波波束搜索不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16962 2026-08-19 eess.IV 新提交 78%

Clinical Pathways Matter for Multimodal Deep Learning in Early Alzheimers Disease Detection

临床路径对早期阿尔茨海默病检测中的多模态深度学习至关重要

Yao Lu, Solveig Kristina Hammonds, Alvaro Fernandez-Quilez

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究提出基于SigLIP的零样本多模态框架,结合结构MRI与常规临床变量,在ADNI队列中实现早期阿尔茨海默病风险分层,性能优于传统模型,且可扩展至纵向数据。

Comments Published

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21693 2026-08-19 cs.LG 版本更新 78%

TiMi: Empower Time Series Transformers with Multimodal Mixture of Experts

TiMi: 通过多模态专家混合增强时间序列变换器

Jiafeng Lin, Yuxuan Wang, Huakun Luo, Jianmin Wang, Zhongyi Pei

机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 TiMi通过多模态专家混合机制,利用大语言模型生成未来推断以提升时间序列预测的因果推理能力,实现多模态数据的有效整合与高精度预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12944 2026-08-14 cs.LG eess.IV stat.ML 新提交 78%

CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation

CardioState-JEPA:面向共享心脏表征的延迟感知跨模态学习

Hamza Shafiq, Hung Manh Pham, Bin Zhu, Pan Zhou, Jun Hu, Aaqib Saeed

机构 * Singapore Management University(新加坡管理大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 CardioState-JEPA是一种延迟感知跨模态心脏基础模型,通过对齐ECG、PPG、PCG的共享生理表征,在25项下游任务上显著提升了各模态的分类性能,实现了异质心脏信号的相互监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10700 2026-08-12 cs.IR 新提交 78%

Deciding When to Rely on Visual Information: Gated Multimodal Fusion in Sequential Recommendation

何时依赖视觉信息:序列推荐中的门控多模态融合

Natalija Glisovic, Danica Kragic, Martin Tegner

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究提出VisGate框架,基于物品和用户上下文自适应融合多模态信号,揭示视觉效用随物品、交互稀疏性变化的规律,实现更精准的序列推荐并可解释视觉信息的作用。

Comments 8 pages, 6 figures, Accepted at CARS @ RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16108 2026-08-12 eess.SP 版本更新 78%

Advancing Industry 4.0: Multimodal Sensor Fusion for AI-Based Fault Detection in 3D Printing

推进工业4.0:面向基于3D打印的AI故障检测的多模态传感器融合

Muhammad Fasih Waheed, Shonda Bernadin, Ali Hassan

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本研究提出了一种低成本、便携的多模态传感器融合AI系统,用于实时监测FDM 3D打印过程中的故障,提升制造可靠性和可持续性。

Comments International Journal of Engineering Research and Innovation | v17, n2, Fall/Winter 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09830 2026-08-11 cs.LG 新提交 78%

Deep Multimodal Wearable Sensor Fusion for Detection of Body-Focused Repetitive Behaviors

用于聚焦身体重复行为检测的深度多模态可穿戴传感器融合

Samaneh Rezaeimanesh, Mohsen Behradfar, Mohammad Fili, Guiping Hu

机构 * George Mason University(乔治梅森大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本研究开发多模态深度学习框架,利用腕戴式传感器数据检测聚焦身体的重复行为,在二元及九分类任务中均优于单模态基线,为可穿戴辅助心理健康诊断奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05647 2026-08-07 cs.RO 新提交 78%

KILVO: Kinematic-Inertial-LiDAR-Visual Odometry with Robust Multimodal Adaptation for Humanoid Robots

KILVO:面向人形机器人的具备鲁棒多模态自适应的运动学-惯性-激光雷达-视觉里程计

Jixin Gao, Fucheng Liu, Teng Zhang, Fusheng Zha

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出面向人形机器人的KILVO里程计,基于ESIKF整合多传感器并设计多模态自适应与接触估计模块,实验显示其精度、效率及鲁棒性优于现有方法,代码与数据集已开源。

Comments This article has been accepted for publication in IEEE/ASME Transactions on Mechatronics. Personal use is permitted. All other uses require IEEE permission

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11981 2026-08-07 math.NA cs.NA eess.SP 版本更新 78%

RJD-BASE: Multi-Modal Spectral Clustering via Randomized Joint Diagonalization

RJD-BASE:基于随机联合对角化的多模态谱聚类

Haoze He, Artemis Pados, Daniel Kressner

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract)

AI总结 本研究提出RJD-BASE方法,通过随机凸组合拉普拉斯矩阵结合BASE选择规则实现多模态谱聚类,在低计算成本下优于经典多模态聚类方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02692 2026-08-05 cs.LG 新提交 78%

PatTree: a novel approach for automated creation of multimodal, graph-based patient representations for medical classification tasks

PatTree:一种用于医学分类任务的多模态图基患者表示自动构建新方法

Julia Gehrmann, Lars Quakulinski, Hamza Naseem, Oya Beyan

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究提出PatTree,一种自动构建的多模态图基患者表示,在ADNI-1队列子集上实现阿尔茨海默病等三分类任务98.5%平衡准确率,可作为临床AI流程的可扩展基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01620 2026-08-04 eess.SP 新提交 78%

Smartwatch Photoplethysmography-Derived Heart Age via ECG-Guided Cross-Modal Pretraining as a Digital Biomarker of Vascular Aging

通过心电引导跨模态预训练从智能手表光体积描记术衍生的心龄作为血管衰老的数字生物标志物

Donglin Xie, Xueying Gui, Yutian Zhu, Feng Xu, Guangkun Nie, Chenyang Xu, Jun Li, Shuailong Tang, Xiaoyu Li, Qi Xie, Yelei Li, Shenda Hong

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 本研究开发心电引导跨模态框架,利用智能手表PPG衍生的心龄差作为数字生物标志物,证实其与动脉僵硬度、高血压显著相关,可用于血管衰老评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01020 2026-08-04 cs.CR 新提交 78%

Inverting the Hidden: Unveiling Multimodal Privacy Leakage in Collaborative LVLM Inference

反转隐藏内容:揭示协作式大型视觉语言模型(LVLM)推理中的多模态隐私泄露

Shuaifan Jin, Zhibo Wang, Qiyuan Wang, Yiting Han, Yajie Zhou, Yuanfan Zhang, Jiahui Hu, Xiaoyi Pang

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究针对协作式LVLM推理的隐私风险,提出RASR多模态重建攻击,可从深层LVLM隐藏状态恢复隐私信息,图像重建MSE降约50%、文本恢复token准确率达99%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00621 2026-08-04 cs.LG 新提交 78%

RHEA: Reliability-Harmonized Reconstruction and Assignment for Robust Multimodal-Attributed Graph Clustering

RHEA:用于鲁棒多模态属性图聚类的可靠性协调重构与分配

Yinlin Zhu, Di Wu, Ziyu Han, Zekai Chenm, Wang Luo, Miao Hu, Guocong Quan

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多模态属性图聚类中属性含噪或缺失时性能下降的问题,提出RHEA框架,通过估计节点特定模态可靠性并结合邻域信息提升聚类效果,在基准测试中表现优于最强基线。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29000 2026-08-03 cs.IR cs.LG 新提交 78%

PaletteID: Prototype-Composed Semantic Identifiers for Multimodal CTR Prediction

PaletteID:用于多模态点击率预测的原型组合语义标识符

Huanyu Liu, Baining Chen, Hui Liu, Zengyang Li, Ziyi Huang

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出PaletteID模型,以SQ-DPP构建原型调色板聚合语义相关原型,在两个公开数据集上提升CTR预测性能,对长尾物品增益更显著且标识符分配更鲁棒、语义更可解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28708 2026-08-03 cs.LG 新提交 78%

MMFGU: Multimodal Federated Graph Unlearning

MMFGU:多模态联邦图遗忘

Haodong Lu, Zekai Chen, Weiwei Ji, Shihao Li, Xunkai Li, Xun Wu, Yinlin Zhu, Rong-Hua Li

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对现有联邦图遗忘无法满足多模态细粒度遗忘请求的问题,提出MMFGU框架,通过目标特定表示解耦等技术解决三大挑战,实验显示其能有效移除请求信息并实现41.5倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27017 2026-08-03 cs.LG cs.RO 版本更新 78%

What Can Latent World Models Know? Physical Parameter Identifiability in Multimodal Predictive Representations

隐式世界模型能知晓什么?多模态预测表示中的物理参数可识别性

Kaizhen Tan, Xin Xu, Siru Tao, Yixiao Li, Hanzhe Hong, Yang Feng, Heqing Du

机构 * New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究通过可控实验揭示,隐式世界模型的目标函数结构决定其获取的物理参数,输入与预测目标分别限制和决定可获知的物理量,额外数据仅优化已获取的参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28446 2026-07-31 cs.CE 新提交 78%

CoLAS: Multimodal Corroboration of Latent Asset Signals for Financial Trading

CoLAS:面向金融交易的潜在资产信号多模态确证

Yanzheng Jin, Pengyang Shao, Xiaohao Liu, Xi Ai, Fei Shen, Kenji Kawaguchi

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究针对金融交易中异构模态信号不可靠的问题,提出CoLAS多模态确证框架,通过增强共享分量与鲁棒一致性目标,在股票和加密货币数据集上实现年化收益率和夏普比率的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24747 2026-07-29 cs.CR cs.HC 新提交 78%

Multimodal User Authentication Method via Fusion of Keystroke Dynamics and Glove-Based Hand Kinematics

通过击键动力学和基于手套的手部运动学融合的多模态用户认证方法

Issei Hyakuda, Lei Jing

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究针对击键动力学受环境影响问题,提出融合击键动力学与手部运动学的多模态认证框架,用定制手套捕获特征,经混合架构融合,通过“未见”评估协议验证,该方法能有效提升认证准确率,融合模态增强了生物识别辨别力。

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏