arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6903 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6903 篇

2608.04452 2026-08-06 cs.CV cs.AI cs.CL 新提交 82%

Q-CueGraph: Query-Conditioned Visual Evidence Graphs for Multimodal Reasoning

Q-CueGraph:用于多模态推理的查询条件化视觉证据图

Pengcheng Pan, Xinfang Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Q-CueGraph是一种用于多模态推理的查询条件化视觉证据图,它为冻结读取器生成受预算约束的坐标级观测,在多个基准测试中显著提升了推理性能,尤其适用于证据可定位、问题能区分位置且分辨率受限的场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04234 2026-08-06 math.ST cs.LG stat.ML stat.TH 新提交 82%

Multimodal Alignment Through Joint Kernel Entropic Gromov--Wasserstein Optimal Transport

基于联合核熵 gromov-wasserstein 最优传输的多模态对齐

Yixuan Florence Wu, Yilun Zhu, Naichen Shi

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对跨模态配对数据稀缺的场景,提出 JK-EGW 框架实现多模态对齐,理论样本复杂度匹配标准最优传输,实验中在数据稀缺的预训练编码器嵌入对齐任务上性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02769 2026-08-05 stat.ME cs.LG math.ST stat.ML stat.TH 新提交 82%

DAIF: A Data-Driven Intermediate Fusion Framework for Multimodal Supervised Learning via Approximate Message Passing

DAIF:一种基于数据的近似消息传递多模态监督学习中间融合框架

Sagnik Nandy, Samriddha Lahiry, Pragya Sur, Subhabrata Sen

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本研究提出DAIF数据自适应中间融合框架,结合随机矩阵理论与非参数依赖度量,通过近似消息传递生成去噪特征,在模拟及两个多模态数据集上的预测任务中表现优于或媲美现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01282 2026-08-04 stat.ME 新提交 82%

Multimodal domain adaptation under label shift and blockwise missing modalities

标签偏移与分块模态缺失下的多模态域适应

Zebin Wang, Ziang Dou, Molei Liu, Tianxi Cai

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对标签偏移与分块模态缺失的多模态域适应问题,提出参考锚定方法,结合代理标签辅助策略,在模拟与RCC应用中实现了分布偏移下的稳定预测。

Comments 49 pages, 3 figures, 15 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29213 2026-08-03 cs.IR cs.LG 新提交 82%

GALA: Generative Aligned Learning for Adaptive Multimodal Representation in the Taobao Shangou Recommender System

GALA:淘宝商购推荐系统中用于自适应多模态表示的生成对齐学习

Jiping Liu, Zhongmin Zhang, Zisen Sang, Zhijia Fang, Tao Ouyang, Ma Jiang, Shaopeng Liang, Zeyang Hou, Guodong Cao, Jia Jia

专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract)

AI总结 本文针对外卖推荐系统多模态融合难、语义与行为对齐不足的问题,提出三阶段流程GALA,通过生成式RL对齐阶段弥合预训练-微调差距,在淘宝商购部署后提升了订单量与AUC等指标。

Comments 13 pages, 12 figures, 5 tables. Accepted at the 2026 IEEE International Conference on Data Engineering (ICDE 2026), Industry and Applications Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27289 2026-07-31 cs.LG 新提交 82%

TIER-MoE: Trust-Informed Expert Routing via Conditional Modality Risk for Multimodal Fusion in Biomedical Classification

TIER-MoE:用于生物医学分类多模态融合的、基于条件模态风险的信任感知专家路由

Yu Chang, Anzhe Cheng, Chenwei Wu, Zhuoran Wang, Jiahao Chen, Tamoghna Chattopadhyay, Sophia I. Thomopoulos, Paul M. Thompson, Liyue Shen, Paul Bogdan

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 该研究提出TIER-MoE风险引导子空间混合专家模型,用于生物医学分类多模态融合,可提升预测性能与概率校准,在多数据集上优于现有最优方法且具备强零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27260 2026-07-31 cs.LG 新提交 82%

Regularizing modality contribution drift in multimodal continual learning

多模态持续学习中模态贡献漂移的正则化

Zhen Zhang, Jielei Chu, Bin Liu, Tianrui Li

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对多模态持续学习中的模态贡献漂移问题,提出含基于重放和无重放版本的CMCDR方法,经实验验证其通用性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15928 2026-07-28 cs.LG 版本更新 82%

Knowledge-Guided Cross-Modal Fusion for Adult-to-Pediatric ECG Transfer via Label-Conditioned Contrastive Alignment

通过标签条件对比对齐实现成人到儿科心电图转换的知识引导跨模态融合

Xinran Liu, Yuwen Li, Hongxiang Gao, Heyang Xu, Jianqing Li, Zongmin Wang, Chengyu Liu

机构 * School of Instrument Science and Engineering, Southeast University(东南大学仪器科学与工程学院) Nanjing Medical University(南京医科大学) Zhengzhou University(郑州大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 研究针对成人与儿科心电图转换问题,提出知识引导的跨模态融合框架PEACE,通过标签条件对比对齐等方法,在有限监督下实现更好的儿科心电图解释,消融实验证明标签条件知识对齐是关键驱动因素。

Comments This article was accidentally submitted as a new arXiv paper instead of a replacement of arXiv:2605.00647. Please refer to arXiv:2605.00647 for the correct and updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22408 2026-07-27 cs.LG 新提交 82%

LunarFM: A Shared Multimodal Representation of the Moon's Surface

LunarFM:月球表面的共享多模态表示

Marc Girona-Mata, Jakob Gawlikowski, Sumit Goski, Gautier Bardi de Fourtou, Valentin T. Bickel, Ben Moseley, Abigail Calzada-Diaz, Sylvester Kaczmarek, Raúl Ramos-Pollán

机构 * University of Cambridge(剑桥大学) German Aerospace Center (DLR)(德国航空航天中心) SPAIDER SPACE(斯派德太空公司) Mines Paris - PSL University(巴黎矿业学院 - 巴黎文理研究大学) University of Bern(伯尔尼大学) Imperial College London(伦敦帝国理工学院) European Space Resources Innovation Center (ESRIC)(欧洲空间资源创新中心) Universidad de Antioquia(安蒂奥基亚大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(abstract)

AI总结 因月球探索需求,针对多源观测致月球表面分析碎片化问题,提出LunarFM多模态基础模型,融合多仪器观测学习通用表示,支持多种下游应用,还提供相关数据集、预训练模型等,助力月球表面高效分析。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22035 2026-07-27 cs.LG 新提交 82%

DCS: A Unified Conditional Sensitivity Framework for Cross-Modal Copyright Infringement Detection

DCS:用于跨模态版权侵权检测的统一条件敏感度框架

Xiafeng Man

机构 * Fudan University(复旦大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 研究针对基础模型版权侵权检测问题,提出统一的DCS框架,将侵权证据视为反事实条件分布转移,通过条件差分隐私形式化,创建双分支并结合多种因素界定敏感度,还定义校准统计量,适用于多种模型并以不同方式评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21058 2026-07-24 cs.RO 新提交 82%

Human-Inspired Framework for Robotic Craniotomy: Integrating Multimodal Fusion and Adaptive Trajectory Adjustment

用于机器人开颅手术的受人类启发框架:集成多模态融合与自适应轨迹调整

Renzhen Le, Xiao Zhang, Di Wu, Yuanyu Wei, Jiachen Zhu, Zhenzhi Ying, Pengfei Zhang, Liming Shu

机构 * Dalian University of Technology(大连理工大学) The University of Tokyo(东京大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 该研究针对机器人开颅手术问题,提出受人类启发的闭环框架,集成术前规划与术中执行。采用自适应双轮廓融合算法生成轨迹,利用多模态网络融合信号实现突破检测,通过原位投影策略调整轨迹,实验验证该框架能实现安全自主且高效闭环控制的开颅手术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20906 2026-07-24 cond-mat.mtrl-sci cond-mat.dis-nn physics.app-ph physics.data-an 新提交 82%

Uni-XAS: Alignment-Driven Bidirectional Multimodal Learning for X-ray Absorption Spectroscopy

Uni-XAS:用于X射线吸收光谱的对齐驱动双向多模态学习

Suyang Zhong, Yuhao Zhao, Boying Huang, Fanjie Xu, Pengwei Xu, Haoyi Tao, Xi Fang, Jun Cheng, Fujie Tang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 研究针对X射线吸收光谱建模中异构模态学习难题,提出Uni-XAS框架。通过XASLip解决元素内配位变化,用检索增强解码防尺度崩溃等,还引入排列校正流匹配解决逆问题,在多方面表现出色,为多模态学习和评估奠定基础。

Comments 48 pages, 7 figures, 11 tables. Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17657 2026-07-21 cs.AI cs.CV cs.MM 新提交 82%

OrientSAM: Mitigating Camera-Centric Shortcut in Multimodal Spatial Reasoning via Orientation-Aware Spatial Alignment

OrientSAM:通过方向感知空间对齐减轻多模态空间推理中以相机为中心的捷径

Wenxiao Fan, Hang Yin, Kan Li

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 研究多模态模型空间推理中以相机为中心的问题,提出OrientSAM框架,通过方向感知令牌、傅里叶角度编码及课程学习策略注入方向信息并改善推理,构建数据管道生成监督,实验证明其在多任务中表现出色,能减轻捷径行为,实现更强大的以对象为中心的空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14410 2026-07-21 cs.LG q-bio.GN 版本更新 82%

LATTICE: Graph Self-Supervised Learning for Multimodal Spatial Omics Integration

LATTICE:用于多模态空间组学整合的图自监督学习

Jagan Mohan Reddy Dwarampudi, Veena Kochat, Suresh Satpati, Hien Van Nguyen, Kunal Rai, Tania Banerjee

机构 * University of Houston(休斯顿大学) MD Anderson Cancer Center(MD安德森癌症中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 研究针对多模态空间组学整合下游分析常采用单模态管道的问题,提出LATTICE框架,通过构建空间邻域图并训练TransformerConv编码器,在黑色素瘤队列实验中实现多模态整合,提升相关指标,为该领域提供实用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15687 2026-07-20 cs.LG 新提交 82%

Toward Federated Multimodal Graph Foundation Models: A Topology-Aware Multimodal Alignment Framework

迈向联邦多模态图基础模型:一种拓扑感知多模态对齐框架

Xunkai Li, Guohao Fu, Yuming Ai, Zhengyu Wu, Hongchao Qin, Rong-Hua Li, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 研究针对多模态属性图分散在不同隐私受限孤岛的问题,提出FedGAMMA框架,将联邦多模态图基础学习视为两阶段语义结构对齐问题,经实验验证该框架在下游任务中表现出色,超越诸多基线,在少样本学习场景下也有优势。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09982 2026-07-14 cs.LG 新提交 82%

Multimodal Routing for Interpretable, Robust, and Auditable Clinical Prediction

用于可解释、稳健且可审计的临床预测的多模态路由

Nikkie Hooman, Zhongjie Wu, Eric C. Larson, Mehak Gupta

机构 * Southern Methodist University(南卫理公会大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对EHR数据多模态预测中现有方法缺乏可解释性的问题,提出显式多模态路由框架,通过构建不同模态路由及引入推理时路由掩码实现可解释、稳健且可审计的推理,经实验评估揭示了临床状况组模态依赖差异。

Comments Accepted at CHASE 2026. 12 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05252 2026-07-07 cs.LG 新提交 82%

FUSE: FK-Steered Multi-Modal Flow Matching for Efficient Simulation-Based Posterior Estimation

FUSE:用于高效基于模拟后验估计的费曼-卡茨引导多模态流匹配

Weichen Qin, Yufan Xie, Peihao Wang, Chia-Jui Chou, Minghui Du, Peng Xu, Ziren Luo, Yi Yang, Jingyi Yu, Bo Liang, Jiakai Zhang

机构 * ShanghaiTech University(上海科技大学) Cellverse, Co., Ltd.(Cellverse公司)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract)

AI总结 针对现有基于模拟推理方法多模态建模效果差的问题,提出双架构FUSE结合FK引导采样,提升后验估计精度,在基准测试和系外行星任务上性能优于现有方法。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026). 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02928 2026-07-07 cs.LG 新提交 82%

CoFEND: A Cross-Modal Fusion End-to-End Network for Cold-Start Drug-Drug Interaction Prediction

CoFEND:用于冷启动药物-药物相互作用预测的跨模态融合端到端网络

Di Wu, Hongyi Sun, Haichao Xu, Jia Chen, Zhong Chen, Jie Yang

机构 * College of Computer and Information Science, Southwest University(西南大学计算机与信息科学学院) Beihang University(北京航空航天大学) School of Computing, Southern Illinois University Carbondale(南伊利诺伊大学卡本代尔分校计算机学院) School of Physics and Electronic Science, Zunyi Normal University(遵义师范学院物理与电子科学学院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 针对新药冷启动药物-药物相互作用预测难题,提出CMF-ELN。利用多模态信息构建知识图谱,设计图自动编码器融合跨模态相似性,采用两阶段可解释性方案,提升预测准确性与机制解释性。

Comments 11 pages, 2 figures, accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28123 2026-06-30 cs.CV cs.AI cs.CL 82%

Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

超越SFT到RL:通过黑盒在线策略蒸馏进行预对齐以多模态RL

Sudong Wang, Weiquan Huang, Xiaomin Yu, Zuhao Yang, Hehai Lin, Keming Wu, Chaojun Xiao, Chen Chen, Wenxuan Wang, Beier Zhu, Yunjian Zhang, Chengwei Qin

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出PRISM框架,通过在SFT和RLVR之间插入显式分布对齐阶段,解决多模态RL中的分布漂移问题,利用基于策略蒸馏的对抗游戏提升对齐效果,实验显示在多个RL算法和基准上性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08668 2026-06-29 eess.SP 版本更新 82%

Beyond Information Redundancy: Expanding Cross-Modal Knowledge Representation for Power Load Time Series Forecasting

PrismNet:通过多模态棱镜解读时间序列以实现可解释的电力负荷预测

Yuxuan Chen, Shuo Dai, Ruoyi Xu, Haipeng Xie

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multi-modal(abstract)

AI总结 PrismNet通过多模态增强模块和PID引导的多模态对比学习,提升电力负荷预测的可解释性与少样本学习能力,在实际数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26629 2026-06-29 cs.LG 版本更新 82%

Context-specific Credibility-aware Multimodal Fusion with Conditional Probabilistic Circuits

基于条件概率电路的上下文特定可信感知多模态融合

Pranuthi Tenali, Sahil Sidheekh, Saurabh Mathur, Erik Blasch, Kristian Kersting, Sriraam Natarajan

机构 * Department of Computer Science , TU Darmstadt(德累斯顿技术大学计算机科学系) Air Force Research Lab(空军研究实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 提出C$^2$MF框架,利用条件概率电路建模实例级源可靠性,通过KL散度度量上下文特定信息可信度,在跨模态冲突下提升预测准确率高达29%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10386 2026-06-25 cs.CV cs.AI cs.MM 82%

Handling Missing Modalities in Multimodal Survival Prediction for Non-Small Cell Lung Cancer

多模态生存预测中缺失模态的处理:非小细胞肺癌的应用

Filippo Ruffini, Camillo Maria Caruso, Claudia Tacconi, Lorenzo Nibid, Francesca Miccolis, Marta Lovino, Carlo Greco, Edy Ippolito, Michele Fiore, Alessio Cortellini, Bruno Beomonte Zobel, Giuseppe Perrone, Bruno Vincenzi, Claudio Marrocco, Alessandro Bria, Elisa Ficarra, Sara Ramella, Valerio Guarrasi, Paolo Soda

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering(人工智能与计算机系统单位,工程系) Università Campus Bio-Medico di Roma(罗马生物医学大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering(诊断与介入部门,辐射物理,生物医学工程) Umeå University(乌梅学院) Research Unit of Radiation Oncology, Department of Medicine and Surgery(放射肿瘤研究单位,医学与外科部门) Fondazione Policlinico Universitario Campus Bio-Medico(生物医学大学附属医院基金会) Anatomical Pathology Operative Research Unit(解剖病理学操作研究单位) Research Unit of Anatomical Pathology, Department of Medicine and Surgery(解剖病理学研究单位,医学与外科部门) Department of Medicine and Surgery(医学与外科部门)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出一种缺失感知的多模态生存框架,结合CT、WSI和临床数据,通过基础模型提取特征并融合,提升NSCLC生存预测的准确性与临床适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20696 2026-06-23 cs.CL cs.AI eess.AS 新提交 82%

MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data

MindAlign: 在有限数据下通过多模态嵌入对齐从fMRI信号解码内心语言

Muxuan Liu, Ichiro Kobayashi, Satoshi Nishida

机构 * Graduate School of Humanities and Sciences Ochanomizu University(大仓山大学人文科学研究生院) Center for Information and Neural Networks Advanced ICT Research Institute National Institute of Information and Communications Technology(信息与神经网络中心先进信息通信研究机构信息通信技术研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 提出MindAlign两阶段框架,通过神经-语义对齐将fMRI信号映射到多模态语义空间,再结合视觉上下文冻结多模态语言模型生成文本,在静默图像描述数据上优于基线,且语义-语言投影可跨被试泛化。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12867 2026-06-17 cs.LG 新提交 82%

SMGFM: Spectral Multimodal Graph Pretraining for Multimodal-Attributed Graphs

SMGFM: 面向多模态属性图的谱多模态图预训练

Zhengyu Wu, Xu Wang, Hongchao Qin, Xunkai Li, Guang Zeng, Rong-Hua Li, Guoren Wang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 提出SMGFM框架,利用图频谱分解区分结构诱导语义与模态特有语义,通过频带路由实现跨模态融合,在图级和模态级任务上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11190 2026-06-12 cs.LG 新提交 82%

When to Align, When to Predict: A Phase Diagram for Multimodal Learning

何时对齐,何时预测:多模态学习的相图

Ilay Kamai, Hugues Van Assel, Aviv Regev, Hagai B. Perets, Randall Balestriero

机构 * Technion(以色列理工学院) Genentech(基因泰克公司) Brown University(布朗大学) Meta AI, FAIR

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 提出统一线性框架,通过信噪比模型揭示跨模态对齐与预测的互补失效模式,构建四区域相图指导多模态学习目标选择,并在非线性实验中验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09131 2026-06-09 cs.AI cs.CL cs.CV cs.LG 新提交 82%

Late-Layer Fusion is Enough: Dual-Path Vision Token Routing for Multimodal Large Language Models under Visual Saturation

晚期融合足矣:面向视觉饱和的多模态大语言模型的双路径视觉令牌路由

Siyuan Liu, Jinyang Wu

机构 * School of Mechanics and Engineering Science, Peking University(北京大学力学与工程科学学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对多模态大语言模型中视觉令牌在深层饱和的问题,提出双路径视觉令牌路由(DPVR-LF),在饱和点将视觉令牌路由至单层可训练分支,仅最后层融合,以约3%可训练参数保持性能并减少计算。

Comments 18 pages, 4 figures. Submitted to Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09082 2026-06-09 cs.IR 新提交 82%

Teach Multimodal Recommendation Model to See via Personalized Visual Extraction and Adaptive Learning

教多模态推荐模型通过个性化视觉提取和自适应学习来观察

Yutong Li, Xinyi Zhang, Ziyi Ye, Daoguo Dong, Yu-gang Jiang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 提出REVEAL框架,通过反馈引导的视觉提取和自适应视觉学习,增强视觉特征利用和跨模态优化,提升多模态序列推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00647 2026-06-09 cs.LG 版本更新 82%

Label-Conditioned Cross-Modal Fusion for Adult-to-Pediatric ECG Transfer via Curriculum-Gated Contrastive Alignment

基于标签的跨模态融合用于成人到儿童ECG转移 via 课程门控对比对齐

Xinran Liu, Yuwen Li, Hongxiang Gao, Heyang Xu, Jianqing Li, Zongmin Wang, Chengyu Liu

机构 * School of Instrument Science and Engineering, Southeast University(东南大学仪器科学与工程学院) Nanjing Medical University(南京医科大学) Zhengzhou University(郑州大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 本文提出PEACE框架,通过预训练和适应性融合提升儿童ECG诊断,采用对比学习和课程适应策略,在有限标注下实现高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03370 2026-06-03 eess.IV 82%

SMAC: Spatial-Modal Joint Modeling and Adaptive Representation Collapse for Multimodal Object Tracking

SMAC: 空间-模态联合建模与自适应表示崩溃的多模态目标跟踪

Meijing Gao, Qitai Sun, Huanyu Sun, Bingxuan Yang, Bingzhou Sun, Xu Chen, Yonghao Yan, Yuxuan Yang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对复杂光照下多模态多目标跟踪中空间与模态特征联合建模不足及固定融合策略适应性有限的问题,提出基于空间-模态卷积融合和蒸馏提示的多模态跟踪框架,通过解耦3D卷积、幅相分解和表示崩溃网络实现自适应融合,在UniRTL数据集上取得领先性能。

Comments 12 pages, 16 figures. Code and pretrained models are available at https://github.com/QitaiSun/SMAC

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05249 2026-06-03 cs.IR 82%

TriAlignGR: Triangular Multitask Alignment with Multimodal Deep Interest Mining for Generative Recommendation

TriAlignGR:面向生成式推荐的多模态深度兴趣挖掘与三角多任务对齐

Yangchen Zeng, Hao Peng, Rongfeng Guo, Zhenyu Yu, Zhiyuan Hu, Jinze Wang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 提出TriAlignGR统一多任务多模态框架,通过两阶段语义传播和三角多任务对齐,解决语义ID中的内容退化与语义不透明问题,实现生成式推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏