arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6929 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6929 篇

2606.01717 2026-06-02 cs.LG 50%

Decentralized Instruction Tuning: Conflict-Aware Splitting and Weight Merging

去中心化指令微调:冲突感知拆分与权重合并

Minsik Choi, Geewook Kim

机构 * Korea University(韩国大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出MERIT方法,通过冲突感知拆分和权重合并实现去中心化指令微调,在Qwen2.5-VL-3B上8个基准平均分从54.3提升至57.0。

Comments 32 pages, 5 figures. Accepted for publication at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00716 2026-06-02 cs.LG eess.SP 50%

Graph Transfer Learning via Shared Latent Geometry: Theory and Applications

基于共享潜在几何的图迁移学习:理论与应用

Tong Wu, Andrew Campbell, Anna Scaglione

机构 * University of Central Florida, USA(佛罗里达中央大学) Cornell University, USA(康奈尔大学)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 提出一种非对称双路径架构,通过教师编码器从高保真模拟器学习算子多项式特征,学生编码器从稀疏数据学习相同潜在几何,实现零样本迁移并给出可证明的误差界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00685 2026-06-02 cs.LG 50%

Prior-Guided Multi-Omic Transformers for Single-Cell Gene Regulatory Network Inference

先验引导的多组学Transformer用于单细胞基因调控网络推断

Tianyang Xu, Tianci Liu, Niraj Rayamajhi, Ryan Patrick, Kranthi Varala, Ying Li, Jing Gao

机构 * Elmore Family School of Electrical and Computer Engineering(埃尔莫夫家庭电气与计算机工程学院) Purdue University(普渡大学) Department of Horticulture and Landscape Architecture(园艺与景观建筑系) School of Biological Sciences(生物科学学院)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 提出EpiAwareNet框架,通过先验引导的多组学Transformer,结合基因-峰值交叉注意力模块和批量数据先验,从配对单细胞数据中重建基因调控网络。

Comments 12 pages, 6 figures. Accepted to the KDD 2026 AI4Sciences Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31040 2026-06-01 cs.LG 50%

UniRTL: Unifying Code and Graph for Robust RTL Representation Learning

UniRTL:统一代码和图以实现稳健的RTL表示学习

Yi Liu, Hongji Zhang, Lei Chen, Mingxuan Yuan, Qiang Xu

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong SAR(计算机科学与工程系,香港中文大学,香港特别行政区) Noah's Ark Lab, Huawei, Hong Kong SAR(华为诺亚实验室,香港特别行政区)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出UniRTL多模态预训练框架,通过互掩码建模和分层训练策略联合利用RTL代码与控制数据流图,实现细粒度对齐,在性能预测和代码检索任务上优于现有方法。

Comments Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30652 2026-06-01 cs.LG 50%

Bridging the Gap Between Natural Language and Market Dynamics via High-Dimensional Representation Learning

弥合自然语言与市场动态之间的差距:基于高维表示学习

Yujin Jeong, Noelle Jung, Brian Y. C. Leung

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文通过用密集FinBERT嵌入替代离散情感评分,在Transformer架构中探索高维表示学习,以提升金融新闻对短期股价预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30350 2026-05-29 cs.RO cs.LG 50%

DynaFLIP: Rethinking Robotics Perception via Tri-Modal-Dynamics Guided Representation

DynaFLIP: 通过三模态动力学引导表示重新思考机器人感知

Jusuk Lee, Seungjae Lee, Jonghun Shin, Hoseong Jung, Sungha Kim, Daesol Cho, H. Jin Kim, Jia-Bin Huang, Furong Huang

机构 * Seoul National University(首尔国立大学) University of Maryland, College Park(马里兰大学学院公园分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出DynaFLIP,一种动力学感知的多模态预训练框架,通过图像-语言-3D流三元组训练图像编码器,利用单纯形体积最小化与余弦正则化和对比目标对齐三模态,提升机器人操作中的运动理解与泛化能力。

Comments Project website: https://dynaflip-robotics.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29021 2026-05-29 cs.LG 50%

Designing Active Tether-Net Systems for Space Debris Capture with Graph-Learning-Aided Mixed-Combinatorial Optimization

基于图学习辅助混合组合优化的空间碎片捕获主动绳网系统设计

Feng Liu, Achira Boonrath, Gishnu Madhu, Eleonora M. Botta, Souma Chowdhury

机构 * University at Buffalo(布法罗大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对主动绳网系统设计中涉及连续、整数和分类变量的混合组合非线性规划问题,提出图神经网络辅助优化方法,将MCNLP简化为NLP,实现网形态、MU质量和推进器选择及瞄准点的联合设计,相比直接求解MCNLP显著加快收敛速度。

Comments Accepted for presentation at 2026 AIAA Aviation Forum

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26821 2026-05-27 hep-ph cs.LG hep-ex 50%

Particle-Lund Multimodality in Jet Taggers

喷注标记器中的粒子-拉普兰多模态

Loukas Gouskos, Benedikt Maier

机构 * Brown University(布朗大学) Imperial College of Science, Technology and Medicine(帝国理工学院科学、技术与医学学院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出PLuM多模态架构,联合处理粒子成分与拉普兰平面分裂,通过交叉注意力机制研究显式QCD层次结构是否补充原始粒子表示,发现对顶夸克和H→bb标记有系统性提升,在HH(4b)分析中背景抑制提高25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25883 2026-05-26 cs.CE 50%

From Reports to Ontologies: Ontology-Guided Representation Learning for 12-Lead ECG

从报告到本体:本体引导的12导联心电图表示学习

Lei Xu, Fahad Sohrab, Mehmet Yamac, Merja Heinaniemi, Moncef Gabbouj

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出MAR-ECG框架,通过本体引导的掩码自回归和图形对齐监督编码器,无需配对临床报告,在低标签设置下优于基线方法,性能与多模态方法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20390 2026-05-26 cs.RO 50%

NeuralTouch: Neural Descriptors for Precise Sim-to-Real Tactile Robot Control

NeuralTouch: 用于精确的仿真到现实触觉机器人控制的神经描述符

Yijiong Lin, Bowen Deng, Keju Pu, Chenghua Lu, Max Yang, Efi Psomopoulou, Nathan F. Lepora

机构 * Department of Engineering Mathematics and Bristol Robotics Laboratory(工程数学系和布里斯托尔机器人实验室)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出NeuralTouch多模态框架,结合神经描述符场(NDF)和触觉感知,通过深度强化学习策略利用触觉反馈优化抓取姿态,实现精确且可泛化的机器人操作。

Journal ref IEEE/ASME Transactions on Mechatronics, 2026 IEEE/ASME Transactions on Mechatronics IEEE/ASME Transactions on Mechatronics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24416 2026-05-26 cs.LG 50%

Synheart Capacity: A Theory-Driven Physiological Representation of Cognitive Capacity Dynamics from Wearable Signals

Synheart Capacity: 一种理论驱动的从可穿戴信号中认知容量动态的生理表征

Yisak Debele, Henok Ademtew, Israel Goytom

机构 * Synheart AI

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出一种理论驱动的多模态学习框架,通过心脏和皮肤电信号的双流编码,将认知容量状态建模为资源分配(努力)和超负荷(压力)的二维生理表征,在SWELL-KW数据集上实现跨个体泛化,并区分不同认知状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24013 2026-05-26 physics.chem-ph 50%

UniField: RBF-Guided Electron Density Fusion for Enhanced Molecular Representations

UniField: RBF引导的电子密度融合用于增强分子表示

Wei Zhang, Kun Li, Jiameng Chen, Jiajun Yu, Yizhen Zheng, Duanhua Cao, Wenbin Hu

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出UniField,一种SE(3)-等变多模态架构,通过融合离散拓扑图与连续电子密度场,在多个基准上取得最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23477 2026-05-25 cs.RO 50%

Semantically Structured Mixture-of-Experts for Compositional Robotic Manipulation

语义结构化混合专家用于组合机器人操作

Chengyu Deng, Guanqi Chen, Yizhou Chen, Zejia Liu, Zhiwen Ruan, Guanhua Chen, Jia Pan

机构 * The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 提出语义结构化混合专家扩散策略(SMoDP),通过视觉语言模型标注的技能语义指导专家专业化,实现参数高效的多任务组合操作。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22941 2026-05-25 cs.LG 50%

Hazard-Responsive Digital Twin for Climate-Driven Urban Resilience and Equity

面向气候驱动的城市韧性与公平的灾害响应数字孪生

Zhenglai Shen, Hongyu Zhou

机构 * Buildings and Transportation Science Division, Oak Ridge National Laboratory(奥克伍德国家实验室建筑与交通科学部门) Civil and Environmental Engineering, University of Tennessee(田纳西大学土木与环境工程系)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出一种灾害响应数字孪生(H-RDT),结合物理信息神经网络、多模态数据融合和公平感知风险分析,在合成区域中验证其能维持温度预测稳定性、自适应融合多源数据、识别高脆弱性区域,并通过前瞻性干预降低热风险。

Comments 52 pages, 9 figures

Journal ref Sustainable Cities and Society 144 (2026) 107413

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20411 2026-05-21 eess.SY cs.SY 50%

Max-Entropy Moment Filtering for Stochastic Hybrid Systems

最大熵矩滤波器用于随机混合系统

Kaito Iwasaki, Tejaswi K. C., Anthony Bloch, Maani Ghaffari, Taeyoung Lee

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出了一种混合扩展的最大熵矩卡尔曼滤波器,用于从部分统计信息中进行滤波,通过传播有限的矩并通过随机混合动态重构信念,关键步骤是基于Dynkin公式推导出的矩传播规则,能够有效处理边界诱导的概率流,从而在不求解底层混合PDE的情况下获得可处理的矩动力学。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19420 2026-05-20 cs.RO 50%

Beyond Waypoints: Dual-Heatmap Grounding for Cross-Embodiment Semantic Navigation

超越航点:双热图接地用于跨具身语义导航

Kaijie Yun, Yue Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) JD AI Research(京东人工智能研究院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出一种统一的视觉-语言框架,通过双热图表示替代单点回归,以解决语义指令与物理可达性之间的差距,从而提升跨具身语义导航的鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17170 2026-05-19 cs.LG 50%

TriAxialKV: Toward Extreme Low-Precision KV-Cache Quantization for Agentic Inference Tasks

TriAxialKV: 向极低精度KV缓存量化迈进以应对代理推理任务

Hanzhang Shen, Haoran Wu, Yiren Zhao, Robert Mullins

机构 * University of Cambridge(剑桥大学) Imperial College London(伦敦帝国学院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出TriAxialKV,一种混合精度的KV缓存量化方案,通过为每个token分配三轴标签,校准每种标签的敏感性,并在固定内存预算下分配INT2/INT4位宽,以提高代理推理任务的效率和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16610 2026-05-19 cs.LG cs.GL 50%

Tensor Cookbook: Mastering Tensors through Diagrams

张量烹饪书:通过图表掌握张量

Beheshteh T. Rakhshan, Guillaume Rabusseau

机构 * Mila & DIRO(Mila与DIRO) Université de Montréal(蒙特利尔大学) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文通过图表语言阐述张量网络及其在张量代数中的应用,展示如何用图形化方法简化高维数据处理和梯度推导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16069 2026-05-18 cs.LG 50%

ITGPT: Generative Pretraining on Irregular Timeseries

ITGPT:对不规则时间序列的生成预训练

Antoine Honoré, Ming Xiao

机构 * Division of Information Science and Engineering, KTH Royal Institute of Technology(信息科学与工程系,皇家理工学院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出ITGPT,一种针对多模态不规则时间序列的注意力架构,通过自监督学习和生成预训练目标处理不规则采样数据,在医疗和预测维护任务中实现SOTA性能。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15291 2026-05-18 stat.AP 50%

BaySC: Uncovering Tissue Architecture in Spatial Multi-Omics via Probabilistic Spatial Clustering

BaySC:通过概率空间聚类揭示空间多组学中的组织结构

Xin Li, Xiaofei Dong, Zhenke Duan, Lulu Shang, Xiao Wang, Xinyuan Song, Hanwen Ning, Guanyu Hu

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 BaySC通过概率空间聚类框架整合多组学数据,自动学习空间域数量,利用马尔可夫随机场保证局部空间一致性,提升空间拓扑结构的保持能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14878 2026-05-15 cs.MA 50%

Decision-Level Fusion for Robust Wearable Affect Recognition

决策级融合用于鲁棒的可穿戴情感识别

Lokesh Singh, Athina Georgara, Jayati Deshmukh, Tan Viet Tuyen Nguyen, Sarvapali D. Ramchurn

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文研究了可穿戴生理数据中情感状态自动识别的鲁棒性问题,提出结合傅里叶-贝塞尔级数展开与EWT的非稳态处理流程,通过决策级融合提升在异构和部分可靠传感下的识别鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14571 2026-05-15 cs.RO cs.LG 50%

Let Robots Feel Your Touch: Visuo-Tactile Cortical Alignment for Embodied Mirror Resonance

让机器人感受你的触摸:用于具身镜像共振的视觉-触觉皮层对齐

Tianfang Zhu, Ning An, Rui Wang, Jiasi Gao, Qingming Luo, Anan Li, Guyue Zhou

机构 * Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) Key Laboratory of Biomedical Engineering of Hainan Province, School of Biomedical Engineering, Hainan University(海南省生物医学工程重点实验室,海南大学生物医学工程学院) School of New Media Art and Design, Beihang University(北航艺术与设计学院) MoE Key Laboratory for Biomedical Photonics, Wuhan National Laboratory for Optoelectronics, Huazhong University of Science and Technology(教育部生物医学光子学重点实验室,武汉光电研究所,华中科技大学)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文提出镜像触觉网络,通过多级约束实现视觉与触觉表征的语义、分布和几何对齐,使机器人能从RGB图像预测毫米级触觉信号,为具身镜像共振提供可解释的机器人感知路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08815 2026-05-12 cs.LG q-bio.BM q-bio.GN q-bio.QM 50%

MicroFuse: Protein-to-Genome Expert Fusion for Microbial Operon Reasoning

MicroFuse:用于微生物启动子推理的蛋白质到基因组专家融合

Seungik Cho

机构 * Department of Physics and Astronomy, Rice University, Texas, USA(物理与天文学系,里士满大学,德克萨斯州,美国)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文提出MicroFuse框架,通过融合蛋白质结构表示和基因组上下文表示,提升微生物启动子预测的准确性。在OG-Operon100K数据集上,MicroFuse在多个评估指标上表现最优,尤其在生物上模糊的情况中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07100 2026-05-11 stat.ML cs.LG 50%

TRACE: Transport Alignment Conformal Prediction via Diffusion and Flow Matching Models

TRACE: 通过扩散与流匹配模型进行传输对齐的置信域

Zhenhan Fang, Aixin Tan, Jian Huang

机构 * Department of Statistics and Actuarial Science University of Iowa(统计与精算科学系,爱荷华大学) Departments of Data Science and AI, and Applied Mathematics The Hong Kong Polytechnic University(数据科学与人工智能系、应用数学系,香港理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出TRACE框架,通过扩散和流匹配模型中的传输对齐定义非符合性分数,实现多维输出的有效置信域构造,验证了其在复杂生成设置中的有效性。

Comments 22 pages, 5 figures and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06175 2026-05-11 cs.RO 50%

VLA-GSE: Boosting Parameter-Efficient Fine-Tuning in VLA with Generalized and Specialized Experts

VLA-GSE: 提升VLA中基于通用和专用专家的参数高效微调

Yuhua Jiang, Junjie Lu, Xinyao Qin, Xiaoyu Chen, Kaixin Wang, Feifei Gao, Li Zhao

机构 * Microsoft Research Asia(微软亚洲研究院) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 VLA-GSE通过通用和专用专家机制提升VLA在机器人控制中的参数高效微调效果,保留预训练知识的同时提高适应能力,实验表明其在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06126 2026-05-08 cs.HC 50%

AffectGPT-RL: Revealing Roles of Reinforcement Learning in Open-Vocabulary Emotion Recognition

AffectGPT-RL:揭示强化学习在开放词汇情绪识别中的作用

Zheng Lian, Fan Zhang, Lan Chen, Yazhou Zhang, Rui Liu, Jinyang Wu, Haoyu Chen, Xiaobai Li, Xiaojiang Peng, Bin He, Jianhua Tao

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出AffectGPT-RL框架,通过强化学习优化非可微目标,提升开放词汇情绪识别的性能,并在情绪识别和其他任务中取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05899 2026-05-08 cs.LG 50%

VisMMOE: Exploiting Visual-Expert Affinity for Efficient Visual-Language MoE Offloading

VisMMOE:利用视觉专家亲和力实现高效的视觉语言MoE卸载

Cheng Xu, Xiaofeng Hou, Jiacheng Liu, Chao Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 VisMMOE通过剪枝冗余视觉token提升视觉语言MoE模型的卸载效率,通过视觉专家亲和力机制优化专家访问集中度与稳定性,从而提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16767 2026-05-04 cs.LG 50%

When Structure Doesn't Help: LLMs Do Not Read Text-Attributed Graphs as Effectively as We Expected

结构无助时:LLM在文本属性图上表现不如我们预期

Haotian Xu, Yuning You, Tengfei Ma

机构 * Stony Brook University(石溪大学) California Institute of Technology(加州理工学院)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 研究发现,LLM在仅依赖节点文本描述时已能高效处理文本属性图,而多数结构编码策略效果有限,挑战了传统图学习范式,推动语义驱动的新方法。

Comments LoG 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26427 2026-04-30 cs.IR 50%

CARD: Non-Uniform Quantization of Visual Semantic Unit for Generative Recommendation

CARD: 视觉语义单元的非均匀量化用于生成推荐

Yibiao Wei, Jie Zou, Pengfei Zhang, Xiao Ao, Weikang Guo, Zeyu Ma, Yang Yang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 CARD框架通过引入视觉语义单元统一文本、视觉和协同信号,提升生成推荐中高质SID学习,同时采用非均匀量化框架解决语义分布不均问题,实验显示其优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21750 2026-04-27 cs.LG 50%

From Words to Amino Acids: Does the Curse of Depth Persist?

从词到氨基酸:深度诅咒是否依然存在?

Aleena Siji, Amir Mohammad Karimi Mamaghan, Ferdinand Kapl, Tobias Höppe, Emmanouil Angelis, Andrea Dittadi, Maurice Brenner, Michael Heinzinger, Karl Henrik Johansson, Kaitlin Maile, Johannes von Oswald, Stefan Bauer

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz AI, Munich(慕尼黑海德堡研究所人工智能部门) KTH Royal Institute of Technology(皇家理工学院) Institute of Computational Biology, Helmholtz Munich(海德堡慕尼黑计算生物学研究所) Google, Paradigms of Intelligence Team(谷歌,智能范式团队)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文研究蛋白质语言模型中深度效率问题,通过分析七种主流PLM家族,发现任务相关计算集中在部分层,其余层主要提供预测细化,这一趋势在序列和多模态模型中均存在。

详情

展开后加载摘要…

URL PDF HTML 收藏