arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-16 至 2025-12-16 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 15 篇

2512.12822 2025-12-16 cs.CV cs.AI 84%

Lemon: A Unified and Scalable 3D Multimodal Model for Universal Spatial Understanding

Lemon:一种统一且可扩展的3D多模态模型用于通用空间理解

Yongyuan Liang, Xiyao Wang, Yuanchen Ju, Jianwei Yang, Furong Huang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 Lemon提出一种统一的Transformer架构,通过联合处理3D点云块和语言标记,实现空间-语言融合,提升3D多模态模型的可扩展性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04870 2025-12-16 eess.IV cs.CV 83%

Multi-modal Uncertainty Robust Tree Cover Segmentation For High-Resolution Remote Sensing Images

多模态不确定性鲁棒树冠覆盖分割用于高分辨率遥感图像

Yuanyuan Gui, Wei Li, Yinjian Wang, Xiang-Gen Xia, Mauro Marty, Christian Ginzler, Zuyuan Wang

机构 * School of Information and Electronics, Beijing Institute of Technology(信息与电子学院,北京理工大学) National Key Laboratory of Science and Technology on Space-Born Intelligent Information Processing(空间智能信息处理国家重点实验室) Department of Electrical and Computer Engineering, University of Delaware(电气与计算机工程系,德雷塞尔大学) Swiss Federal Institute for Forest, Snow, and Landscape Research WSL(瑞士森林、雪和景观研究联邦 institute WSL)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 MURTreeFormer通过多模态分割框架降低不确定性,提升高分辨率遥感图像中树冠分割的鲁棒性与准确性。

Journal ref IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13261 2025-12-16 cs.CV 83%

Unlocking the Potential of Difficulty Prior in RL-based Multimodal Reasoning

解锁基于强化学习的多模态推理中难度先验的潜力

Mingrui Chen, Haogeng Liu, Hao Liang, Huaibo Huang, Wentao Zhang, Ran He

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) NLPR&MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) Zhongguancun Academy(中关村学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文通过建模问题难度先验信息,改进基于强化学习的多模态推理性能,通过数据筛选、优势分化和难度提示提升模型推理深度和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11901 2025-12-16 cs.CV cs.LG 83%

CLARGA: Multimodal Graph Representation Learning over Arbitrary Sets of Modalities

CLARGA:任意模态集合上的多模态图表示学习

Santosh Patapati

机构 * Santosh Patapati(独立研究者)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 CLARGA是一种通用的多模态融合架构,通过构建注意力加权图实现多模态表示学习,适用于任意模态集合,具有高效的融合能力和良好的鲁棒性。

Comments WACV; Supplementary material is available on CVF proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12657 2025-12-16 cs.CV 79%

Cross-modal Fundus Image Registration under Large FoV Disparity

跨模态视网膜图像在大视野差异下的配准

Hongyang Li, Junyi Tao, Qijie Wei, Ningzhi Yang, Meng Wang, Weihong Yu, Xirong Li

机构 * Renmin University of China, Beijing, China(中国人民大学) Peking Union Medical College Hospital, Beijing, China(北京友谊医院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出CARe方法,用于解决大视野差异下的跨模态视网膜图像配准问题,通过裁剪和双拟合对齐改进配准效果。

Comments Accepted as a regular paper at MMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20991 2025-12-16 cs.CV 79%

MR-COSMO: Visual-Text Memory Recall and Direct CrOSs-MOdal Alignment Method for Query-Driven 3D Segmentation

MR-COSMO:一种用于查询驱动3D分割的视觉-文本记忆召回与直接跨模态对齐方法

Chade Li, Pengju Zhang, Yihong Wu

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 MR-COSMO通过视觉-文本记忆召回与直接跨模态对齐方法,在查询驱动的3D分割中实现几何与语义特征的精确融合,提升点云分割性能。

Comments Accepted by AAAI 2026. Copyright (c) 2026, Association for the Advancement of Artificial Intelligence (www.aaai.org). All rights reserved

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12881 2025-12-16 cs.LG q-bio.NC stat.ML 78%

Unsupervised learning of multiscale switching dynamical system models from multimodal neural data

从多模态神经数据中无监督学习多尺度切换动力学系统模型

DongKyu Kim, Han-Lin Hsieh, Maryam M. Shanechi

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出了一种无监督学习方法,通过多尺度神经观测学习切换多尺度动力学系统模型,以更准确解码行为并提升脑机接口性能。

Comments 30 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12842 2025-12-16 cs.RO cs.AI cs.LG 70%

SAGA: Open-World Mobile Manipulation via Structured Affordance Grounding

SAGA:通过结构化可及性 grounding 实现开放世界移动操作

Kuan Fang, Yuxin Chen, Xinghao Zhu, Farzad Niroui, Lingfeng Sun, Jiuguang Wang

机构 * RAI Institute(RAI研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 SAGA通过结构化可及性接地实现开放世界移动操作,能有效处理多种任务形式并实现零样本执行。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01042 2025-12-16 cs.CV 70%

WCCNet: Wavelet-context Cooperative Network for Efficient Multispectral Pedestrian Detection

WCCNet:小波-上下文协作网络用于高效多光谱行人检测

Xingjian Wang, Li Chai, Jiming Chen, Zhiguo Shi

机构 * the College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) the College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 WCCNet通过低计算成本的多光谱特征提取与跨模态融合,提升自动驾驶中的行人检测效率与精度。

Comments 35 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12690 2025-12-16 cs.LG cs.CL cs.CV 62%

Reassessing the Role of Supervised Fine-Tuning: An Empirical Study in VLM Reasoning

重新评估监督微调的作用:VLM推理中的实证研究

Yongcan Yu, Lingxiao He, Shuo Lu, Lijun Sheng, Yinuo Xu, Yanbo Wang, Kuangpu Guo, Jianjie Cheng, Meng Wang, Qianlong Xie, Xingxing Wang, Dapeng Hu, Jian Liang

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(人工智能研究院 & 模式识别与人工智能研究所,中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Meituan(美团)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本研究通过实证分析发现,监督微调在VLM推理中具有重要作用,挑战了强化学习优于监督微调的主流观点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11849 2025-12-16 cs.RO cs.AI cs.CV cs.SY eess.IV eess.SY 62%

LocoMamba: Vision-Driven Locomotion via End-to-End Deep Reinforcement Learning with Mamba

LocoMamba:基于端到端深度强化学习的视觉驱动运动控制框架

Yinuo Wang, Gavin Tao

机构 * School of Computer Science and Statistics, Trinity College Dublin(计算机科学与统计学系,三一学院都柏林)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 LocoMamba通过端到端深度强化学习实现视觉驱动的运动控制,利用Mamba模型提升序列建模效率,有效捕捉长程依赖并增强训练效率。

Comments 14 pages. This paper has been published in Advanced Engineering Informatics. Please cite the journal version: DOI: 10.1016/j.aei.2025.104230

Journal ref Advanced Engineering Informatics, Vol. 70, Art. no. 104230 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13240 2025-12-16 cs.AI cs.LG 57%

Reflective Preference Optimization (RPO): Enhancing On-Policy Alignment via Hint-Guided Reflection

反射偏好优化(RPO):通过提示引导的反思增强策略对齐

Zihui Zhao, Zechang Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 RPO通过提示引导的反思增强策略对齐,减少幻觉并提升多模态基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12658 2025-12-16 cs.CV 57%

CogDoc: Towards Unified thinking in Documents

CogDoc: 向文档中的统一思维迈进

Qixin Xu, Haozhe Wang, Che Liu, Fangzhen Lin, Wenhu Chen

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) University of Waterloo(滑铁卢大学) Imperial College London(伦敦帝国学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 CogDoc提出一种统一的粗到细思维框架,通过直接强化学习提升文档推理性能,优于现有方法并在视觉丰富任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09350 2025-12-16 cs.CV 57%

TextGuider: Training-Free Guidance for Text Rendering via Attention Alignment

TextGuider: 通过注意力对齐实现文本渲染的无训练指导

Kanghyun Baek, Sangyub Lee, Jin Young Choi, Jaewoo Song, Daemin Park, Jooyoung Choi, Chaehun Shin, Bohyung Han, Sungroh Yoon

机构 * Interdisciplinary Program in Artificial Intelligence, Seoul National University(人工智能交叉学科项目,首尔国立大学) Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Global Technology Research, Samsung Electronics(三星电子全球技术研究) AIIS, ASRI, INMC, ISRC, Seoul National University(AIIS、ASRI、INMC、ISRC、首尔国立大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 TextGuider通过注意力对齐实现文本渲染的无训练指导,提升文本生成的准确性和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12134 2025-12-16 q-bio.BM cs.LG 50%

Modeling Dabrafenib Response Using Multi-Omics Modality Fusion and Protein Network Embeddings Based on Graph Convolutional Networks

基于图卷积网络的多组学模态融合与蛋白质网络嵌入建模达拉菲尼反应

La Ode Aman, A Mu'thi Andy Suryadi, Dizky Ramadani Putri Papeo, Hamsidar Hasan, Ariani H Hutuba, Netty Ino Ischak, Yuszda K. Salimi

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本研究通过多组学融合与图卷积网络提升达拉菲尼反应预测,揭示互补分子决定因素。

详情

展开后加载摘要…

URL PDF HTML 收藏