arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-19 至 2025-12-19 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 5 篇

2512.15885 2025-12-19 cs.CV cs.AI cs.CL cs.MM 85%

Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models

超越文字:面向多模态大语言模型的自监督视觉学习

Davide Caffagni, Sara Sarto, Marcella Cornia, Lorenzo Baraldi, Pier Luigi Dovesi, Shaghayegh Roohi, Mark Granroth-Wilding, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) AMD Silo AI

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 JARVIS通过自监督视觉学习提升多模态大语言模型的视觉推理能力,无需依赖语言监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20322 2025-12-19 cs.CV 85%

HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models

HyperET: 在超几何空间中为多模态大语言模型实现高效训练

Zelin Peng, Zhengqin Xu, Qingyang Liu, Xiaokang Yang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, SJTU(摩埃人工智能重点实验室、人工智能学院、计算机科学学院、上海交通大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

AI总结 HyperET通过在双曲空间中动态调整半径,实现多模态大语言模型的高效训练,提升跨模态对齐性能。

Comments Accepted by NeurIPS2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05037 2025-12-19 cs.LG 78%

ModalSurv: Investigating opportunities and limitations of multimodal deep survival learning in prostate and bladder cancer

ModalSurv: 探索多模态深度生存学习在前列腺和膀胱癌中的机会与局限

Noorul Wahab, Ethar Alzaid, Jiaqi Lv, Fayyaz Minhas, Adam Shephard, Shan E Ahmed Raza

机构 * TIA Centre, Department of Computer Science, University of Warwick, UK(沃里克大学计算机科学系TIA中心,英国)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 ModalSurv通过多模态数据整合提升生存预测,但在外部测试中临床特征表现更优,揭示了多模态对齐的挑战和泛化能力的限制。

Comments 4 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18267 2025-12-19 cs.LG cs.AI 57%

ARD-LoRA: Dynamic Rank Allocation for Parameter-Efficient Fine-Tuning of Foundation Models with Heterogeneous Adaptation Needs

ARD-LoRA:动态秩分配用于具有异质适应需求的基础模型参数高效微调

Haseeb Ullah Khan Shinwari, Muhammad Usama

机构 * Newton AI Lab(牛顿人工智能实验室) School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(电气工程学院,韩国科学技术院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 ARD-LoRA通过动态秩分配提升基础模型微调效率,实现参数高效且适应性更强的模型调整。

Journal ref IEEE Transactions on Artificial Intelligence, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06189 2025-12-19 cs.RO cs.HC 50%

Accessible and Pedagogically-Grounded Explainability for Human-Robot Interaction: A Framework Based on UDL and Symbolic Interfaces

可及且以教学为导向的机器人可解释性:基于UDL和符号接口的框架

Francisco J. Rodríguez Lera, Raquel Fernández Hernández, Sonia Lopez González, Miguel Angel González-Santamarta, Francisco Jesús Rodríguez Sedano, Camino Fernandez Llamas

机构 * Grupo de Robótica , EIIIA Campus de Vegazana, Universidad de León(机器人组,EIIIA校区,莱昂大学) C.E.E. Ntra. Sra. Del Sagrado Corazón(圣心宗女会)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出基于UDL和符号接口的框架,旨在通过多模态解释板提升人机交互中不同需求用户的可解释性与教学导向性。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏