arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-15 至 2025-09-15 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6 篇

2411.02992 2025-09-15 cs.IR cs.CV 88%

Efficient and Effective Adaptation of Multimodal Foundation Models in Sequential Recommendation

Junchen Fu, Xuri Ge, Xin Xin, Alexandros Karatzoglou, Ioannis Arapakis, Kaiwen Zheng, Yongxin Ni, Joemon M. Jose

机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算机科学学院) Amazon(亚马逊) Telefonica Scientific Research(Telefonica科学研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV

Comments Accepted by IEEE Transactions on Knowledge and Data Engineering (TKDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09940 2025-09-15 cs.LG 88%

DyKen-Hyena: Dynamic Kernel Generation via Cross-Modal Attention for Multimodal Intent Recognition

Yifei Wang, Wenbin Wang, Yong Luo

机构 * Wuhan University(武汉大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title);audio-visual(abstract)

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10408 2025-09-15 cs.CV cs.AI 81%

Multimodal SAM-adapter for Semantic Segmentation

Iacopo Curti, Pierluigi Zama Ramirez, Alioscia Petrelli, Luigi Di Stefano

机构 * University of Bologna(博洛尼亚大学) SINA

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21135 2025-09-15 cs.CV cs.AI 81%

HiddenObject: Modality-Agnostic Fusion for Multimodal Hidden Object Detection

Harris Song, Tuan-Anh Vu, Sanjith Menon, Sriram Narasimhan, M. Khalid Jawed

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments fix typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17910 2025-09-15 cs.LG cs.AI 79%

A Novel Approach to Balance Convenience and Nutrition in Meals With Long-Term Group Recommendations and Reasoning on Multimodal Recipes and its Implementation in BEACON

Vansh Nagpal, Siva Likitha Valluru, Kausik Lakkaraju, Nitin Gupta, Zach Abdulrahman, Andrew Davison, Biplav Srivastava

机构 * BEACON

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10139 2025-09-15 cs.RO 71%

CaR1: A Multi-Modal Baseline for BEV Vehicle Segmentation via Camera-Radar Fusion

Santiago Montiel-Marín, Angel Llamazares, Miguel Antunes-García, Fabio Sánchez-García, Luis M. Bergasa

机构 * Department of Electronics. University of Alcalá, Community of Madrid, Spain(电子系。阿尔卡拉大学,马德里社区)

专题命中 多模态训练与对齐 :multi-modal(title)

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏