arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-15 至 2025-10-15 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 11 篇

2510.12395 2025-10-15 cs.CR 82%

IP-Augmented Multi-Modal Malicious URL Detection Via Token-Contrastive Representation Enhancement and Multi-Granularity Fusion

Ye Tian, Yanqiu Yu, Liangliang Song, Zhiquan Liu, Yanbin Wang, Jianguo Sun

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05839 2025-10-15 cs.MM cs.CV 81%

Towards Robust and Realible Multimodal Misinformation Recognition with Incomplete Modality

Hengyang Zhou, Yiwei Wei, Jian Yang, Zhenyu Zhang

机构 * Nanjing University(南京大学) China University of Petroleum(中国石油大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12245 2025-10-15 cs.LG cs.AI 79%

MoRA: On-the-fly Molecule-aware Low-Rank Adaptation Framework for LLM-based Multi-Modal Molecular Assistant

Tao Yin, Xiaohong Zhang, Jiacheng Zhang, Li Huang, Zhibin Zhang, Yuansong Zeng, Jin Xie, Meng Yan

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02575 2025-10-15 cs.CL cs.CR cs.LG 79%

Cross-Modal Safety Alignment: Is textual unlearning all you need?

Trishna Chakraborty, Erfan Shayegani, Zikui Cai, Nael Abu-Ghazaleh, M. Salman Asif, Yue Dong, Amit K. Roy-Chowdhury, Chengyu Song

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 多模态训练与对齐 :cross-modal(title);multi-modal(abstract);分类 cs.CL

Comments Accepted by EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12260 2025-10-15 cs.CV cs.LG eess.IV 70%

AngularFuse: A Closer Look at Angle-based Perception for Spatial-Sensitive Multi-Modality Image Fusion

Xiaopeng Liu, Yupei Lin, Sen Zhang, Xiao Wang, Yukai Shi, Liang Lin

机构 * School of Information Engineering, Guangdong University of Technology(广东技术大学信息工程学院) TikTok, ByteDance Inc(字节跳动) School of Computer Science, Anhui University(安徽大学计算机科学学院) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

Comments For the first time, angle-based perception was introduced into the multi-modality image fusion task

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12482 2025-10-15 cs.CV cs.AI 62%

A Text-Image Fusion Method with Data Augmentation Capabilities for Referring Medical Image Segmentation

Shurong Chai, Rahul Kumar JAIN, Rui Xu, Shaocong Mo, Ruibo Hou, Shiyu Teng, Jiaqing Liu, Lanfen Lin, Yen-Wei Chen

机构 * College of Information Science and Engineering(信息科学与工程学院) Ritsumeikan University(立命馆大学) Tiwaki Co., Ltd.(Tiwaki公司) Dalian University of Technology(大连理工大学) School of Software(软件学院) Zhejiang University(浙江大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12287 2025-10-15 cs.CV cs.CL 62%

Vision Language Models Map Logos to Text via Semantic Entanglement in the Visual Projector

Sifan Li, Hongkai Chen, Yujun Cai, Qingwen Ye, Liyang Chen, Junsong Yuan, Yiwei Wang

机构 * University of California, Merced(加州大学梅尔德分校) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司) University of Queensland(昆士兰大学) UCLA(加州大学洛杉矶分校) University at Buffalo(布法罗大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12178 2025-10-15 cs.AI cs.CL 62%

Evolution of meta's llama models and parameter-efficient fine-tuning of large language models: a survey

Abdulhady Abas Abdullah, Arkaitz Zubiaga, Seyedali Mirjalili, Amir H. Gandomi, Fatemeh Daneshfar, Mohammadsadra Amini, Alan Salam Mohammed, Hadi Veisi

机构 * University of Kurdistan(库尔德斯坦大学) Queen Mary University(女王玛丽大学) Torrens University Australia(澳大利亚托伦斯大学) University of Technology Sydney(悉尼技术大学) University of Kurdistan Sanandaj, Iran(伊朗桑和杰德大学) TU Dortmund University(多特蒙德技术大学) University of Kurdistan Hewler(库尔德斯坦大学海勒) Tehran University(德黑兰大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21857 2025-10-15 cs.CV cs.AI cs.LG 62%

SPADE: Spatial Transcriptomics and Pathology Alignment Using a Mixture of Data Experts for an Expressive Latent Space

Ekaterina Redekop, Mara Pleasure, Zichen Wang, Kimberly Flores, Anthony Sisk, William Speier, Corey W. Arnold

机构 * Biomedical AI Research Lab, University of California, Los Angeles(生物医学人工智能研究实验室,加州大学洛杉矶分校) Department of Pathology, University of California, Los Angeles(病理学系,加州大学洛杉矶分校) Department of Radiology, University of California, Los Angeles(放射学系,加州大学洛杉矶分校) Department of Bioengineering, University of California, Los Angeles(生物工程系,加州大学洛杉矶分校) UCLA Medical Informatics Home Area, University of California, Los Angeles(UCLA医学信息学家庭区域,加州大学洛杉矶分校) Department of Computational Medicine, University of California, Los Angeles(计算医学系,加州大学洛杉矶分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12798 2025-10-15 cs.CV 57%

Detect Anything via Next Point Prediction

Qing Jiang, Junan Huo, Xingyu Chen, Yuda Xiong, Zhaoyang Zeng, Yihao Chen, Tianhe Ren, Junzhi Yu, Lei Zhang

机构 * International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA))

专题命中 多模态训练与对齐 :MLLM(abstract);分类 cs.CV

Comments homepage: https://rex-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12087 2025-10-15 cs.GR 50%

Can Representation Gaps Be the Key to Enhancing Robustness in Graph-Text Alignment?

Heng Zhang, Tianyi Zhang, Yuling Shi, Xiaodong Gu, Yaomin Shen, Zijian Zhang, Yilei Yuan, Hao Zhang, Jin Huang

专题命中 多模态训练与对齐 :cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏