arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-31 至 2025-10-31 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 7 篇

2510.26105 2025-10-31 cs.CV cs.AI cs.CR 81%

Security Risk of Misalignment between Text and Image in Multi-modal Model

Xiaosen Wang, Zhijin Ge, Shaokang Wang

机构 * Xidian University(西安电子科技大学) Shanghai Jiaotong University(上海交通大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26583 2025-10-31 cs.CV 79%

Emu3.5: Native Multimodal Models are World Learners

Yufeng Cui, Honghao Chen, Haoge Deng, Xu Huang, Xinghang Li, Jirong Liu, Yang Liu, Zhuoyan Luo, Jinsheng Wang, Wenxuan Wang, Yueze Wang, Chengyuan Wang, Fan Zhang, Yingli Zhao, Ting Pan, Xianduo Li, Zecheng Hao, Wenxuan Ma, Zhuo Chen, Yulong Ao, Tiejun Huang, Zhongyuan Wang, Xinlong Wang

机构 * BAAI(百度人工智能研究院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments project page: https://emu.world

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01074 2025-10-31 cs.LG 78%

Omni-Mol: Multitask Molecular Model for Any-to-any Modalities

Chengxin Hu, Hao Li, Yihe Yuan, Zezheng Song, Chenyang Zhao, Haixin Wang

机构 * National University of Singapore(新加坡国立大学) University of Maryland, College Park(马里兰大学 College Park 分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 多模态生成 :any-to-any(title);multimodal(abstract)

Comments 44 pages, 9 figures, 13 tables, paper accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25798 2025-10-31 cs.LG cs.AI cs.CL 73%

MemEIC: A Step Toward Continual and Compositional Knowledge Editing

Jin Seong, Jiyun Park, Wencke Liermann, Hongseok Choi, Yoonji Nam, Hyun Kim, Soojong Lim, Namhoon Lee

机构 * Electronics and Telecommunications Research Institute, Republic of Korea(韩国电子电信研究院) POSTECH Sungkyunkwan University(全南大学)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2025, 38 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26670 2025-10-31 cs.RO 71%

Hybrid Consistency Policy: Decoupling Multi-Modal Diversity and Real-Time Efficiency in Robotic Manipulation

Qianyou Zhao, Yuliang Shen, Xuanran Zhai, Ce Hao, Duidi Wu, Jin Qi, Jie Hu, Qiaojun Yu

机构 * Shanghai Jiao Tong University(上海交通大学) National University of Singapore(国立新加坡大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 多模态生成 :multi-modal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13267 2025-10-31 cs.CV 70%

Dynamic Traceback Learning for Medical Report Generation

Shuchang Ye, Mingyuan Meng, Mingjian Li, Dagan Feng, Usman Naseem, Jinman Kim

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted to IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21451 2025-10-31 cs.SE 50%

Scalpel: Automotive Deep Learning Framework Testing via Assembling Model Components

Yinglong Zou, Juan Zhai, Chunrong Fang, An Guo, Jiawei Liu, Zhenyu Chen

专题命中 多模态生成 :multi-modal(abstract)

Comments Accepted by the 48th IEEE/ACM International Conference on Software Engineering (ICSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏