arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-02 至 2026-02-02 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3 篇

2601.22610 2026-02-02 cs.LG cs.AI 79%

Local-Global Multimodal Contrastive Learning for Molecular Property Prediction

局部-全局多模态对比学习用于分子性质预测

Xiayu Liu, Zhengyi Lu, Yunhong Liao, Chan Fan, Hou-biao Li

机构 * School of Mathematical Sciences(数学科学学院) University of Electronic Science and Technology of China(电子科技大学) Department of Computer Science and Engineer(计算机科学与工程系) Oakland University(奥克兰大学) Department of Electrical and Computer Engineering(电气与计算机工程系) College of Management Science(管理科学学院) Chengdu University of Technology(成都理工大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 LGM-CL通过局部-全局多模态对比学习框架,整合分子结构和化学语义信息,提升分子性质预测的准确性与性能。

Comments 16 pages, 9 figures. Submitted to Briefings in Bioinformatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01372 2026-02-02 cs.IR cs.AI 79%

Structured Spectral Reasoning for Frequency-Adaptive Multimodal Recommendation

结构化频谱推理用于频率自适应多模态推荐

Wei Yang, Rui Zhong, Yiqun Chen, Chi Lu, Peng Jiang

机构 * Kuaishou Technology(快手科技) Renmin University of China(中国人民大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出结构化频谱推理框架,通过频谱分解、可靠性调节、超光谱融合和对比正则化,提升多模态推荐的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23041 2026-02-02 cs.CV 57%

One-shot Optimized Steering Vector for Hallucination Mitigation for VLMs

单次优化的转向向量用于VLMs的幻觉缓解

Youxu Shi, Suorong Yang, Dong Liu

机构 * University of Science(科学大学) Nanjing University(南京大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出OSGA框架,通过单次优化生成通用转向向量,有效缓解VLMs的幻觉问题并提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏