arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-09 至 2025-09-09 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 8 篇

2406.06620 2025-09-09 cs.LG cs.AI cs.CL 84%

MedualTime: A Dual-Adapter Language Model for Medical Time Series-Text Multimodal Learning

Jiexia Ye, Weiqi Zhang, Ziyue Li, Jia Li, Meng Zhao, Fugee Tsung

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Technical University of Munich(慕尼黑技术大学) Columbia University(哥伦比亚大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

Comments 9 pages, 6 figure, 3 tables

Journal ref IJCAI 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06291 2025-09-09 cs.CV 83%

Prototype-Aware Multimodal Alignment for Open-Vocabulary Visual Grounding

Jiangnan Xie, Xiaolong Zheng, Liang Zheng

机构 * College of Electronics and Information, Hangzhou Dianzi University(电子信息学院,杭州电子大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05615 2025-09-09 cs.LG cs.AI 79%

Causal Debiasing Medical Multimodal Representation Learning with Missing Modalities

Xiaoguang Zhu, Lianlong Sun, Yang Liu, Pengyi Jiang, Uma Srivatsa, Nipavan Chiamvimonvat, Vladimir Filkov

机构 * DataLab: Data Science and Informatics, University of California, Davis(加州大学戴维斯分校数据实验室) Department of Electrical and Computer Engineering, University of Rochester(罗切斯特大学电气与计算机工程系) Academy for Engineering & Technology, Fudan University(复旦大学工程与技术学院) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Department of Electrical and Computer Engineering, New York University(纽约大学电气与计算机工程系) UC Davis Health(加州大学戴维斯分校医疗中心) Department of Basic Medical Sciences, University of Arizona(亚利桑那大学基础医学系) Department of Computer Science, University of California, Davis(加州大学戴维斯分校计算机科学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

Comments Submitted to IEEE TKDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04139 2025-09-09 cs.CV cs.AI cs.ET cs.LG cs.RO 73%

Driver-Net: Multi-Camera Fusion for Assessing Driver Take-Over Readiness in Automated Vehicles

Mahdi Rezaei, Mohsen Azarmi

机构 * Institute for Transport Studies, Computer Vision and Machine Learning Group, University of Leeds(交通研究 institute,计算机视觉和机器学习组,莱斯特大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Journal ref 2025 IEEE Intelligent Vehicles Symposium (IV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06321 2025-09-09 cs.CV 70%

Text4Seg++: Advancing Image Segmentation via Generative Language Modeling

Mengcheng Lan, Chaofeng Chen, Jiaxing Xu, Zongrui Li, Yiping Ke, Xudong Jiang, Yingchen Yu, Yunqing Zhao, Song Bai

机构 * College of Computing and Data Science, Nanyang Technological University(computing and Data Science学院,南洋理工大学) School of Electrical and Electronic Engineering, Nanyang Technological University(Electrical and Electronic Engineering学院,南洋理工大学) School of Artificial Intelligence, Wuhan University(Artificial Intelligence学院,武汉大学) ByteDance(字节跳动)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Extended version of our conference paper arXiv:2410.09855

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11299 2025-09-09 cs.CL cs.AI 62%

BriLLM: Brain-inspired Large Language Model

Hai Zhao, Hongqiu Wu, Dongjie Yang, Anni Zou, Jiale Hong

机构 * AGI Institute(AGI研究院) Computer School(计算机学院) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23067 2025-09-09 cs.AI 57%

FairReason: Balancing Reasoning and Social Bias in MLLMs

Zhenyu Pan, Yutong Zhang, Jianshu Zhang, Haoran Lu, Haozheng Luo, Yuwei Han, Philip S. Yu, Manling Li, Han Liu

机构 * Northwestern University(西北大学) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

Comments Accepted to the Trustworthy FMs workshop in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15113 2025-09-09 cs.CY cs.AI cs.LG 57%

Transit for All: Mapping Equitable Bike2Subway Connection using Region Representation Learning

Min Namgung, JangHyeon Lee, Fangyi Ding, Yao-Yi Chiang

机构 * University of Minnesota, Twin Cities(明尼苏达大学,双城分校) The University of Hong Kong(香港大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

Comments SIGSPATIAL 25

详情

展开后加载摘要…

URL PDF HTML 收藏