arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-09 至 2025-09-09 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 9 篇

2509.05925 2025-09-09 cs.CV cs.IT math.IT 88%

Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models

Ruiqi Shen, Haotian Wu, Wenjing Zhang, Jiangjing Hu, Deniz Gunduz

机构 * Department of Electrical and Electronic Engineering, Imperial College London(帝国理工学院电子与电气工程系)

专题命中 图文多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV

Comments Published as a conference paper at IEEE 35th Workshop on Machine Learning for Signal Processing (MLSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08040 2025-09-09 cs.LG cs.AI 79%

BadPromptFL: A Novel Backdoor Threat to Prompt-based Federated Learning in Multimodal Models

Maozhen Zhang, Mengnan Zhao, Wei Wang, Bo Wang

机构 * School of Information and Communication Engineering, Dalian University of Technology(信息与通信工程学院,大连理工大学) School of Computer Science and Technology, Anhui University(计算机科学与技术学院,安徽大学) New Laboratory of Pattern Recognition (NLPR) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS) Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室(NLPR)多模态人工智能系统国家重点实验室(MAIS)自动化研究所,中国科学院(CASIA))

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05786 2025-09-09 cs.MM cs.SD eess.AS 73%

Effectively obtaining acoustic, visual and textual data from videos

Jorge E. León, Miguel Carrasco

机构 * Adolfo Ibánez University(阿多洛·伊巴涅斯大学) Diego Portales University(迪埃戈·波特莱斯大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06535 2025-09-09 cs.CV cs.AI cs.LG 62%

On the Reproducibility of "FairCLIP: Harnessing Fairness in Vision-Language Learning''

Hua Chang Bakker, Stan Fris, Angela Madelon Bernardy, Stan Deutekom

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06759 2025-09-09 cs.LG cs.AI 57%

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization

Thanh Thi Nguyen, Campbell Wilson, Janis Dalins

机构 * AiLECS Lab, Monash University Melbourne, Australia(墨尔本大学AiLECS实验室,澳大利亚) AiLECS Lab, Monash University, Australia ICMEC Australia, Sydney, Australia(墨尔本大学AiLECS实验室,澳大利亚 ICMEC澳大利亚,悉尼,澳大利亚)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments Accepted for publication in the Proceedings of the 8th International Conference on Algorithms, Computing and Artificial Intelligence (ACAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05669 2025-09-09 cs.CV 57%

Context-Aware Multi-Turn Visual-Textual Reasoning in LVLMs via Dynamic Memory and Adaptive Visual Guidance

Weijie Shen, Xinrui Wang, Yuanqi Nie, Apiradee Boonmee

机构 * Beihua University(白华大学) Kasem Bundit University(Kasem Bundit大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19757 2025-09-09 cs.RO cs.CV 57%

Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy

Zhi Hou, Tianyi Zhang, Yuwen Xiong, Haonan Duan, Hengjun Pu, Ronglei Tong, Chengyang Zhao, Xizhou Zhu, Yu Qiao, Jifeng Dai, Yuntao Chen

机构 * Shanghai AI Lab(上海人工智能实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) Peking University(北京大学) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) HKISI, CAS(中国科学院香港中文大学研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Preprint; https://robodita.github.io; To appear in ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10032 2025-09-09 cs.CV 57%

Osprey: Pixel Understanding with Visual Instruction Tuning

Yuqian Yuan, Wentong Li, Jian Liu, Dongqi Tang, Xinjie Luo, Chi Qin, Lei Zhang, Jianke Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Microsoft(微软) The HongKong Polytechnical University(香港理工大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments CVPR2024, Code and Demo link:https://github.com/CircleRadon/Osprey

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06768 2025-09-09 cs.RO 50%

Embodied Hazard Mitigation using Vision-Language Models for Autonomous Mobile Robots

Oluwadamilola Sotomi, Devika Kodi, Kiruthiga Chandra Shekar, Aliasghar Arab

机构 * Department of Mechanical and Aerospace Engineering, Tandon School of Engineering, New York University(机械与航空航天工程系,坦顿工程学院,纽约大学) GenAuto.ai by General Autonomy Inc.(General Autonomy Inc. 的 GenAuto.ai)

专题命中 图文多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏