arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-15 至 2025-08-15 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 10 篇

2508.10494 2025-08-15 cs.LG cs.AI cs.MA 85%

A Unified Multi-Agent Framework for Universal Multimodal Understanding and Generation

Jiulin Li, Ping Huang, Yexin Li, Shuo Chen, Juewen Hu, Ye Tian

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);any-to-any(abstract);分类 cs.AI

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05262 2025-08-15 cs.CV 79%

Debiasing Multimodal Large Language Models via Penalization of Language Priors

YiFan Zhang, Yang Shi, Weichen Yu, Qingsong Wen, Xue Wang, Wenjing Yang, Zhang Zhang, Liang Wang, Rong Jin

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Alibaba Group(阿里巴巴集团) National University of Defense Technology(国防科技大学) Meta

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments 10 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08098 2025-08-15 cs.CV 70%

TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning

Junzhe Xu, Yuyang Yin, Xi Chen

机构 * Basic Algorithm Center, PCG, Tencent(腾讯基础算法中心、PCG、腾讯)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13307 2025-08-15 cs.CV cs.AI 62%

Quantitative Comparison of Fine-Tuning Techniques for Pretrained Latent Diffusion Models in the Generation of Unseen SAR Images

Solène Debuysère, Nicolas Trouvé, Nathan Letheule, Olivier Lévêque, Elise Colin

机构 * Paris-Saclay University(巴黎-萨克雷大学) ONERA - The French Aerospace Lab(法国航空航天实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08601 2025-08-15 cs.CV cs.AI 62%

Yan: Foundational Interactive Video Generation

Deheng Ye, Fangyun Zhou, Jiacheng Lv, Jianqi Ma, Jun Zhang, Junyan Lv, Junyou Li, Minwen Deng, Mingyu Yang, Qiang Fu, Wei Yang, Wenkai Lv, Yangbin Yu, Yewen Wang, Yonghang Guan, Zhihao Hu, Zhongbin Fang, Zhongqian Sun

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10858 2025-08-15 cs.CV 57%

Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation

Harold Haodong Chen, Haojian Huang, Qifeng Chen, Harry Yang, Ser-Nam Lim

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

Comments Project Page: https://haroldchen19.github.io/PhysHPO-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10280 2025-08-15 cs.CV 57%

High Fidelity Text to Image Generation with Contrastive Alignment and Structural Guidance

Danyi Gao

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10013 2025-08-15 cs.CL 57%

Semantic Bridge: Universal Multi-Hop Question Generation via AMR-Driven Graph Synthesis

Linqing Chen, Hanmeng Zhong, Wentao Wu, Weilei Wang

机构 * Linqing Chen, Hanmeng Zhong, Wentao Wu, Weilei Wang(作者)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01272 2025-08-15 cs.CV 57%

PromptSafe: Gated Prompt Tuning for Safe Text-to-Image Generation

Zonglei Jing, Xiao Yang, Xiaoqian Li, Siyuan Liang, Aishan Liu, Mingchuan Zhang, Xianglong Liu

机构 * Beihang University(北航) Beijing University of Posts and Telecommunications(北京邮电大学) Taishan University(泰山大学) Nanyang Technological University(南洋理工大学) Henan University of Science and Technology(河南科技大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19948 2025-08-15 cs.RO 50%

Motion Planning Diffusion: Learning and Adapting Robot Motion Planning with Diffusion Models

J. Carvalho, A. Le, P. Kicki, D. Koert, J. Peters

机构 * Intelligent Autonomous Systems Lab, Computer Science Department, Technical University of Darmstadt, Germany(德意志图林根技术大学计算机科学系智能自主系统实验室) Poznan University of Technology, Poland(波兰波兹南技术大学) IDEAS, Warsaw, Poland(波兰华沙IDEAS) Centre for Cognitive Science, Technical University of Darmstadt, Germany(德意志图林根技术大学认知科学中心) German Research Center for AI (DFKI), Research Department: SAIROL, Darmstadt, Germany(德国人工智能研究中心(DFKI)研究部:SAIROL,德意志图林根,德国) Hessian.AI, Darmstadt, Germany(黑森AI,德意志图林根,德国)

专题命中 多模态生成 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏