arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4975 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4975 篇

2503.08120 2026-01-14 cs.CV cs.AI cs.LG cs.MM 67%

UniF$^2$ace: A Unified Fine-grained Face Understanding and Generation Model

UniF$^2$ace: 一个统一的细粒度人脸理解和生成模型

Junzhe Li, Sifan Zhou, Liya Guo, Xuerui Qiu, Linrui Xu, Delin Qu, Tingting Long, Chun Fan, Ming Li, Hehe Fan, Jun Liu, Shuicheng Yan

机构 * Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Central South University(中南大学) Fudan University(复旦大学) Guangming Lab(光明实验室) Zhejiang University(浙江大学) Lancaster University(兰卡斯特大学) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 UniF$^2$ace是一个专门针对细粒度人脸理解和生成的统一多模态模型,通过双离散扩散损失和多级分组专家混合架构,提升高质量面部细节生成和细粒度属性处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00827 2026-01-13 eess.AS cs.AI cs.MM 67%

Speak the Art: A Direct Speech to Image Generation Framework

Speak the Art: 一种直接语音到图像生成框架

Mariam Saeed, Manar Amr, Farida Adel, Nada Hassan, Nour Walid, Eman Mohamed, Mohamed Hussein, Marwan Torki

专题命中 多模态生成 :image-text(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文提出Speak the Art框架,通过改进语音嵌入和使用扩散模型,实现更稳定和多样化的语音到图像生成,并验证了多语言扩展的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12196 2025-12-16 cs.MM cs.CV cs.SD eess.AS 67%

AutoMV: An Automatic Multi-Agent System for Music Video Generation

AutoMV: 一种自动多智能体系统用于音乐视频生成

Xiaoxuan Tang, Xinping Lei, Chaoran Zhu, Shiyun Chen, Ruibin Yuan, Yizhi Li, Changjae Oh, Ge Zhang, Wenhao Huang, Emmanouil Benetos, Yang Liu, Jiaheng Liu, Yinghao Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanjing University(南京大学) Queen Mary University of London(伦敦大学女王学院) Hong Kong University of Science and Technology(香港科技大学) University of Manchester(曼彻斯特大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

AI总结 AutoMV通过多智能体协作生成完整音乐视频,优于现有方法并接近专业水准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10949 2025-12-12 cs.CV cs.AI cs.CL 67%

Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation

我们是否准备好在文本到3D生成中使用强化学习?一项渐进性的调查

Yiwen Tang, Zoey Guo, Kaixin Zhu, Ray Zhang, Qizhi Chen, Dongzhi Jiang, Junli Liu, Bohan Zeng, Haoming Song, Delin Qu, Tianyi Bai, Dan Xu, Wentao Zhang, Bin Zhao

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文首次系统研究了强化学习在文本到3D生成中的应用,提出Hi-GRPO范式和AR3D-R1模型,探讨奖励设计、算法优化及3D生成基准。

Comments Code is released at https://github.com/Ivan-Tang-3D/3DGen-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05112 2025-12-05 cs.CV cs.AI cs.CL cs.LG 67%

DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation

DraCo: 文本到图像预览与稀有概念生成的草稿作为CoT

Dongzhi Jiang, Renrui Zhang, Haodong Li, Zhuofan Zong, Ziyu Guo, Jun He, Claire Guo, Junyan Ye, Rongyao Fang, Weijia Li, Rui Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学 MMLab) CUHK IMIXR(香港中文大学 IMIXR) Sun Yat-Sen University(中山大学) SCUT(华南理工大学) CUHK (Shenzhen)(香港中文大学(深圳))

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 DraCo通过结合文本和视觉内容的交错推理,提升文本到图像生成的精度和稀有概念生成能力。

Comments Project Page: https://github.com/CaraJ7/DraCo

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16671 2025-11-21 cs.CV cs.AI cs.CL 67%

Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation

生成中思考:在视觉生成过程中穿插文本推理

Ziyu Guo, Renrui Zhang, Hongyu Li, Manyuan Zhang, Xinyan Chen, Sifan Wang, Yan Feng, Peng Pei, Pheng-Ann Heng

机构 * CUHK(香港中文大学) IMIXR MMLab Meituan Project(美团项目)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出TwiG框架,通过在视觉生成过程中穿插文本推理,提升生成内容的上下文感知和语义丰富性。

Comments Project Page: https://think-while-gen.github.io Code: https://github.com/ZiyuGuo99/Thinking-while-Generating

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15030 2025-11-20 eess.SP 67%

WiCo-PG: Wireless Channel Foundation Model for Pathloss Map Generation via Synesthesia of Machines

Mingran Sun, Lu Bai, Ziwei Huang, Xuesong Cai, Xiang Cheng, Jianjun Wu

专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02423 2025-11-05 eess.SP 67%

LLM4PG: Adapting Large Language Model for Pathloss Map Generation via Synesthesia of Machines

Mingran Sun, Lu Bai, Xiang Cheng, Jianjun Wu

专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13883 2025-10-17 q-bio.NC cs.MA 67%

Large Language Model Agents Enable Autonomous Design and Image Analysis of Microwell Microfluidics

Dinh-Nguyen Nguyen, Sadia Shakil, Raymond Kai-Yu Tong, Ngoc-Duy Dinh

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10637 2025-10-14 cs.RO 67%

High-Fidelity Simulated Data Generation for Real-World Zero-Shot Robotic Manipulation Learning with Gaussian Splatting

Haoyu Zhao, Cheng Zeng, Linghao Zhuang, Yaxi Zhao, Shengke Xue, Hao Wang, Xingyue Zhao, Zhongyu Li, Kehan Li, Siteng Huang, Mingxiu Chen, Xin Li, Deli Zhao, Hua Zou

机构 * Wuhan University(武汉大学) DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(虎扑实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :multi-modal(abstract);MLLM(abstract)

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09757 2025-10-14 q-bio.OT 67%

A path towards AI-scale, interoperable biological data

Brian Aevermann, Andrea Califano, Chi-Li Chiu, Nathan Clack, William M. Clemons, Jonah Cool Florence D. D'Orazi, Joseph L. DeRisi, Joshua E. Elias, Elizabeth Fahsbender, Scott E. Fraser, Carlos G. Gonzalez, Matthias Haury, Theofanis Karaletsos, Shana O. Kelley, Aly A. Khan, Alan R. Lowe, Emma Lundberg, Ryan A. McClure, Stephani Otte, Evan O. Paull, Loïc A. Royer, Dana Sadgat, Sandra L. Schmid, Samantha Scovanner, Cathy Stolitzka, Jason R. Swedlow, Joan Wong, Garabet Yeretssian, Patricia Brennan, Ambrose J. Carr

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract)

Comments 8 pages, 2 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05593 2025-10-08 cs.CV cs.AI cs.CL 67%

Improving Chain-of-Thought Efficiency for Autoregressive Image Generation

Zeqi Gu, Markos Georgopoulos, Xiaoliang Dai, Marjan Ghazvininejad, Chu Wang, Felix Juefei-Xu, Kunpeng Li, Yujun Shi, Zecheng He, Zijian He, Jiawei Zhou, Abe Davis, Jialiang Wang

机构 * Meta Superintelligence Labs(Meta超智能实验室) Meta FAIR Cornell University(康奈尔大学) Stony Brook University(石溪大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07730 2025-10-07 cs.CV cs.AI cs.LG cs.MM 67%

STIV: Scalable Text and Image Conditioned Video Generation

Zongyu Lin, Wei Liu, Chen Chen, Jiasen Lu, Wenze Hu, Tsu-Jui Fu, Jesse Allardice, Zhengfeng Lai, Liangchen Song, Bowen Zhang, Cha Chen, Yiran Fei, Lezhi Li, Yizhou Sun, Kai-Wei Chang, Yinfei Yang

机构 * Apple(苹果公司) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23625 2025-09-30 cs.CV cs.AI cs.CL cs.LG 67%

RIV: Recursive Introspection Mask Diffusion Vision Language Model

YuQian Li, Limeng Qiao, Lin Ma

机构 * Meituan(美团)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19090 2025-09-25 cs.CV cs.AI cs.CL 67%

Citrus-V: Advancing Medical Foundation Models with Unified Medical Image Grounding for Clinical Reasoning

Guoxin Wang, Jun Zhao, Xinyi Liu, Yanbo Liu, Xuyang Cao, Chao Li, Zhuoyun Liu, Qintian Sun, Fangru Zhou, Haoqiang Xing, Zhenhong Yang

机构 * JDH Algo(京东健康算法)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18461 2025-09-24 cs.GR cs.AI cs.CV cs.MM 67%

Zero-Shot Visual Deepfake Detection: Can AI Predict and Prevent Fake Content Before It's Created?

Ayan Sar, Sampurna Roy, Tanupriya Choudhury, Ajith Abraham

机构 * School of Computer Sciences, University of Petroleum and Energy Studies (UPES), Dehradun(计算机科学学院,石油与能源研究大学(UPES),德里加恩)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Published in Foundations and Trends in Signal Processing (#1 in Signal Processing, #3 in Computer Science)

Journal ref Foundations and Trends in Signal Processing (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14476 2025-09-22 cs.CV cs.AI cs.MM 67%

AToken: A Unified Tokenizer for Vision

Jiasen Lu, Liangchen Song, Mingze Xu, Byeongjoo Ahn, Yanjun Wang, Chen Chen, Afshin Dehghan, Yinfei Yang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments 30 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11698 2025-09-16 cs.CL cs.AI cs.CV cs.LG 67%

CoachMe: Decoding Sport Elements with a Reference-Based Coaching Instruction Generation Model

Wei-Hsin Yeh, Yu-An Su, Chih-Ning Chen, Yi-Hsueh Lin, Calvin Ku, Wen-Hsin Chiu, Min-Chun Hu, Lun-Wei Ku

机构 * Institute of Information Science, Academia Sinica(学术院信息研究所) National Tsing Hua University(国立清华大学) National Taiwan University(国立台湾大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Published in Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), ACL 2025. Official version: https://doi.org/10.18653/v1/2025.acl-long.1413

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics Volume 1: Long Papers (2025) 29126-29151

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06945 2025-09-10 cs.CV cs.AI cs.CL cs.LG 67%

Interleaving Reasoning for Better Text-to-Image Generation

Wenxuan Huang, Shuang Chen, Zheyong Xie, Shaosheng Cao, Shixiang Tang, Yufan Shen, Qingyu Yin, Wenbo Hu, Xiaoman Wang, Yuntian Tang, Junbo Qiao, Yue Guo, Yao Hu, Zhenfei Yin, Philip Torr, Yu Cheng, Wanli Ouyang, Shaohui Lin

机构 * East China Normal University(华东师范大学) The Chinese University of Hong Kong(香港中文大学) Xiaohongshu Inc.(小红书公司) University of California, Los Angeles(加州大学洛杉矶分校) Zhejiang University(浙江大学) University of Oxford(牛津大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17879 2025-09-04 eess.SP 67%

LLM4SG: Adapting Large Language Model for Scatterer Generation via Synesthesia of Machines

Zengrui Han, Lu Bai, Ziwei Huang, Xiang Cheng

专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13034 2025-08-21 cs.CL cs.AI cs.CV cs.LG 67%

Natural Language Generation from Visual Events: State-of-the-Art and Key Open Questions

Aditya K Surikuchi, Raquel Fernández, Sandro Pezzelle

机构 * Institute for Logic, Language and Computation (ILLC), University of Amsterdam(逻辑、语言与计算研究所(ILLC),阿姆斯特丹大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09987 2025-08-14 cs.CV cs.AI cs.CL 67%

Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation

Junyan Ye, Dongzhi Jiang, Zihao Wang, Leqi Zhu, Zhenghao Hu, Zilong Huang, Jun He, Zhiyuan Yan, Jinghua Yu, Hongsheng Li, Conghui He, Weijia Li

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学) CUHK MMLab(香港中文大学多模态实验室) Peking University(北京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09834 2025-08-14 cs.CL cs.AI cs.CV 67%

Speed Always Wins: A Survey on Efficient Architectures for Large Language Models

Weigao Sun, Jiaxi Hu, Yucheng Zhou, Jusen Du, Disen Lan, Kexin Wang, Tong Zhu, Xiaoye Qu, Yu Zhang, Xiaoyu Mo, Daizong Liu, Yuxuan Liang, Wenliang Chen, Guoqi Li, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) HKUST (GZ)(香港科技大学) University of Macau(澳门大学) Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) Soochow University(苏州大学) KTH Royal Institute of Technology(皇家理工学院) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Survey, 82 pages, GitHub: https://github.com/weigao266/Awesome-Efficient-Arch

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00043 2025-08-13 cs.CL cs.AI cs.CV 67%

CrossWordBench: Evaluating the Reasoning Capabilities of LLMs and LVLMs with Controllable Puzzle Generation

Jixuan Leng, Chengsong Huang, Langlin Huang, Bill Yuchen Lin, William W. Cohen, Haohan Wang, Jiaxin Huang

机构 * CMU(卡内基梅隆大学) WUSTL(华盛顿大学) UIUC(伊利诺伊大学香槟分校)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12899 2025-08-13 cs.CV cs.AI cs.MM 67%

DreamStory: Open-Domain Story Visualization by LLM-Guided Multi-Subject Consistent Diffusion

Huiguo He, Huan Yang, Zixi Tuo, Yuan Zhou, Qiuyue Wang, Yuhang Zhang, Zeyu Liu, Wenhao Huang, Hongyang Chao, Jian Yin

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10574 2025-08-12 cs.CV cs.MM cs.SD eess.AS 67%

DanceChat: Large Language Model-Guided Music-to-Dance Generation

Qing Wang, Xiaohang Yang, Yilan Dong, Naveen Raj Govindaraj, Gregory Slabaugh, Shanxin Yuan

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22076 2025-07-31 cs.LG 67%

Test-time Prompt Refinement for Text-to-Image Models

Mohammad Abdul Hafeez Khan, Yash Jain, Siddhartha Bhattacharyya, Vibhav Vineet

机构 * Florida Institute of Technology(佛罗里达理工学院) Microsoft Research(微软研究院)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract)

Comments Accepted to ICCV 2025, MARS2 Workshop. Total 14 pages, 12 figures and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03147 2025-06-23 cs.CV cs.AI cs.CL 67%

UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation

Bin Lin, Zongjian Li, Xinhua Cheng, Yuwei Niu, Yang Ye, Xianyi He, Shenghai Yuan, Wangbo Yu, Shaodong Wang, Yunyang Ge, Yatian Pang, Li Yuan

机构 * Peking University(北京大学) Shenzhen Graduate School(深圳研究生院) Peng Cheng Laboratory(鹏城实验室) Rabbitpre AI

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08351 2025-06-11 cs.CV cs.AI cs.CL 67%

How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models

Huixuan Zhang, Junzhe Zhang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王玄计算技术研究所)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07045 2025-06-10 cs.CV cs.AI cs.CL 67%

Interpretable and Reliable Detection of AI-Generated Images via Grounded Reasoning in MLLMs

Yikun Ji, Hong Yan, Jun Lan, Huijia Zhu, Weiqiang Wang, Qi Fan, Liqing Zhang, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏