arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-10 至 2025-10-10 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 7 篇

2510.08485 2025-10-10 cs.CV 83%

InstructX: Towards Unified Visual Editing with MLLM Guidance

Chong Mou, Qichao Sun, Yanze Wu, Pengze Zhang, Xinghui Li, Fulong Ye, Songtao Zhao, Qian He

机构 * Intelligent Creation Team, ByteDance(字节跳动智能创作团队)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08530 2025-10-10 cs.GR cs.CV 79%

X2Video: Adapting Diffusion Models for Multimodal Controllable Neural Video Rendering

Zhitong Huang, Mohan Zhang, Renhan Wang, Rui Tang, Hao Zhu, Jing Liao

机构 * City University of Hong Kong(香港城市大学) WeChat, Tencent Inc(微信、腾讯公司) Manycore Tech Inc(很多核科技公司)

专题命中 多模态生成 :multimodal(title);multi-modal(abstract);分类 cs.CV

Comments Code, model, and dataset will be released at project page soon: https://luckyhzt.github.io/x2video

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05096 2025-10-10 cs.CV cs.AI cs.CL cs.MA cs.MM 70%

Paper2Video: Automatic Video Generation from Scientific Papers

Zeyu Zhu, Kevin Qinghong Lin, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(展示实验室,新加坡国立大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Project Page: https://showlab.github.io/Paper2Video/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08157 2025-10-10 cs.CV 57%

Beyond Textual CoT: Interleaved Text-Image Chains with Deep Confidence Reasoning for Image Editing

Zhentao Zou, Zhengrong Yue, Kunpeng Du, Binlei Bao, Hanting Li, Haizhen Xie, Guozheng Xu, Yue Zhou, Yali Wang, Jie Hu, Xue Jiang, Xinghao Chen

机构 * Shanghai Jiaotong University(上海交通大学) Huawei Noah’s Ark Lab(华为诺亚实验室) East China Normal University(华东师范大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 25pages,20figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07865 2025-10-10 cs.RO cs.AI 57%

DM1: MeanFlow with Dispersive Regularization for 1-Step Robotic Manipulation

Guowei Zou, Haitao Wang, Hejun Wu, Yukun Qian, Yuhang Wang, Weibing Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments Website with code: https://guowei-zou.github.io/dm1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05492 2025-10-10 cs.LG cs.AI 57%

High-Fidelity Synthetic ECG Generation via Mel-Spectrogram Informed Diffusion Training

Zhuoyi Huang, Nutan Sahoo, Anamika Kumari, Girish Kumar, Kexuan Cai, Shixing Cao, Yue Kang, Tian Xia, Somya Chatterjee, Nicholas Hausman, Aidan Jay, Eric S. Rosenthal, Soundar Srinivasan, Sadid Hasan, Alex Fedorov, Sulaiman Vesal

机构 * Microsoft(微软公司) Massachusetts General Hospital, Harvard University(哈佛大学麻省总医院) Emory University(埃默里大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22258 2025-10-10 math.OC 50%

Diffusion at Absolute Zero: Langevin Sampling using Successive Moreau Envelopes [journal paper]

Andreas Habring, Alexander Falk, Martin Zach, Thomas Pock

专题命中 多模态生成 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏