arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2510.15914 2025-10-21 cs.AR cs.AI cs.PL 57%

VeriGRAG: Enhancing LLM-Based Verilog Code Generation with Structure-Aware Soft Prompts

Jiayu Zhao, Song Chen

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15857 2025-10-20 cs.CV 57%

BLIP3o-NEXT: Next Frontier of Native Image Generation

Jiuhai Chen, Le Xue, Zhiyang Xu, Xichen Pan, Shusheng Yang, Can Qin, An Yan, Honglu Zhou, Zeyuan Chen, Lifu Huang, Tianyi Zhou, Junnan Li, Silvio Savarese, Caiming Xiong, Ran Xu

机构 * Salesforce Research(Salesforce研究部) University of Maryland(马里兰大学) Virginia Tech(弗吉尼亚理工大学) New York University(纽约大学) UC Davis(加州大学戴维斯分校)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03409 2025-10-20 cs.CV 57%

PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation

Ao Wang, Hui Chen, Jiaxin Li, Jianchao Tan, Kefeng Zhang, Xunliang Cai, Zijia Lin, Jungong Han, Guiguang Ding

机构 * School of Software, Tsinghua University(清华大学软件学院) BNRist, Tsinghua University(清华大学BNRist) Meituan Inc.(美团公司) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments NeurIPS 2025 Camera-ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23402 2025-10-17 cs.CV 57%

WorldSplat: Gaussian-Centric Feed-Forward 4D Scene Generation for Autonomous Driving

Ziyue Zhu, Zhanqian Wu, Zhenxin Zhu, Lijun Zhou, Haiyang Sun, Bing Wan, Kun Ma, Guang Chen, Hangjun Ye, Jin Xie, jian Yang

机构 * Nankai University(南开大学) Nanjing University, Suzhou(南京大学苏州校区)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12041 2025-10-16 cs.CL 57%

Improving Text-to-Image Generation with Input-Side Inference-Time Scaling

Ruibo Chen, Jiacheng Pan, Heng Huang, Zhenheng Yang

机构 * TikTok University of Maryland, College Park(马里兰大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12777 2025-10-15 cs.CV 57%

What If : Understanding Motion Through Sparse Interactions

Stefan Andreas Baumann, Nick Stracke, Timy Phan, Björn Ommer

机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Project page and code: https://compvis.github.io/flow-poke-transformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10742 2025-10-15 cs.AI 57%

The Philosophical Foundations of Growing AI Like A Child

Dezhi Luo, Yijiang Li, Hokin Deng

机构 * University of Michigan(密歇根大学) University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12253 2025-10-15 cs.LG cs.AI 57%

Diffusion Models for Reinforcement Learning: Foundations, Taxonomy, and Development

Changfu Xu, Jianxiong Guo, Yuzhu Liang, Haiyang Huang, Haodong Zou, Xi Zheng, Shui Yu, Xiaowen Chu, Jiannong Cao, Tian Wang

机构 * Jiangxi University of Finance and Economics(江西财经大学) Beijing Normal University(北京师范大学) Anhui University(安徽大学) Macquarie University(麦考瑞大学) University of Technology Sydney(悉尼大学) The University of Science and Technology (Guangzhou)(广州大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12095 2025-10-15 cs.CV 57%

IL3D: A Large-Scale Indoor Layout Dataset for LLM-Driven 3D Scene Generation

Wenxu Zhou, Kaixuan Nie, Hang Du, Dong Yin, Wei Huang, Siqiang Guo, Xiaobo Zhang, Pengbo Hu

机构 * University of Science and Technology of China(中国科学技术大学) Songying Technology(宋英科技)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 9 pages main paper; 15 pages references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11650 2025-10-14 cs.CV 57%

InfiniHuman: Infinite 3D Human Creation with Precise Control

Yuxuan Xue, Xianghui Xie, Margaret Kostyrko, Gerard Pons-Moll

机构 * University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) University of Tübingen, Tübingen AI Center, MPI for Informatics, SIC(图宾根大学,图宾根人工智能中心,马克斯·普朗克信息研究所,SIC) University of Tübingen(图宾根大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Accepted to ACM SIGGRAPH Asia 2025. Project website: https://yuxuan-xue.com/infini-human

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10158 2025-10-14 cs.NI cs.AI 57%

Multi-Scale Diffusion Transformer for Jointly Simulating User Mobility and Mobile Traffic Pattern

Ziyi Liu, Qingyue Long, Zhiwen Xue, Huandong Wang, Yong Li

机构 * Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(电子工程系,信息科学与技术国家研究中心(BNRist),清华大学) International School, Beijing University of Posts and Telecommunications(国际学院,北京邮电大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.AI

Comments 9 pages, 4 figures. Code: https://github.com/tsinghua-fib-lab/MSTDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10156 2025-10-14 cs.CV 57%

ReMix: Towards a Unified View of Consistent Character Generation and Editing

Benjia Zhou, Bin Fu, Pei Cheng, Yanru Wang, Jiayuan Fan, Tao Chen

机构 * Tencent GYLab(腾讯GY实验室) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09254 2025-10-13 cs.RO cs.AI 57%

Obstacle Avoidance using Dynamic Movement Primitives and Reinforcement Learning

Dominik Urbaniak, Alejandro Agostini, Pol Ramon, Jan Rosell, Raúl Suárez, Michael Suppa

机构 * Institute of Industrial and Control Engineering, Universitat Politècnica de Catalunya(工业与控制工程研究所,巴塞罗那理工大学) Department of Computer Science, University of Innsbruck(计算机科学系,因斯布鲁克大学) Roboception GmbH(Roboception公司)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08625 2025-10-13 cs.CV 57%

Adjusting Initial Noise to Mitigate Memorization in Text-to-Image Diffusion Models

Hyeonggeun Han, Sehwan Kim, Hyungjun Joo, Sangwoo Hong, Jungwoo Lee

机构 * Seoul National University(首尔国立大学) CSE, Konkuk University(计算机科学与工程系,konkuk大学) Hodoo AI Labs(Hodoo AI实验室)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08157 2025-10-10 cs.CV 57%

Beyond Textual CoT: Interleaved Text-Image Chains with Deep Confidence Reasoning for Image Editing

Zhentao Zou, Zhengrong Yue, Kunpeng Du, Binlei Bao, Hanting Li, Haizhen Xie, Guozheng Xu, Yue Zhou, Yali Wang, Jie Hu, Xue Jiang, Xinghao Chen

机构 * Shanghai Jiaotong University(上海交通大学) Huawei Noah’s Ark Lab(华为诺亚实验室) East China Normal University(华东师范大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 25pages,20figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07865 2025-10-10 cs.RO cs.AI 57%

DM1: MeanFlow with Dispersive Regularization for 1-Step Robotic Manipulation

Guowei Zou, Haitao Wang, Hejun Wu, Yukun Qian, Yuhang Wang, Weibing Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments Website with code: https://guowei-zou.github.io/dm1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05492 2025-10-10 cs.LG cs.AI 57%

High-Fidelity Synthetic ECG Generation via Mel-Spectrogram Informed Diffusion Training

Zhuoyi Huang, Nutan Sahoo, Anamika Kumari, Girish Kumar, Kexuan Cai, Shixing Cao, Yue Kang, Tian Xia, Somya Chatterjee, Nicholas Hausman, Aidan Jay, Eric S. Rosenthal, Soundar Srinivasan, Sadid Hasan, Alex Fedorov, Sulaiman Vesal

机构 * Microsoft(微软公司) Massachusetts General Hospital, Harvard University(哈佛大学麻省总医院) Emory University(埃默里大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03498 2025-10-08 cs.CV 57%

OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation

Han Li, Xinyu Peng, Yaoming Wang, Zelin Peng, Xin Chen, Rongxiang Weng, Jingang Wang, Xunliang Cai, Wenrui Dai, Hongkai Xiong

机构 * Meituan Inc(美团公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments technical report, project url:https://onecat-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05093 2025-10-07 cs.CV 57%

Character Mixing for Video Generation

Tingting Liao, Chongjian Ge, Guangyi Liu, Hao Li, Yi Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04615 2025-10-07 eess.SY cs.AI cs.SY 57%

Design Process of a Self Adaptive Smart Serious Games Ecosystem

X. Tao, P. Chen, M. Tsami, F. Khayati, M. Eckert

机构 * Research Center on Software Technologies and Multimedia Systems for Sustainability (CITSEM), Universidad Politécnica de Madrid (UPM), Spain(软件技术与多媒体系统可持续性研究所以及马德里理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04125 2025-10-07 cs.CV 57%

Joint Learning of Pose Regression and Denoising Diffusion with Score Scaling Sampling for Category-level 6D Pose Estimation

Seunghyun Lee, Tae-Kyun Kim

机构 * KAIST(韩国科学技术院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03886 2025-10-07 cs.AI 57%

Rare Text Semantics Were Always There in Your Diffusion Transformer

Seil Kang, Woojung Han, Dayun Ju, Seong Jae Hwang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03591 2025-10-07 cs.CV 57%

Resolving Task Objective Conflicts in Unified Model via Task-Aware Mixture-of-Experts

Jiaxing Zhang, Hao Tang

机构 * Sichuan University(四川大学) Peking University(北京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02987 2025-10-06 cs.CV 57%

TIT-Score: Evaluating Long-Prompt Based Text-to-Image Alignment via Text-to-Image-to-Text Consistency

Juntong Wang, Huiyu Duan, Jiarui Wang, Ziheng Jia, Guangtao Zhai, Xiongkuo Min

机构 * Institute of Image Communication and Network Engineering(图像通信与网络工程研究所) MoE Key Lab of Artificial Intelligence, AI Institute(人工智能关键实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02722 2025-10-06 cs.CV 57%

MoGIC: Boosting Motion Generation via Intention Understanding and Visual Context

Junyu Shi, Yong Sun, Zhiyuan Zhang, Lijiang Liu, Zhengjie Zhang, Yuxin He, Qiang Nie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23426 2025-10-03 cs.LG cs.AI 57%

Enhanced DACER Algorithm with High Diffusion Efficiency

Yinuo Wang, Likun Wang, Mining Tan, Wenjun Zou, Xujie Song, Wenxuan Wang, Tong Liu, Guojian Zhan, Tianze Zhu, Shiqi Liu, Zeyu He, Feihong Zhang, Jingliang Duan, Shengbo Eben Li

机构 * School of Vehicle and Mobility & College of AI, Tsinghua University(车辆与移动学院及人工智能学院,清华大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) School of Mechanical Engineering, University of Science and Technology Beijing(机械工程学院,北京科技大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14399 2025-10-03 cs.IR cs.AI cs.DB cs.LG cs.SI 57%

Handling Heterophily in Recommender Systems with Wavelet Hypergraph Diffusion

Darnbi Sakong, Thanh Tam Nguyen

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments Fixed and extended results

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02842 2025-10-03 cs.CV 57%

DiffCut: Catalyzing Zero-Shot Semantic Segmentation with Diffusion Features and Recursive Normalized Cut

Paul Couairon, Mustafa Shukor, Jean-Emmanuel Haugeard, Matthieu Cord, Nicolas Thome

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments NeurIPS 2024. Project page at https://diffcut-segmentation.github.io. Code at https://github.com/PaulCouairon/DiffCut

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00974 2025-10-02 cs.CV 57%

JEPA-T: Joint-Embedding Predictive Architecture with Text Fusion for Image Generation

Siheng Wan, Zhengtao Yao, Zhengdao Li, Junhao Dong, Yanshu Li, Yikai Li, Linshan Li, Haoyan Xu, Yijiang Li, Zhikang Dong, Huacan Wang, Jifeng Shen

机构 * Jiangsu University(江苏大学) University of Southern California(南加州大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学) Brown University(布朗大学) UC San Diego(加州大学圣地亚哥分校) Stony Brook University(石溪大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00911 2025-10-02 cs.LG cs.AI 57%

RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training

Tao Ren, Jinyang Jiang, Hui Yang, Wan Tian, Minhao Zou, Guanghao Li, Zishi Zhang, Qinghao Wang, Shentao Qin, Yanjun Zhao, Rui Tao, Hui Shao, Yijie Peng

机构 * Peking University(北京大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏