arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2511.08536 2025-11-12 cs.CV 57%

3D4D: An Interactive, Editable, 4D World Model via 3D Video Generation

Yunhong He, Zhengqing Yuan, Zhengzhong Tu, Yanfang Ye, Lichao Sun

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments Accepted by AAAI 2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07877 2025-11-12 cs.CV 57%

Visual Bridge: Universal Visual Perception Representations Generating

Yilin Gao, Shuguang Dou, Junzhou Li, Zhiheng Yu, Yin Li, Dongsheng Jiang, Shugong Xu

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07744 2025-11-12 cs.CV 57%

VectorSynth: Fine-Grained Satellite Image Synthesis with Structured Semantics

Daniel Cher, Brian Wei, Srikumar Sastry, Nathan Jacobs

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07690 2025-11-12 cs.AI 57%

Towards AI-Assisted Generation of Military Training Scenarios

Soham Hans, Volkan Ustun, Benjamin Nye, James Sterrett, Matthew Green

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22812 2025-11-11 cs.CL 57%

EditGRPO: Reinforcement Learning with Post-Rollout Edits for Clinically Accurate Chest X-Ray Report Generation

Kai Zhang, Christopher Malon, Lichao Sun, Martin Renqiang Min

机构 * NEC Laboratories America(NEC美国实验室) Lehigh University(莱特大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

Comments AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18452 2025-11-11 cs.SD eess.AS 57%

DIFFA: Large Language Diffusion Models Can Listen and Understand

Jiaming Zhou, Hongjie Chen, Shiwan Zhao, Jian Kang, Jie Li, Enzhi Wang, Yujie Guo, Haoqin Sun, Hui Wang, Aobo Kong, Yong Qin, Xuelong Li

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所)

专题命中 多模态生成 :multimodal(abstract);分类 eess.AS

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06422 2025-11-11 cs.CV 57%

DiffusionUavLoc: Visually Prompted Diffusion for Cross-View UAV Localization

Tao Liu, Kan Ren, Qian Chen

机构 * School of Electronic and Optical Engineering, Nanjing University of Science and Technology(电子与光学工程学院,南京理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15387 2025-11-11 cs.CV 57%

DIO: Refining Mutual Information and Causal Chain to Enhance Machine Abstract Reasoning Ability

Ruizhuo Song, Beiming Yuan

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

Comments 15 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01322 2025-11-11 cs.CV 57%

FreeInsert: Disentangled Text-Guided Object Insertion in 3D Gaussian Scene without Spatial Priors

Chenxi Li, Weijie Wang, Qiang Li, Bruno Lepri, Nicu Sebe, Weizhi Nie

机构 * Tianjin University(天津大学) University of Trento(特伦托大学)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

Comments Accepted by ACMMM2025, Our project webpage: https://tjulcx.github.io/FreeInsert/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05606 2025-11-11 cs.CV 57%

FreeBlend: Advancing Concept Blending with Staged Feedback-Driven Interpolation Diffusion

Yufan Zhou, Haoyu Shen, Huan Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology of China(中国科学技术大学) Westlake University(西湖大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

Comments Webpage: https://petershen-csworld.github.io/FreeBlend

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00105 2025-11-07 cs.CY cs.AI 57%

Artificial Intelligence in Elementary STEM Education: A Systematic Review of Current Applications and Future Challenges

Majid Memari, Krista Ruggles

机构 * Department of Computer Science, Utah Valley University(计算机科学系,犹他谷大学) School of Education, Utah Valley University(教育学院,犹他谷大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21529 2025-11-07 cs.CV 57%

Chain-of-Cooking:Cooking Process Visualization via Bidirectional Chain-of-Thought Guidance

Mengling Xu, Ming Tao, Bing-Kun Bao

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06853 2025-11-06 cs.LG cs.AI cs.CE physics.chem-ph q-bio.MN 57%

DiffSpectra: Molecular Structure Elucidation from Spectra using Diffusion Models

Liang Wang, Yu Rong, Tingyang Xu, Zhenyi Zhong, Zhiyuan Liu, Pengju Wang, Deli Zhao, Qiang Liu, Shu Wu, Liang Wang, Yang Zhang

机构 * NLPR, MAIS, Institute of Automation(NLPR、MAIS、自动化研究所) School of Artificial Intelligence(人工智能学院) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) Hupan Lab(华普实验室) College of Intelligence and Computing(智能与计算学院) National University of Singapore(新加坡国立大学) Cancer Science Institute of Singapore(新加坡癌症科学研究所)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02091 2025-11-05 cs.LG cs.AI 57%

Natural Building Blocks for Structured World Models: Theory, Evidence, and Scaling

Lancelot Da Costa, Sanjeev Namjoshi, Mohammed Abbas Ansari, Bernhard Schölkopf

机构 * VERSES AI Research Lab(VERSES AI研究实验室) University of Tübingen(图宾根大学) ELLIS Institute, Tübingen(图宾根ELLIS研究所) MPI for Intelligent Systems, Tübingen(图宾根智能系统研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments 13 pages, 3 figures, under review for World Modeling Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01894 2025-11-05 cs.GR cs.AI cs.LG 57%

LGCC: Enhancing Flow Matching Based Text-Guided Image Editing with Local Gaussian Coupling and Context Consistency

Fangbing Liu, Pengfei Duan, Wen Li, Yi He

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01645 2025-11-04 cs.CV 57%

Enhancing Diffusion-based Restoration Models via Difficulty-Adaptive Reinforcement Learning with IQA Reward

Xiaogang Xu, Ruihang Chu, Jian Wang, Kun Zhou, Wenjie Shu, Harry Yang, Ser-Nam Lim, Hao Chen, Liang Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Snap Research Shenzhen University(深圳大学) HKUST(香港科技大学) University of Central Florida(佛罗里达大学) UC Davis(加州大学戴维斯分校) Sun Yat-Sen University(孙中山大学)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16800 2025-11-04 cs.CV 57%

Phys4DGen: Physics-Compliant 4D Generation with Multi-Material Composition Perception

Jiajing Lin, Zhenzhong Wang, Dejun Xu, Shu Jiang, YunPeng Gong, Min Jiang

机构 * School of Informatics, Xiamen University(厦门大学信息学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Accepted by ACM MM 2025. Project Page: https://jiajinglin.github.io/Phys4DGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00344 2025-11-04 cs.CV 57%

Federated Dialogue-Semantic Diffusion for Emotion Recognition under Incomplete Modalities

Xihang Qiu, Jiarong Cheng, Yuhao Fang, Wanpeng Zhang, Yao Lu, Ye Zhang, Chun Li

机构 * Shenzhen MSU-BIT University(深圳MSU-BIT大学) Beijing Institude of Technology(北京理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27448 2025-11-03 cs.AI 57%

GeoFM: Enhancing Geometric Reasoning of MLLMs via Synthetic Data Generation through Formal Language

Yuhao Zhang, Dingxin Hu, Tinghao Yu, Hao Liu, Yiting Liu

机构 * Tencent Hunyuan Team(腾讯文言团队)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25163 2025-10-30 cs.CV 57%

Target-Guided Bayesian Flow Networks for Quantitatively Constrained CAD Generation

Wenhao Zheng, Chenwei Sun, Wenbo Zhang, Jiancheng Lv, Xianggen Liu

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education, Chengdu, China(教育部机器学习与工业智能工程研究中心)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (2025) 3330-3339

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16691 2025-10-29 cs.CV 57%

InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention

Qiang Xiang, Shuang Sun, Binglei Li, Dejia Song, Huaxia Li, Nemo Chen, Xu Tang, Yao Hu, Junping Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Accepted in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14627 2025-10-28 cs.RO cs.CV 57%

GOPLA: Generalizable Object Placement Learning via Synthetic Augmentation of Human Arrangement

Yao Zhong, Hanzhi Chen, Simon Schaefer, Anran Zhang, Stefan Leutenegger

机构 * Technical University of Munich(慕尼黑技术大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10776 2025-10-28 cs.CR cs.AI 57%

ME: Trigger Element Combination Backdoor Attack on Copyright Infringement

Feiyu Yang, Siyuan Liang, Aishan Liu, Dacheng Tao

专题命中 多模态生成 :image-text(abstract);分类 cs.AI

Comments Finding unfinished issue in this work , still refining

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20350 2025-10-27 cs.CY cs.AI 57%

What Do AI-Generated Images Want?

Amanda Wasielewski

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15382 2025-10-24 cs.LG cs.AI cs.RO 57%

Towards Robust Zero-Shot Reinforcement Learning

Kexin Zheng, Lauriane Teyssier, Yinan Zheng, Yu Luo, Xianyuan Zhan

机构 * The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments Neurips 2025, 29 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18911 2025-10-23 physics.chem-ph cs.AI 57%

Prospects for Using Artificial Intelligence to Understand Intrinsic Kinetics of Heterogeneous Catalytic Reactions

Andrew J. Medford, Todd N. Whittaker, Bjarne Kreitz, David W. Flaherty, John R. Kitchin

机构 * organization= School of Chemical \& Biomolecular Engineering, Georgia Institute of Technology , addressline= 311 Ferst Drive NW , city= Atlanta , postcode= 30332 , state= GA , country= USA organization= Department of Chemical Engineering, Carnegie Mellon University , addressline= 5000 Forbes Street , city= Pittsburgh , postcode= 15213 , state= PA , country= USA

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments Submitted to "Current Opinion in Chemical Engineering" for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12323 2025-10-23 cs.CV 57%

Doctor Approved: Generating Medically Accurate Skin Disease Images through AI-Expert Feedback

Janet Wang, Yunbei Zhang, Zhengming Ding, Jihun Hamm

机构 * Tulane University(路易斯安那州立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05051 2025-10-23 cs.CV cs.RO 57%

ComDrive: Comfort-Oriented End-to-End Autonomous Driving

Junming Wang, Xingyu Zhang, Zebin Xing, Songen Gu, Xiaoyang Guo, Yang Hu, Ziying Song, Qian Zhang, Xiaoxiao Long, Wei Yin

机构 * Horizon Robotics University of Hong Kong(香港大学) University of the Chinese Academy of Sciences(中国科学院大学) Nanjing University(南京大学) Beijing Jiaotong University(北京交通大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18345 2025-10-22 cs.CV 57%

GPTFace: Generative Pre-training of Facial-Linguistic Transformer by Span Masking and Weakly Correlated Text-image Data

Yudong Li, Hao Li, Xianxu Hou, Linlin Shen

机构 * Shenzhen University(深圳大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments This work was initially drafted in November 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17937 2025-10-22 cs.LG cs.AI 57%

UniRL-Zero: Reinforcement Learning on Unified Models with Joint Language Model and Diffusion Model Experts

Fu-Yun Wang, Han Zhang, Michael Gharbi, Hongsheng Li, Taesung Park

机构 * Cuhk(香港中文大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏