arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4979 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4979 篇

2408.04380 2024-08-22 cs.RO cs.LG 71%

Deep Generative Models in Robotics: A Survey on Learning from Multimodal Demonstrations

Julen Urain, Ajay Mandlekar, Yilun Du, Mahi Shafiullah, Danfei Xu, Katerina Fragkiadaki, Georgia Chalvatzaki, Jan Peters

专题命中 多模态生成 :multimodal(title)

Comments 20 pages, 11 figures, submitted to TRO

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20218 2024-08-06 physics.acc-ph math.OC 71%

cDVAE: Multimodal Generative Conditional Diffusion Guided by Variational Autoencoder Latent Embedding for Virtual 6D Phase Space Diagnostics

Alexander Scheinker

专题命中 多模态生成 :multimodal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13942 2024-06-21 cs.LG 71%

Synthesizing Multimodal Electronic Health Records via Predictive Diffusion Models

Yuan Zhong, Xiaochen Wang, Jiaqi Wang, Xiaokun Zhang, Yaqing Wang, Mengdi Huai, Cao Xiao, Fenglong Ma

专题命中 多模态生成 :multimodal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06227 2024-04-10 cs.HC 71%

Multimodal Road Network Generation Based on Large Language Model

Jiajing Chen, Weihang Xu, Haiming Cao, Zihuan Xu, Yu Zhang, Zhao Zhang, Siyao Zhang

专题命中 多模态生成 :multimodal(title)

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06164 2024-01-15 q-fin.GN cs.LG 71%

Multimodal Gen-AI for Fundamental Investment Research

Lezhi Li, Ting-Yu Chang, Hai Wang

专题命中 多模态生成 :multimodal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14146 2023-10-24 stat.AP 71%

Cocaine Use Prediction with Tensor-based Machine Learning on Multimodal MRI Connectome Data

Anru R. Zhang, Ryan P. Bell, Chen An, Runshi Tang, Shana A. Hall, Cliburn Chan, Kareem Al-Khalil, Christina S. Meade

专题命中 多模态生成 :multimodal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.02616 2023-09-07 eess.IV cs.LG cs.NI 71%

Generative AI-aided Joint Training-free Secure Semantic Communications via Multi-modal Prompts

Hongyang Du, Guangyuan Liu, Dusit Niyato, Jiayi Zhang, Jiawen Kang, Zehui Xiong, Bo Ai, Dong In Kim

专题命中 多模态生成 :multi-modal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03933 2023-04-11 stat.ME cs.LG stat.CO stat.ML 71%

Efficient Multimodal Sampling via Tempered Distribution Flow

Yixuan Qiu, Xiao Wang

专题命中 多模态生成 :multimodal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.06826 2023-01-18 cs.RO 71%

Vis2Hap: Vision-based Haptic Rendering by Cross-modal Generation

Guanqun Cao, Jiaqi Jiang, Ningtao Mao, Danushka Bollegala, Min Li, Shan Luo

专题命中 多模态生成 :cross-modal(title)

Comments This paper is accepted at ICRA 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.14066 2022-11-30 gr-qc astro-ph.HE 71%

Accelerating multimodal gravitational waveforms from precessing compact binaries with artificial neural networks

Lucy M. Thomas, Geraint Pratten, Patricia Schmidt

专题命中 多模态生成 :multimodal(title)

Comments Matches published version in PRD. 19 pages (including appendix and bibliography), 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.14708 2021-10-01 physics.optics cond-mat.mtrl-sci 71%

Multimodal Tip-Enhanced Nonlinear Optical Nano-Imaging of Plasmonic Silver Nanocubes

Chih-Feng Wang, Patrick Z. El-Khoury

专题命中 多模态生成 :multimodal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.06552 2020-09-09 q-bio.NC 71%

Multiscale and multimodal network dynamics underpinning working memory

Andrew C. Murphy, Maxwell A. Bertolero, Lia Papadopoulos, David M. Lydon-Staley, Danielle S. Bassett

专题命中 多模态生成 :multimodal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.14020 2020-07-15 physics.optics physics.bio-ph 71%

A multimodal laser-scanning nonlinear optical microscope with a rapid broadband Fourier-transform coherent Raman modality

Faris Sinjab, Kazuki Hashimoto, Venktata Ramaiah Badarla, Junko Omachi, Takuro Ideguchi

专题命中 多模态生成 :multimodal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.02121 2020-03-31 physics.med-ph cs.LG physics.bio-ph q-bio.GN 71%

Next Generation Radiogenomics Sequencing for Prediction of EGFR and KRAS Mutation Status in NSCLC Patients Using Multimodal Imaging and Machine Learning Approaches

Isaac Shiri, Hassan Maleki, Ghasem Hajianfar, Hamid Abdollahi, Saeed Ashrafinia, Mathieu Hatt, Mehrdad Oveisi, Arman Rahmim

专题命中 多模态生成 :multimodal(title)

Comments 42 pages,3 Figures,4 Tables, 13 Supplemental Figures, 11 Supplemental Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.01981 2018-04-11 physics.bio-ph 71%

Multi-modal transport and dispersion of organelles in narrow tubular cells

Saurabh Mogre, Elena F. Koslover

专题命中 多模态生成 :multi-modal(title)

Comments 17 pgs, 8 figures

Journal ref Phys. Rev. E 97, 042402 (2018)

详情

展开后加载摘要…

URL PDF HTML 收藏
1608.00936 2016-09-02 cs.GR q-bio.NC 71%

Multimodal Brain Visualization

Saad Nadeem, Arie Kaufman

专题命中 多模态生成 :multimodal(title)

Comments SPIE Medical Imaging 2016, Proc. SPIE Medical Imaging: Biomedical Applications in Molecular, Structural, and Functional Imaging, 2016

Journal ref SPIE Medical Imaging, pp. 97881Y-97881Y. 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15510 2026-08-18 cs.AI 新提交 70%

Who Leads Now? Token-Level Modality Arbitration for Chart-to-Code Generation

当前谁主导?用于图表转代码生成的令牌级模态仲裁

Qinghao Fu, Yarong Wang, Shunlei Ning, Yilin Wang, Shunwen Bai, Xinda Wang, Jiaotuan Wang, Yinan Nie, Wei Zhou

专题命中 多模态生成 :cross-modal(abstract,abstract_cn);分类 cs.AI

AI总结 提出MoCA模型,通过CAB分离视觉与编码能力并动态仲裁贡献,经两阶段训练后在三个基准测试中取得与同类模型相当的图表转代码性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16285 2026-08-14 cs.CV 版本更新 70%

EvoTale: Continual Character Customization for Expanding Story Worlds

持久故事世界模拟与连续角色定制

Jinlu Zhang, Qiyun Wang, Baoxiang Du, Jiayi Ji, Jing He, Rongsheng Zhang, Tangjie Lv, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Fuxi AI Lab, Netease Inc.(福克斯AI实验室,网易公司)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出EverTale,通过统一LoRA模块实现连续角色自定义,引入质量门和区域聚焦采样策略,提升多角色视觉叙事的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08494 2026-08-12 cs.CV 版本更新 70%

Linguistically-Aligned and Visually-Grounded Preference Optimization for Clinically-Augmented Medical Report Generation

面向临床增强型医疗报告生成的语言对齐与视觉 grounded 的偏好优化

Qiang Hu, Yuxuan Luo, Yingjie Guo, Hao Wang, Qimei Wang, Qiang Li, Zhiwei Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对现有医疗报告生成方法的临床事实错误与视觉-语言对齐不足问题,提出DPO-Clin框架,通过ECD模块、M²DPO及反事实偏好数据构建提升模型可靠性,在多医学数据集上取得优异性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19341 2026-08-11 cs.CV 版本更新 70%

ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis

ExpertVerse:知识密集型视觉合成中专家级推理的通用基准

Yuan Wang, Yongchao Du, Mengting Chen, Jinsong Lan, Jiaxuan Luo, Xuetao Feng, Xiaoyong Zhu

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究针对多模态生成模型在知识密集型生成的不足,开发ExpertVerse基准,涵盖多种认知能力和专家学科,生成相关数据集,训练KnowThinker并提出BPPO优化方法,揭示模型推理缺陷,强调知识密集型基准对下一代视觉生成的重要性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19990 2026-08-11 cs.AI 版本更新 70%

LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?

LEGO-Puzzles:多模态大语言模型(MLLMs)在多步骤空间推理上的表现如何?

Kexian Tang, Junyao Gao, Yanhong Zeng, Haodong Duan, Yanan Sun, Zhening Xing, Wenran Liu, Kai Chen, Kaifeng Lyu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tongji University(同济大学) Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(abstract,abstract_cn);分类 cs.AI

AI总结 该研究推出多步骤空间推理基准LEGO-Puzzles,评估29个顶尖MLLMs,发现其在基础空间推理、多步骤规划任务上远逊于人类,凸显其空间推理能力存在关键局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06917 2026-08-10 cs.AI 新提交 70%

ReGraph: Learning to Generate Recipe Graphs from Food Images

ReGraph:从食物图像生成食谱图的学习方法

Guoshan Liu, Bin Zhu, Pengkun Jiao, Jingjing Chen, Chong-Wah Ngo, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信体智能研究院) Singapore Management University(新加坡管理大学)

专题命中 多模态生成 :multimodal(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对现有食谱生成方法的过程结构捕捉不足问题,构建了ReGraph食谱图数据集并提出RGL两阶段框架,可让LMM从食物图像生成结构化食谱图,提升了烹饪实体与过程关系的生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23586 2026-08-05 cs.CV cs.CL cs.MM cs.SD eess.AS 版本更新 70%

Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

Talker-T2AV:基于自回归扩散模型的联合说话音频视频生成

Zhen Ye, Xu Tan, Aoxiong Yin, Hongzhan Lin, Guangyan Zhang, Peiwen Sun, Yiming Li, Chi-Min Chan, Wei Ye, Shikun Zhang, Wei Xue

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Independent Researcher(独立研究者)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本文提出Talker-T2AV,通过共享骨干和模态特定解码器实现音频视频联合生成,提升跨模态一致性与生成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26817 2026-08-04 cs.RO cs.CV 版本更新 70%

From Uncertainty to Determinism: Coarse-to-Fine Visual Floorplan Localization without Ray Matching

从不确定性到确定性:无射线匹配的由粗到细视觉楼层平面图定位

Shiyong Meng, Bolei Chen, Ping Zhong, Yang Wan, Rongzhi Wang, Jiazhi Xia, Jianxin Wang

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 该研究针对视觉楼层平面图定位的多模态姿态分布问题,提出无射线匹配的由粗到细框架,通过图像条件姿态扩散模型与局部细化器实现定位,在S3D和ZInD基准上达到最优精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02817 2026-08-04 cs.CV 版本更新 70%

MMPhysVideo: Physically Plausible Video Generation Through Joint RGB-Perception Modeling

MMPhysVideo: 通过联合多模态建模提升视频生成的物理合理性

Shubo Lin, Xuanyang Zhang, Wei Cheng, Weiming Hu, Gang Yu, Jin Gao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) StepFun(阶跃星辰) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(多模态信息超级智能安全北京市重点实验室) School of Information Science and Technology, Shanghai Tech University(上海科技大学信息科学与技术学院)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 MMPhysVideo通过联合多模态建模提升视频生成的物理合理性,将感知线索统一为伪RGB格式,提出双向控制教师架构以减少跨模态干扰,并通过MMPhysPipe构建物理丰富的多模态数据集,提升物理合理性和视觉质量。

Comments Project Page: https://shubolin028.github.io/MMPhysVideo-Page

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19537 2026-08-03 cs.CV cs.AI cs.LG cs.MM cs.SD eess.AS 版本更新 70%

Deepfake Media Generation and Detection in the Generative AI Era: A Survey and Outlook

生成式AI时代的深度伪造媒体生成与检测:综述与展望

Florinel-Alin Croitoru, Andrei-Iulian Hiji, Vlad Hondru, Nicolae Catalin Ristea, Paul Irofti, Marius Popescu, Cristian Rusu, Radu Tudor Ionescu, Fahad Shahbaz Khan, Mubarak Shah

机构 * Department of Computer Science, University of Bucharest(布加勒斯特大学计算机科学系) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Department of Computer Science, University of Central Florida(中佛罗里达大学计算机科学系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 综述了深度伪造生成与检测技术,涵盖图像、视频、音频和多模态内容,构建了分类体系,并提出了新的多模态基准测试,发现现有检测器对未见生成器的深度伪造泛化能力不足。

Comments Accepted in ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23472 2026-07-28 cs.CV 新提交 70%

VIPER: Visual In-Context Physics Reasoning for Physically Plausible Video Generation

VIPER:用于物理上合理的视频生成的视觉上下文物理推理

Tianxiao Chen, Hanmo Chen, Huajin Chen, Bo Li, Qi Ye, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 研究针对视频生成模型控制物理行为难的问题,提出VIPER框架,利用多模态大语言模型提取物理线索,通过分层训练引导图像到视频生成器,构建VIPER-19K数据集,实验证明该框架能实现物理行为转移且效果良好。

Comments tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24110 2026-07-28 cs.CV cs.LG physics.optics 新提交 70%

BeyondFusion: Self-Aligned Latent Diffusion for Calibration-Free Infrared Super-Resolution and Infrared-Visible Fusion

超越融合:用于无校准红外超分辨率和红外-可见光融合的自对齐潜在扩散

Minchong Chen, Xiaoyun Yuan, Minyu Cao, Jianing Zhang, Jun Zhang, Shuyang Liu, Xiaokang Yang

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对移动红外-可见光成像中跨传感器未对准问题,提出超越融合框架,通过引入跨模态自对齐模块及未对准增强模块,实现无校准条件下的红外超分辨率和红外-可见光融合,经实验验证了其有效性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20660 2026-07-24 cs.CV 新提交 70%

Axolotl3D: a Unified Framework for Faithful 3D Shape Completion

Axolotl3D:用于精确3D形状完成的统一框架

Anita Hu, Maria Shugrina

机构 * NVIDIA(英伟达)

专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对3D生成模型在多场景适用性有限及缺乏统一框架的问题,提出Axolotl3D模型,它基于多种模态条件设定,利用点云和相机参数,通过统一训练策略实现精确3D形状完成,实验验证其在多方面性能出色。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20197 2026-07-23 cs.CV 新提交 70%

RS-RIE-Bench: Benchmarking Reasoning-Guided Remote Sensing Image Editing

RS-RIE-Bench:推理引导的遥感图像编辑基准测试

Zihan Qin, Boao Xu, Zhao Dong, Yingping Sun, Ziheng Jiao, Junying Wang, Hongwei Wang

机构 * Huawei(华为)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对遥感图像编辑,引入RS-RIE-Bench基准,将任务分类,通过特定评估协议和方法评估模型,经实验发现当前模型在推理引导的遥感编辑中有局限,为未来模型提供了基准和研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏