arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2512.11719 2025-12-15 cs.CV 57%

Referring Change Detection in Remote Sensing Imagery

遥感图像中的指称变化检测

Yilmaz Korkmaz, Jay N. Paranjape, Celso M. de Melo, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) DEVCOM U.S. Army Research Laboratory(美国陆军研究实验室)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出指称变化检测方法,通过自然语言提示实现遥感图像中特定类别的变化检测,并引入两阶段框架提升数据生成效率。

Comments 2026 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14040 2025-12-15 cs.LG cs.AI cs.RO 57%

WARPD: World model Assisted Reactive Policy Diffusion

WARPD:世界模型辅助的反应策略扩散

Shashank Hegde, Satyajeet Das, Gautam Salhotra, Gaurav S. Sukhatme

机构 * University of Southern California(南加州大学) Google(谷歌) Intrinsic LLC(Intrinsic 公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 WARPD通过直接生成闭环策略,提高了机器人任务中长动作时间跨度和鲁棒性的性能,同时显著降低了推理成本。

Comments Outstanding Paper Award at the Embodied World Models for Decision Making Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10991 2025-12-15 cs.LG cs.AI physics.chem-ph q-bio.QM 57%

MolSculpt: Sculpting 3D Molecular Geometries from Chemical Syntax

MolSculpt:从化学语法雕刻3D分子几何

Zhanpeng Chen, Weihao Gao, Shunyu Wang, Yanan Zhu, Hong Meng, Yuexian Zou

机构 * AI for Science (AI4S)-Preferred Program, Peking University Shenzhen Graduate School, China(人工智能科学(AI4S)优选计划,北京大学深圳研究生院,中国) Faculty of Materials Science, Shenzhen MSU-BIT University, Shenzhen, China(材料科学学院,深圳MSU-BIT大学,中国)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.AI

AI总结 MolSculpt通过整合1D化学知识与3D生成过程,实现了从化学语法到精确3D分子几何的高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10352 2025-12-12 cs.CV 57%

Topology-Agnostic Animal Motion Generation from Text Prompt

基于文本提示的拓扑无关动物运动生成

Keyi Chen, Mingze Sun, Zhenyu Liu, Zhangquan Chen, Ruqi Huang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出OmniZoo数据集和通用自回归框架,实现基于文本提示的任意拓扑动物运动生成及跨物种风格迁移。

Comments 10 pages, 7 figures.Conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09814 2025-12-11 cs.CV 57%

DynaIP: Dynamic Image Prompt Adapter for Scalable Zero-shot Personalized Text-to-Image Generation

DynaIP: 动态图像提示适配器用于可扩展的零样本个性化文本到图像生成

Zhizhong Wang, Tianyi Chu, Zeyi Huang, Nanyang Wang, Kehan Li

机构 * Central Media Technology Institute, Huawei(华为中央媒体技术研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 DynaIP通过动态解耦策略和层次特征融合模块,提升零样本个性化文本到图像生成的细粒度概念保真度与多主体扩展能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03506 2025-12-11 cs.AI 57%

OneFlow: Concurrent Mixed-Modal and Interleaved Generation with Edit Flows

OneFlow:并发混合模态与交错生成的编辑流

John Nguyen, Marton Havasi, Tariq Berrada, Luke Zettlemoyer, Ricky T. Q. Chen

机构 * FAIR at Meta(Meta 的 FAIR 部门) Univ. Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK, France(格勒诺布尔阿尔卑斯大学、法国国家科学研究中心、法国国家信息与自动化技术研究所、格勒诺布尔理工大学、LJK、法国)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 OneFlow是一种非自回归多模态模型,通过编辑流和流匹配实现并发混合模态生成,优于自回归和扩散方法,提升生成效率和推理能力。

Comments https://oneflow.framer.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08897 2025-12-10 cs.CV 57%

UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation

UniLayDiff: 一种统一的扩散变换器用于内容感知的布局生成

Zeyang Liu, Le Wang, Sanping Zhou, Yuxuan Wu, Xiaolong Sun, Gang Hua, Haoxiang Li

机构 * College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) Amazon.com, Inc.(亚马逊公司) Pixocial Technology(Pixocial技术)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 UniLayDiff通过统一的扩散变换器框架,首次实现了内容感知布局生成任务的端到端统一生成,提升了布局质量和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08534 2025-12-10 cs.CV 57%

PaintFlow: A Unified Framework for Interactive Oil Paintings Editing and Generation

PaintFlow:一种用于交互式油画创作与生成的统一框架

Zhangli Hu, Ye Chen, Jiajun Yao, Bingbing Ni

机构 * Zhangli Hu, Ye Chen, Jiajun Yao, Bingbing Ni(张立虎、陈叶、姚佳君、倪炳炳)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 PaintFlow提出了一种统一框架,通过多模态输入实现交互式油画创作与编辑,利用空间对齐、语义增强和自监督风格迁移技术,提升油画生成与编辑的风格一致性与艺术表现力。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08506 2025-12-10 cs.CV 57%

OCCDiff: Occupancy Diffusion Model for High-Fidelity 3D Building Reconstruction from Noisy Point Clouds

OCCDiff:基于点云的高保真3D建筑重建的占用扩散模型

Jialu Sui, Rui Liu, Hongsheng Zhang

机构 * Department of Geography, Faculty of Social Science, the University of Hong Kong(地理系,社会科学学院,香港大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 OCCDiff通过潜在扩散和函数自动编码器生成高保真3D建筑重建,结合点编码器与多任务训练提升鲁棒性与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19523 2025-12-10 cs.LG cs.AI 57%

Language Models for Controllable DNA Sequence Design

用于可控DNA序列设计的语言模型

Xingyu Su, Xiner Li, Yuchao Lin, Ziqian Xie, Degui Zhi, Shuiwang Ji

机构 * Texas A&M University(德克萨斯大学) University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心(休斯顿))

专题命中 多模态生成 :cross-modal(abstract);分类 cs.AI

AI总结 ATGC-Gen是一种用于可控DNA序列设计的语言模型,通过跨模态编码整合生物信号,提升序列生成的可控性和生物相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07747 2025-12-09 cs.CV 57%

Unison: A Fully Automatic, Task-Universal, and Low-Cost Framework for Unified Understanding and Generation

Unison: 一个完全自动、任务通用且低成本的统一理解和生成框架

Shihao Zhao, Yitong Chen, Zeyinzi Jiang, Bojia Zi, Shaozhe Hao, Yu Liu, Chaojie Mao, Kwan-Yee K. Wong

机构 * The University of Hong Kong(香港大学) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Unison提出一个低成本、全自动的多模态理解和生成框架,通过两阶段方案实现任务自适应,覆盖多种理解和生成任务,提升生成质量与自动化水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01302 2025-12-09 cs.CV 57%

DCText: Scheduled Attention Masking for Visual Text Generation via Divide-and-Conquer Strategy

DCText: 通过分而治之策略实现视觉文本生成的调度注意力遮罩

Jaewoo Song, Jooyoung Choi, Kanghyun Baek, Sangyub Lee, Daemin Park, Sungroh Yoon

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 DCText通过分而治之策略和注意力遮罩技术,实现高效视觉文本生成,提升长文本和多文本处理能力,同时保持图像质量和生成效率。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20415 2025-12-09 cs.CV 57%

MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layouts

魔法城:基于语言的美学自适应城市生成与可控3D资产和布局

Zilong Huang, Jun He, Xiaobin Huang, Ziyi Xiong, Yang Luo, Junyan Ye, Weijia Li, Yiping Chen, Ting Han

机构 * Sun Yat-sen University(中山大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 MajutsuCity通过可控3D资产和布局生成逼真城市,结合语言驱动和美学自适应,实现高保真度和风格多样性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05757 2025-12-09 cs.AI 57%

Hyperbolic Large Language Models

双曲大语言模型

Sarang Patil, Zeyong Zhang, Yiran Huang, Tengfei Ma, Mengjia Xu

机构 * Department of Data Science, New Jersey Institute of Technology(数据科学系,新泽西理工学院) Department of Biomedical Informatics, Stony Brook University(生物医学信息学系,石溪大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出双曲大语言模型,通过双曲几何提升语义表示学习和多尺度推理能力。

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07341 2025-12-09 cs.CV 57%

DCoAR: Deep Concept Injection into Unified Autoregressive Models for Personalized Text-to-Image Generation

DCoAR: 一种深度概念注入到统一自回归模型中用于个性化文本到图像生成

Fangtai Wu, Mushui Liu, Weijie He, Zhao Wang, Yunlong Yu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 DCoAR通过深度概念注入框架实现个性化文本到图像生成,采用LMCL策略和多正则化方案提升生成质量与上下文适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06022 2025-12-09 cs.SD cs.MM 57%

DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation

DreamFoley: 用于高保真视频到音频生成的可扩展视觉-语言模型

Fu Li, Weichao Zhao, You Li, Zhichao Zhou, Dongliang He

机构 * Bytedance Intelligent Creation Lab(字节跳动智能创作实验室) Zhejiang University(浙江大学)

专题命中 多模态生成 :audio-visual(abstract);分类 cs.MM

AI总结 DreamFoley通过结合视觉-语言模型,提出了一种可扩展的视频到音频生成方法,实现了高保真音频生成并优化了训练效率与质量的平衡。

Comments 10 pages; Bytedance

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01627 2025-12-09 cs.CV 57%

JambaTalk: Speech-Driven 3D Talking Head Generation Based on Hybrid Transformer-Mamba Model

JambaTalk: 基于混合Transformer-Mamba模型的语音驱动3D说话人脸生成

Farzaneh Jafari, Stefano Berretti, Anup Basu

机构 * University of Alberta, Multimedia Research Center (MRC)(阿尔伯塔大学多媒体研究中心) University of Florence, Media Integration and Communication Center (MICC)(佛罗伦萨大学媒体整合与通信中心)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 JambaTalk基于混合Transformer-Mamba模型,通过多模态整合实现语音驱动的3D说话人脸生成,实验表明其性能可与当前最先进模型相当。

Comments 23 pages with 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05965 2025-12-08 cs.CV 57%

EditThinker: Unlocking Iterative Reasoning for Any Image Editor

EditThinker: 解锁任何图像编辑器的迭代推理

Hongyu Li, Manyuan Zhang, Dian Zheng, Ziyu Guo, Yimeng Jia, Kaituo Feng, Hao Yu, Yexin Liu, Yan Feng, Peng Pei, Xunliang Cai, Linjiang Huang, Hongsheng Li, Si Liu

机构 * Beihang University(北航大学) Meituan(美团) CUHK MMLab CUHK IMIXR Tsinghua University(清华大学)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 EditThinker通过迭代推理框架提升图像编辑指令遵循能力,利用强化学习优化编辑过程,显著提高模型性能。

Comments Project page: https://appletea233.github.io/think-while-edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06211 2025-12-08 cs.CV 57%

iMotion-LLM: Instruction-Conditioned Trajectory Generation

iMotion-LLM:基于指令的轨迹生成

Abdulwahab Felemban, Nussair Hroub, Jian Ding, Eslam Abdelrahman, Xiaoqian Shen, Abduallah Mohamed, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology (KAUST)(卡塔尔国王阿卜杜勒阿齐兹大学科学与技术学院) Meta Reality Labs(Meta现实实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 iMotion-LLM通过结合预训练LLM与轨迹预测模块,实现基于文本指令的交互式运动生成,提升自动驾驶中的轨迹生成准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04857 2025-12-05 cs.CV 57%

Autoregressive Image Generation Needs Only a Few Lines of Cached Tokens

自回归图像生成只需少量缓存的token

Ziran Qin, Youru Lv, Mingbao Lin, Zeren Zhang, Chanfan Gan, Tieyuan Chen, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Rakuten Peking University(北京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 LineAR通过行级缓存压缩技术,在自回归图像生成中实现内存节省和吞吐量提升,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23002 2025-12-05 cs.CV 57%

JarvisEvo: Towards a Self-Evolving Photo Editing Agent with Synergistic Editor-Evaluator Optimization

JarvisEvo: 向自进化式照片编辑代理迈进:协同编辑器-评估器优化

Yunlong Lin, Linqing Wang, Kunjie Lin, Zixu Lin, Kaixiong Gong, Wenbo Li, Bin Lin, Zhenxi Li, Shiyi Zhang, Yuyang Peng, Wenxun Dai, Xinghao Ding, Chunyu Wang, Qinglin Lu

机构 * Tencent Hunyuan(腾讯文元)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 JarvisEvo通过协同编辑器-评估器优化,实现自进化式照片编辑代理,提升编辑质量和内容保真度。

Comments 31 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04082 2025-12-04 cs.CV 57%

PosterCopilot: Toward Layout Reasoning and Controllable Editing for Professional Graphic Design

PosterCopilot: 向专业图形设计中的布局推理与可控编辑迈进

Jiazhe Wei, Ken Li, Tianyu Lao, Haofan Wang, Liang Wang, Caifeng Shan, Chenyang Si

机构 * PRLab, Nanjing University(南京大学PRLab) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 PosterCopilot通过三阶段训练策略和完整工作流程,实现专业图形设计中布局推理与可控编辑的提升。

Comments Project page: https://postercopilot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14206 2025-12-04 cs.LG cs.AI 57%

Challenges and Limitations of Generative AI in Synthesizing Wearable Sensor Data

生成式AI在合成可穿戴传感器数据中的挑战与局限性

Flavio Di Martino, Franca Delmastro

机构 * Institute for Informatics and Telematics of the Nationa Research Council (IIT-CNR)(意大利国家研究 council 信息与电信研究所)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.AI

AI总结 本文探讨了生成式AI在合成可穿戴传感器数据中的挑战与局限,评估了现有模型在多模态处理、长依赖性和条件生成方面的不足,并提出了未来研究方向以提升生成模型的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03430 2025-12-04 cs.CV 57%

Label-Efficient Hyperspectral Image Classification via Spectral FiLM Modulation of Low-Level Pretrained Diffusion Features

通过低级预训练扩散特征的光谱FiLM调制实现标签高效的超光谱图像分类

Yuzhen Hu, Biplab Banerjee, Saurabh Prasad

机构 * University of Houston, Texas, USA(德克萨斯大学) Indian Institute of Technology Bombay, Mumbai, India(印度班加罗尔理工学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于预训练扩散模型的标签高效超光谱图像分类方法,通过光谱FiLM调制融合空间和光谱信息,提升分类性能。

Comments Accepted to the ICML 2025 TerraBytes Workshop (June 9, 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03335 2025-12-04 cs.CV cs.LG 57%

Step-by-step Layered Design Generation

逐步分层设计生成

Faizan Farooq Khan, K J Joseph, Koustava Goswami, Mohamed Elhoseiny, Balaji Vasan Srinivasan

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出逐步分层设计生成方法,通过分层变化建模设计生成过程,引入新评估套件并验证其有效性。

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03073 2025-12-04 cs.CY cs.AI 57%

Economies of Open Intelligence: Tracing Power & Participation in the Model Ecosystem

开源智能的经济效应:追踪模型生态系统中的权力与参与

Shayne Longpre, Christopher Akiki, Campbell Lund, Atharva Kulkarni, Emily Chen, Irene Solaiman, Avijit Ghosh, Yacine Jernite, Lucie-Aimée Kaffee

机构 * MIT Data Provenance Initiative(MIT数据溯源计划) Data Provenance Initiative(数据溯源计划) ScaDS.AI Leipzig(ScaDS.AI莱比锡) University of Edinburgh(爱丁堡大学) University of Southern California(南加州大学) UNC at Chapel Hill(北卡罗来纳大学教堂山分校) Hugging Face

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 研究分析了开放模型经济中权力和参与的变化,揭示了开发者中介者的作用及市场权力的重新分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02457 2025-12-04 cs.CV 57%

Does Hearing Help Seeing? Investigating Audio-Video Joint Denoising for Video Generation

听觉有助于视觉吗?研究音频视频联合去噪用于视频生成

Jianzong Wu, Hao Lian, Dachao Hao, Ye Tian, Qingyu Shi, Biaolong Chen, Hao Jiang, Yunhai Tong

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出通过音频视频联合去噪提升视频生成质量,验证了跨模态训练对构建更物理基础的世界模型的潜力。

Comments Project page at https://jianzongwu.github.io/projects/does-hearing-help-seeing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02713 2025-12-03 cs.AI 57%

Training Data Attribution for Image Generation using Ontology-Aligned Knowledge Graphs

利用本体对齐的知识图谱训练数据归因于图像生成

Theodoros Aivalis, Iraklis A. Klampanos, Antonis Troumpoukis, Joemon M. Jose

机构 * National Centre for Scientific Research ``Demokritos''(国家科学研究中心「德莫克里特」) University of Glasgow(格拉斯哥大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出利用本体对齐的知识图谱方法,通过多模态大语言模型提取图像中的结构化三元组,以追踪生成模型中训练数据的影响,从而提升透明度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02554 2025-12-03 cs.CV 57%

OmniPerson: Unified Identity-Preserving Pedestrian Generation

OmniPerson: 统一的身份保持行人生成

Changxiao Ma, Chao Yuan, Xincheng Shi, Yuzhuo Ma, Yongfei Zhang, Longkun Zhou, Yujia Zhang, Shangze Li, Yifan Xu

机构 * Beihang University(北航大学) Pengcheng Laboratory(鹏城实验室)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 OmniPerson通过统一身份保持的行人生成管道,解决ReID中数据不足问题,实现高保真生成和身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02492 2025-12-03 cs.CV 57%

YingVideo-MV: Music-Driven Multi-Stage Video Generation

YingVideo-MV: 基于音乐的多阶段视频生成

Jiahui Chen, Weida Wang, Runhua Shi, Huan Yang, Chaofan Ding, Zihao Chen

机构 * AI Lab, GiantNetwork(人工智能实验室)

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV

AI总结 YingVideo-MV通过整合音频语义分析、时间感知扩散模型和摄像机运动控制模块,实现了基于音乐的高质量视频生成。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏