arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-01 至 2025-12-01 共收录 20 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 20 篇

2511.22943 2025-12-01 cs.CL cs.CV 84%

Visual Puns from Idioms: An Iterative LLM-T2IM-MLLM Framework

基于成语的视觉双关:一个迭代的LLM-T2IM-MLLM框架

Kelaiti Xiao, Liang Yang, Dongyu Zhang, Paerhati Tulajiang, Hongfei Lin

机构 * Dalian University of Technology(大连理工大学) Xinjiang Normal University(新疆师范大学)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出一个迭代框架,结合LLM、T2IM和MLLM,实现基于成语的视觉双关的自动生成与评估,实验表明MLLM选择对性能影响最大。

Comments Submitted to ICASSP 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21698 2025-12-01 cs.MM cs.AI 84%

TIP and Polish: Text-Image-Prototype Guided Multi-Modal Generation via Commonality-Discrepancy Modeling and Refinement

TIP和Polish:通过共同性-差异性建模与细化的文本-图像-原型引导的多模态生成

Zhiyong Ma, Jiahao Chen, Qingyuan Chuai, Zhengping Li

专题命中 多模态生成 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 TIPPo通过共同性-差异性建模与细化,提升多模态生成的主题一致性和风格一致性。

Comments Submitted to ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07565 2025-12-01 cs.CV 83%

OpenDance: Multimodal Controllable 3D Dance Generation with Large-scale Internet Data

OpenDance: 基于大规模互联网数据的多模态可控3D舞蹈生成

Jinlu Zhang, Zixi Kang, Libin Liu, Jianlong Chang, Qi Tian, Feng Gao, Yizhou Wang

机构 * Peking University(北京大学) Huawei Cloud(华为云)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 OpenDance通过构建大规模舞蹈数据集和提出统一的可控生成框架,实现了多模态的3D舞蹈生成,支持音乐、文本、关键点和轨迹等多种条件控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23321 2025-12-01 cs.SE 82%

Chart2Code-MoLA: Efficient Multi-Modal Code Generation via Adaptive Expert Routing

Chart2Code-MoLA: 通过自适应专家路由实现高效的多模态代码生成

Yifei Wang, Jacky Keung, Zhenyu Mao, Jingyu Zhang, Yuchen Cao

专题命中 多模态生成 :multi-modal(title,abstract);multimodal(abstract)

AI总结 Chart2Code-MoLA通过自适应专家路由实现高效多模态代码生成,提升生成准确性、降低内存消耗并加速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23386 2025-12-01 cs.CV 79%

VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction

VQRAE:用于多模态理解、生成和重建的表示量化自编码器

Sinan Du, Jiahao Guo, Bo Li, Shuhao Cui, Zhengzhuo Xu, Yifu Luo, Yongxian Wei, Kun Gai, Xinggang Wang, Kai Wu, Chun Yuan

机构 * Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Kolors Team, Kuaishou Technology(快手科技Kolors团队)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 VQRAE通过统一的分词器生成连续语义特征和离散标记,提升多模态理解、生成和重建的性能。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12770 2025-12-01 cs.LG cs.CE 78%

MolEdit: Knowledge Editing for Multimodal Molecule Language Models

MolEdit: 多模态分子语言模型的知识编辑

Zhenyu Lei, Patrick Soga, Yaochen Zhu, Yinhan He, Yushun Dong, Jundong Li

机构 * University of Virginia(弗吉尼亚大学) Florida State University(佛罗里达州立大学)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 MolEdit通过多专家知识适配器和专家意识编辑切换器,提升多模态分子语言模型的编辑可靠性与局部性,实现分子与描述词的高效互转。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22805 2025-12-01 cs.CV cs.LG cs.MM 74%

From Pixels to Feelings: Aligning MLLMs with Human Cognitive Perception of Images

从像素到感受:将MLLMs对齐于人类对图像的认知感知

Yiming Chen, Junlin Han, Tianyi Bai, Shengbang Tong, Filippos Kokkinos, Philip Torr

机构 * Oxford University(牛津大学) HKUST(香港科技大学) University College London(伦敦大学学院) New York University(纽约大学)

专题命中 多模态生成 :MLLM(abstract,comments);multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出CogIP-Bench基准,通过后训练提升MLLMs对图像认知属性的对齐能力,并展示其在图像生成中的应用。

Comments Project page with codes/datasets/models: https://follen-cry.github.io/MLLM-Cognition-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23469 2025-12-01 cs.CV 70%

Visual Generation Tuning

视觉生成微调

Jiahao Guo, Sinan Du, Jingfeng Yao, Wenyu Liu, Bo Li, Haoxiang Cao, Kun Gai, Chun Yuan, Kai Wu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) School of Artificial Intelligence, South China Normal University(华南师范大学人工智能学院) Kolors Team, Kuaishou Technology(快手科技Kolors团队)

专题命中 多模态生成 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本文提出VGT,通过视觉生成微调提升视觉语言模型的视觉生成能力,在图像重建和生成任务中均取得优异成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22896 2025-12-01 cs.CV 70%

DM$^3$T: Harmonizing Modalities via Diffusion for Multi-Object Tracking

DM$^3$T: 通过扩散和谐多模态以实现多目标跟踪

Weiran Li, Yeqiang Liu, Yijie Wei, Mina Han, Qiannan Guo, Zhenbo Li

机构 * China Agricultural University(中国农业大学) Beijing Normal University(北京师范大学)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 DM$^3$T通过扩散模型实现多模态特征对齐,提升多目标跟踪的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21579 2025-12-01 cs.CV 70%

Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy

Harmony: 通过跨任务协同实现音频和视频生成

Teng Hu, Zhentao Yu, Guozhen Zhang, Zihan Su, Zhengguang Zhou, Youliang Zhang, Yuan Zhou, Qinglin Lu, Ran Yi

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan Project(腾讯文心项目)

专题命中 多模态生成 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 Harmony通过跨任务协同机制和同步增强CFG,实现高效音频视频同步生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22982 2025-12-01 cs.CV cs.AI 62%

Ovis-Image Technical Report

Ovis-Image 技术报告

Guo-Hua Wang, Liangfu Cao, Tianyu Cui, Minghao Fu, Xiaohao Chen, Pengxin Zhan, Jianshan Zhao, Lan Li, Bowen Fu, Jiaqi Liu, Qing-Guo Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Ovis-Image 是一个70亿参数的文本到图像模型,通过优化的多模态主干和文本聚焦训练方法,在紧凑架构下实现与大型开源模型相当的文本渲染性能。

Comments Code is released at https://github.com/AIDC-AI/Ovis-Image

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04182 2025-12-01 cs.CL cs.AI 62%

COPO: Causal-Oriented Policy Optimization for Hallucinations of MLLMs

COPO:面向MLLM幻觉的因果导向策略优化

Peizheng Guo, Jingyao Wang, Wenwen Qiang, Jiahuan Zhou, Changwen Zheng, Gang Hua

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) Amazon.com, Inc.(亚马逊公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 COPO通过引入因果完整性奖励和GRPO框架,解决多模态大语言模型的幻觉问题,通过令牌级因果约束确保输出的正确性和证据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23377 2025-12-01 cs.CV 57%

DEAL-300K: Diffusion-based Editing Area Localization with a 300K-Scale Dataset and Frequency-Prompted Baseline

DEAL-300K:基于扩散的编辑区域定位与30万规模数据集及频率提示基线

Rui Zhang, Hongxia Wang, Hangqing Liu, Yang Zhou, Qiang Zeng

机构 * School of Cyber Science and Engineering, Sichuan University(四川大学计算机科学与工程学院) Key Laboratory of Data Protection and Intelligent Management, Ministry of Education, Sichuan University(教育部数据保护与智能管理重点实验室)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 DEAL-300K通过多模态大语言模型生成编辑指令,结合频率提示微调方法,实现了基于扩散的图像编辑区域定位,提供高精度的基线和研究基础。

Comments 13pages,12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22863 2025-12-01 cs.CV 57%

CoordSpeaker: Exploiting Gesture Captioning for Coordinated Caption-Empowered Co-Speech Gesture Generation

CoordSpeaker: 利用手势描述生成协调的 caption-驱动的语音同步手势生成

Fengyi Fang, Sicheng Yang, Wenming Yang

机构 * Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 CoordSpeaker通过引入手势描述框架和条件潜在扩散模型,实现了协调的caption驱动的语音同步手势生成,解决了手势生成中的语义先验间隙和多模态控制难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22773 2025-12-01 cs.RO cs.AI 57%

CAPE: Context-Aware Diffusion Policy Via Proximal Mode Expansion for Collision Avoidance

CAPE:通过近端模式扩展实现上下文感知的扩散策略用于避障

Rui Heng Yang, Xuan Zhao, Leo Maxime Brunswic, Montgomery Alban, Mateo Clemente, Tongtong Cao, Jun Jin, Amir Rasouli

机构 * Huawei Technologies Canada(华为加拿大技术有限公司) Huawei(华为) Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 CAPE通过近端模式扩展实现上下文感知的扩散策略,提升避障任务中轨迹生成的泛化能力与碰撞规避性能。

Comments 4 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23240 2025-12-01 cs.CV 57%

Autoregressive Styled Text Image Generation, but Make it Reliable

自回归风格文本图像生成,但使其更可靠

Carmine Zaccagnino, Fabio Quattrini, Vittorio Pippi, Silvia Cascianelli, Alessio Tonioni, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) Google(谷歌)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Eruku方法,通过多模态提示条件生成任务和分类器自由引导策略,改进自回归模型以生成更可靠、更忠实于文本提示的风格化文本图像。

Comments Accepted at WACV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00802 2025-12-01 cs.CV 57%

TRACE: Temporally Reliable Anatomically-Conditioned 3D CT Generation with Enhanced Efficiency

TRACE: 基于时间可靠性的解剖条件3D CT生成与增强效率

Minye Shao, Xingyu Miao, Haoran Duan, Zeyu Wang, Jingkun Chen, Yawen Huang, Xian Wu, Jingjing Deng, Yang Long, Yefeng Zheng

机构 * Department of Computer Science, Durham University(杜伦大学计算机科学系) Department of Automation, Tsinghua University(清华大学自动化系) College of Computer Science and Engineering, Dalian Minzu University(大连民族大学计算机科学与工程学院) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Jarvis Research Center, Tencent YouTu Lab(腾讯YouTu实验室 Jarvis 研究中心) School of Engineering Mathematics and Technology, University of Bristol(布里斯托大学工程数学与技术学院) Medical Artificial Intelligence Laboratory, School of Engineering, Westlake University(西湖大学工程学院医学人工智能实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 TRACE通过2D多模态条件扩散方法生成具有时空对齐的3D CT图像,提升生成效率和解剖保真度。

Comments Accepted to MICCAI 2025 (this version is not peer-reviewed; it is the extended version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21780 2025-12-01 cs.MM cs.SD 57%

3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation

3MDiT:用于文本驱动同步音频视频生成的统一三模态扩散变换器

Yaoru Li, Heyu Si, Federico Landi, Pilar Oplustil Gallegos, Ioannis Koutsoumpas, O. Ricardo Cortez Vazquez, Ruiju Fu, Qi Guo, Xin Jin, Shunyu Liu, Mingli Song

机构 * Zhejiang University(浙江大学) Huawei(华为) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.MM

AI总结 3MDiT提出了一种统一三模态扩散变换器,通过联合演变流实现文本驱动的同步音频视频生成,提升多模态对齐与同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21746 2025-12-01 cs.CL 57%

DELTA: Language Diffusion-based EEG-to-Text Architecture

DELTA: 基于语言扩散的EEG到文本架构

Mingyu Jeon, Hyobin Kim

机构 * Sungkyunkwan University(成均馆大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 DELTA通过结合残差向量量化和语言扩散模型,提升了EEG到文本的语义对齐和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02058 2025-12-01 q-bio.BM cs.LG 50%

RiboGen: RNA Sequence and Structure Co-Generation with Equivariant MultiFlow

RiboGen:基于等变多流的RNA序列和结构联合生成

Dana Rubin, Allan dos Santos Costa, Manvitha Ponnapati, Joseph Jacobson

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) MIT Media Lab(麻省理工学院媒体实验室) Molecular Machines(分子机器) Center for Bits and Atoms(比特与原子中心)

专题命中 多模态生成 :multimodal(abstract)

AI总结 RiboGen通过等变多流方法实现RNA序列和结构的联合生成,为RNA设计提供了新的深度学习解决方案。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏