arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 337 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 337 篇

2607.02220 2026-07-03 cs.CV 新提交 83%

DetailAnywhere: Fashion Detail Generation via Cross-Modal Feature Alignment Distillation

DetailAnywhere: 通过跨模态特征对齐蒸馏实现时尚细节生成

Zijun Li, Yimin Zhou, Jia Sun, Honglie Wang, Pengcheng Wei, Junlong Wu, Yongrui Heng, Jiyuan Wang, Huan Ouyang, Boheng Zhang, Huaiqing Wang, Dewen Fan, Qianqian Gan, Fan Yang, Tingting Gao

机构 * Kuaishou Technology(快手科技) AIM for Health Lab, Monash University(Monash大学AIM健康实验室)

专题命中 多模态生成 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 针对在线购物中用户关注服装细节(如领口、袖口、面料纹理)的需求,提出新任务“时尚细节生成”及基准FDBench,并设计跨模态特征对齐蒸馏(CFAD)方法,结合多模态扩散Transformer和一致性奖励模型,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20300 2026-06-25 cs.CV 新提交 83%

CMDS-AD: Cross-Modal Dual-Stream Decoupling for Few-Shot Anomaly Detection

CMDS-AD: 跨模态双流解耦用于少样本异常检测

Junhao Cai, Junyu Chen, Deyu Zeng, Junhao Pang, Qiwei Liang, Xiaopin Zhong, Zongze Wu

机构 * Shenzhen University(深圳大学) Guangzhou Maritime University(广州航海学院) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态生成 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 提出跨模态双流异常检测框架CMDS-AD,通过扩散模型生成多样本并利用低频正常估计辅助解耦高频缺陷,在1-shot设置下MVTec 3D-AD上I-AUROC提升5.7%。

Comments Accepted to ECCV 2026! Project page: https://cmds-ad.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24301 2026-06-24 cs.CV 新提交 83%

MM-TRELLIS: Point-Cloud Guided Multi-Modal 3D Vehicle Generation in Autonomous Driving

MM-TRELLIS: 自动驾驶中基于点云引导的多模态3D车辆生成

Hongli Xiao, Youjian Zhang, Yucai Bai, Chaoyue Wang, Yaohui Jin, Xiaoguang Ren, Wenjing Yang, Long Lan

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室) Academy of Military Science(军事科学院) Bosch innovation software development (Wuxi) Co., Ltd.(博世创新软件开发(无锡)有限公司) College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院) Shopee Pte. Ltd.(Shopee私人有限公司)

专题命中 多模态生成 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出MM-TRELLIS,融合多视图图像与LiDAR点云,通过点云引导和体素过滤策略,实现高质量3D车辆生成,在Waymo数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23643 2026-06-23 cs.AI 新提交 83%

TailorMind: Towards Preference-Aligned Multimodal Content Generation

TailorMind: 面向偏好对齐的多模态内容生成

Hengji Zhou, Ye Liu, Yufeng Liu, Si Wu, Lianghao Xia, Liqiang Nie

机构 * South China University of Technology(华南理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出TailorMind框架,通过超图协同过滤和文本梯度下降建模用户偏好,结合检索增强风格控制和跨模态一致性反射,实现无候选池的个性化多模态内容生成,在TailorBench上优于基线。

Comments 18 pages, 13 figures, 6 tables. Code available at https://github.com/iLearn-Lab/TailorMind

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18123 2026-06-23 cs.CV 新提交 83%

Predicting Immune Biomarkers with MultiModal Mixture-of-Expert Pathology Foundation Models Empowers Precision Oncology

使用多模态混合专家病理基础模型预测免疫生物标志物,赋能精准肿瘤学

Tianyu Liu, Ziqing Wang, Zhaokang Liang, Tong Ding, Peter Humphrey, Lorraine Colón-Cartagena, Emily Ling-Lin Pai, Kenneth Tou En Chang, Mohamed Kahila, Jonathan Chong Kai Liew, Tinglin Huang, Rex Ying, Kaize Ding, Faisal Mahmood, Wengong Jin

机构 * Program of Computational Biology and Bioinforamtics, Yale University(耶鲁大学计算生物学与生物信息学项目) Broad Institute of MIT and Harvard(麻省理工学院与哈佛大学博德研究所) Department of Statistics and Data Science, Northwestern University(西北大学统计与数据科学系) Department of Computer Science, Northeastern University(东北大学计算机科学系) Department of Computer Science, Harvard University(哈佛大学计算机科学系) Department of Pathology, Yale University(耶鲁大学病理学系) Department of Anatomic Pathology and Laboratory Medicine, Hospital of the University of Pennsylvania(宾夕法尼亚大学医院解剖病理学与检验医学系) Department of Pathology and Laboratory Medicine, University of California, San Francisco(加州大学旧金山分校病理学与检验医学系) Department of Pathology and Laboratory Medicine, KK Women’s and Children’s Hospital(竹脚妇幼医院病理学与检验医学系) Department of Biostatistics, Epidemiology and Informatics, Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院生物统计学、流行病学与信息学系)

专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 提出MixTIME多模态基础模型,采用混合专家架构整合不同模态的病理基础模型,从HE全切片图像预测多重免疫荧光蛋白表达,在17个蛋白标记物上达到最优性能,并增强空间域识别、生存预测等下游任务。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16255 2026-06-16 cs.CV 新提交 83%

UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer

UniDDT: 使用解耦扩散变换器统一多模态理解与生成

Shuai Wang, Liang Li, Yang Chen, Ruopeng Gao, Yao Teng, Limin Wang

机构 * Nanjing University(南京大学) ByteDance Seed(字节跳动Seed) University of Hong Kong(香港大学)

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 提出UniDDT模型,通过噪声ViT编码器统一视觉语义表示,并采用解耦扩散解码器分离扩散与文本解码,平衡多模态理解与生成任务,在多个基准上取得优异性能。

Comments This work was completed in \textbf{November 2025}

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17164 2026-08-19 cs.LG 新提交 83%

SCENARIODIFF: A Scenario-level Guidance Framework for Multimodal Time Series Forecasting--Extended Version

SCENARIODIFF:面向多模态时间序列预测的场景级引导框架——扩展版

Tuan-Binh Tran, Dat Nguyen Cong, Duc-Trong Le, Thanh Trung Huynh, Tung Kieu

机构 * VinUniversity FPT Software AI Center, FPT Corporation(FPT软件AI中心,FPT集团) VNU University of Engineering and Technology(VNU工程技术大学) Aalborg University(奥尔堡大学)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 该研究针对现有多模态时间序列预测方法上下文影响难解释控制的问题,提出SCENARIODIFF分层框架,通过三类智能体生成结构化信号引导多模态扩散Transformer,锚点混合采样优化轨迹,在Time-MMD基准的事件驱动领域表现优异。

Comments 10 pages. An extended version of "SCENARIODIFF: A Scenario-level Guidance Framework for Multimodal Time Series Forecasting" accepted at ICDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12876 2026-08-14 cs.CV cs.AI 新提交 82%

SPARED: Reasoning-Based AI-Generated Image Detection via Adversarially Edited Data

SPARED:基于推理的AI生成图像检测方法,采用对抗编辑数据

Yicheng Bao, Xiahui Guo, Xuhong Wang, Xin Tan

专题命中 多模态生成 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出对抗强化学习框架SPARED,通过扩散图像编辑器与推理型MLLM的交替博弈,训练出能抗捷径、泛化能力强的AI生成图像检测器,在三个外部基准上性能单调提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11670 2026-06-11 cs.CV cs.AI 新提交 82%

ARGUS: Stacked Multi-View Identity Mosaic Injection for Subject-Preserving Video Generation

ARGUS: 堆叠多视角身份马赛克注入用于主体保持的视频生成

Zijie Meng, Jiwen Liu, Yufei Liu, Chengzhuo Tong, Xiaoqiang Liu, Yuanxing Zhang, Yulong Xu, Pengfei Wan

机构 * Peking University(北京大学) Kuaishou Technology(快手科技) Xiamen University(厦门大学)

专题命中 多模态生成 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 提出ARGUS框架,通过堆叠多视角身份马赛克注入(SMII)将身份表示为紧凑动态分布,结合MLLM身份导演、无交叉对反事实训练等模块,在主体保持视频生成中达到SOTA。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14710 2026-08-18 cs.CV cs.AI cs.CL 新提交 82%

Path2ST: Hierarchical Cell-Tissue Grounded Cross-Modal Translation for Spatial Transcriptomics

Path2ST:面向空间转录组学的基于细胞-组织层级的跨模态转换方法

Ruochen Liu, Wei Lou

机构 * University of Liverpool(利物浦大学) Zhejiang Normal University(浙江师范大学)

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Path2ST是一种基于细胞-组织层级的跨模态转换框架,通过融合层级条件机制、尺度自适应生成与全谱损失函数,实现从H&E图像精准预测空间转录组,在三个数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13679 2026-08-17 cs.GR 新提交 82%

Strand-based Hairstyle Generation via Large Reconstruction and Multimodal Models

基于 strand 的发型生成:结合大型重建模型与多模态模型

Conghui Hao, Tao Huang, Yuefan Shen, Tongtong Wang, Zhongtian Zheng, Kui Wu

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 该研究提出一种结合 LRMs、LMMs 与经典几何处理的自动流程,可从单视图图像快速生成高质量、适配生产的各类基于 strand 的发型,适用于现代数字人工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08497 2026-07-10 cs.CV cs.AI cs.CL cs.LG 新提交 82%

Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing

用于多模态理解、生成和编辑的认知结构多模态智能体

Feng Wang, Canmiao Fu, Zhipeng Huang, Chen Li, Jing Lyu, Ge Li

机构 * Peking University(北京大学) Tencent Inc(腾讯公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对统一多模态模型在长时多模态对话中的局限,提出认知结构多模态智能体,通过外化视觉信息等方式改进。开发统一场景引擎,构建评估基准。实验显示该智能体检索准确率高、推理时间减半,还介绍了工具包,为长时多模态智能体提供新范式。

Comments 16 pages, 7 figures, 8 tables. Project page: https://caseclose.github.io/cma-harness/ Code: https://github.com/caseclose/cma-harness

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31093 2026-07-01 cs.DC 新提交 82%

Omni-Flow: A Unified Workflow Orchestration and Distributed KV Cache Sharing Framework for Multimodal Inference

Omni-Flow:面向多模态推理的统一工作流编排与分布式KV缓存共享框架

Bin Xiao, Jingfu Dong, Changran Wang, Yitian Chen, Xiaoyu Zhao, Yuqi Peng, Jianping Lin, Yuchen Xie

专题命中 多模态生成 :multimodal(title,abstract);omni-modal(abstract)

AI总结 提出Omni-Flow框架,通过三层抽象(控制流、数据流、计算流)统一编排多模态推理工作流,实现异构单元协同、分布式KV缓存共享与高效传输,支持多种多模态场景。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19534 2026-06-19 cs.CV cs.AI cs.CL 新提交 82%

PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models

PerceptionDLM:基于多模态扩散语言模型的并行区域感知

Yueyi Sun, Yuhao Wang, Jason Li, Ye Tian, Tao Zhang, Jacky Mai, Yihan Wang, Haochen Wang, Jinbin Bai, Ling Yang, Yunhai Tong

机构 * Peking University(北京大学) MSALab ByteDance(字节跳动)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出PerceptionDLM,利用扩散语言模型的并行解码特性,通过高效提示和结构化注意力掩码实现多区域并行感知,显著提升推理效率,并构建ParaDLC-Bench基准进行评估。

Comments Code available at https://github.com/MSALab-PKU/PerceptionDLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10340 2026-06-10 cs.RO 新提交 82%

OMG: Omni-Modal Motion Generation for Generalist Humanoid Control

OMG: 面向通用人形机器人的全模态运动生成

Siqiao Huang, Kun-Ying Lee, Dongming Qiao, Guanqi He, Zhenyu Wang, Yitang Li, Shaoting Zhu, Hang Zhao

机构 * Tsinghua University(清华大学)

专题命中 多模态生成 :omni-modal(title,abstract);multi-modal(abstract)

AI总结 提出OMG框架,通过精心策划的数据流程和扩散模型,实现基于语言、音频和参考动作的全模态全身控制,展示了最先进的性能和可扩展性。

Comments Project Page: https://tsinghua-mars-lab.github.io/OMG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24157 2026-07-28 cs.CV 新提交 81%

UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling

UniGen-AR:通过自回归建模统一视觉生成

Zhipeng Bao, Zhen Zhu, Nupur Kumari, Anurag Bagchi, Yu-Xiong Wang, Pavel Tokmakov, Martial Hebert

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳 - 香槟分校) Toyota Research Institute(丰田研究院)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 研究统一视觉生成问题,提出UniGen-AR框架,将通用多模态语言模型与视觉自回归解码器配对,能为多任务生成图像值输出,相比基于扩散的基线,推理延迟低达19倍,确立视觉自回归建模为统一视觉生成的高效主干。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01050 2026-07-07 cs.CV 新提交 81%

GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process Supervision

GeoSearcher: 基于锚点引导的渐进推理遥感视觉定位与过程监督

Dianyu Wang, Peirong Zhang, Xuyang Li, Xiaoxuan Liu, Lei Wang

机构 * Key Laboratory of Target Cognition and Application Technology (TCAT), Chinese Academy of Sciences(中国科学院目标认知与应用技术重点实验室) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出GeoSearcher,通过锚点引导的渐进推理和过程监督,将遥感视觉定位转化为两阶段过程,解决小目标定位和复杂查询的挑战。

Comments 14 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18937 2026-08-20 cs.CL cs.AI 新提交 81%

MedUAG: Unified Understanding and Generation for Medical Multimodal Models

MedUAG:面向医学多模态模型的统一理解与生成框架

Zijie Meng, Yuncheng Zhang, Hualiang Wang, Yitian Tang, Xiaotang Gai, Chen Shen, Songtao Jiang, Shaosheng Cao, Jian Wu, Xian Wu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Tencent Jarvis Lab(腾讯Jarvis实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对医学多模态领域缺乏统一理解生成框架的问题,本文构建了MedUAGCorpus数据集与MedUAGBench基准,开发了MedUAG模型,其在医学理解与生成任务中表现出色,为下一代医学多模态系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17564 2026-08-19 cs.CV cs.AI 新提交 81%

Where a New Concept Must Enter: Entry Point Gates Cross-Task Usability in Unified Multimodal Models

新概念必须进入之处:统一多模态模型中的入口门跨任务可用性

Zongyang Qiu, Yihan Wu, Kaixuan Fan, Bo Li, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Columbia University(哥伦比亚大学) CUHK(香港中文大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究通过分离统一多模态模型的理解与生成任务方向,发现跨任务可用性取决于概念绑定的入口层,提出的对齐目标可在极低损失下实现概念跨任务迁移。

Comments 27 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14138 2026-08-17 cs.CV cs.AI 新提交 81%

SPARGen: Unifying Spatial Perception and Reasoning through Native Multimodal Generation

SPARGen:通过原生多模态生成统一空间感知与推理

Jinsheng Quan, Jianhua Li, Siyi Xie, Xuanke Shi, Kewang Deng, Zukai Chen, Feifei Shao, Lei Yang, Quan Wang, Yawei Luo

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 SPARGen是统一多模态框架,将3D重建等空间任务转为指令条件生成任务,在单一框架内实现异构空间任务的竞争力性能,突破现有方法的知识迁移限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10291 2026-08-12 cs.CV cs.AI cs.LG 新提交 81%

MRIComp4Flow: Compression of 3D Brain MRI for Training Multi-Modal Generative Models

MRIComp4Flow:用于训练多模态生成模型的三维脑部MRI压缩

Lisa K. Fischer, Mykhailo Riabets, Daniel Rueckert, Benedikt Wiestler, Anke Meyer-Baese, Sandeep Nagar

机构 * Technical University of Munich (TUM)(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Imperial College London(帝国理工学院) Florida State University(佛罗里达州立大学) Institute for Advanced Study, TUM (TUM-IAS)(慕尼黑工业大学高等研究院) TUM University Hospital(慕尼黑工业大学医院)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究针对大规模多模态MRI的存储与I/O问题,采用JPEG2000或JPEG-LS压缩三维脑肿瘤MRI,在20:1压缩率下训练Wavelet Flow Matching模型,证实其合成质量与未压缩数据训练的模型相当,为可扩展三维MRI生成建模提供了实用方案。

Comments Accepted: MICCAI 2026 SASHIMI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06770 2026-08-10 cs.AI cs.CV 新提交 81%

Surg-UniWorld: A Unified Surgical World Model with Multimodal Control Experts

Surg-UniWorld:具有多模态控制专家的统一外科世界模型

Rulin Zhou, Wanhao Liu, Guoheng Ma, Liangjin Shao, Qiujie Song, Yidu Wang, Guankun Wang, Tong Chen, Long Bai, Luping Zhou, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院) the University of Sydney(悉尼大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出Surg-UniWorld统一外科世界模型,构建Chlec80-SurgWAM基准,经实验证实其在可控外科视频生成相关指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04655 2026-08-06 cs.CV cs.AI 新提交 81%

CSGen: A Multi-Domain Curvilinear Structure Generation Model via Hierarchical Multimodal Diffusion

CSGen:一种基于分层多模态扩散的多领域曲线结构生成模型

Zhe Shan, Ziming Yang, Lei Zhou, Wenwen Zhang, Cong Lin, Xia Xie

机构 * Hainan University(海南大学) Guangdong Ocean University(广东海洋大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究针对可控曲线结构图像生成的挑战,提出CSGen模型,通过构建多领域数据集、分层渐进控制策略与稀疏感知损失机制,提升生成图像的结构精度与下游分割性能,为曲线结构分析提供新范式。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21343 2026-07-24 cs.LG cs.AI cs.CV 新提交 81%

M$^3$-Gen: Interpretable Multimodal Generation of Gene Expression Profiles Using Clinical and Imaging Data

M$^3$-Gen:利用临床和影像数据对基因表达谱进行可解释的多模态生成

Francesca Pia Panaccione, Carlo Sgaravatti, Marco Venere

机构 * DEIB - Dipartimento Elettronica, Informazione e Bioingegneria, Politecnico di Milano(米兰理工大学电子、信息与生物工程系)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究旨在解决基因表达数据获取受限问题,提出M$^3$-Gen框架,通过对比学习从临床变量和图像中学习潜在表示,以生成生物学连贯的基因表达谱,在TCGA数据集上验证有效性,且具有内在可解释性。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19344 2026-07-22 cs.CV cs.AI cs.GR 新提交 81%

Appearance Pointers -- Multimodal Region Control of Diffusion Transformers

外观指针——扩散变压器的多模态区域控制

Rahul Sajnani, Yulia Gryaditskaya, Radomír Měch, Srinath Sridhar, Matheus Gadelha

机构 * Brown University(布朗大学) Adobe Research(Adobe 研究院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对可控图像生成难题,提出外观指针方法,通过区域对应网络和空间聚合机制生成并细化指针,为扩散变压器引入模态无关的局部多模态控制接口,单一模型性能达或超现有技术。

Comments 38 Pages, Preprint with supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11919 2026-07-15 cs.NE cs.AI cs.CV cs.LG 新提交 81%

Do You Remember? Toward Memory-Centric Multimodal AI

你还记得吗?迈向以记忆为中心的多模态人工智能

Xuguang Yu, Weigang Zheng, Minyue Yu

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对当前多模态语言模型缺乏重建性记忆的问题,提出DoYouRemember三阶段架构,通过VQ-VAE、LoRA微调语言模型和扩散解码器实现,经实验发现语言模型隐藏状态视觉信息少,还解决了共享记忆矩阵训练问题,统一相关发现于信息论框架。

Comments 43 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11364 2026-07-14 cs.LG cs.AI cs.MM 新提交 81%

BackgroundMellow: A Multi-Modal Cohesive Framework for Narrative-Driven Rich Cinematic Soundscape Generation

BackgroundMellow:一种用于叙事驱动的丰富电影音效生成的多模态凝聚框架

Ajitesh Jamulkar, Aritra Hazra

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡拉格布尔分校)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI、cs.MM

AI总结 多模态AI中为文本叙事生成电影音效困难,BackgroundMellow框架将其视为编排与信号处理问题,通过主 - 专家架构、Tango2模型、背景音乐检索器及NLP模块实现,经实验验证在时间同步等方面有效。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07027 2026-07-09 cs.LG cs.AI cs.CV 新提交 81%

Latent graph encoding of multimodal neuroimaging features with generative AI architectures

基于生成式人工智能架构的多模态神经影像特征的潜在图编码

Ishaan Batta, Meenu Ajith, Vince Calhoun

机构 * Center for Translational Research in Neuroimaging and Data Science (TReNDS)(转化神经影像与数据科学研究中心)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究旨在设计多模态生成框架用于神经影像特征分析,通过评估多种策略和模型,利用GMV和sFNC特征分析多个生成框架,提出的gMMVAE在多指标上超替代变体,有潜力用于稳健的多模态神经影像分析。

Comments 6 pages, accepted in IEEE International Conference on Image Processing (ICIP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04423 2026-07-08 cs.CV cs.AI 新提交 81%

Transferability Between Understanding and Generation in Unified Multimodal Models

统一多模态模型中理解与生成之间的可迁移性

Jiwon Kang, Heeji Yoon, Jaewoo Jung, Jaewon Min, Minkyeong Jeon, Biyeon Hwang, Sangwon Jung, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Blynx(布林克斯公司) Trillionlabs(万亿实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究统一多模态模型中理解与生成任务间的可迁移性,通过实验发现其依赖架构,据此提出实用训练策略,训练对应理解任务迁移至生成可提升性能并减少分布偏移。

Comments Accepted at ECCV 2026. Project Page: https://cvlab-kaist.github.io/UMM_Transferability/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13368 2026-07-01 cs.AI cs.CV 新提交 81%

IterCAD: An Iterative Multimodal Agent for Visually-Grounded CAD Generation and Editing

IterCAD:一种用于视觉引导的CAD生成与编辑的迭代多模态智能体

Tao Hu, Jiaxin Ai, Licheng Wen, Xueheng Li, Shu Zou, Siqi Li, Nianchen Deng, Xinyu Cai, Hongbin Zhou, Pinlong Cai, Daocheng Fu, Yu Yang, Hairong Zhang, Botian Shi, Xuemeng Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出IterCAD,一种闭环交互式CAD生成与编辑的多模态智能体框架,通过渐进式SFT和几何感知强化学习优化,在代码可执行性和几何精度上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏