Training on Synthetic Data Beats Real Data in Multimodal Relation Extraction
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS
Proteo-R1:用于从头蛋白质设计的推理基础模型
专题命中 多模态生成 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.AI
AI总结 针对现有从头蛋白质设计模型缺乏推理能力的问题,本文提出 Proteo-R1 双专家架构框架,通过 MLLM 识别关键功能残基作为硬约束,结合扩散模型实现稳定可解释的蛋白质设计。
Journal ref ICML 2026
CoT-Edit:让思维链(CoT)指导指令视频编辑
机构 * University of Science and Technology of China(中国科学技术大学) ; Zhongguancun Academy(中关村学院) ; Tsinghua University(清华大学)
专题命中 多模态生成 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV
AI总结 本文提出CoT-Edit的plan--guide--edit框架,以CoT增强的MLLM为规划器生成空间先验,结合扩散编辑器实现高保真指令视频编辑,性能优于多个基准方法
超人:统一骨骼与视觉用于人体运动感知与生成
机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(通用人工智能国家重点实验室,北京大学深圳研究生院) ; Sony R&D Center(索尼研发中心) ; Nanyang Technological University(南洋理工大学)
专题命中 多模态生成 :MLLM(summary_cn,abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对人体运动分析范式碎片化问题,提出Superman统一框架,通过视觉引导运动分词器创建跨模态运动词汇,训练单一MLLM架构处理多任务,实验表明该方法在运动任务中性能领先或具竞争力,为运动分析提供高效可扩展路径。
在模态缺失情况下通过知识蒸馏从噪声多模态教师中实现鲁棒的人体感知:Purify-then-Align
机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) ; Institute of Computer Science, Universität Bern(伯尔尼大学计算机科学研究所) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV;any-to-any(comments)
AI总结 本文提出PTA框架,通过元学习和知识扩散解决多模态人体感知中模态缺失问题,通过净化知识源和对齐模态提升单模态模型鲁棒性。
Comments Accepted by CVPR 2026 Workshop On Any-to-Any Multimodal Learning
专题命中 多模态生成 :multimodal(title);multimodal foundation model(title);分类 cs.CV
专题命中 多模态生成 :multimodal(title);multimodal foundation model(title);分类 cs.CV
Comments Accepted for presentation at IROS2024
多模态生成模糊系统:模糊推理引导的大模型交互式问答框架
专题命中 多模态生成 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对多模态问答的模态偏差、知识不确定性与推理深度不足问题,提出多模态生成模糊系统(MMGFS),通过多模态协同沉思机制与模糊规则多跳推理实现性能提升,在多数据集上优于现有方法。
Comments 13 pages, 8 figures
一次关注一个令牌的多模态生成
机构 * CVIT, IIIT Hyderabad(海得拉巴国际信息技术研究所计算机视觉与信息处理中心)
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 研究多模态大语言模型生成时令牌级动态,按语义角色跟踪注意力转移。引入多模态任务,通过因果注意力阻断干预等方法,发现一致模式并据此提出测试时干预,提升多模态任务性能。
重建对齐改进统一多模态模型
机构 * UC Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; Duke University(杜克大学)
专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 提出重建对齐(RECA),一种资源高效的后训练方法,利用视觉理解编码器嵌入作为密集文本提示,通过自监督重建损失对齐理解与生成,显著提升多种统一多模态模型的生成和编辑性能。
Comments 43 pages, 36 figures and 14 tables; accepted by ICLR 2026
ASRU:激活引导与强化遗忘融合用于多模态大语言模型
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI
AI总结 ASRU提出一种可控多模态遗忘框架,通过激活引导和强化学习提升多模态大语言模型的遗忘效果和生成质量,实验显示在Qwen3-VL上遗忘效果提升24.6%,生成质量提升5.8倍。
Archon:面向整体数字人生成的统一多模态模型
机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) ; Google(谷歌) ; Google DeepMind(谷歌DeepMind)
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出Archon,一个完全预训练的以人为中心的统一多模态模型,通过模态特定分词器、语义视频重参数化和“模态思维”策略,实现文本、音频、动作和视觉等七种模态的整体数字人生成。
Comments Accepted to CVPR 2026. Project Page: https://zju3dv.github.io/archon/
二阶多级方差校正用于多模态模型中的模态竞争
机构 * University of Oxford, Oxford, United Kingdom(牛津大学,英国)
专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出ML-FOP-SOAP框架,通过多级方差校正提升多模态对齐稳定性,实验显示在Janus和Emu3数据集上,该方法提高了样本效率和训练速度,适用于大规模多模态基础模型。
MPerS: 动态多模态大语言模型混合专家感知引导的遥感场景分割
机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) ; Southwest Jiaotong University(西南交通大学)
专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出MPerS方法,通过设计多提示生成高质量遥感描述,结合DINOv3提取视觉特征,利用动态混合专家模块和语言查询引导注意力实现精准分割。
Comments Accepted to CVPR 2026 Findings. 11 pages, 6 figures
超越跨模态对齐:测量和利用模态差距在视觉-语言模型中
机构 * King’s College London(伦敦国王学院) ; University of Surrey(萨里大学) ; University of Oxford(牛津大学) ; MIT CSAIL(麻省理工学院CSAIL实验室) ; The Alan Turing Institute(阿兰·图灵研究院)
专题命中 多模态生成 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出通过测量和利用模态差距改进视觉-语言模型的下游任务,引入模态主导分数和自动可解释性度量,实现轻量级编辑和系统分析。
Comments accepted by ACL26-findings
Deep-Reporter:基于多模态长形式生成的深度研究
机构 * National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; University of Edinburgh(爱丁堡大学) ; Beijing Institute of Technology(北京理工大学)
专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Deep-Reporter框架,通过多模态搜索、检查清单引导合成和上下文管理,解决多模态长形式生成中的整合与选择难题,通过8K高质量数据集和M2LongBench测试集验证其有效性。
Comments 41 pages, 6 figures, 8 tables. Code available at https://github.com/fangda-ye/Deep-Report. v2: corrected typos and updated experimental results
思维中的推理:潜在空间中的动态多模态交错
机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) ; Stanford University(斯坦福大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL
AI总结 本文提出DMLR框架,通过动态潜在策略梯度优化和视觉注入策略,在潜在空间中实现视觉与文本的动态交错推理,提升多模态推理性能并保持高效推理。
Draw-In-Mind: 在统一多模态模型中重新平衡设计师-画家角色有助于图像编辑
机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab) ; TikTok
专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 本文提出Draw-In-Mind模型,通过重新分配设计职责提升图像编辑性能,展示了在统一多模态模型中平衡理解与生成模块的重要性。
Comments ICLR 2026 Camera Ready Version; Add more discussions and fix typos
多模态病理生成模型基础框架
机构 * Department of Radiation Oncology, Stanford University School of Medicine(斯坦福大学医学院放射肿瘤学系) ; Department of Psychiatry and Behavioral Sciences, Stanford University School of Medicine(斯坦福大学医学院精神病学与行为科学系) ; Department of Statistics and Data Science, Yale University(耶鲁大学统计与数据科学系) ; Department of Computer Science, Stanford University(斯坦福大学计算机科学系) ; Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系) ; Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) ; Department of Radiology, Stanford University(斯坦福大学放射学系) ; Center for Artificial Intelligence in Medicine and Imaging, Stanford University(斯坦福大学医学与影像人工智能中心)
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出MuPD模型,通过扩散变压器整合病理图像、分子数据和临床文本,实现跨模态生成任务,提升诊断准确性和数据扩展性。
Comments 33 pages, 9 figures
将多模态大语言模型知识整合到无模态补全中
机构 * KAIST(韩国科学技术院) ; AITRICS
专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 本文提出AmodalCG框架,利用多模态大语言模型知识指导无模态补全,通过评估遮挡程度选择性调用MLLM指导,结合视觉生成模型迭代优化补全结果,实验表明优于现有方法。
关系图驱动的微分去噪和扩散注意力融合用于多模态对话情感识别
机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(中南林业科技大学计算机与数学学院) ; Department of Computer Science, State University of New York, New Paltz(纽约州立大学新帕尔茨分校计算机科学系)
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、eess.AS
AI总结 本文提出关系感知去噪和扩散注意力融合模型,通过微分Transformer去噪、构建模态关系子图和文本引导跨模态扩散机制,提升多模态对话情感识别性能。
Comments 19 pages
Journal ref neurocomputing2026
扩散引导的语义一致性用于多模态异质性
机构 * The University of British Columbia(不列颠哥伦比亚大学) ; Fudan University(复旦大学) ; Duke Kunshan University(杜克昆山大学) ; East China Normal University(华东师范大学) ; University of California, Davis(加州大学戴维斯分校) ; China University of Mining and Technology(中国矿业大学) ; SMBU ; Shenzhen University(深圳大学)
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出SemanticFL框架,利用预训练扩散模型的语义表示,通过跨模态对比学习提升联邦学习在多模态异质数据中的鲁棒性,实验表明其在CIFAR-10等数据集上准确率提升达5.49%。
Comments Accepted by IEEE ICME 2026
MSRAMIE:多模态结构推理代理用于多指令图像编辑
机构 * University Of Melbourne(墨尔本大学)
专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 MSRAMIE基于多模态大语言模型构建无需训练的代理框架,通过结构化多模态推理处理多指令图像编辑任务,提升复杂指令遵循度和完成概率,同时保持图像质量和一致性。
Comments 14 pages, 6 figures, 3 tables, appendix and references provided
从几何模仿到综合生成:一种基于上下文的多模态扩散模型用于城市形态合成
机构 * Zhejiang Agriculture and Forestry University(浙江农业与林业大学) ; Alibaba Group(阿里巴巴集团) ; Zhejiang University(浙江大学) ; Zhejiang University of Technology(浙江工业大学)
专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 本文提出ControlCity模型,通过多模态信息融合实现城市形态综合生成,提升了形态保真度和空间重叠度,实现了跨城市风格迁移和未知城市零样本生成。
Comments Accepted
Journal ref International Journal of Geographical Information Science (2026)
BLOCK:一个开源的双阶段MLLM字符到皮肤生成Minecraft pipeline
专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 BLOCK通过双阶段流程生成Minecraft皮肤,结合MLLM和FLUX.2模型,提出EvolveLoRA提升生成稳定性与效率。
UniWeTok: 一种具有 $2^{128}$ 大小代码本的统一二进制分词器用于统一多模态大语言模型
专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 UniWeTok通过大规模二进制代码本和改进的训练框架,实现统一多模态大语言模型的高效视觉表示。
Comments 29 pages, 9 figures, 33 tables
基于大语言模型的引导式目标发现指导:用于基于事实的多模态大语言模型医疗报告生成
机构 * Zhejiang University(浙江大学) ; The Second Affiliated Hospital Zhejiang University School of Medicine(浙江大学医学院附属第二医院) ; Hangzhou Pu Jian Medical Technology Co., Ltd.(杭州普健医疗科技有限公司)
专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL
AI总结 本文提出Fact-Flow框架,通过引导大语言模型生成事实准确的医疗报告,利用LLM自动生成标注数据集,提升医疗报告生成的事实准确性。
Comments 10 pages, 1 figure
SemHiTok:一种通过语义引导的层次代码本实现的统一图像分词器,用于多模态理解和生成
机构 * Sun Yat-sen University(中山大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; University of Hong Kong(香港大学) ; South China University of Technology(华南理工大学)
专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 SemHiTok通过语义引导的层次代码本实现统一图像分词器,提升多模态理解和生成性能。
Comments ICLR 2026
MultiDiffSense: 基于扩散的多模态视觉-触觉图像生成,基于物体形状和接触姿态
机构 * Department of Bioengineering, Imperial-X Initiative, Imperial College London(生物工程系、Imperial-X计划、帝国理工学院伦敦分校) ; CAMS-Oxford Institute, University of Oxford(CAMS-牛津研究所、牛津大学)
专题命中 多模态生成 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 MultiDiffSense是一种基于扩散的多模态视觉-触觉图像生成模型,通过双条件化实现可控且物理一致的多模态生成,提升了触觉传感数据集的生成效率和跨模态学习能力。
Comments Accepted by 2026 ICRA