TEAL: Tokenize and Embed ALL for Multi-modal Large Language Models
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CL、cs.AI
Comments Multi-modal, Large Language Models, Tokenizer, Understanding and Generation
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CL、cs.AI
Comments Multi-modal, Large Language Models, Tokenizer, Understanding and Generation
SEED: 用于可解释文本伪造检测的简单ViT与演化框架
机构 * State Key Laboratory of Internet of Things for Smart City, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系智慧城市物联网国家重点实验室) ; School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院)
专题命中 多模态生成 :MLLM(summary_cn,abstract);分类 cs.CV
AI总结 提出SEED系统,结合相似性引导数据增强、单一ViT联合检测与定位、以及基于MLLM的演化报告生成,在ACM MM 2026文本伪造挑战赛中获得第三名。
UniGen-AR:通过自回归建模统一视觉生成
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳 - 香槟分校) ; Toyota Research Institute(丰田研究院)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);multi-modal(abstract);分类 cs.CV
AI总结 研究统一视觉生成问题,提出UniGen-AR框架,将通用多模态语言模型与视觉自回归解码器配对,能为多任务生成图像值输出,相比基于扩散的基线,推理延迟低达19倍,确立视觉自回归建模为统一视觉生成的高效主干。
GeoSearcher: 基于锚点引导的渐进推理遥感视觉定位与过程监督
机构 * Key Laboratory of Target Cognition and Application Technology (TCAT), Chinese Academy of Sciences(中国科学院目标认知与应用技术重点实验室) ; School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出GeoSearcher,通过锚点引导的渐进推理和过程监督,将遥感视觉定位转化为两阶段过程,解决小目标定位和复杂查询的挑战。
Comments 14 pages, 11 figures, 7 tables
模态解耦的在线递归编辑
机构 * Harbin Institute of Technology, Shenzhen, China.(哈尔滨工业大学(深圳)) ; Peng Cheng Laboratory, China.(鹏城实验室) ; Huazhong University of Science and Technology, China(华中科技大学)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 本文提出M-ORE,一种用于持续多模态大语言模型适应的模态解耦在线递归编辑器,通过统一的近端投影公式和Sherman-Morrison递归实现常数级的每编辑开销,从而在保持模块局部统计信息和固定正交低秩编辑子空间的同时,减少长周期干扰,提升可靠性、通用性和局部性。
基于推理的编辑:基于假设指令的图像编辑与视觉推理
机构 * Tencent Youtu Lab(腾讯云图实验室) ; Sichuan University(四川大学) ; University of the Chinese Academy of Sciences(中国科学院大学) ; Fudan University(复旦大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出Reason50K数据集和ReasonBrain框架,通过多模态大语言模型和扩散模型实现复杂隐含指令的图像编辑,提升视觉推理能力。
Comments Accepted by ICML2026
SpatialFusion:赋予统一图像生成内在三维几何意识
机构 * Zhejiang University(浙江大学) ; HiThink Research(HiThink研究院)
专题命中 多模态生成 :MLLM(summary_cn,abstract);分类 cs.CV
AI总结 本文提出SpatialFusion框架,通过引入混合变压器增强MLLM的三维几何建模能力,并利用深度适配器将显式几何约束注入扩散模型,提升空间感知任务性能。
MedUAG:面向医学多模态模型的统一理解与生成框架
机构 * Zhejiang University(浙江大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Tsinghua University(清华大学) ; Tencent Jarvis Lab(腾讯Jarvis实验室)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 针对医学多模态领域缺乏统一理解生成框架的问题,本文构建了MedUAGCorpus数据集与MedUAGBench基准,开发了MedUAG模型,其在医学理解与生成任务中表现出色,为下一代医学多模态系统奠定基础。
新概念必须进入之处:统一多模态模型中的入口门跨任务可用性
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Columbia University(哥伦比亚大学) ; CUHK(香港中文大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 该研究通过分离统一多模态模型的理解与生成任务方向,发现跨任务可用性取决于概念绑定的入口层,提出的对齐目标可在极低损失下实现概念跨任务迁移。
Comments 27 pages, 10 figures
SPARGen:通过原生多模态生成统一空间感知与推理
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 SPARGen是统一多模态框架,将3D重建等空间任务转为指令条件生成任务,在单一框架内实现异构空间任务的竞争力性能,突破现有方法的知识迁移限制。
MRIComp4Flow:用于训练多模态生成模型的三维脑部MRI压缩
机构 * Technical University of Munich (TUM)(慕尼黑工业大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Imperial College London(帝国理工学院) ; Florida State University(佛罗里达州立大学) ; Institute for Advanced Study, TUM (TUM-IAS)(慕尼黑工业大学高等研究院) ; TUM University Hospital(慕尼黑工业大学医院)
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 该研究针对大规模多模态MRI的存储与I/O问题,采用JPEG2000或JPEG-LS压缩三维脑肿瘤MRI,在20:1压缩率下训练Wavelet Flow Matching模型,证实其合成质量与未压缩数据训练的模型相当,为可扩展三维MRI生成建模提供了实用方案。
Comments Accepted: MICCAI 2026 SASHIMI workshop
LaViT:对齐潜在视觉思维以进行多模态推理
机构 * City University of Hong Kong(香港城市大学) ; University of Science and Technology of China(中国科学技术大学) ; Utrecht University(乌特勒支大学) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 LaViT通过对齐潜在视觉思维提升多模态推理能力,实现视觉感知增强和模型性能突破。
FronTalk: 以多模态反馈进行对话式代码生成的前端开发基准测试
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Duke University(杜克大学)
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.CL
AI总结 提出FronTalk基准,通过多轮对话和多模态反馈(文本与视觉指令)评估前端代码生成,发现模型存在遗忘和视觉反馈理解困难,提出AceCoder方法有效减少遗忘并提升性能。
Comments CoLM 2026
Surg-UniWorld:具有多模态控制专家的统一外科世界模型
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; the University of Sydney(悉尼大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本研究提出Surg-UniWorld统一外科世界模型,构建Chlec80-SurgWAM基准,经实验证实其在可控外科视频生成相关指标上优于现有方法。
CSGen:一种基于分层多模态扩散的多领域曲线结构生成模型
机构 * Hainan University(海南大学) ; Guangdong Ocean University(广东海洋大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 该研究针对可控曲线结构图像生成的挑战,提出CSGen模型,通过构建多领域数据集、分层渐进控制策略与稀疏感知损失机制,提升生成图像的结构精度与下游分割性能,为曲线结构分析提供新范式。
Comments Accepted to ACM MM 2026
跨分支冲突作为一种保护手段:在统一多模态图像编辑中保护面部身份
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 研究统一多模态模型中个人肖像编辑的安全问题,提出CCS统一对抗保护框架,通过联合驱动ViT和VAE表示及破坏跨分支兼容性,防止模型恢复身份信息,在抑制身份保留编辑上表现优于现有方法。
Comments 14 pages, preprint
通过多模态强化学习扩展医学影像报告生成
机构 * Microsoft Research(微软研究院)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 本文提出UniRG框架,通过多模态强化学习提升医学影像报告生成的性能和泛化能力,在CXR报告生成中取得新的SOTA成绩。
DreamCAD: 通过可微参数曲面实现多模态CAD生成的扩展
机构 * DFKI ; RPTU ; Imperial College London(帝国理工学院伦敦分校) ; Huawei London Research Center(华为伦敦研究中心)
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 DreamCAD通过可微参数曲面直接生成可编辑的BRep,无需CAD特定注释,实现多模态CAD生成的扩展,并在多个基准测试中取得最佳性能。
Comments For Caption Dataset: https://huggingface.co/datasets/SadilKhan/CADCap-1M
M$^3$-Gen:利用临床和影像数据对基因表达谱进行可解释的多模态生成
机构 * DEIB - Dipartimento Elettronica, Informazione e Bioingegneria, Politecnico di Milano(米兰理工大学电子、信息与生物工程系)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 研究旨在解决基因表达数据获取受限问题,提出M$^3$-Gen框架,通过对比学习从临床变量和图像中学习潜在表示,以生成生物学连贯的基因表达谱,在TCGA数据集上验证有效性,且具有内在可解释性。
Comments 15 pages, 6 figures
接触网-受电弓系统中弧光检测的多模态学习
机构 * Chair of Structural Mechanics & Monitoring, ETH Zürich(苏黎世联邦理工学院结构力学与监测教授职位) ; Intelligent Maintenance and Operations Systems Lab, EPFL(洛桑联邦理工学院智能维护与运营系统实验室)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出多模态学习框架,结合图像与力数据,有效检测接触网-受电弓系统中的弧光事件,提升检测鲁棒性和准确性。
外观指针——扩散变压器的多模态区域控制
机构 * Brown University(布朗大学) ; Adobe Research(Adobe 研究院)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 针对可控图像生成难题,提出外观指针方法,通过区域对应网络和空间聚合机制生成并细化指针,为扩散变压器引入模态无关的局部多模态控制接口,单一模型性能达或超现有技术。
Comments 38 Pages, Preprint with supplement
Boogu-Image-0.1:提升开源统一多模态理解与生成能力
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 介绍开源统一多模态模型Boogu-Image-0.1,通过改进模型理解、数据质量和训练管道等,结合智能推理扩展,提升生成和编辑性能,在标准基准测试中表现出色,成本低,还分享实践讨论并开源代码等推动相关生态发展。
Hallo4D:用于一致时空生成的多模态幻觉缓解
机构 * Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Shanghaitech University(上海科技大学)
专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究针对3D和4D内容生成中的时空幻觉问题,提出Hallo4D框架,利用多模态语言模型,通过生成-检测-校正范式及多种技术提升一致性,实验证明其在多样生成设置下优于基线,提供了可扩展通用的一致性感知内容生成方案。
你还记得吗?迈向以记忆为中心的多模态人工智能
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 研究针对当前多模态语言模型缺乏重建性记忆的问题,提出DoYouRemember三阶段架构,通过VQ-VAE、LoRA微调语言模型和扩散解码器实现,经实验发现语言模型隐藏状态视觉信息少,还解决了共享记忆矩阵训练问题,统一相关发现于信息论框架。
Comments 43 pages, 8 figures, 3 tables
BackgroundMellow:一种用于叙事驱动的丰富电影音效生成的多模态凝聚框架
机构 * Indian Institute of Technology Kharagpur(印度理工学院卡拉格布尔分校)
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI、cs.MM
AI总结 多模态AI中为文本叙事生成电影音效困难,BackgroundMellow框架将其视为编排与信号处理问题,通过主 - 专家架构、Tango2模型、背景音乐检索器及NLP模块实现,经实验验证在时间同步等方面有效。
Comments 7 pages
M4V:用于高效文本到视频生成的多模态曼巴
机构 * Meituan(美团) ; University of Technology Sydney(技术大学悉尼分校) ; Beijing Jiaotong University(北京交通大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 研究针对文本到视频生成计算量大的问题,引入多模态曼巴框架M4V。设计MM-DiM块,采用多模态令牌重新组合设计,增强时空一致性。实验表明,该框架能在降计算成本的同时生成高质量视频。
Comments CVPR 2026
基于生成式人工智能架构的多模态神经影像特征的潜在图编码
机构 * Center for Translational Research in Neuroimaging and Data Science (TReNDS)(转化神经影像与数据科学研究中心)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 研究旨在设计多模态生成框架用于神经影像特征分析,通过评估多种策略和模型,利用GMV和sFNC特征分析多个生成框架,提出的gMMVAE在多指标上超替代变体,有潜力用于稳健的多模态神经影像分析。
Comments 6 pages, accepted in IEEE International Conference on Image Processing (ICIP) 2026
统一多模态模型中理解与生成之间的可迁移性
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; Blynx(布林克斯公司) ; Trillionlabs(万亿实验室)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 研究统一多模态模型中理解与生成任务间的可迁移性,通过实验发现其依赖架构,据此提出实用训练策略,训练对应理解任务迁移至生成可提升性能并减少分布偏移。
Comments Accepted at ECCV 2026. Project Page: https://cvlab-kaist.github.io/UMM_Transferability/
IterCAD:一种用于视觉引导的CAD生成与编辑的迭代多模态智能体
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 提出IterCAD,一种闭环交互式CAD生成与编辑的多模态智能体框架,通过渐进式SFT和几何感知强化学习优化,在代码可执行性和几何精度上显著超越现有方法。
语义生成微调用于统一多模态模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent ARCLab(腾讯ARCLab)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出语义生成微调(SGT)方法,通过将高阶语义任务作为生成代理,统一多模态模型的感知与生成能力,提升多模态理解和生成质量。
Comments 14 pages, 13 figures