arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2601.19577 2026-03-16 cs.CV 57%

MaDiS: Taming Masked Diffusion Language Models for Sign Language Generation

MaDiS:驯服掩码扩散语言模型用于手语生成

Ronglai Zuo, Rolandos Alexandros Potamias, Qi Sun, Evangelos Ververas, Jiankang Deng, Stefanos Zafeiriou

机构 * Imperial College London(伦敦帝国学院)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出MaDiS,一种基于掩码扩散的语言模型,用于手语生成,通过双向依赖捕捉和高效并行多令牌生成,提升生成效率和质量,同时引入三级交叉模态预训练方案和混合部分嵌入层,实现多层级手语表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00947 2026-03-16 cs.CV 57%

Mobile-VTON: High-Fidelity On-Device Virtual Try-On

Mobile-VTON: 高保真设备端虚拟试衣

Zhenchen Wan, Ce Chen, Runqi Lin, Jiaxin Huang, Tianxi Chen, Yanwu Xu, Tongliang Liu, Mingming Gong

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出Mobile-VTON,一种基于设备端的高保真虚拟试衣框架,通过模块化架构和隐私保护技术,在无需云端支持的情况下实现高质量试衣效果。

Comments The project page is available at: https://zhenchenwan.github.io/Mobile-VTON/

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15369 2026-03-16 eess.IV cs.AI 57%

OpenVision 3: A Family of Unified Visual Encoder for Both Understanding and Generation

OpenVision 3: 一种用于理解和生成的统一视觉编码器家族

Letian Zhang, Sucheng Ren, Yanqing Liu, Xianhang Li, Zeyu Wang, Yuyin Zhou, Huaxiu Yao, Zeyu Zheng, Weili Nie, Guilin Liu, Zhiding Yu, Cihang Xie

机构 * UC Santa Cruz(加州大学圣克ruz分校) JHU(约翰霍普金斯大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出OpenVision 3,通过统一视觉表示实现图像理解和生成。核心架构将VAE压缩的图像潜在特征输入ViT编码器,同时训练其输出以支持重建和语义学习,从而在共享潜在空间中实现良好泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00511 2026-03-16 cs.CV 57%

ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation

ID-Crafter:基于视觉语言模型的在线强化学习多主体视频生成框架

Panwang Pan, Jingjing Zhao, Yuchen Lin, Chenguo Lin, Chenxin Li, Hengyu Liu, Tingting Shen, Yadong MU

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出ID-Crafter框架,通过层次化注意力机制、预训练视觉语言模型和在线强化学习,提升多主体视频生成中身份保持与语义一致性。

Comments Project page: https://angericky.github.io/ID-Crafter, Code: https://github.com/paulpanwang/IDCrafter

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06119 2026-03-16 cs.CV 57%

Omni-Video: Democratizing Unified Video Understanding and Generation

Omni-Video:统一视频理解与生成的普及

Zhiyu Tan, Hao Yang, Luozheng Qin, Jia Gong, Mengping Yang, Hao Li

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Omni-Video框架,通过改进多模态大语言模型生成连续视觉线索,结合轻量架构和高效训练方案,实现视频理解、生成与编辑的统一模型。

Comments Technical report, project page: https://howellyoung-s.github.io/OmniVideo_project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12264 2026-03-13 cs.CV 57%

GRADE: Benchmarking Discipline-Informed Reasoning in Image Editing

GRADE: 图像编辑中学科引导推理的基准测试

Mingxin Liu, Ziqian Fan, Zhaokai Wang, Leyao Gu, Zirun Zhu, Yiguo He, Yuchen Yang, Changyao Tian, Xiangyu Zhao, Ning Liao, Shaofeng Zhang, Qibing Ren, Zhihang Zhong, Xuanhe Zhou, Junchi Yan, Xue Yang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 GRADE是首个评估图像编辑中学科引导推理能力的基准测试,通过多领域样本和多维评估协议揭示当前模型在知识密集型编辑任务中的局限性。

Comments 49 pages, 23 figures, 10 tables; Project Page: https://grade-bench.github.io/, Code: https://github.com/VisionXLab/GRADE, Dataset: https://huggingface.co/datasets/VisionXLab/GRADE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12126 2026-03-13 cs.CV cs.LG 57%

Hoi3DGen: Generating High-Quality Human-Object-Interactions in 3D

Hoi3DGen:生成高质量的人-物交互的3D模型

Agniv Sharma, Xianghui Xie, Tom Fischer, Eddy Ilg, Gerard Pons-Moll

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学院) Technische Universität Nürnberg(纽伦堡技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Hoi3DGen通过多模态大语言模型生成高质量3D人-物交互模型,显著提升交互保真度和3D生成质量,实现文本到3D的高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12108 2026-03-13 cs.CV 57%

EvoTok: A Unified Image Tokenizer via Residual Latent Evolution for Visual Understanding and Generation

EvoTok:通过残差潜在进化实现统一的图像分词器用于视觉理解和生成

Yan Li, Ning Liao, Xiangyu Zhao, Shaofeng Zhang, Xiaoxing Wang, Yifan Yang, Junchi Yan, Xue Yang

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Corporation(微软公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 EvoTok通过残差潜在进化统一图像理解和生成,实现高效视觉表征建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11984 2026-03-13 cs.CV 57%

Ada3Drift: Adaptive Training-Time Drifting for One-Step 3D Visuomotor Robotic Manipulation

Ada3Drift: 适应性训练时间漂移用于一步式三维视觉-运动机器人操作

Chongyang Xu, Yixian Zou, Ziliang Feng, Fanman Meng, Shuaicheng Liu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Ada3Drift通过将迭代细化从推理时间转移到训练时间,实现高保真的单步三维视觉-运动机器人操作生成,同时在少样本条件下提升性能并减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11675 2026-03-13 cs.CV 57%

PROMO: Promptable Outfitting for Efficient High-Fidelity Virtual Try-On

PROMO: 可提示的高效高保真虚拟试衣

Haohua Chen, Tianze Zhou, Wei Zhu, Runqi Wang, Yandong Guan, Dejia Song, Yibo Chen, Xu Tang, Yao Hu, Lu Sheng, Zhiyong Wu

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 PROMO通过流匹配DiT框架和潜在多模态条件拼接,实现高效高保真虚拟试衣,平衡保真度与效率。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10519 2026-03-12 cs.CV 57%

Visually-Guided Controllable Medical Image Generation via Fine-Grained Semantic Disentanglement

通过细粒度语义解耦实现视觉引导的可控医学图像生成

Xin Huang, Junjie Liang, Qingshan Hou, Peng Cao, Jinzhu Yang, Xiaoli Liu, Osmar R. Zaiane

机构 * Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程系,中国沈阳) Key Laboratory of Intelligent Computing in Medical Image of Ministry of Education, Northeastern University, Shenyang, China(教育部医学图像智能计算重点实验室,东北大学,中国沈阳) National Frontiers Science Center for Industrial Intelligence and Systems Optimization, Shenyang, China(工业智能与系统优化国家级前沿科学中心,中国沈阳) AiShiWeiLai AI Research, China(艾世维来人工智能研究,中国) Amii, University of Alberta, Edmonton, Alberta, Canada(阿尔伯塔大学艾米人工智能研究所,加拿大埃德蒙顿,阿尔伯塔)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出视觉引导的文本解耦框架,通过细粒度语义解耦提升医学图像生成的可控性和生成质量。

Comments 10 pages, 7 figures. Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10470 2026-03-12 cs.CV 57%

Fighting Hallucinations with Counterfactuals: Diffusion-Guided Perturbations for LVLM Hallucination Suppression

用反事实对抗幻觉:基于扩散引导的扰动用于LVLM幻觉抑制

Hamidreza Dastmalchi, Aijun An, Ali Cheraghian, Hamed Barzamini

机构 * York University(约克大学) Macquarie University(麦考瑞大学) Northern Illinois University(北伊利诺伊大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 CIPHER通过反事实图像扰动减少LVLM中的视觉幻觉,提升模型忠实性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01957 2026-03-12 cs.CV 57%

AFTER: Mitigating the Object Hallucination of LVLM via Adaptive Factual-Guided Activation Editing

AFTER: 通过自适应事实引导激活编辑缓解LVLM中的对象幻觉

Tianbo Wang, Yuqing Ma, Kewei Liao, Zhange Zhang, Simin Li, Jinyang Guo, Xianglong Liu

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 AFTER通过自适应事实引导激活编辑缓解LVLM中的对象幻觉,显著降低幻觉发生率。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09759 2026-03-11 cs.CV 57%

LogoDiffuser: Training-Free Multilingual Logo Generation and Stylization via Letter-Aware Attention Control

LogoDiffuser: 无需训练的多语言标志生成与风格化通过字母感知注意力控制

Mingyu Kang, Hyein Seo, Yuna Jeong, Junhyeong Park, Yong Suk Choi

机构 * Department of Artificial Intelligence, Hanyang University(翰阳大学人工智能系) Department of Computer Science, Hanyang University(翰阳大学计算机科学系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 LogoDiffuser通过字母感知注意力控制,无需训练实现多语言标志生成与风格化,通过多模态扩散变换器整合字符结构与视觉设计,提升多语言标志生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24417 2026-03-11 cs.CV 57%

EasyText: Controllable Diffusion Transformer for Multilingual Text Rendering

EasyText: 用于多语言文本渲染的可控扩散变换器

Runnan Lu, Yuxuan Zhang, Jiaming Liu, Haofan Wang, Yiren Song

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 EasyText提出了一种基于DiT的可控扩散变换器,用于多语言文本渲染,通过字符位置编码和插值技术实现精确生成,并利用大规模数据集提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08387 2026-03-11 cs.CV 57%

Recognition-Synergistic Scene Text Editing

识别协同场景文本编辑

Zhengyao Fang, Pengyuan Lyu, Jingjing Wu, Chengquan Zhang, Jun Yu, Guangming Lu, Wenjie Pei

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Tencent(腾讯) Department of Computer Vision Technology, Baidu Inc.(百度公司计算机视觉技术部门)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 RS-STE通过整合文本识别与编辑的协同效应,提出了一种统一框架,实现高效且一致的场景文本编辑,提升了复杂场景下的性能。

Comments accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08589 2026-03-10 cs.CV 57%

CARE-Edit: Condition-Aware Routing of Experts for Contextual Image Editing

CARE-Edit:基于条件的专家路由用于上下文图像编辑

Yucheng Wang, Zedong Wang, Yuetong Wu, Yue Ma, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 CARE-Edit通过条件感知的专家路由提升上下文图像编辑的性能和稳定性

Comments Accepted by CVPR 2026. Project page: https://care-edit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07940 2026-03-10 hep-ex cs.AI 57%

AI Agents, Language, Deep Learning and the Next Revolution in Science

人工智能代理、语言、深度学习与科学的下一次革命

Ke Li, Beijiang Liu, Bruce Mellado, Changzheng Yuan, Zhengde Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于深度学习的智能代理作为科学方法的下一次进化,通过多代理推理框架在粒子物理中实现科学发现的扩展与知识生产的革新。

Comments This perspective paper is accepted by Frontier of Physics

Journal ref Front. Phys., 2026, 21(9): 096401

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07430 2026-03-10 cs.CV 57%

Disentangled Textual Priors for Diffusion-based Image Super-Resolution

解耦文本先验用于基于扩散的图像超分辨率

Lei Jiang, Xin Liu, Xinze Tong, Zhiliang Li, Jie Liu, Jie Tang, Gangshan Wu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing 210023, China(新型软件技术国家重点实验室,南京大学,南京)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 DTPSR通过解耦文本先验提升基于扩散的图像超分辨率性能,引入空间层次和频率语义两个维度,实现高感知质量和强泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07144 2026-03-10 cs.CV 57%

CanoVerse: 3D Object Scalable Canonicalization and Dataset for Generation and Pose

CanoVerse: 3D对象可扩展规范化的数据集用于生成和姿态

Li Jin, Yuchen Yang, Weikai Chen, Yujie Wang, Dehao Hao, Tanghui Jia, Yingda Yin, Zeyu Hu, Runze Zhang, Keyang Luo, Li Yuan, Long Quan, Xin Wang, Xueying Qin

机构 * SDU(1 南开大学) LIGHTSPEED(2 LIGHTSPEED) UNC Chapel Hill(3 匹兹堡大学柴尔德斯分校) HKUST(4 香港理工大学) PKU(5 北京大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 CanoVerse通过大规模规范3D数据集提升3D生成稳定性,实现跨模态检索与零样本点云方向估计

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07093 2026-03-10 cs.CV 57%

Facial Expression Generation Aligned with Human Preference for Natural Dyadic Interaction

面向自然双人互动的人类偏好对齐的面部表情生成

Xu Chen, Rui Gao, Xinjie Zhang, Haoyu Zhang, Che Sun, Zhi Gao, Yuwei Wu, Yunde Jia

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于人类反馈的面部表情生成方法,通过动作学习和强化学习策略实现自然双人互动中与人类偏好的对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13687 2026-03-09 cs.CV 57%

Towards Scalable Pre-training of Visual Tokenizers for Generation

面向生成任务的视觉分词器可扩展预训练

Jingfeng Yao, Yuda Song, Yucong Zhou, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) MiniMax

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 VTP通过联合优化图像-文本对比、自监督和重建损失,提升视觉分词器的生成性能和扩展性。

Comments Our pre-trained models are available at https://github.com/MiniMax-AI/VTP

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06038 2026-03-09 cs.CV cs.GR 57%

FontUse: A Data-Centric Approach to Style- and Use-Case-Conditioned In-Image Typography

FontUse: 一种以数据为中心的方法用于风格和使用场景条件下的图像内字体设计

Xia Xin, Yuki Endo, Yoshihiro Kanamori

机构 * University of Tsukuba(茨口大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 FontUse提出了一种以数据为中心的方法,通过构建大规模字体数据集并结合多模态模型,提升文本生成中字体风格和使用场景的控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06032 2026-03-09 cs.CV 57%

StruVis: Enhancing Reasoning-based Text-to-Image Generation via Thinking with Structured Vision

StruVis: 通过结构化视觉进行推理的文本到图像生成增强

Yuanhuiyi Lyu, Kaiyu Lei, Ziqiao Weng, Xu Zheng, Lutao Jiang, Teng Li, Yangfu Li, Ziyuan Huang, Linfeng Zhang, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology(香港科技大学) East China Normal University(华东师范大学)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 StruVis通过结构化视觉引导推理,提升基于推理的文本到图像生成性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06014 2026-03-09 cs.CV 57%

EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect Creation

EffectMaker:统一推理与生成以实现定制化视觉效果创建

Shiyuan Yang, Ruihuang Li, Jiale Tao, Shuai Shao, Qinglin Lu, Jing Liao

机构 * Tencent Hunyuan(腾讯文言) City University of Hong Kong(香港城市大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 EffectMaker通过统一推理生成框架实现定制化视觉效果创建,利用多模态模型和扩散变换器提升效果质量和一致性,构建大规模数据集增强泛化能力。

Comments Project page: https://effectmaker.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05769 2026-03-09 cs.CV 57%

Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformers

逐层实例绑定用于文本到图像扩散变换器中的区域和遮挡控制

Ruidong Chen, Yancheng Bai, Xuanpu Zhang, Jianhao Zeng, Lanjun Wang, Dan Song, Lei Sun, Xiangxiang Chu, Anan Liu

机构 * Tianjin University(天津大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 LayerBind通过逐层实例绑定实现文本到图像扩散变换器中的区域和遮挡控制,无需训练即可提升生成质量和遮挡管理能力。

Comments Accepted by CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05518 2026-03-09 cs.HC cs.CV 57%

CoEditor++: Instruction-based Visual Editing via Cognitive Reasoning

CoEditor++:基于指令的视觉编辑 via 认知推理

Minheng Ni, Yutao Fan, Zhengyuan Yang, Yeli Shen, Yuxiang Wei, Yaowen Zhang, Lijuan Wang, Lei Zhang, Wangmeng Zuo

机构 * Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学) Microsoft(微软公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 CoEditor++通过认知推理实现基于指令的视觉编辑,无需训练即可在通用和负责任的编辑任务中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04980 2026-03-06 cs.CV 57%

A Simple Baseline for Unifying Understanding, Generation, and Editing via Vanilla Next-token Prediction

一种通过 vanilla next-token 预测统一理解、生成和编辑的简单基线

Jie Zhu, Hanghang Ma, Jia Wang, Yayong Guan, Yanbing Zeng, Lishuai Gao, Junqiang Wu, Jie Hu, Leye Wang

机构 * Key Lab of High Confidence Software Technologies (Peking University), Ministry of Education, China(高可信软件技术重点实验室(北京大学),教育部,中国) School of Computer Science, Peking University, Beijing, China(北京大学计算机学院,北京,中国) School of Computer Science and Technology, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学计算机科学与技术学院,北京,中国)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出 Wallaroo,一种通过 vanilla next-token 预测统一多模态理解、生成和编辑的简单基线模型,展示了其在多任务中的竞争力。

Comments Technical report. This work serves as a straightforward autoregressive baseline for unifying understanding, generation, and editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17100 2026-03-06 cs.LG cs.AI 57%

Generative Models in Decision Making: A Survey

生成模型在决策中的应用:综述

Xinyu Shao, Jianping Zhang, Haozhi Wang, Leo Maxime Brunswic, Kaiwen Zhou, Jiqian Dong, Kaiyang Guo, Zhitang Chen, Jun Wang, Jianye Hao, Xiu Li, Yinchuan Li

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 本文综述提出了一种基于概率框架的控制作为推理的系统分类,将生成决策置于其中,通过变分因子分解轨迹后验,概念化了四个功能角色,并探讨了生成模型在高风险领域的应用及挑战。

Comments Project page:https://github.com/xyshao23/Awesome-Generative-Models-for-Decision-Making-Taxonomy

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05091 2026-03-05 cs.CV 57%

Factuality Matters: When Image Generation and Editing Meet Structured Visuals

事实性至关重要:当图像生成与编辑遇见结构化视觉

Le Zhuo, Songhao Han, Yuandong Pu, Boxiang Qiu, Sayak Paul, Yue Liao, Yihao Liu, Jie Shao, Xi Chen, Si Liu, Hongsheng Li

机构 * CUHK MMLab(香港大学多模态实验室) Beihang University(北京航空航天大学) Krea AI(Krea人工智能) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) Hugging Face National University of Singapore(新加坡国立大学) ByteDance(字节跳动) The University of Hong Kong(香港大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种统一模型,通过整合视觉语言模型和FLUX.1 Kontext,提升结构化视觉生成与编辑的多模态理解与事实准确性。

Comments Accepted by ICLR 2026, Project page: https://structvisuals.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏