arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-10 至 2026-02-10 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 5 篇

2602.08388 2026-02-10 cs.CV 91%

Geometric Image Editing via Effects-Sensitive In-Context Inpainting with Diffusion Transformers

通过扩散变换器实现的基于效果敏感的上下文内修补图像编辑

Shuo Zhang, Wenzhuo Wu, Huayu Zhang, Jiarong Cheng, Xianghao Zang, Chao Ban, Hao Sun, Zhongjiang He, Tianwei Cao, Kongming Liang, Zhanyu Ma

机构 * PRIS, Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院) Beijing Institute of Technology(北京理工大学)

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);inpainting(title);分类 cs.CV

AI总结 GeoEdit通过扩散变换器实现基于效果敏感的上下文内修补,解决复杂场景中几何变换和光照阴影建模的问题,提升图像编辑的真实感和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08785 2026-02-10 cs.CV cs.AI 83%

DeltaSpace: A Semantic-aligned Feature Space for Flexible Text-guided Image Editing

DeltaSpace: 一种语义对齐的特征空间用于灵活的文本引导图像编辑

Yueming Lyu, Kang Zhao, Bo Peng, Huafeng Chen, Yue Jiang, Yingya Zhang, Jing Dong, Caifeng Shan

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 DeltaSpace通过语义对齐的特征空间实现文本引导图像编辑的灵活训练和推理,支持零样本推理和无需文本的训练。

Comments 18 pages. arXiv admin note: text overlap with arXiv:2303.06285

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07993 2026-02-10 cs.CV cs.AI 79%

MCIE: Multimodal LLM-Driven Complex Instruction Image Editing with Spatial Guidance

MCIE: 多模态大语言模型驱动的复杂指令图像编辑与空间引导

Xuehai Bai, Xiaoling Gu, Akide Liu, Hangjie Yuan, YiFan Zhang, Jack Ma

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 MCIE通过空间引导和背景一致性模块,提升复杂指令图像编辑的指令合规性,实现23.96%的性能提升。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07095 2026-02-10 cs.CV cs.AI 79%

WorldEdit: Towards Open-World Image Editing with a Knowledge-Informed Benchmark

WorldEdit: 向开放世界图像编辑迈进的基于知识的基准

Wang Lin, Feng Wang, Majun Zhang, Wentao Hu, Tao Jin, Zhou Zhao, Fei Wu, Jingyuan Chen, Alan Yuille, Sucheng Ren

机构 * Zhejiang University(浙江大学) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 WorldEdit通过引入基于知识的基准,提升模型在开放世界图像编辑中对隐式指令的理解和处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25682 2026-02-10 cs.CL 67%

PairUni: Pairwise Training for Unified Multimodal Language Models

PairUni: 用于统一多模态语言模型的成对训练

Jiani Zheng, Zhiyang Teng, Kunpeng Qiu, Xiangtai Li, Anran Wang, Yu Tian, Ye Tian, Haochen Wang, Zhuochen Wang

机构 * ByteDance(字节跳动)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract)

AI总结 PairUni通过成对训练提升统一多模态语言模型的理解与生成能力,采用配对数据集和PairGRPO算法实现更有效的策略学习。

Comments 22 pages, 11 figures, and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏