arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3055 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 85 篇

2606.19073 2026-07-07 cs.CV 新提交 57%

Taming I2V models for Image HOI Editing: A Cognitive Benchmark and Agentic Self-Correcting Framework

驯服I2V模型用于图像HOI编辑:认知基准与智能体自校正框架

Jiayi Gao, Qingchao Chen, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(王轩计算机技术研究所,北京大学,北京,中国) National Institute of Health Data Science, Peking University, Beijing, China(国家健康数据科学研究院,北京大学,北京,中国)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出HOI-Edit基准和SCPE框架,利用I2V模型的时间生成能力进行动态人-物交互编辑,通过自校正提示迭代优化,实现与SOTA竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31637 2026-07-01 cs.GR cs.AI 新提交 57%

Intrinsic decomposition and editing of 3D Gaussian splats

3D高斯散点的本征分解与编辑

Alexandre Lanvin, Jeffrey Hu, Simon Lucas, Adrien Bousseau, George Drettakis

机构 * Inria, Université Côte d’Azur(法国国家信息与自动化研究所,蔚蓝海岸大学) Cambridge University(剑桥大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.GR

AI总结 提出将本征分解扩展到高斯散点辐射场的方法,通过独立高斯基元、数据驱动优化和单图纹理编辑实现场景的材质与光照分离及编辑。

Comments 18 pages

Journal ref Proc. ACM Comput. Graph. Interact. Tech. 9, 1, Article 10 (May 2026), 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22042 2026-06-23 cs.CV 新提交 57%

IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance

IDAG-Edit: 基于实例解耦注意力和引导的多对象视频编辑

Yuan-Zhih Lin, Huu-Thang Nguyen, Huu-Phu Do, Hong-Han Shuai, Ching-Chun Huang

机构 * Department of Computer Science, National Yang Ming Chiao Tung University, Taiwan(台湾阳明交通大学计算机科学系)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 提出IDAG-Edit框架,通过布局引导注意力调制和实例级掩码实现无训练的多对象视频编辑,解决注意力泄露和身份漂移问题,提升时间一致性和多对象可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20709 2026-06-23 cs.CV 新提交 57%

TeleStyle V2: Beyond Content-Preserving Style Transfer with Self-Distillation and Distribution-Matching-Distillation

TeleStyle V2:超越内容保持风格迁移的自蒸馏与分布匹配蒸馏

Shiwen Zhang, Yifan Xu, Haibin Huang, Chi Zhang, Xuelong Li

机构 * TeleAI

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出TeleStyle V2,通过自蒸馏数据合成和分布匹配蒸馏,支持四种内容-风格参考组合,解决内容一致性退化问题,性能与Qwen-Image-Edit和Gemini 3 Pro相当。

Comments https://github.com/Tele-AI/TeleStyleV2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20556 2026-06-19 cs.CV 新提交 57%

Thinking in Boxes: 3D Editing in Real Images Made Easy

Thinking in Boxes: 真实图像中的3D编辑变得简单

Pradhaan S Bhat, Naveen Chandra R, Rishubh Parihar, Vaibhav Vavilala, R. Venkatesh Babu, D. A. Forsyth, Anand Bhattad

机构 * Indian Institute of Science(印度科学研究所) Apple(苹果公司) UIUC(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出使用3D盒子作为结构化规范,通过用户提供输入和输出盒子来精确控制真实图像中的平移、旋转、缩放和视角变化,同时保持场景和物体身份,恢复未见的物体区域。

Comments Project Page: https://thinking-in-boxes.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13558 2026-06-12 cs.CV cs.CL 新提交 57%

Edit the Bits, Diff the Codes: Bitwise Residual Editing for Visual Autoregressive Models

编辑比特,差异编码:面向视觉自回归模型的逐比特残差编辑

Shengqiang Zhang, Ruotong Liao, Volker Tresp, Barbara Plank, Hinrich Schütze

机构 * LMU Munich & Munich Center for Machine Learning (MCML)(慕尼黑大学 & 慕尼黑机器学习中心 (MCML))

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出BitResEdit,一种无需训练的视觉自回归图像编辑方法,通过比特级源负引导和残差编码注入,在保持背景的同时实现强文本对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07171 2026-06-08 cs.CV 新提交 57%

When Recovery Matters: The Blind Spot of Surrogate Privacy in MLLM Editing

当恢复至关重要时:MLLM编辑中替代隐私的盲点

Siyuan Xu, Yibing Liu, Peilin Chen, Yung-Hui LI, Shiqi Wang, Sam Kwong

机构 * City University of Hong Kong(香港城市大学) Hon Hai Research Institute(鸿海研究院) Lingnan University(岭南大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 针对多模态大模型编辑中的隐私风险,提出首个面向恢复的替代隐私保护编辑基准SPPE,涵盖36个细粒度隐私类别和65个编辑指令,并设计可编辑性评估与替代到源编辑恢复两个任务及对应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24538 2026-07-28 cs.RO 新提交 50%

NEO: NeRF It Once, Edit It Many Times for Continuous Object Manipulation

NEO:一次性NeRF,多次编辑以进行连续物体操纵

Mikołaj Zieliński, David Hall, Dominik Belter, Peyman Moghadam

机构 * Institute of Robotics and Machine Intelligence, Poznan University of Technology(波兹南理工大学机器人与机器智能研究所) CSIRO Robotics, CSIRO(联邦科学与工业研究组织机器人部)

专题命中 图像编辑 :inpainting(abstract)

AI总结 本文提出NEO框架,用于机器人操纵的语言引导NeRF编辑。结合神经场重采样与多视图修复实现物体移除,利用知识蒸馏进行NeRF权重编辑,还创建了评估基准NEO-Dataset。该方法在场景编辑任务中表现出色,优于现有基线。

Comments Accepted to IEEE ROBOTICS AND AUTOMATION LETTERS (RA-L) JULY, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14531 2026-06-15 cs.RO 新提交 50%

AERMANI-PLACE: Language Guided Object Placement with Aerial Manipulators

AERMANI-PLACE: 基于语言引导的空中机械臂物体放置

Sarthak Mishra, Ritama Sanyal, Rishabh Dev Yadav, Wei Pan, Spandan Roy

机构 * Robotics Research Center, IIIT Hyderabad(海得拉巴国际信息技术学院机器人研究中心) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Newcastle University(纽卡斯尔大学)

专题命中 图像编辑 :image editing(abstract)

AI总结 提出AERMANI-PLACE框架,通过自然语言指令和图像编辑模型生成视觉标记,引导空中机械臂完成物体放置,在测试集和真实平台上分别达到87%和72%的平均成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 2337 篇

2607.03752 2026-07-07 cs.CV cs.AI cs.CL cs.MA 新提交 92%

EmCom-Diffusion: Probing Visual Reflection in Emergent Languages via Image Generation

EmCom-Diffusion:通过图像生成探究新兴语言中的视觉反射

Haruumi Omoto, Tadahiro Taniguchi

机构 * Graduate School of Informatics, Kyoto University, Kyoto, Japan(京都大学信息学研究科) Research Organization of Science and Technology, Ritsumeikan University, Shiga, Japan(立命馆大学科学技术研究机构)

专题命中 扩散模型 :diffusion(title,title_cn);image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 研究新兴语言编码输入视觉内容程度的问题,提出EmCom-Diffusion框架,直接测量视觉反射,通过微调文本到图像扩散模型,以重建图像与原图的感知相似性评分,验证其优于现有指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07053 2026-06-08 cs.CV cs.LG 新提交 92%

TrioPose: Native Triple-Stream Diffusion Transformers for Pose-Guided Text-to-Image Generation

TrioPose: 用于姿态引导文本到图像生成的原生三流扩散变换器

Dian Gu, Zhengyi Yang

机构 * Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 提出TrioPose,基于SD3.5M架构的原生三流姿态感知DiT,通过逐层激活和零初始化双残差注入保持预训练稳定性,并设计可学习关系偏置掩码和姿态引导空间损失加权,在多人姿态引导生成中实现SOTA性能,Human-Art上AP达64.33。

Comments 15 pages (9 pages main body, 6 pages references and appendix), 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07079 2026-06-08 cs.CV 新提交 91%

AsyncPatch Diffusion: spatially-flexible image generation

异步补丁扩散:空间灵活的图像生成

Samuele Papa, Valentin De Bortoli, Guillaume Couairon, Daniel Sýkora, Romuald Elie, Klaus Greff

机构 * Google DeepMind(谷歌DeepMind) University of Amsterdam(阿姆斯特丹大学) The Netherlands Cancer Institute(荷兰癌症研究所)

专题命中 扩散模型 :diffusion(title,summary_cn);image generation(title);inpainting(abstract);分类 cs.CV

AI总结 提出AsyncPatch Diffusion框架,通过为不同空间区域分配不同噪声水平实现异质去噪轨迹,在保持生成质量的同时原生支持图像修复和自适应生成。

Comments 36 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07003 2026-08-10 cs.CV 新提交 90%

HRDiT: Training-Free High-Resolution Image Generation with Off-the-Shelf Diffusion Transformer Models

HRDiT:基于现成扩散Transformer模型的无需训练高分辨率图像生成

Yu Xue, Haoxuan Qu, Zhuoling Li, Hongbin Xu, Jianxiong Yin, Simon See, Hossein Rahmani, Jun Liu

机构 * Lancaster University(兰卡斯特大学) South China University of Technology(华南理工大学) NVIDIA AI Tech Centre(英伟达AI技术中心)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 本研究针对现成DiT模型适配高分辨率图像合成的空间紊乱、生成时间长两大挑战,提出新方法,经实验验证其有效性,代码公开。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06875 2026-06-08 cs.CV cs.CR 新提交 90%

Unified Safe In-context Image Generation in Multimodal Diffusion Transformers via Restricting Unsafe Information Flows

统一安全上下文图像生成:在多模态扩散变换器中通过限制不安全信息流

Xiang Yang, Feifei Li, Mi Zhang, Geng Hong, Xiaoyu You, Mi Wen, Min Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 提出UVR框架,通过分析注意力动态中的不安全信息流,在无需训练的情况下对输出补丁进行注意力调制,实现图像生成和编辑任务的安全控制,达到91%和77%的擦除率。

Comments ICML26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09816 2026-06-09 cs.CV cs.AI math.PR 新提交 90%

PTL-Diffusion: Manifold-Aware Diffusion with Periodic Terminal Laws

PTL-Diffusion: 具有周期终端定律的流形感知扩散

Danqi Zhuang, Jisui Huang, Xiaoyue Xi, Andrew Kiggins, Xiaojie Wang, Ke Chen, Yue Wu

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Cambridge(剑桥大学) University of Oxford(牛津大学) Harvard University(哈佛大学) MIT(麻省理工学院) University of Washington(华盛顿大学)

专题命中 扩散模型 :diffusion(title,title_cn);分类 cs.CV

AI总结 提出PTL-Diffusion,通过将前向噪声过程收敛到周期高斯终端族而非单一分布,显式嵌入相位结构,改善低维流形上的分布匹配,在点云和人脸数据集上降低误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26735 2026-07-30 cs.CV cs.AI cs.MM 新提交 90%

Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise Perspectives

文本到图像扩散模型的双重逆推:从提示与噪声双视角

Xiaolong Liu, Junjian Li, Yuan Xiao, Jiaqi Deng, Dayong Ye, Tianqing Zhu, Huan Huo

机构 * University of Technology Sydney(悉尼科技大学) Geely(吉利) City University of Hong Kong(香港城市大学) City University of Macau(澳门城市大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image editing(abstract);分类 cs.CV、cs.MM

AI总结 该研究针对现有文本到图像扩散模型提示逆推方法的局限,提出联合恢复语义提示与潜在噪声的Dualin方法,实现了高质量逆推提示与最优图像保真度,为可控图像编辑奠定基础。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06136 2026-07-08 cs.CV cs.MM 新提交 90%

Tuning-Free Latent Diffusion Models for Ultrahigh-Resolution Image Editing

用于超高分辨率图像编辑的免调优潜在扩散模型

Wanglong Lu, Lingming Su, Kaijie Shi, Minglun Gong, Xiaogang Jin, Hanli Zhao, Xianta Jiang

机构 * College of Computer Science and Artificial Intelligence, Wenzhou University(温州大学计算机科学与人工智能学院) Department of Computer Science, Memorial University of Newfoundland(纽芬兰纪念大学计算机科学系) AI Analytics Team, Nasdaq(纳斯达克人工智能分析团队) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);image generation(abstract);分类 cs.CV、cs.MM

AI总结 针对现有图像编辑方法在高分辨率处理上的局限,提出免调优的UltraDiffEdit框架,通过多尺度渐进编辑、多补丁编码、全局-局部一致性去噪及补丁混合采样等技术,实现高质量超高分辨率图像编辑,处理能力达8K且灵活性高。

Comments 29 pages, 29 figures. Published in IEEE Transactions on Neural Networks and Learning Systems

Journal ref IEEE Transactions on Neural Networks and Learning Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12328 2026-08-14 cs.CL 新提交 89%

LoRA-Diffusion: Parameter-Efficient Fine-Tuning via Low-Rank Trajectory Decomposition

LoRA-Diffusion:基于低秩轨迹分解的参数高效微调方法

Iman Khazrak, Narges Nejad, Mohammadhossein Homaei, Mostafa M. Rezaee, Robert C. Green

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 本文提出 LoRA-Diffusion,将低秩分解应用于扩散式语言模型的去噪轨迹而非权重,引入轨迹级适配器等技术,在 SST-2 等数据集上取得优异性能,为扩散式语言模型提供参数高效微调框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05722 2026-07-08 cs.CL 新提交 89%

Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding

Nemotron-Labs-Diffusion:一种统一自回归、扩散和自推测解码的三模式语言模型

Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Norouzi, Jingyu Liu, Shiyi Lan, Ligeng Zhu, Jin Wang, Jindong Jiang, Morteza Mardani, Mehran Maghoumi, Song Han, Ante Jukić, Nima Tajbakhsh, Jan Kautz, Pavlo Molchanov

机构 * Nemotron-Labs(Nemotron实验室)

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 介绍了统一AR、扩散和自推测解码的三模式语言模型Nemotron-Labs-Diffusion,通过联合目标训练,能切换模式。研究表明其目标互补,自推测模式表现优,有长期潜力,该模型家族在精度和速度上优于现有开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26285 2026-06-26 cs.CR cs.AI 新提交 89%

TEMPO-Diffusion: Temporally Exposed Malicious Poisoning of Diffusion Models

TEMPO-Diffusion:扩散模型的时间暴露恶意投毒

William Aiken, Paula Branco, Guy-Vincent Jourdan, Iosif-Viorel Onut

机构 * School of Electrical Engineering and Computer Science, University of Ottawa(电气与计算机科学学院,渥太华大学)

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 提出TEMPO-Diffusion框架,通过时间条件触发实现针对特定类别的后门攻击,支持多子图像后门和修复,并引入CALISA数据集验证攻击有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19315 2026-06-18 cs.LG 新提交 89%

Diffusion-Proof: Recipe for Formal Theorem Proving Beyond Auto-Regressive Generation

Diffusion-Proof:超越自回归生成的正式定理证明配方

Ruida Wang, Rui Pan, Pengcheng Wang, Shizhe Diao, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 提出Diffusion-Proof框架,首次将扩散语言模型应用于形式定理证明,通过全证明生成和局部校正方法,在ProofNet和MiniF2F上分别提升1.61%和6.14%,并解决了一个DeepSeek-Prover-V2-7B无法解决的IMO问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16104 2026-08-18 cs.CV 新提交 89%

Nexus: Structured Synergy for Efficient Text-to-Image Generation using Rectified Flow Model

Nexus:使用整流流模型实现高效文本到图像生成的结构化协同框架

Yizhao Wang

机构 * School of Computer Science, Henan Institute of Science and Technology(河南科技学院计算机学院)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究针对文本到图像生成模型计算量大、复杂度高的问题,提出集成稀疏架构、线性复杂度与低比特量化的Nexus模型,结合MoE前馈层等技术,在保持与SDXL、SD3相当生成质量的同时提升推理效率,经COCO、LAION验证有效。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08720 2026-08-11 cs.CV 新提交 89%

High-Quality Exposure Correction with Diffusion-Based Image Generation Priors

基于扩散模型图像生成先验的高质量曝光校正

Ziwen Li, Meng Cao, Jinpu Zhang, Chunyang Li, Long Bao, Heng Sun, Yuehuan Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) National University of Defense Technology(国防科技大学) Xiaomi Communications Company Ltd.(小米通讯有限公司)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散先验的曝光校正框架DPEC,通过高效微调策略与联合交叉注意力模块,在多数据集上实现了优于现有方法的曝光校正性能。

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03937 2026-08-05 cs.CV cs.CR 新提交 89%

Progressive Learning of a Diffusion-based Inpainting Model for Separating Overlapped Fingerprints

用于分离重叠指纹的基于扩散模型的修复模型的渐进式学习

Noor Hussein, Anil K. Jain, Karthik Nandakumar

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 本研究针对重叠指纹分离问题,提出渐进式学习的基于扩散的修复模型,结合指纹先验与多通道条件的感知重叠修复,在公开数据集上实现了高匹配度的组成指纹重建。

Comments Accepted to IJCB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25078 2026-07-29 cs.CV 新提交 89%

Diff-ID: Identity Consistent Facial Image Generation and Morphing via Diffusion Models

Diff-ID:通过扩散模型实现身份一致的面部图像生成与变形

Taimoor Rizwan, Sara Atito, Muhammad Awais, Zhenhua Feng, Josef Kittler

机构 * University of Surrey(萨里大学) Jiangnan University(江南大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);image synthesis(abstract);分类 cs.CV

AI总结 研究针对面部图像合成中高分辨率下身份保持难题,提出Diff-ID框架,通过自定义数据集、集成嵌入及新损失函数实现,实验表明其在身份-真实感权衡上表现出色,还展示了基于DDIM的变形管道,强调联合评估身份保持与真实感。

Comments 20 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22963 2026-07-28 eess.IV cs.CV 新提交 89%

PriSAR: 3D Geometric-Prior-Guided Diffusion for Parameter-Controlled SAR Image Generation

PriSAR:用于参数控制SAR图像生成的3D几何先验引导扩散

Fan Zhang, Xuanting Wu, Fei Ma, Qiang Yin, Yuxin Hu

专题命中 扩散模型 :diffusion(title,abstract);image generation(title,abstract);分类 cs.CV

AI总结 研究SAR图像在稀疏观测角度下的可控生成问题,提出用3D模型导出的几何先验引导扩散模型的方法,即GeoDiff-SAR,经实验在飞机和车辆数据集上取得较好结果,证明该轻量级3D几何先验可改善视点一致性,用作生成指导。

Comments 17 pages,15 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03180 2026-07-07 cs.CV 新提交 89%

FairFlow: Demystifying and Mitigating Stereotype Bias in Text-to-Image Diffusion Transformers

FairFlow:揭开文本到图像扩散变换器中刻板印象偏差的面纱并减轻其影响

Chen Chen, Yuanmin Huang, Zhenfei Zhang, Mi Zhang, Xiaohan Zhang, Yun Xiong, Xiaoyu You, Min Yang

机构 * Fudan University(复旦大学) East China University of Science and Technology(华东理工大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究文本到图像扩散变换器中刻板印象偏差问题,通过机理分析找到偏差根源,提出FairFlow框架,能有效中和刻板印象偏差,实现公平与保真平衡,且推理开销小、对复杂提示鲁棒。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04030 2026-08-06 cs.GR cs.AI cs.CV cs.CY cs.LG 新提交 89%

NuclearDiffusion: Text-to-Image Foundation Models for Learning Nuclear Energy Concepts

NuclearDiffusion:用于学习核能概念的文生成像基础模型

Mohammed I. Radaideh, Jeremy Moon, Andre Gala-Garza, Emma Son, Yug Shah, Majdi I. Radaideh

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);image generation(abstract);image synthesis(abstract)

AI总结 本研究通过微调开源扩散模型构建核能文生成像模型,发现微调效果依赖生成架构,且微调后开源模型在专业核能图像生成上优于主流商业系统,证实领域特定微调是开发可信领域生成式AI的可行路径。

Comments 29 pages, 10 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15341 2026-08-18 cs.CV 新提交 89%

TEA: Text Encoder Alignment for Robust Concept Erasure in Text-to-Image Models

TEA:用于文本到图像模型中稳健概念擦除的文本编码器对齐

Alireza Dehghanpour Farashah, Zhuan Shi, Negar Rostamzadeh, Golnoosh Farnadi

机构 * Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) McGill University(麦吉尔大学) Google Research(谷歌研究院)

专题命中 扩散模型 :diffusion(summary_cn,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 该研究提出轻量级文本编码器对齐框架 TEA,将概念擦除建模为文本表示空间的域对齐问题,仅微调文本编码器,在零推理开销下提升了文本到图像模型对对抗攻击的概念擦除稳健性,且模型无关,在 Stable Diffusion 系列模型上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03284 2026-08-05 cs.CV cs.AI 新提交 89%

Test-Time Scaling for Safe Text-Guided Image Generation via Intermediate Clean Estimates

通过中间干净图像估计实现安全文本引导图像生成的测试时缩放

Jinya Sakurai, Shueicheng Yan, Xun Xu

专题命中 扩散模型 :diffusion(summary_cn,abstract);image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 该研究针对文本到图像扩散模型的安全问题,提出利用中间干净图像估计和稀疏边际目标的测试时缩放方法,在 Stable Diffusion 上实现了更优的安全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏