arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1802 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 56 篇

2506.13770 2026-07-07 cs.CV 版本更新 57%

CDST: Color Disentangled Style Transfer for Universal Style Reference Customization

CDST:用于通用风格参考定制的颜色解缠风格迁移

Shiwen Zhang, Zhuowei Chen, Lang Chen, Yanze Wu

机构 * ByteDance(字节跳动)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 介绍CDST这种新颖高效的双流风格迁移训练范式,能分离颜色与风格,推理时免调参实现通用风格迁移,首次免调参解决带风格和内容参考的特征保留风格迁移问题,实验证明效果达最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.13771 2026-07-07 cs.CV 版本更新 57%

AppAgent: Multimodal Agents as Smartphone Users

AppAgent:作为智能手机用户的多模态智能体

Chi Zhang, Zhao Yang, Jiaxuan Liu, Yanda Li, Yucheng Han, Xin Chen, Zebiao Huang, Bin Fu, Gang Yu

机构 * Tencent(腾讯)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 介绍基于大语言模型的多模态智能体框架,通过简化动作空间操作智能手机应用,无需系统后端访问,经自主探索或观察人类示范学习,能执行复杂任务,测试验证其处理多种高级任务的能力。

Comments Accepted to CHI 2025, project page is https://appagent-official.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05778 2026-07-03 cs.CV 版本更新 57%

Beyond Absolute Scores: Relative Edit-induced Difference for Generalizable Image Aesthetic Assessment

超越绝对分数:基于编辑诱导差异的通用图像美学评估

Qifei Jia, Xintong Yao, Yasen Zhang, Minghao Li, Yajie Chai, Qiming Lu, Baoyue Shen, Runyu Shi, Ying Huang, Yue Zhang

机构 * Xiaomi Corporation, Beijing, China(小米公司,北京,中国)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出RED-Aes框架,利用可控图像编辑模型模拟人类审美推理,通过相对编辑诱导差异学习通用美学原则,实现跨场景泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01521 2026-07-03 cs.CV 版本更新 57%

MiraGe: Editable 2D Images using Gaussian Splatting

MiraGe: 使用高斯溅射的可编辑2D图像

Joanna Waczyńska, Tomasz Szczepanik, Piotr Borycki, Sławomir Tadeja, Thomas Bohné, Przemysław Spurek

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出MiraGe方法,利用镜面反射在3D空间中感知2D图像,并通过平面控制的高斯函数实现精确编辑,提升渲染质量并支持物理仿真修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18765 2026-07-02 cs.CV cs.AI 版本更新 57%

NI-Tex: Non-isometric Image-based Garment Texture Generation

NI-Tex: 基于非等距图像的服装纹理生成

Hui Shan, Ming Li, Haitao Yang, Kai Zheng, Sizhe Zheng, Yanwei Fu, Xiangru Huang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Fudan University(复旦大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 针对非等距图像与3D服装网格间的纹理生成问题,提出结合物理模拟数据集、非等距图像编辑和迭代烘焙的框架,生成高质量PBR纹理。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04349 2026-06-26 cs.CV cs.AI 版本更新 57%

VecSet-Edit: Unleashing Pre-trained LRM for Mesh Editing from Single Image

VecSet-Edit:利用预训练的LRM进行单图像网格编辑

Teng-Fang Hsiao, Bo-Kai Ruan, Yu-Lun Liu, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VecSet-Edit,利用VecSet LRM进行单图像网格编辑,通过Mask引导的token播种和注意力对齐的token门控策略,结合漂移感知的token修剪和细节保留的纹理烘焙模块,实现高精度网格编辑。

Comments Accepted by SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21542 2026-06-19 cs.CV cs.AI 版本更新 57%

Bi-Anchor Interpolation Solver for Accelerating Generative Modeling

双锚点插值求解器加速生成建模

Hongxu Chen, Hongxiang Li, Zhen Wang, Long Chen

机构 * The Hong Kong University of Science(香港科学与技术大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出BA-solver,通过轻量SideNet(1-2%主干大小)学习双向时间感知和双锚点速度积分,在不重新训练主干的情况下,以极低训练成本实现10步内达到100+步Euler求解器质量,支持即插即用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11124 2026-08-03 cs.SD cs.AI 版本更新 50%

BeatEdit: Symbolic Music Generation as Explicit Editing

BeatEdit:作为显式编辑的符号音乐生成

Haoyu Gu, Lekai Qian, Haowu Zhou, Qi Liu, Shuai Wang

机构 * School of Future Technology South China University of Technology Guangzhou China(未来技术学院 华南理工大学 广州 中国) South China University of Technology(华南理工大学) Nanjing University(南京大学)

专题命中 图像编辑 :diffusion(abstract)

AI总结 研究针对符号音乐生成中缺乏选择性修改支持的问题,提出BeatEdit框架,基于BEAT编码,含三种互补机制,共享单一编码和预训练主干,在多项任务中精度和质量更高且高效,揭示编码设计对编辑有效性有重要影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03573 2026-06-17 cs.CE 版本更新 50%

STRIDE: Post-Training LLMs to Reason and Refine Bio-Sequences via Edit Trajectories

STRIDE: 通过编辑轨迹对生物序列进行后训练推理与优化

Daiheng Zhang, Shiyang Zhang, Sizhuang He, Yangtian Zhang, Syed Asad Rizvi, David van Dijk

专题命中 图像编辑 :diffusion(abstract)

AI总结 提出STRIDE框架,通过后训练使LLM生成可执行的插入/删除/替换轨迹,结合监督微调和策略优化实现离散生物序列的迭代优化,在蛋白质和分子编辑任务上显著提升成功率和新颖性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 1384 篇

2606.29814 2026-07-17 cs.CV 版本更新 93%

Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis

Nemotron-Labs-Diffusion-Image:推进掩码离散扩散用于高分辨率图像合成

Shufan Li, Greg Heinrich, Hanrong Ye, Yonggan Fu, Aditya Grover, Jan Kautz, Pavlo Molchanov

机构 * NVIDIA

专题命中 扩散模型 :diffusion(title,title_cn);image synthesis(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 提出Nemotron-Labs-Diffusion-Image模型,通过令牌编辑机制和分组交叉熵目标解决掩码离散扩散模型的自校正缺失和训练信号稀疏问题,实现高分辨率文本到图像合成。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08434 2026-06-09 cs.GR cs.CV 版本更新 93%

Bokeh Diffusion: Defocus Blur Control in Text-to-Image Diffusion Models

Bokeh Diffusion:文本到图像扩散模型中的散焦模糊控制

Armando Fortes, Tianyi Wei, Shangchen Zhou, Xingang Pan

机构 * S-Lab, Nanyang Technological University(S实验室,南洋理工大学)

专题命中 扩散模型 :diffusion(title,title_cn);text-to-image(title,abstract);image editing(abstract);分类 cs.CV、cs.GR

AI总结 提出Bokeh Diffusion框架,通过物理散焦模糊参数条件化扩散模型,结合混合训练流程和接地自注意力机制,实现场景一致的散景模糊控制,支持双向模糊强度调整和真实图像编辑。

Comments SIGGRAPH Asia 2025. Project page: https://atfortes.github.io/projects/bokeh-diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22216 2026-08-06 eess.IV cs.AI cs.CV 版本更新 91%

Delta-Diffusion: Modeling Longitudinal Brain Amyloid-PET Trajectories via Conditional Poisson Diffusion Bridge

Delta-Diffusion: 通过条件泊松扩散桥建模纵向脑淀粉样蛋白-PET轨迹

Yongheng Sun, Minhui Yu, Mengqi Wu, Maureen Kohi, Mingxia Liu

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 扩散模型 :diffusion(title,title_cn);image synthesis(abstract);分类 cs.CV

AI总结 提出Delta-Diffusion框架,将纵向PET合成建模为条件泊松扩散桥过程,结合扩散Transformer和物理启发的泊松扰动,在542名受试者上优于现有方法,准确捕捉淀粉样蛋白沉积的纵向变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07865 2026-06-23 cs.CV 版本更新 90%

SimAC: A Simple Anti-Customization Method for Protecting Face Privacy against Text-to-Image Synthesis of Diffusion Models

SimAC: 一种针对扩散模型文本到图像合成的简单面部隐私反定制方法

Feifei Wang, Zhentao Tan, Tianyi Wei, Yue Wu, Qidong Huang

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Cloud(阿里云)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);image synthesis(title);分类 cs.CV

AI总结 针对扩散模型定制化技术引发的隐私问题,提出SimAC方法,通过分析时间步选择与频域感知关系及去噪过程不同层特征,设计自适应贪婪搜索和特征优化框架,有效提升身份干扰,保护用户隐私。

Comments Accepted by CVPR2024. Code: https://github.com/somuchtome/SimAC

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04344 2026-07-21 cs.LG cs.AI 版本更新 89%

UnMaskFork: Test-Time Scaling for Masked Diffusion via Deterministic Action Branching

UnMaskFork:通过确定性动作分支实现Masked Diffusion的测试时扩展

Kou Misaki, Takuya Akiba

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 UnMaskFork通过确定性动作分支提升Masked Diffusion在测试时的扩展能力,优于现有方法并在复杂任务中表现优异。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01170 2026-07-14 cs.IR cs.AI 版本更新 89%

Diffusion-GR2: Diffusion Generative Reasoning Re-ranker

Diffusion-GR2: 扩散生成推理重排序器

Zhuoxuan Zhang, Kangqi Ni, Yuhang Chen, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Frank Shyu, Adam, Song, Sandeep Pandey, Luke Simon, Tianlong Chen, Xi Liu

机构 * Meta AI UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 提出Diffusion-GR2,通过转换微调、在线策略蒸馏和强化学习将自回归推理重排序器转换为块扩散模型,在保持精度的同时将推理吞吐量提升2.4-3.5倍。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23053 2026-06-23 cs.LG 版本更新 89%

Double-Diffusion: Balancing Speed, Accuracy, and Uncertainty in Probabilistic Forecasting for Urban Sensor Networks

Double-Diffusion: 城市传感器网络中概率预测的速度、准确性与不确定性的平衡

Hanlin Dong, Arian Prabowo, Hao Xue, Ao Shuang, Tianyi Zhou, Yuxuan Liang, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) University of Maryland(马里兰大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 提出Double-Diffusion方法,结合闭式图热先验与去噪扩散模型,通过短预热链从先验开始去噪,实现快速、准确且具有不确定性的概率预测,在四个真实数据集上取得最佳CRPS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24817 2026-08-10 cs.CV eess.IV 版本更新 89%

High-Fidelity Synthetic Transmission Electron Microscopy Image Generation Using Diffusion Probabilistic Models for Data-Limited Semiconductor Metrology

高保真合成透射电子显微镜图像生成:基于扩散概率模型的数据受限半导体计量

Johannes Boehm, Bappaditya Dey

机构 * Chemnitz University of Technology, Chemnitz, Germany(化学工业大学,化学矿泉,德国) Interuniversity Microelectronics Centre (imec), Leuven, Belgium(大学微电子中心(imec),卢汶,比利时)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 针对半导体计量中TEM数据稀缺问题,提出基于去噪扩散概率模型(DDPM)的合成图像生成框架,采用渐进式补丁训练策略,仅需15个样本即可从零训练,并集成数据增强、域迁移、分类器引导和修复技术,生成图像在结构相似性上达到MS-SSIM>0.98,支持缺陷检测、分割等下游任务。

Comments To be presented at the 2026 International Symposium ELMAR, published by IEEE in the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15357 2026-07-28 cs.CV cs.LG 版本更新 89%

MaskAttn-SDXL: Controllable Region-Level Text-To-Image Generation

MaskAttn-SDXL:可控区域级文本到图像生成

Yu Chang, Jiahao Chen, Anzhe Cheng, Paul Bogdan

机构 * University of Southern California(南加州大学) University of Toronto(多伦多大学)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出MaskAttn-SDXL模块,通过在softmax前注入token条件空间门控,解决扩散模型在多物体生成中的全局协调和可靠性问题,无需改变SDXL流程。

Comments Published in the 2026 International Joint Conference on Neural Networks (IJCNN 2026)

Journal ref Proceedings of the 2026 International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03499 2026-07-27 eess.IV cs.CV 版本更新 89%

GeoDiff-SAR: A Geometric Prior Guided Diffusion Model for SAR Image Generation

GeoDiff-SAR:一种基于几何先验的扩散模型用于SAR图像生成

Fan Zhang, Xuanting Wu, Fei Ma, Qiang Yin, Yuxin Hu

机构 * College of Information Science and Technology, Beijing University of Chemical Technology(信息科学与技术学院,北京化工大学) Aerospace Information Research Institute, Chinese Academy of Sciences(航天信息研究所,中国科学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title,abstract);分类 cs.CV

AI总结 GeoDiff-SAR通过引入几何先验引导扩散模型,提升SAR图像生成的保真度和分类准确性,尤其在不同方位角识别性能上有显著提升。

Comments 3 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23783 2026-08-13 cs.CV 版本更新 89%

Diffusion Probe: Generated Image Result Prediction Using CNN Probes

扩散探针:利用CNN探针进行生成图像结果预测

Benlei Cui, Bukun Huang, Zhizeng Ye, Xuemei Dong, Tuo Chen, Hui Xue, Dingkang Yang, Longtao Huang, Jingqun Tang, Haiwen Hong

机构 * Alibaba Group(阿里巴巴集团) Laboratory for Statistical Monitoring and Intelligent Governance of Common Prosperity, School of Statistics and Data Science, Zhejiang Gongshang University(浙江工商大学统计与数据科学学院共同富裕统计监测与智能治理实验室) Southeast University(东南大学) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ByteDance Inc.(字节跳动有限公司)

专题命中 扩散模型 :diffusion(title,summary_cn);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Diffusion Probe框架,通过早期扩散交叉注意力分布预测最终图像质量,提升文本生成图像的效率与质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19244 2026-07-17 cs.CV 版本更新 89%

Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation

Lavida-O:用于统一多模态理解与生成的弹性大掩码扩散模型

Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

机构 * Adobe(Adobe公司) UCLA(加州大学洛杉矶分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 研究提出Lavida-O统一多模态MDM,采用Elastic-MoT架构,结合轻量级生成与理解分支,通过多种技术支持高效生成。该模型在多模态任务基准测试中性能领先,优于现有模型,还能加速推理,成为可扩展多模态推理和生成新范式。

Comments 31 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16551 2026-07-20 cs.CV cs.AI 版本更新 88%

CompDiff: Hierarchical Compositional Diffusion for Fair and Zero-Shot Intersectional Medical Image Generation

CompDiff:分层组合扩散用于公平和零样本交叉性医学图像生成

Mahmoud Ibrahim, Bart Elen, Chang Sun, Gokhan Ertaylan, Michel Dumontier

机构 * Institute of Data Science, Faculty of Science and Engineering, Maastricht University, Maastricht, The Netherlands(数据科学研究所,科学与工程学院,马斯特里赫特大学,马斯特里赫特,荷兰) Department of Advanced Computing Sciences, Faculty of Science and Engineering, Maastricht University, Maastricht, The Netherlands(先进计算科学系,科学与工程学院,马斯特里赫特大学,马斯特里赫特,荷兰) VITO, Belgium(比利时VITO研究院)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 CompDiff通过分层组合扩散框架解决生成模型中因数据不平衡导致的公平性和零样本交叉性生成问题,在图像质量、子组公平性和零样本交叉性生成方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16167 2026-07-16 cs.CV cs.AI 版本更新 88%

PersGuard: Preventing Malicious Personalization in Text-to-Image Diffusion Models via Model Backdoors

PersGuard:通过模型后门防止文本到图像扩散模型中的恶意个性化

Xinwei Liu, Xiaojun Jia, Yuan Xun, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) BraneMatrix AI School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(中山大学深圳校区计算机科学与技术学院)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 研究针对文本到图像扩散模型个性化引发的隐私问题,提出PersGuard框架,通过在模型发布前嵌入保护后门,结合统一优化问题制定后门注入,经实验验证其在隐私保护方面优于现有基于扰动的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08303 2026-07-07 cs.CV 版本更新 88%

SnapGen++: Unleashing Diffusion Transformers for Efficient High-Fidelity Image Generation on Edge Devices

SnapGen++:释放扩散变压器以在边缘设备上进行高效高保真图像生成

Dongting Hu, Aarush Gupta, Magzhan Gabidolla, Arpit Sahni, Huseyin Coskun, Yanyu Li, Yerlan Idelbayev, Ahsan Mahmood, Aleksei Lebedev, Dishani Lahiri, Anujraaj Goyal, Ju Hu, Mingming Gong, Sergey Tulyakov, Anil Kag

机构 * Snap Inc. University of Melbourne(墨尔本大学) MBZUAI

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散变压器在边缘设备部署的高成本问题,提出高效DiT框架。通过紧凑架构、弹性训练框架和知识引导的分布匹配蒸馏,在资源受限下实现变压器级生成质量,可在多样硬件上部署。

Comments Project page: https://snap-research.github.io/snapgenplusplus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22699 2026-07-07 cs.CV 版本更新 88%

Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer

Z-Image: 一种基于单流扩散Transformer的高效图像生成基础模型

Image Team, Huanqia Cai, Sihan Cao, Ruoyi Du, Peng Gao, Aiming Hao, Steven Hoi, Zhaohui Hou, Shijie Huang, Dengyang Jiang, Yuming Jiang, Xin Jin, Liangchen Li, Zhen Li, Zhong-Yu Li, David Liu, Dongyang Liu, Qilong Wu, Feng Yu, Zechao Zhan, Chi Zhang, Shifeng Zhang, Ruikai Zhou, Shilin Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 提出Z-Image,一种6B参数的高效图像生成基础模型,采用可扩展单流扩散Transformer架构,通过优化数据基础设施和训练流程,仅用314K H800 GPU小时完成训练,性能媲美顶级商业模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00094 2026-07-02 cs.CV cs.AI 版本更新 88%

Diffusion Image Generation with Explicit Modeling of Data Manifold Geometry

显式建模数据流形几何的扩散图像生成

Duoduo Xue, Zhiyu Zhu, Junhui Hou

机构 * City University of Hong Kong(香港城市大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 提出MIND框架,通过将离散补丁标记化集成到连续扩散模型的得分函数中显式建模流形几何,结合离散标记的结构量化能力和连续扩散的并行生成灵活性,在ImageNet 256×256上显著降低FID。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14679 2026-07-02 cs.CV 版本更新 88%

Universal Image Immunization against Diffusion-based Image Editing via Semantic Injection

基于语义注入的通用图像免疫方法抵御基于扩散模型的图像编辑

Chanhui Lee, Donggyu Choi, Seunghyun Shin, Hae-Gon Jeon, Jeany Son

机构 * POSTECH(浦项科技大学) GIST(光州科学技术院) Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

AI总结 提出首个通用对抗扰动框架,通过语义注入使扩散模型误解输入图像,抑制原始内容,从而有效阻断未经授权的编辑,在通用扰动设置下优于基线,并具备黑盒迁移性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08127 2026-07-02 cs.CV cs.AI 版本更新 88%

Controllable Diffusion-Based Lesion Inpainting for Scalable Histopathology Data Augmentation

基于可控扩散的病灶修复用于可扩展的组织病理学数据增强

Mohamad Koohi-Moghadam, Mohammad-Ali Nikouei Mahani, Rex K. H. Au-Yeung, Raymond Yu O, Monalyn Marabi, Piyapharom Intarawichian, Fabian Z. X. Lean, Andrew Ferguson, Kyongtae Tyler Bae

机构 * Department of Diagnostic Radiology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院诊断放射学系) Department of Pathology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院病理学系) Department of Anatomical and Cellular Pathology, Prince of Wales Hospital, The Chinese University of Hong Kong(香港中文大学威尔斯亲王医院解剖及细胞病理学系) Department of Infectious Diseases and Public Health, Jockey Club College of Veterinary Medicine and Life Sciences, City University of Hong Kong(香港城市大学赛马会动物医学及生命科学院传染病及公共卫生学系) CityU Veterinary Diagnostic Laboratory Co., Ltd., City University of Hong Kong(香港城市大学城市大学兽医诊断实验室有限公司)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 提出PathoGen扩散模型,将病灶可控地修复到良性组织图像中,生成高保真形态,在四个数据集上优于基线,病理专家区分真假仅略高于随机(57.75%),数据增强使分割Dice提升最高0.18。

Comments 19 pages, 5 figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01959 2026-06-17 cond-mat.mtrl-sci 版本更新 88%

Score-based diffusion models for accurate crystal-structure inpainting and reconstruction of hydrogen positions

基于分数的扩散模型用于精确的晶体结构修补和氢原子位置重建

Timo Reents, Arianna Cantarella, Marnik Bercx, Pietro Bonfà, Giovanni Pizzi

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

AI总结 提出将计算机视觉中的图像修补扩散模型应用于材料科学,实现从部分信息重建晶体结构,特别是氢原子位置,成功率超97%。

Journal ref npj Comput Mater 12, 203 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23452 2026-08-12 cs.CV cs.CL 版本更新 87%

FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing

FoR-SALE:基于参考坐标系引导的LLM驱动扩散编辑中的空间调整

Tanawan Premsri, Parisa Kordjamshidi

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 FoR-SALE是SLD的扩展,通过参考坐标系引导的潜在空间操作调整图像朝向与深度,在三个空间理解基准上仅单轮校正就将SOTA T2I模型性能提升最高7.0个百分点,解决了非相机视角空间表达的生成偏差问题。

Comments Published in COLM 2026. 10 main pages, 4 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏