arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1268 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1268 篇

2606.06140 2026-06-05 cs.CR 50%

RedEdit: Agentic Red-Teaming of Image Safety Classifiers via MCTS-Guided Photo-Editing

RedEdit: 基于MCTS引导的照片编辑的图像安全分类器智能红队测试

Weilin Lin, Ziqi Lin, Zhenxing Zhou, Jianze Li, Tong Zhang, Hui Xiong, Li Liu

专题命中 图像编辑 :image editing(abstract)

AI总结 提出RedEdit,一种基于视觉语言模型提议和蒙特卡洛树搜索规划的黑盒红队代理,通过组合编辑工具序列使不安全图像逃避检测,平均不到两次编辑即可使76.2%的不安全图像绕过分类器,同时保留93.0%的恶意语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24735 2026-05-26 cs.CY 50%

Dual-Use AI Face Swap Apps Are Mostly Unsafe: A Systematic Safety Audit

双用途AI换脸应用大多不安全:系统性安全审计

Alaa Daffalla, Sarah Chao, Eric Zeng

专题命中 图像编辑 :image editing(abstract)

AI总结 本研究系统审计了iOS和Android平台上的420款AI换脸应用,发现70%缺乏防止生成裸体图像的技术保障,且多数应用的服务条款未禁止此类滥用,建议平台和立法者强制要求安全过滤措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11368 2026-05-13 cs.LG cs.AI q-bio.GN 50%

LPDP: Inference-Time Reward Control for Variable-Length DNA Generation with Edit Flows

LPDP:用于可变长度DNA生成的推理时间奖励控制

Jeongchan Kim, Yunkyung Ko, Jong Chul Ye

机构 * KAIST AI(韩国釜山科学技术院人工智能实验室)

专题命中 图像编辑 :inpainting(abstract)

AI总结 本文提出LPDP,一种无需训练的局部重解算子,用于可变长度DNA编辑动作生成。通过局部离散程序聚焦于连贯的替换、插入和删除子图,并利用硬Max或软LSE备份聚合局部延续,用于增强子优化和外显子内含子外显子修复。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24104 2026-04-28 cs.CL 50%

Factual and Edit-Sensitive Graph-to-Sequence Generation via Graph-Aware Adaptive Noising

通过图感知自适应噪声生成事实和编辑敏感的图到序列生成

Aditya Hemant Shahane, Anuj Kumar Sirohi, Tanmoy Chakraborty, Prathosh A P, Sandeep Kumar

机构 * Department of Electrical Engineering, Indian Institute of Technology Delhi, New Delhi, India(印度理工学院德里分校电子工程系) Indian Institute of Science, Bengaluru, India(印度科学研究所,班加罗尔,印度)

专题命中 图像编辑 :diffusion(abstract)

AI总结 本文提出DLM4G框架,通过自适应噪声策略提升图到序列生成的事实性和编辑敏感性,在多个数据集上优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11703 2026-04-09 cs.LG 50%

EvoFlows: Evolutionary Edit-Based Flow-Matching for Protein Engineering

EvoFlows:基于进化编辑的蛋白质工程流匹配

Nicolas Deutschmann, Constance Ferragu, Jonathan D. Ziegler, Shayan Aziznejad, Eli Bixby

机构 * Cradle Zürich, CH(Cradle 苏黎世,瑞士)

专题命中 图像编辑 :diffusion(abstract)

AI总结 EvoFlows通过编辑流学习蛋白质序列间的突变轨迹,实现可控的插入、删除和替换操作,生成与自然蛋白家族一致的变异体,优于现有方法。

Comments Accepted at Workshop on Foundation Models for Science: Real-World Impact and Science-First Design, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07990 2026-03-25 cs.LG 50%

MJ1: Multimodal Judgment via Grounded Verification

MJ1: 通过 grounded 验证实现多模态判断

Bhavesh Kumar, Dylan Feng, Leonard Tang

机构 * Haize Labs(哈泽实验室)

专题命中 图像编辑 :image editing(abstract)

AI总结 MJ1 通过结构化 grounded 验证链和反事实一致性奖励提升多模态判断准确性,训练后在 MMRB2 数据集上达到 77.0% 准确率,超越更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07148 2026-03-10 cs.LG 50%

Agentic Planning with Reasoning for Image Styling via Offline RL

基于推理的图像风格化代理规划 via 离线强化学习

Subhojyoti Mukherjee, Stefano Petrangeli, Branislav Kveton, Trung Bui, Franck Dernoncourt, Arko Mukherjee

机构 * Adobe Research(Adobe研究)

专题命中 图像编辑 :image editing(abstract)

AI总结 本文提出基于推理的代理规划框架,通过结构化规划和工具链提升图像风格化效果,采用合成数据生成和离线强化学习方法,验证在视觉质量和指令遵循上的优越性。

Comments 85 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08570 2026-02-23 cs.LG 50%

Who Said Neural Networks Aren't Linear?

谁说神经网络不是线性的?

Nimrod Berman, Assaf Hallak, Assaf Shocher

专题命中 图像编辑 :diffusion(abstract)

AI总结 本文提出线性化器架构,通过结构运输概念使神经网络在特定向量空间中表现为线性算子,从而应用线性代数工具处理非线性映射,并展示其在扩散模型和风格迁移中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06050 2026-02-05 cs.LG 50%

Edit-Based Flow Matching for Temporal Point Processes

基于编辑的流匹配用于时间点过程

David Lüdke, Marten Lienen, Marcel Kollovieh, Stephan Günnemann

机构 * School of Computation, Information and Technology & Munich Data Science Institute(计算、信息与技术学院及慕尼黑数据科学研究所)

专题命中 图像编辑 :diffusion(abstract)

AI总结 本文提出了一种基于编辑操作的流匹配方法,用于改进时间点过程的建模,通过连续时间马尔可夫链框架学习瞬时编辑率,提升生成效率和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01206 2026-02-03 cs.AI 50%

Addressing Explainability of Generative AI using SMILE (Statistical Model-agnostic Interpretability with Local Explanations)

通过SMILE(统计模型无关可解释性与局部解释)解决生成AI的可解释性问题

Zeinab Dehghani

机构 * School of Computer Science(计算机科学学院) University of Hull(赫尔大学)

专题命中 图像编辑 :image editing(abstract)

AI总结 gSMILE通过受控扰动、Wasserstein距离和加权替代模型,提升生成AI的可解释性,实现细粒度归因和直观热图生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22408 2026-02-02 q-bio.BM cs.LG 50%

Minimal-Action Discrete Schrödinger Bridge Matching for Peptide Sequence Design

最小作用离散薛定谔桥匹配用于肽序列设计

Shrey Goel, Pranam Chatterjee

机构 * Duke University(杜克大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 图像编辑 :diffusion(abstract)

AI总结 本文提出MadSBM框架,通过最小作用离散薛定谔桥匹配方法,实现肽序列设计的高效生成与优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12174 2025-11-18 cs.LG 50%

TSGDiff: Rethinking Synthetic Time Series Generation from a Pure Graph Perspective

Lifeng Shen, Xuyang Li, Lele Long

专题命中 图像编辑 :diffusion(abstract)

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07627 2025-10-09 cs.CE q-bio.BM 50%

LSMTCR: A Scalable Multi-Architecture Model for Epitope-Specific T Cell Receptor de novo Design

Ruihao Zhang, Xiao Liu

专题命中 图像编辑 :diffusion(abstract)

Comments 13 main pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04738 2025-10-07 cs.SD cs.AI cs.CL cs.LG eess.AS 50%

Speak, Edit, Repeat: High-Fidelity Voice Editing and Zero-Shot TTS with Cross-Attentive Mamba

Baher Mohammad, Magauiya Zhussip, Stamatios Lefkimmiatis

机构 * MTS AI(MTS人工智能公司) ITMO University(ITMO大学)

专题命中 图像编辑 :diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02109 2025-09-30 cs.LG math.PR stat.ML 50%

Differentiable Expectation-Maximisation and Applications to Gaussian Mixture Model Optimal Transport

Samuel Boïté, Eloi Tanguy, Julie Delon, Agnès Desolneux, Rémi Flamary

机构 * Université Paris Cité, CNRS, MAP5(巴黎大学、国家科学研究中心、MAP5) CNRS(国家科学研究中心) ENS Paris-Saclay(巴黎-萨克雷大学) ECOLE POLYTECHNIQUE(巴黎高等理工学院) Institut Polytechnique de Paris(巴黎理工学院)

专题命中 图像编辑 :image generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01456 2025-07-03 math.GN 50%

QC-OT: Optimal Transport with Quasiconformal Mapping

Yuping Lv, Qi Zhao, Xuebin Chang, Wei Zeng

专题命中 图像编辑 :image editing(abstract)

Comments 24 pages,18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03477 2025-04-22 cs.HC 50%

CrowdGenUI: Aligning LLM-Based UI Generation with Crowdsourced User Preferences

Yimeng Liu, Misha Sra, Chang Xiao

专题命中 图像编辑 :image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03992 2025-03-20 eess.IV 50%

Medical Image Fusion for High-Level Analysis: A Mutual Enhancement Framework for Unaligned PAT and MRI

Yutian Zhong, Jinchuan He, Zhichao Liang, Shuangyang Zhang, Qianjin Feng, Lijun Lu, Li Qi

专题命中 图像编辑 :image generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17410 2025-01-31 cs.HC 50%

Copying style, Extracting value: Illustrators' Perception of AI Style Transfer and its Impact on Creative Labor

Julien Porquet, Sitong Wang, Lydia B. Chilton

专题命中 图像编辑 :text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11233 2025-01-22 cs.IR cs.CL cs.MA 50%

PlotEdit: Natural Language-Driven Accessible Chart Editing in PDFs via Multimodal LLM Agents

Kanika Goswami, Puneet Mathur, Ryan Rossi, Franck Dernoncourt

专题命中 图像编辑 :image editing(abstract)

Comments Accepted at ECIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11908 2024-10-17 cs.HC cs.AI 50%

ChatHouseDiffusion: Prompt-Guided Generation and Editing of Floor Plans

Sizhong Qin, Chengyu He, Qiaoyun Chen, Sen Yang, Wenjie Liao, Yi Gu, Xinzheng Lu

专题命中 图像编辑 :diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01971 2024-10-04 cs.RO cs.LG 50%

Run-time Observation Interventions Make Vision-Language-Action Models More Visually Robust

Asher J. Hancock, Allen Z. Ren, Anirudha Majumdar

专题命中 图像编辑 :image editing(abstract)

Comments Website: https://aasherh.github.io/byovla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06082 2024-09-17 cs.HC 50%

MemoVis: A GenAI-Powered Tool for Creating Companion Reference Images for 3D Design Feedback

Chen Chen, Cuong Nguyen, Thibault Groueix, Vladimir G. Kim, Nadir Weibel

专题命中 图像编辑 :image editing(abstract)

Comments In the Journal of ACM Transactions on Computer-Human Interaction

Journal ref ACM Transactions on Computer-Human Interaction, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14170 2024-08-27 eess.IV 50%

Image Provenance Analysis via Graph Encoding with Vision Transformer

Keyang Zhang, Chenqi Kong, Shiqi Wang, Anderson Rocha, Haoliang Li

专题命中 图像编辑 :image editing(abstract)

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16732 2024-08-06 cs.SE cs.AI 50%

PyBench: Evaluating LLM Agent on various real-world coding tasks

Yaolun Zhang, Yinxu Pan, Yudong Wang, Jie Cai

专题命中 图像编辑 :image editing(abstract)

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02247 2023-11-07 cs.LG 50%

PRISM: Progressive Restoration for Scene Graph-based Image Manipulation

Pavel Jahoda, Azade Farshad, Yousef Yeganeh, Ehsan Adeli, Nassir Navab

专题命中 图像编辑 :image generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.02953 2023-04-11 eess.IV 50%

Using Decoupled Features for Photo-realistic Style Transfer

Trevor D. Canham, Adrián Martín, Marcelo Bertalmío, Javier Portilla

专题命中 图像编辑 :diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.00079 2023-02-02 cs.HC cs.LG 50%

GANravel: User-Driven Direction Disentanglement in Generative Adversarial Networks

Noyan Evirgen, Xiang 'Anthony' Chen

专题命中 图像编辑 :image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.09164 2022-08-17 cs.LG cs.AI 50%

High Fidelity Visualization of What Your Self-Supervised Representation Knows About

Florian Bordes, Randall Balestriero, Pascal Vincent

专题命中 图像编辑 :diffusion(abstract)

Comments Accepted at TMLR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.08320 2022-08-16 cs.HC cs.AI cs.LG 50%

GANzilla: User-Driven Direction Discovery in Generative Adversarial Networks

Noyan Evirgen, Xiang 'Anthony' Chen

专题命中 图像编辑 :image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏