arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1887 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 112 篇

2605.03065 2026-06-29 cs.LG cs.RO 版本更新 50%

OGPO: Sample Efficient Full-Finetuning of Generative Control Policies

OGPO:生成控制策略的样本高效全微调

Sarvesh Patil, Mitsuhiko Nakamoto, Manan Agarwal, Shashwat Saxena, Jesse Zhang, Giri Anantharaman, Cleah Winston, Chaoyi Pan, Douglas Chen, Nai-Chieh Huang, Zeynep Temel, Oliver Kroemer, Sergey Levine, Abhishek Gupta, Hongkai Dai, Paarth Shah, Max Simchowitz

机构 * University of California, Berkeley(加州大学伯克利分校) UC Berkeley(加州大学伯克利分校)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出OGPO算法,通过离策略评论网络和修改的PPO目标,实现生成控制策略的样本高效微调,在多种操作任务上达到最优性能,并能在无专家数据下微调不良初始化的行为克隆策略。

Comments Website: https://simchowitzlabpublic.github.io/ogpo-site/ Code: https://github.com/simchowitzlabpublic/OGPO_public

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18969 2026-06-26 math.OC 版本更新 50%

A Local Discontinuous Galerkin Method for Dirichlet Boundary Control Problems

Dirichlet边界控制问题的局部间断Galerkin方法

Peter Benner, Michael Hinze, Hamdullah Yücel

专题命中 可控生成 :diffusion(abstract)

AI总结 针对二维凸多边形域上对流扩散方程的L^2-Dirichlet边界控制问题,采用局部间断Galerkin方法离散,推导了全离散和变分离散控制逼近的先验误差估计,数值实验验证了方法性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23527 2026-06-26 cs.LG 版本更新 50%

Normalizing Flows are Capable Models for Continuous Control

归一化流是连续控制的有效模型

Raj Ghugare, Benjamin Eysenbach

机构 * Department of Computer Science(计算机科学系)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出一种归一化流架构,可无缝集成到强化学习算法中作为策略、Q函数和占用度量,在模仿学习、离线、目标条件和无监督RL中取得更高性能。

Comments Project page with code - https://rajghugare19.github.io/nf4rl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20906 2026-06-23 cs.RO cs.AI 版本更新 50%

DASIP: Dynamic Test-Time Compute Scaling for Robot Control with Stochastic Interpolant Policies

DASIP:基于随机插值策略的机器人控制动态测试时计算缩放

Inkook Chun, Seungjae Lee, Michael S. Albergo, Saining Xie, Eric Vanden-Eijnden

机构 * New York University(纽约大学) University of Maryland(马里兰大学) Harvard University(哈佛大学) Capital Fund Management(资本基金管理公司)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出难度感知随机插值策略(DA-SIP),通过难度分类器动态调整推理步数、求解器和ODE/SDE积分,在保持任务成功率的同时将计算时间减少2.6-4.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02647 2026-06-23 math.OC cs.MS cs.NA math.NA 版本更新 50%

Multilevel Stochastic Gradient Descent for Optimal Control Under Uncertainty

不确定性下最优控制的多层随机梯度下降法

Niklas Baumgarten, David Schneiderhan

专题命中 可控生成 :diffusion(abstract)

AI总结 提出一种多层随机梯度下降法,用于求解受不确定输入数据影响的偏微分方程最优控制问题,通过并行多层蒙特卡洛估计随机梯度,实现线性收敛并显著优于标准随机梯度下降法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05107 2026-06-18 cs.AI 版本更新 50%

Structured Cognitive Loop for Behavioral Intelligence in Large Language Model Agents (Extended Revision: From Behavioral Architecture to Epistemic Accountability)

大型语言模型代理中行为智能的结构化认知循环(扩展修订:从行为架构到认知问责)

Myung Ho Kim

机构 * JEI University(JEI大学)

专题命中 可控生成 :image generation(abstract)

AI总结 提出结构化认知循环(SCL)架构,通过分离认知、记忆、控制和行动模块,实现LLM代理的可问责行为,在360个任务中成功率86.3%,优于基线方法。

Comments This revised version extends the original SCL framework from a behavioral architecture for reliable LLM agents into a broader architecture of epistemic accountability, integrating context-aware Human-in-the-Loop control, Pool-Gated Retrieval, and the Horizon-Warrant-Commitment structure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00924 2026-06-16 cs.LG cs.AI 版本更新 50%

StyleShield: Exposing the Fragility of AIGC Detectors through Continuous Controllable Style Transfer

StyleShield: 通过连续可控风格迁移揭示AIGC检测器的脆弱性

Guantian Zheng

机构 * National University of Singapore(新加坡国立大学)

专题命中 可控生成 :image synthesis(abstract)

AI总结 提出StyleShield,一种基于流匹配的条件文本风格迁移框架,通过连续控制风格迁移强度,在保持语义相似度的同时实现高规避率,并引入RateAudit算法质疑基于分数的检测可靠性。

Comments 12 pages, 5 figures. Code and model weights will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21391 2026-06-16 cs.RO cs.AI 版本更新 50%

From Noise to Intent: Anchoring Generative VLA Policies with Residual Bridges

从噪声到意图:基于残差桥的生成式VLA策略锚定

Yiming Zhong, Yaoyu He, Zemin Yang, Pengfei Tian, Yifan Huang, Qingqiu Huang, Xinge Zhu, Yuexin Ma

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出ResVLA架构,通过频谱分析将机器人控制解耦为确定性低频锚点和随机高频残差,利用残差扩散桥聚焦局部动态精化,实现高效表示与强条件对齐。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17152 2026-06-12 physics.app-ph nlin.CD physics.comp-ph 版本更新 50%

Criticality of a Stochastic Dense Associative Memory Model with Exponential Interaction Function

具有指数交互函数的随机稠密联想记忆模型的临界性

Marco Cafiso, Paolo Paradisi

专题命中 可控生成 :diffusion(abstract)

AI总结 研究随机指数稠密联想记忆模型在MNIST数据上的动力学,发现噪声诱导的相变,临界噪声水平随负载增加而降低,临界状态下呈现长时间相关动力学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.07269 2026-06-11 math.AP 版本更新 50%

Hamilton-Jacobi-Bellman Equations in Random Geometries: Homogenization on Continuum Percolation Clusters

连续渗流簇上的Hamilton-Jacobi-Bellman方程的随机均匀化

Rodrigo Bazaes, Alexander Mielke, Chiranjib Mukherjee

专题命中 可控生成 :diffusion(abstract)

AI总结 研究连续渗流簇上退化随机Hamilton-Jacobi-Bellman方程的均匀化性质,利用Hamiltonian的强制性和相对熵结构,结合连续渗流随机几何,证明了几乎必然的均匀化结果。

Comments Completely revised manuscript, some earlier assumptions corrected; the revised assumptions are now sharp and apply to a substantially broader class of models, large parts of the proofs have been rewritten and are new

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26078 2026-06-09 cs.LG 版本更新 50%

Global Convergence of Wasserstein Policy Gradient for Entropy-Regularized Reinforcement Learning

Wasserstein策略梯度在熵正则化强化学习中的全局收敛性

Zhaoyu Zhu, Rui Gao, Shuang Li

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 可控生成 :diffusion(abstract)

AI总结 本文通过利用熵正则化强化学习的Bellman结构,证明了Wasserstein策略梯度(WPG)方法的全局收敛性,并建立了分布Polyak-Łojasiewicz条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15354 2026-06-08 cs.LG 版本更新 50%

Controllable Molecular Generative Foundation Models

可控分子生成基础模型

Yihan Zhu, Yuhan Liu, Weijiang Li, Tengfei Luo, Meng Jiang

机构 * University of Notre Dame(诺丁汉大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出CoMole,一种基于基团感知图扩散的统一框架,结合强化学习优化条件反向策略,在材料与药物设计的九个目标上均实现最优可控性,MAE最高降低48.2%,且无需规则修正。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 36 篇

2511.20722 2026-07-31 cs.CV cs.AI 版本更新 86%

DinoLizer: Separating VAE and Diffusion Artifacts in Generative Inpainting Localization

DinoLizer: 从最佳中学习以实现生成修复的定位

Minh Thong Doi, Vincent Itier, Jan Butora, Jérémie Boulanger, Patrick Bas

专题命中 图像修复 :inpainting(title,abstract);diffusion(title);分类 cs.CV

AI总结 DinoLizer基于DINOv2改进生成修复中的篡改定位,通过滑动窗口和后处理提升鲁棒性,实现更高的IoU性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15368 2026-07-22 cs.CV eess.IV 版本更新 83%

Aligned Stable Inpainting: Mitigating Unwanted Object Insertion and Preserving Color Consistency

对齐稳定修复:缓解不需要的对象插入并保持颜色一致性

Yikai Wang, Junqiu Yu, Chenjie Cao, Xiangyang Xue, Yanwei Fu

机构 * Nanyang Technological University(南洋理工大学) Tencent Hunyuan3D(腾讯 Hunyuan3D) Fudan University(复旦大学) Fudan ISTBI–ZJNU Algorithm Centre for Brain-Inspired Intelligence(复旦大学 ISTBI–浙师大脑启发式智能算法中心) Zhejiang Normal University(浙江师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出ASUKA框架,通过重建先验和专有VAE解码器解决生成修复中的对象插入和颜色不一致问题,提升修复图像的质量和一致性。

Comments Update: more exps and analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19985 2026-07-02 cs.CV 版本更新 83%

SONIC: Spectral Optimization of Noise for Inpainting with Consistency

SONIC: 用于一致性修复的噪声谱优化

Seungyeon Baek, Erqun Dong, Shadan Namazifard, Mark J. Matthews, Kwang Moo Yi

机构 * University of British Columbia(不列颠哥伦比亚大学) Google DeepMind(谷歌DeepMind)

专题命中 图像修复 :inpainting(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出一种无需训练的修复方法,通过谱域优化初始噪声样本,使通用文本到图像模型适用于修复任务,在少量优化步骤后超越现有技术。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00176 2026-06-18 cs.CV cs.AI 版本更新 83%

Posterior Continuation with Noise-Conditioned Frequency Exposure for Diffusion Inverse Problems

基于噪声条件频率暴露的扩散逆问题后验延续

Feng Tian, Yixuan Li, Weili Zeng, Weitian Zhang, Yichao Yan, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 图像修复 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 提出后验延续框架,根据扩散噪声水平逐步暴露测量频率,结合稳定采样器实现超分辨率、修复和去模糊的先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06158 2026-08-25 cs.CV 版本更新 79%

Adaptive Tokenisation Via Temporal Redundancy Masking And Latent Inpainting

通过时间冗余掩码和潜在修复的自适应分词

Kevin Dave, Sai Aditya Patkuri, Chhaya Kumar Das, Gouranga Bala, Rajeshkumar SA, R. Venkatesh Babu

机构 * Phronetic AI IISc Bangalore IIT Bombay

专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV

AI总结 提出一种无参数的自适应视频分词机制,利用冻结连续分词器的潜在空间中的时间冗余,通过阈值丢弃冗余位置,并使用轻量级潜在修复变压器重建,实现内容驱动的令牌分配和高效推理。

Comments Accepted at BMVC 2026. Project page: https://apatkuri.github.io/adaptive-tokenisation-bmvc-2026/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24136 2026-08-25 cs.CV eess.IV 版本更新 79%

Bridging Restoration and Generation in One-step Diffusion for Real-World Image Super-Resolution

连接恢复与生成流形的单步扩散在现实世界超分辨率中的应用

Shyang-En Weng, Yi-Cheng Liao, Yu-Syuan Xu, Chia-Hung Yuan, Wei-Chen Chiu, Ching-Chun Huang

机构 * National Yang Ming Chiao Tung University, Hsinchu, Taiwan MediaTek Inc., Taiwan

专题命中 图像修复 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出IDaS-SR框架,通过Manifold Inversion Noise Estimator和CHARIOT机制,解决单步扩散中恢复与生成流形的匹配问题,提升现实世界超分辨率的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25042 2026-06-29 cs.CV 版本更新 79%

Unbiased Diffusion Variational Inversion via Principled Posterior Matching

无偏扩散变分反演:基于原则性后验匹配

Weimin Bai, Yuxuan Gu, Yifei Wang, Weijian Luo, He Sun

机构 * Peking University(北京大学)

专题命中 图像修复 :diffusion(title);inpainting(abstract);分类 cs.CV

AI总结 提出原则性后验匹配(PPM)框架,通过精确优化KL散度(利用Fisher散度积分)解决逆问题中模式坍塌和不确定性量化不可靠的问题,统一变分推理和摊销推理,在图像修复、超分辨荧光显微和射电干涉成像中实现高保真重建和校准的不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18535 2026-08-24 eess.AS cs.SD 版本更新 78%

Audio Inpainting in Time-Frequency Domain with Phase-Aware Prior

时频域中具有相位意识先验的音频修补

Peter Balušík, Pavel Rajmic

专题命中 图像修复 :inpainting(title,abstract)

AI总结 本文提出了一种基于相位意识先验的时频域音频修补方法,通过优化算法提升重建质量并降低计算成本,优于现有深度神经网络和自回归方法。

Comments submitted to IEEE for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08832 2026-08-17 cs.LG physics.flu-dyn 版本更新 78%

Inpainting physics: self-supervised learning for context-driven fluid simulation

物理修复:用于上下文驱动流体模拟的自监督学习

Jonas Weidner, Yeray Martin-Ruisanchez, Daniel Rueckert, Benedikt Wiestler, Julian Suk

机构 * AI for Image-Guided Diagnosis and Therapy, Technical University of Munich(图像引导诊断与治疗人工智能,慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) AI in Healthcare and Medicine, Technical University of Munich(医疗人工智能,慕尼黑技术大学) Imperial College London(伦敦帝国学院)

专题命中 图像修复 :inpainting(title,abstract)

AI总结 提出将稳态CFD推理重构为修复问题,通过自监督学习速度场先验并在推理时施加边界约束,利用局部邻域分词器处理大规模3D网格,在颅内动脉瘤血流动力学中优于监督代理模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13309 2026-08-13 cs.RO 版本更新 78%

Utilizing Inpainting for Keypoint Detection for Vision-Based Control of Robotic Manipulators

利用图像修复进行基于视觉的机械臂运动控制的关键点检测

Sreejani Chatterjee, Venkatesh Mullur, Abhinav Gandhi, Berk Calli

机构 * Worcester Polytechnic Institute(沃斯彻斯特理工学院)

专题命中 图像修复 :inpainting(title,abstract)

AI总结 本文提出一种新的视觉伺服框架,通过纯自然视觉特征控制机械臂的配置空间。通过图像修复生成无标记的机械臂图像,训练关键点检测算法以实现基于自然特征的控制,无需依赖相机校准或机器人模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08594 2026-08-12 cs.AI 版本更新 78%

SDDBMs: Soft Denoising Diffusion Bridge Models

SDDBMs:软去噪扩散桥模型

Shiyi Qi, Kun He, Mingmou Liu

机构 * Nanjing University(南京大学) Renmin University of China(中国人民大学)

专题命中 图像修复 :diffusion(title,abstract)

AI总结 本文提出SDDBMs,一种正则化扩散桥的通用框架,以非退化高斯终端边际替代硬端点约束,涵盖现有多种扩散桥模型,图像修复实验显示其数值稳定性与生成质量更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05672 2026-07-07 cs.CV cs.AI cs.LG 版本更新 70%

InverseCrafter: Efficient Video ReCapture as a Latent Domain Inverse Problem

InverseCrafter:作为潜在域逆问题的高效视频重新捕捉

Yeobin Hong, Suhyeon Lee, Hyungjin Chung, Jong Chul Ye

机构 * Graduate School of AI, KAIST, South Korea(韩国釜山国立大学人工智能研究生院) EverEx, South Korea(韩国EverEx公司) Korea University, South Korea(韩国国立庆熙大学)

专题命中 图像修复 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出InverseCrafter框架,将新视角视频生成转化为潜在空间基于图像修复的逆问题,通过轻量级潜在掩码编码器建立算子等价,无需标注4D训练数据,实现高效合成与编辑。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01779 2026-06-12 eess.IV cs.CV cs.LG stat.ML 版本更新 70%

Plug-and-Play image restoration with Stochastic deNOising REgularization

即插即用图像恢复:随机去噪正则化

Marien Renaud, Jean Prost, Arthur Leclaire, Nicolas Papadakis

专题命中 图像修复 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出SNORE框架,仅在适当噪声水平图像上应用去噪器,结合随机正则化与梯度下降求解逆问题,在去模糊和修复任务上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22924 2026-08-19 cs.CV 版本更新 57%

Layering Virtual Try-On

分层虚拟试穿

Chun Feng, Bowei Chen, Mengyi Shan, Ira Kemelmacher-Shlizerman

机构 * University of Washington(华盛顿大学)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 研究针对现实中服装分层搭配的虚拟试穿难题,提出LVTON方法。先通过自动数据生成管道训练获取一般VTON先验知识,再在专用数据集微调学习分层逻辑,在LVTON基准及传统VTON基准上取得优异成果,展现零样本能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15158 2026-08-17 cs.CV 版本更新 57%

RefGC-SR$^2$: Reference-guided Super-Resolution and Refinement of AI Generated Content

RefGC-SR$^2$: 参考引导的生成内容超分辨率与精炼

Jeahun Sung, Dahyeon Kye, Soo Ye Kim, Jihyong Oh

机构 * CMLab, Chung-Ang University(Chung-Ang 大学 CMLab) Adobe Research(Adobe 研究院)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 针对生成管道中参考图像下采样导致细节丢失和伪影问题,提出RefGC-SR$^2$任务,利用原始高分辨率参考图像同时恢复细节、精炼伪影并提升分辨率,构建首个真实三元组数据生成管道并设计频率感知扩散Transformer模型。

Comments The first two authors contributed equally to this work. The last two authors are co-corresponding authors. Please visit our project page at https://cmlab-korea.github.io/RefGC-SR2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03391 2026-08-17 eess.IV cs.CV 版本更新 57%

Edit2Restore:Few-Shot Image Restoration via Parameter-Efficient Adaptation of Pre-trained Editing Models

Edit2Restore:通过参数高效适应预训练编辑模型实现少样本图像修复

Mustafa Akın Yılmaz, Ahmet Bilican, Burak Can Biner, Ahmet Murat Tekalp

机构 * Codeway AI Koc University(科克大学)

专题命中 图像修复 :image editing(abstract);分类 cs.CV

AI总结 Edit2Restore通过参数高效微调预训练编辑模型,在少样本条件下实现多种图像修复任务,提升感知质量并减少数据需求。

Comments Accepted to the LoViF Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04568 2026-08-11 cs.CV 版本更新 57%

Mask-aware inference with State-Space Models

具有掩码意识的State-Space模型推理

Ignasi Mas, Ramon Morros, Javier-Ruiz Hidalgo, Ivan Huerta

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 本文提出Partial Vision Mamba(PVM)架构,用于处理具有任意形状无效数据的State-Space模型推理任务,展示了其在深度补全、图像修复和分类中的有效性。

Comments Some results contain significant errors and we are working in a rework on this paper, which is now outdated

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14990 2026-08-04 cs.CV 版本更新 57%

JADE-GS: Joint Allocation of Deblurring Evidence for Event-Assisted 3D Gaussian Splatting

JADE-GS:3D高斯点云渲染中基于事件引导的联合交替去模糊

Haoyu Fu, Jiafeng Huang, Yuchen Wang, Shengjie Zhao

机构 * School of Mechatronic Engineering and Automation, Shanghai University(上海大学机电工程与自动化学院) Shanghai Baoshan Shangda General Intelligent Robotics Research Institute(上海宝山尚大通用智能机器人研究院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 研究相机快速移动曝光时模糊问题,提出JADE-GS方法,通过像素自适应路由门融合互补先验,2D恢复器与3D高斯点云渲染双向循环耦合,正则化恢复器,在合成和真实基准测试中获最佳感知质量,训练高效且保留实时渲染。

详情

展开后加载摘要…

URL PDF HTML 收藏