arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 107 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 107 篇

2603.24589 2026-07-07 eess.AS cs.SD 版本更新 50%

YingMusic-Singer: Controllable Singing Voice Synthesis with Flexible Lyric Manipulation and Annotation-free Melody Guidance

YingMusic-Singer-Plus: 可控歌唱语音合成与灵活歌词操控及无标注旋律引导

Chunbo Hao, Junjie Zheng, Guobin Ma, Yuepeng Jiang, Huakang Chen, Wenjie Tian, Gongyu Chen, Zihao Chen, Lei Xie

机构 * AI Lab, GiantNetwork(巨人网络AI实验室)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出YingMusic-Singer-Plus,一种基于扩散模型的可控歌唱语音合成方法,支持灵活歌词操控和无标注旋律引导,优于现有基准模型。

Comments INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02948 2026-07-07 cs.LG cs.NA math.NA 版本更新 50%

Variational Sparse Paired Autoencoders (vsPAIR) for Inverse Problems and Uncertainty Quantification

用于逆问题和不确定性量化的变分稀疏配对自动编码器(vsPAIR)

Jack Michael Solomon, Rishi Leburu, Matthias Chung

机构 * Emory University Department of Mathematics(埃默里大学数学系)

专题命中 可控生成 :inpainting(abstract)

AI总结 针对逆问题,提出变分稀疏配对自动编码器(vsPAIR)。架构通过学习的潜在映射连接标准VAE和稀疏VAE,能进行不确定性估计,鼓励可解释性,提供结构化不确定性估计,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03324 2026-07-07 math.PR 版本更新 50%

Strong law of large numbers and L log L condition for supercritical branching processes

超临界分支过程的强大数定律和L log L条件

Vincent Bansaye, Tresnia Berah, Bertrand Cloez

专题命中 可控生成 :diffusion(abstract)

AI总结 研究结构化种群的超临界分支过程,在重正化半群加权全变差范数收敛假设下,结合鞅族、半群收缩等技术,证明归一化经验测度强收敛等,在Llog L条件下扩展大数定律适用范围。

Comments MISTEA - Axe syst{è}mes dynamiques

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08580 2026-07-03 math.OC cs.LG 版本更新 50%

Adjoint Matching through the Lens of the Stochastic Maximum Principle in Optimal Control

通过随机最大原理视角的伴随匹配

Carles Domingo-Enrich, Jiequn Han

机构 * Microsoft Research New England(微软研究院新英格兰) Flatiron Institute(熨斗研究所)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文基于随机最优控制问题,重新推广并严谨推导了伴随匹配方法,将其置于随机最大原理基础上,提出通用Hamiltonian伴随匹配目标,并展示其在连续时间下的实现方法,为随机控制问题提供新的可实施目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18368 2026-07-03 cs.RO 版本更新 50%

Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation

学习多任务机器人操作的语义原子技能

Yihang Zhu, Weiqing Wang, Shijie Wu, Ye Shi, Jingya Wang

机构 * ShanghaiTech University(上海科技大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出AtomSkill框架,通过语义对比对齐和关键姿态想象,从演示中学习可重用原子技能,实现多任务机器人操作,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03065 2026-06-29 cs.LG cs.RO 版本更新 50%

OGPO: Sample Efficient Full-Finetuning of Generative Control Policies

OGPO:生成控制策略的样本高效全微调

Sarvesh Patil, Mitsuhiko Nakamoto, Manan Agarwal, Shashwat Saxena, Jesse Zhang, Giri Anantharaman, Cleah Winston, Chaoyi Pan, Douglas Chen, Nai-Chieh Huang, Zeynep Temel, Oliver Kroemer, Sergey Levine, Abhishek Gupta, Hongkai Dai, Paarth Shah, Max Simchowitz

机构 * University of California, Berkeley(加州大学伯克利分校) UC Berkeley(加州大学伯克利分校)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出OGPO算法,通过离策略评论网络和修改的PPO目标,实现生成控制策略的样本高效微调,在多种操作任务上达到最优性能,并能在无专家数据下微调不良初始化的行为克隆策略。

Comments Website: https://simchowitzlabpublic.github.io/ogpo-site/ Code: https://github.com/simchowitzlabpublic/OGPO_public

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18969 2026-06-26 math.OC 版本更新 50%

A Local Discontinuous Galerkin Method for Dirichlet Boundary Control Problems

Dirichlet边界控制问题的局部间断Galerkin方法

Peter Benner, Michael Hinze, Hamdullah Yücel

专题命中 可控生成 :diffusion(abstract)

AI总结 针对二维凸多边形域上对流扩散方程的L^2-Dirichlet边界控制问题,采用局部间断Galerkin方法离散,推导了全离散和变分离散控制逼近的先验误差估计,数值实验验证了方法性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23527 2026-06-26 cs.LG 版本更新 50%

Normalizing Flows are Capable Models for Continuous Control

归一化流是连续控制的有效模型

Raj Ghugare, Benjamin Eysenbach

机构 * Department of Computer Science(计算机科学系)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出一种归一化流架构,可无缝集成到强化学习算法中作为策略、Q函数和占用度量,在模仿学习、离线、目标条件和无监督RL中取得更高性能。

Comments Project page with code - https://rajghugare19.github.io/nf4rl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20906 2026-06-23 cs.RO cs.AI 版本更新 50%

DASIP: Dynamic Test-Time Compute Scaling for Robot Control with Stochastic Interpolant Policies

DASIP:基于随机插值策略的机器人控制动态测试时计算缩放

Inkook Chun, Seungjae Lee, Michael S. Albergo, Saining Xie, Eric Vanden-Eijnden

机构 * New York University(纽约大学) University of Maryland(马里兰大学) Harvard University(哈佛大学) Capital Fund Management(资本基金管理公司)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出难度感知随机插值策略(DA-SIP),通过难度分类器动态调整推理步数、求解器和ODE/SDE积分,在保持任务成功率的同时将计算时间减少2.6-4.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02647 2026-06-23 math.OC cs.MS cs.NA math.NA 版本更新 50%

Multilevel Stochastic Gradient Descent for Optimal Control Under Uncertainty

不确定性下最优控制的多层随机梯度下降法

Niklas Baumgarten, David Schneiderhan

专题命中 可控生成 :diffusion(abstract)

AI总结 提出一种多层随机梯度下降法,用于求解受不确定输入数据影响的偏微分方程最优控制问题,通过并行多层蒙特卡洛估计随机梯度,实现线性收敛并显著优于标准随机梯度下降法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05107 2026-06-18 cs.AI 版本更新 50%

Structured Cognitive Loop for Behavioral Intelligence in Large Language Model Agents (Extended Revision: From Behavioral Architecture to Epistemic Accountability)

大型语言模型代理中行为智能的结构化认知循环(扩展修订:从行为架构到认知问责)

Myung Ho Kim

机构 * JEI University(JEI大学)

专题命中 可控生成 :image generation(abstract)

AI总结 提出结构化认知循环(SCL)架构,通过分离认知、记忆、控制和行动模块,实现LLM代理的可问责行为,在360个任务中成功率86.3%,优于基线方法。

Comments This revised version extends the original SCL framework from a behavioral architecture for reliable LLM agents into a broader architecture of epistemic accountability, integrating context-aware Human-in-the-Loop control, Pool-Gated Retrieval, and the Horizon-Warrant-Commitment structure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00924 2026-06-16 cs.LG cs.AI 版本更新 50%

StyleShield: Exposing the Fragility of AIGC Detectors through Continuous Controllable Style Transfer

StyleShield: 通过连续可控风格迁移揭示AIGC检测器的脆弱性

Guantian Zheng

机构 * National University of Singapore(新加坡国立大学)

专题命中 可控生成 :image synthesis(abstract)

AI总结 提出StyleShield,一种基于流匹配的条件文本风格迁移框架,通过连续控制风格迁移强度,在保持语义相似度的同时实现高规避率,并引入RateAudit算法质疑基于分数的检测可靠性。

Comments 12 pages, 5 figures. Code and model weights will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21391 2026-06-16 cs.RO cs.AI 版本更新 50%

From Noise to Intent: Anchoring Generative VLA Policies with Residual Bridges

从噪声到意图:基于残差桥的生成式VLA策略锚定

Yiming Zhong, Yaoyu He, Zemin Yang, Pengfei Tian, Yifan Huang, Qingqiu Huang, Xinge Zhu, Yuexin Ma

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出ResVLA架构,通过频谱分析将机器人控制解耦为确定性低频锚点和随机高频残差,利用残差扩散桥聚焦局部动态精化,实现高效表示与强条件对齐。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17152 2026-06-12 physics.app-ph nlin.CD physics.comp-ph 版本更新 50%

Criticality of a Stochastic Dense Associative Memory Model with Exponential Interaction Function

具有指数交互函数的随机稠密联想记忆模型的临界性

Marco Cafiso, Paolo Paradisi

专题命中 可控生成 :diffusion(abstract)

AI总结 研究随机指数稠密联想记忆模型在MNIST数据上的动力学,发现噪声诱导的相变,临界噪声水平随负载增加而降低,临界状态下呈现长时间相关动力学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.07269 2026-06-11 math.AP 版本更新 50%

Hamilton-Jacobi-Bellman Equations in Random Geometries: Homogenization on Continuum Percolation Clusters

连续渗流簇上的Hamilton-Jacobi-Bellman方程的随机均匀化

Rodrigo Bazaes, Alexander Mielke, Chiranjib Mukherjee

专题命中 可控生成 :diffusion(abstract)

AI总结 研究连续渗流簇上退化随机Hamilton-Jacobi-Bellman方程的均匀化性质,利用Hamiltonian的强制性和相对熵结构,结合连续渗流随机几何,证明了几乎必然的均匀化结果。

Comments Completely revised manuscript, some earlier assumptions corrected; the revised assumptions are now sharp and apply to a substantially broader class of models, large parts of the proofs have been rewritten and are new

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26078 2026-06-09 cs.LG 版本更新 50%

Global Convergence of Wasserstein Policy Gradient for Entropy-Regularized Reinforcement Learning

Wasserstein策略梯度在熵正则化强化学习中的全局收敛性

Zhaoyu Zhu, Rui Gao, Shuang Li

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 可控生成 :diffusion(abstract)

AI总结 本文通过利用熵正则化强化学习的Bellman结构,证明了Wasserstein策略梯度(WPG)方法的全局收敛性,并建立了分布Polyak-Łojasiewicz条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15354 2026-06-08 cs.LG 版本更新 50%

Controllable Molecular Generative Foundation Models

可控分子生成基础模型

Yihan Zhu, Yuhan Liu, Weijiang Li, Tengfei Luo, Meng Jiang

机构 * University of Notre Dame(诺丁汉大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出CoMole,一种基于基团感知图扩散的统一框架,结合强化学习优化条件反向策略,在材料与药物设计的九个目标上均实现最优可控性,MAE最高降低48.2%,且无需规则修正。

详情

展开后加载摘要…

URL PDF HTML 收藏