arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-11 至 2025-12-11 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 7 篇

2503.10287 2025-12-11 cs.SD cs.CV cs.GR eess.AS 81%

MACS: Multi-source Audio-to-image Generation with Contextual Significance and Semantic Alignment

MACS:基于上下文意义和语义对齐的多源音频到图像生成

Hao Zhou, Xiaobao Guo, Yuzhe Zhu, Adams Wai-Kin Kong

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV、cs.GR

AI总结 MACS通过分离多源音频并利用语义对齐提升音频到图像生成的质量和表现。

Comments Accepted at AAAI 2026. Code available at https://github.com/alxzzhou/MACS

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09095 2025-12-11 cs.CV 79%

Food Image Generation on Multi-Noun Categories

多名词类别的食物图像生成

Xinyue Pan, Yuhao Chen, Jiangpeng He, Fengqing Zhu

机构 * Purdue University(普渡大学) University of Waterloo(滑铁卢大学)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出FoCULR方法,通过整合食品领域知识和早期引入核心概念,解决多名词类别食物图像生成中的语义误解和布局错误问题。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21070 2025-12-11 math.NA cs.NA 78%

Numerical analysis of a stabilized scheme for an optimal control problem governed by a parabolic convection--diffusion equation

对由抛物型对流-扩散方程所支配的最优控制问题的稳定化方案的数值分析

Christos Pervolianakis

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文研究了由抛物型对流-扩散方程支配的最优控制问题,提出稳定化方案并推导了误差估计,通过数值实验验证了其收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09406 2025-12-11 cs.RO cs.AI cs.CV 70%

H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos

H2R-Grounder:一种无需配对数据的视频到物理 grounded 机器人视频翻译范式

Hai Ci, Xiaokang Liu, Pei Yang, Yiren Song, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学显示实验室)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 H2R-Grounder通过无需配对数据的方法,将人类交互视频转换为物理 grounded 的机器人视频,提升机器人学习的现实感和扩展性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09740 2025-12-11 physics.optics 50%

Mode Control and Dynamic Population Gratings in Quantum-Dot Lasers

量子点激光器中的模式控制与动态人口光栅

Xiangpeng Ou, Artem Prokoshin, Hongyan Yu, Xin Yao, Ying Shi, William He, Zhican Zhou, Yating Wan

专题命中 可控生成 :diffusion(abstract)

AI总结 本研究提出利用动态人口光栅实现量子点激光器的单模操作,展示了其在高调谐范围和抗反馈性能上的优势,为片上光子系统提供了新的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09504 2025-12-11 cs.SD 50%

DMP-TTS: Disentangled multi-modal Prompting for Controllable Text-to-Speech with Chained Guidance

DMP-TTS: 解耦多模态提示的可控文本到语音系统 with 链式引导

Kang Yin, Chunyu Qiang, Sirui Zhao, Xiaopeng Wang, Yuzhe Liang, Pengfei Cai, Tong Xu, Chen Zhang, Enhong Chen

机构 * University of Science and Technology of China(科学技术大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 DMP-TTS通过解耦多模态提示和链式引导技术,实现了更强的文本到语音风格可控性,同时保持良好的可懂度和自然度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09126 2025-12-11 math.OC 50%

Second-Order $Λ$-Sets and Extensions to Non-Smooth, Hybrid, and Stochastic Optimal Control

二阶Λ集及其在非光滑、混合及随机最优控制中的扩展

Mohammad H. M Rashid

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出二阶Λ集框架,用于非光滑、混合及随机最优控制问题,结合几何方法与变分方法,提供新的最优性条件和应用实例。

详情

展开后加载摘要…

URL PDF HTML 收藏