arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-09 至 2025-12-09 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 7 篇

2512.07170 2025-12-09 cs.CV cs.AI 79%

Towards Unified Semantic and Controllable Image Fusion: A Diffusion Transformer Approach

迈向统一的语义和可控图像融合:一种扩散变换器方法

Jiayang Li, Chengjie Jiang, Junjun Jiang, Pengwei Liang, Jiayi Ma, Liqiang Nie

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Electronic Information School, Wuhan University(武汉大学电子信息学院)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 DiTFuse通过融合图像与自然语言指令,实现端到端、语义感知的图像融合,统一了多种融合任务并在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12175 2025-12-09 cs.SD eess.AS 78%

Audio Palette: A Diffusion Transformer with Multi-Signal Conditioning for Controllable Foley Synthesis

音频调色盘:一种多信号条件的扩散变压器用于可控的 Foley 合成

Junnuo Wang

机构 * New York University(纽约大学)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 Audio Palette通过多信号条件和LoRA技术实现可控Foley合成,提供高效、可解释的音频生成与控制方法。

Comments Accepted for publication in the Artificial Intelligence Technology Research (AITR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00975 2025-12-09 cs.CV cs.LG cs.RO 57%

MM-ACT: Learn from Multimodal Parallel Generation to Act

MM-ACT: 从多模态并行生成中学习以行动

Haotian Liang, Xinyi Chen, Bin Wang, Mingkang Chen, Yitian Liu, Yuhao Zhang, Zanxin Chen, Tianshuo Yang, Yilun Chen, Jiangmiao Pang, Dong Liu, Xiaokang Yang, Yao Mu, Wenqi Shao, Ping Luo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 MM-ACT通过多模态并行生成提升机器人任务执行能力,实现96.3%的成功率。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01254 2025-12-09 cs.CV 57%

EmojiDiff: Advanced Facial Expression Control with High Identity Preservation in Portrait Generation

EmojiDiff: 高精度面部表情控制与高保真身份保持在肖像生成中

Liangwei Jiang, Ruida Li, Zhifeng Zhang, Shuo Fang, Chenguang Ma

机构 * Terminal Technology Department, Alipay, Ant Group(蚂蚁集团支付宝终端技术部)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 EmojiDiff通过解耦训练和微调方法,实现了高精度面部表情控制与高保真身份保持的端到端肖像生成解决方案。

Comments accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13558 2025-12-09 cs.CV 57%

X-Scene: Large-Scale Driving Scene Generation with High Fidelity and Flexible Controllability

X-Scene: 通过高保真和灵活可控性实现大规模驾驶场景生成

Yu Yang, Alan Liang, Jianbiao Mei, Yukai Ma, Yong Liu, Gim Hee Lee

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 X-Scene通过高保真和灵活可控性实现大规模驾驶场景生成,支持多粒度控制和一致性外推,提升自动驾驶的数据生成与模拟能力。

Comments Accepted by NeurIPS 2025, Project page at https://x-scene.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10339 2025-12-09 cs.CV 57%

Towards Unsupervised Domain Bridging via Image Degradation in Semantic Segmentation

通过图像退化实现无监督领域桥接的语义分割方法

Wangkai Li, Rui Sun, Huayu Mai, Tianzhu Zhang

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知联合实验室,中国科学技术大学) National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家深空探测重点实验室,深空探测实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DiDA通过图像退化构建中间领域并补偿语义偏移,提升语义分割在不同领域间的适应性能。

Comments Accepted by Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15703 2025-12-09 math.OC 50%

Robust pointwise second order necessary conditions for singular stochastic optimal control with model uncertainty

具有模型不确定性的奇异随机最优控制的鲁棒点wise二次必要条件

Guangdong Jing

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种针对具有模型不确定性的奇异随机最优控制问题的鲁棒点wise二次必要条件,结合凸变分方法和极小极大定理,通过例子验证了方法的有效性。

Comments 35 pages

Journal ref Volume 92, article number 66, (2025)https://link.springer.com/article/10.1007/s00245-025-10297-9

详情

展开后加载摘要…

URL PDF HTML 收藏