arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-01 至 2025-12-01 共收录 14 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 14 篇

2503.09864 2025-12-01 cs.GR cs.CV cs.LG 86%

Leveraging Semantic Attribute Binding for Free-Lunch Color Control in Diffusion Models

利用语义属性绑定实现扩散模型中的免费午餐颜色控制

Héctor Laria, Alexandra Gomez-Villa, Jiang Qin, Muhammad Atif Butt, Bogdan Raducanu, Javier Vazquez-Corral, Joost van de Weijer, Kai Wang

机构 * Computer Vision Center, Spain(西班牙计算机视觉中心) Universitat Autònoma de Barcelona(巴塞罗那自治大学) Harbin Institute of Technology(哈尔滨工业大学) City University of Hong Kong(香港城市大学) Program of Computer Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)计算机科学项目)

专题命中 可控生成 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV、cs.GR

AI总结 ColorWave通过语义属性绑定实现扩散模型中精确的颜色控制,无需微调,提升颜色指定的准确性和适用性。

Comments WACV 2026. Project page: https://hecoding.github.io/colorwave-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22864 2025-12-01 cs.CV 79%

ControlEvents: Controllable Synthesis of Event Camera Datawith Foundational Prior from Image Diffusion Models

ControlEvents: 基于图像扩散模型的基础先验的可控事件相机数据合成

Yixuan Hu, Yuxuan Xue, Simon Klenk, Daniel Cremers, Gerard Pons-Moll

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ControlEvents,利用图像扩散模型生成高质量事件数据,通过文本标签、2D骨骼和3D姿态控制信号,减少标注数据成本并提升视觉任务性能。

Comments Accepted to WACV2026. Project website:https://yuxuan-xue.com/controlevents/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22640 2025-12-01 cs.LG 75%

Flow Density Control: Generative Optimization Beyond Entropy-Regularized Fine-Tuning

流密度控制:超越熵正则化微调的生成优化

Riccardo De Santi, Marin Vlastelica, Ya-Ping Hsieh, Zebang Shen, Niao He, Andreas Krause

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世人工智能中心)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

AI总结 流密度控制通过简化复杂优化问题,实现超越熵正则化微调的生成模型优化,适用于分子设计和图像生成等任务。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22194 2025-12-01 cs.CV 70%

Controllable 3D Object Generation with Single Image Prompt

单图像提示下的可控3D物体生成

Jaeseok Lee, Jaekoo Lee

机构 * College of Computer Science, Kookmin University, Seoul, Korea(计算机科学学院,韩国高丽大学,首尔)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出两种方法,通过单图像提示生成可控的3D物体,提升3D一致性并优于现有文本倒置方法。

Journal ref Pattern Recognition. ICPR 2024. Lecture Notes in Computer Science, vol 15306. Springer, Cham. p222-238

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23146 2025-12-01 cs.CV 57%

InstanceV: Instance-Level Video Generation

InstanceV: 实例级视频生成

Yuheng Chen, Teng Hu, Jiangning Zhang, Zhucun Xue, Ran Yi, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 InstanceV通过实例级控制和全局语义一致性,实现高质量视频生成,并在实例感知指标上超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23051 2025-12-01 cs.CV 57%

GOATex: Geometry & Occlusion-Aware Texturing

GOATex: 几何与遮挡感知纹理生成

Hyunjin Kim, Kunho Kim, Adam Lee, Wonkwang Lee

机构 * KRAFTON AI(KRAFTON人工智能研究院) NC AI(NC人工智能研究院) UC Berkeley(伯克利大学) Seoul National University(首尔国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 GOATex通过基于命中层级的遮挡感知框架,实现高质量3D网格内外表面纹理生成,无需微调扩散模型,具备结构连贯性与无缝纹理输出。

Comments Accepted to NeurIPS 2025; Project Page: https://goatex3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22991 2025-12-01 cs.CV 57%

Guiding Visual Autoregressive Models through Spectrum Weakening

通过频谱弱化引导视觉自回归模型

Chaoyang Wang, Tianmeng Yang, Jingdong Wang, Yunhai Tong

机构 * Peking University(北京大学) Baidu(百度)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种无需重新训练的频谱弱化框架,用于提升视觉自回归模型的生成质量与条件对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22897 2025-12-01 cs.CV 57%

From Points to Clouds: Learning Robust Semantic Distributions for Multi-modal Prompts

从点到云:学习多模态提示的稳健语义分布

Weiran Li, Yeqiang Liu, Yijie Wei, Mina Han, Xin Liu, Zhenbo Li

机构 * China Agricultural University(中国农业大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出P2C框架,通过动态去噪机制学习语义云分布,提升多模态提示学习的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04931 2025-12-01 cs.CV cs.AI 57%

CzechLynx: A Dataset for Individual Identification and Pose Estimation of the Eurasian Lynx

CzechLynx:用于欧亚猞猁个体识别和姿态估计的数据集

Lukas Picek, Elisa Belotti, Michal Bojda, Ludek Bufka, Vojtech Cermak, Martin Dula, Rostislav Dvorak, Luboslav Hrdy, Miroslav Jirik, Vaclav Kocourek, Josefa Krausova, Jirı Labuda, Jakub Straka, Ludek Toman, Vlado Trulık, Martin Vana, Miroslav Kutal

机构 * Faculty of Applied Sciences, University of West Bohemia in Pilsen, Czechia(西波西米亚大学应用科学学院) Inria, LIRMM, University of Montpellier, France(Inria、LIRMM、蒙彼利埃大学,法国) Faculty of Forestry and Wood Sciences, Czech University of Life Sciences Prague, Czechia(林业与木科学学院,捷克生命科学大学布拉格,捷克) Department of Research and Nature Protection, Šumava National Park Administration, Czechia(研究与自然保护部门,Šumava国家公园管理局,捷克) Department of Forest Ecology, Faculty of Forestry and Wood Technology, Mendel University in Brno, Czechia(森林生态学系,林业与木技术学院,梅德利大学布拉格,捷克) Friends of the Earth Czech Republic, Carnivore Conservation Programme, Czechia(捷克地球之友、食肉动物保护计划,捷克) Center for Machine Perception, Czech Technical University in Prague, Czechia(机器感知中心,布拉格捷克技术大学,捷克)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 CzechLynx数据集通过合成图像和生成管道,为欧亚猞猁的个体识别和姿态估计提供了大规模、开放的基准测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22135 2025-12-01 cs.CV 57%

EASL: Multi-Emotion Guided Semantic Disentanglement for Expressive Sign Language Generation

EASL: 多情绪引导的语义解耦用于表达性手语生成

Yanchao Zhao, Jihao Zhu, Yu Liu, Weizhuo Chen, Yuling Yang, Kun Peng

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) University of Health and Rehabilitation Sciences(康复科学大学) The University of Aberdeen(阿伯丁大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 EASL通过多情绪引导的语义解耦架构,提升手语生成的表达性和情感表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07769 2025-12-01 cs.CV 57%

Dream4D: Lifting Camera-Controlled I2V towards Spatiotemporally Consistent 4D Generation

Dream4D: 通过可控视频生成与神经4D重建提升I2V向时空一致4D生成

Xiaoyan Liu, Kangrui Li, Yuehao Song, Jiaxin Liu

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学) Huazhong University of Science and Technology(华中科技大学) The University of New South Wales(新南威尔士大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Dream4D通过可控视频生成与神经4D重建的协同,实现高质量的时空一致4D内容生成。

Comments Project Page: https://wanderer7-sk.github.io/Dream4D.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13911 2025-12-01 cs.CV 57%

GraspDiffusion: Synthesizing Realistic Whole-body Hand-Object Interaction

GraspDiffusion: 合成逼真的全身手-物体交互

Patrick Kwon, Chen Chen, Hanbyul Joo

机构 * University of Central Florida(中央佛罗里达大学) Seoul National University(首尔国立大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 GraspDiffusion通过结合身体和手姿态的生成先验知识,生成逼真的全身手-物体交互场景,优于现有方法。

Comments Paper has been accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01100 2025-12-01 math.OC math.PR 50%

Ergodic Risk Sensitive Control of Diffusions under a General Structural Hypothesis

扩散过程在一般结构假说下的遍历风险敏感控制

Sumith Reddy Anugu, Guodong Pang

专题命中 可控生成 :diffusion(abstract)

AI总结 本文在一般结构假说下研究扩散过程的遍历风险敏感控制问题,通过引入inf-紧扰动和变分公式,刻画最优平稳马尔可夫控制并解决紧性问题。

Comments The manuscript is 57 pages long

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22428 2025-12-01 math.OC 50%

A Variational Approach to Mean Field Type Control

一种变分方法用于均场类型控制

Alain Bensoussan, Ziyu Huang, Sheung Chi Phillip Yam

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种基于变分方法的均场控制理论新方法,替代传统耦合HJ-FP方程系统,扩展了控制问题的解决范围。

详情

展开后加载摘要…

URL PDF HTML 收藏