arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-01 至 2025-12-01 共收录 126 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 81 篇

2507.14939 2025-12-01 math.NA cs.NA 50%

A second-order generalized BDF method for the two-dimensional (modified) Fisher-Kolmogorov-Petrovsky-Piskunov equation

一种用于二维(修正)菲舍尔-科尔莫戈罗夫-彼得罗夫斯基-皮斯库诺夫方程的二阶广义BDF方法

Lei Ge, Yong-Liang Zhao, Qian-Yu Shu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种用于二维修正菲舍尔-KPP方程的二阶广义BDF方法,通过移位BDF2方法实现,证明了均匀离散化方案的稳定性,并通过数值实验验证了其鲁棒性和准确性。

Comments 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05034 2025-12-01 math.NA cs.NA 50%

Fourier Spectral Method for Nonlocal Equations on Bounded Domains

有界域上非局部方程的傅里叶谱方法

Ilyas Mustapha, Bacim Alali, Nathan Albin

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种基于二维傅里叶延续算法的高效谱方法,用于求解有界域上的非局部方程,通过傅里叶变换将积分转化为乘法,提升计算效率和精度。

Comments 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09244 2025-12-01 math.PR math-ph math.AP math.MP 50%

SDEs with critical general distributional drifts: sharp solvability and blow-ups

具有临界一般分布漂移的随机微分方程:精确解的存在性和爆破

D. Kinzebulatov, R. Vafadar

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究了具有临界分布漂移的SDEs的解存在性与爆破问题,通过Hilbert三重结构和BMO空间分析,揭示了Keller-Segel型粒子系统在湍流中的吸引强度范围,并改进了Hardy不等式常数的上界。

Comments Fixed typos, added a new proof in Appendix D

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02104 2025-12-01 astro-ph.GA astro-ph.CO physics.plasm-ph 50%

Collisionless relaxation to equilibrium distributions in cold dark matter halos: origin of the Navarro-Frenk-White profile

暗物质晕中无碰撞弛豫到平衡分布:纳瓦罗-弗伦克-怀特分布的起源

Uddipan Banik, Amitava Bhattacharjee

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究揭示了冷暗物质晕中无碰撞弛豫过程如何形成纳瓦罗-弗伦克-怀特密度分布。

Comments 17 pages, 3 figures; accepted for publication in Physical Review D. arXiv admin note: substantial text overlap with arXiv:2411.18827

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19089 2025-12-01 physics.bio-ph physics.flu-dyn 50%

Self-organized homogenization of flow networks

自组织流网络的均质化

Julien Bouvard, Swarnavo Basu, Charlott Leu, Onurcan Bektas, Joachim O. Rädler, Gabriel Amselem, Karen Alim

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过受控侵蚀实现人工流网络的自组织均质化,提升多孔介质性能。

Journal ref Phys. Rev. X 15, 041038 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 14 篇

2503.09864 2025-12-01 cs.GR cs.CV cs.LG 86%

Leveraging Semantic Attribute Binding for Free-Lunch Color Control in Diffusion Models

利用语义属性绑定实现扩散模型中的免费午餐颜色控制

Héctor Laria, Alexandra Gomez-Villa, Jiang Qin, Muhammad Atif Butt, Bogdan Raducanu, Javier Vazquez-Corral, Joost van de Weijer, Kai Wang

机构 * Computer Vision Center, Spain(西班牙计算机视觉中心) Universitat Autònoma de Barcelona(巴塞罗那自治大学) Harbin Institute of Technology(哈尔滨工业大学) City University of Hong Kong(香港城市大学) Program of Computer Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)计算机科学项目)

专题命中 可控生成 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV、cs.GR

AI总结 ColorWave通过语义属性绑定实现扩散模型中精确的颜色控制,无需微调,提升颜色指定的准确性和适用性。

Comments WACV 2026. Project page: https://hecoding.github.io/colorwave-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22864 2025-12-01 cs.CV 79%

ControlEvents: Controllable Synthesis of Event Camera Datawith Foundational Prior from Image Diffusion Models

ControlEvents: 基于图像扩散模型的基础先验的可控事件相机数据合成

Yixuan Hu, Yuxuan Xue, Simon Klenk, Daniel Cremers, Gerard Pons-Moll

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ControlEvents,利用图像扩散模型生成高质量事件数据,通过文本标签、2D骨骼和3D姿态控制信号,减少标注数据成本并提升视觉任务性能。

Comments Accepted to WACV2026. Project website:https://yuxuan-xue.com/controlevents/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22640 2025-12-01 cs.LG 75%

Flow Density Control: Generative Optimization Beyond Entropy-Regularized Fine-Tuning

流密度控制:超越熵正则化微调的生成优化

Riccardo De Santi, Marin Vlastelica, Ya-Ping Hsieh, Zebang Shen, Niao He, Andreas Krause

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世人工智能中心)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

AI总结 流密度控制通过简化复杂优化问题,实现超越熵正则化微调的生成模型优化,适用于分子设计和图像生成等任务。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22194 2025-12-01 cs.CV 70%

Controllable 3D Object Generation with Single Image Prompt

单图像提示下的可控3D物体生成

Jaeseok Lee, Jaekoo Lee

机构 * College of Computer Science, Kookmin University, Seoul, Korea(计算机科学学院,韩国高丽大学,首尔)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出两种方法,通过单图像提示生成可控的3D物体,提升3D一致性并优于现有文本倒置方法。

Journal ref Pattern Recognition. ICPR 2024. Lecture Notes in Computer Science, vol 15306. Springer, Cham. p222-238

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23146 2025-12-01 cs.CV 57%

InstanceV: Instance-Level Video Generation

InstanceV: 实例级视频生成

Yuheng Chen, Teng Hu, Jiangning Zhang, Zhucun Xue, Ran Yi, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 InstanceV通过实例级控制和全局语义一致性,实现高质量视频生成,并在实例感知指标上超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23051 2025-12-01 cs.CV 57%

GOATex: Geometry & Occlusion-Aware Texturing

GOATex: 几何与遮挡感知纹理生成

Hyunjin Kim, Kunho Kim, Adam Lee, Wonkwang Lee

机构 * KRAFTON AI(KRAFTON人工智能研究院) NC AI(NC人工智能研究院) UC Berkeley(伯克利大学) Seoul National University(首尔国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 GOATex通过基于命中层级的遮挡感知框架,实现高质量3D网格内外表面纹理生成,无需微调扩散模型,具备结构连贯性与无缝纹理输出。

Comments Accepted to NeurIPS 2025; Project Page: https://goatex3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22991 2025-12-01 cs.CV 57%

Guiding Visual Autoregressive Models through Spectrum Weakening

通过频谱弱化引导视觉自回归模型

Chaoyang Wang, Tianmeng Yang, Jingdong Wang, Yunhai Tong

机构 * Peking University(北京大学) Baidu(百度)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种无需重新训练的频谱弱化框架,用于提升视觉自回归模型的生成质量与条件对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22897 2025-12-01 cs.CV 57%

From Points to Clouds: Learning Robust Semantic Distributions for Multi-modal Prompts

从点到云:学习多模态提示的稳健语义分布

Weiran Li, Yeqiang Liu, Yijie Wei, Mina Han, Xin Liu, Zhenbo Li

机构 * China Agricultural University(中国农业大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出P2C框架,通过动态去噪机制学习语义云分布,提升多模态提示学习的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04931 2025-12-01 cs.CV cs.AI 57%

CzechLynx: A Dataset for Individual Identification and Pose Estimation of the Eurasian Lynx

CzechLynx:用于欧亚猞猁个体识别和姿态估计的数据集

Lukas Picek, Elisa Belotti, Michal Bojda, Ludek Bufka, Vojtech Cermak, Martin Dula, Rostislav Dvorak, Luboslav Hrdy, Miroslav Jirik, Vaclav Kocourek, Josefa Krausova, Jirı Labuda, Jakub Straka, Ludek Toman, Vlado Trulık, Martin Vana, Miroslav Kutal

机构 * Faculty of Applied Sciences, University of West Bohemia in Pilsen, Czechia(西波西米亚大学应用科学学院) Inria, LIRMM, University of Montpellier, France(Inria、LIRMM、蒙彼利埃大学,法国) Faculty of Forestry and Wood Sciences, Czech University of Life Sciences Prague, Czechia(林业与木科学学院,捷克生命科学大学布拉格,捷克) Department of Research and Nature Protection, Šumava National Park Administration, Czechia(研究与自然保护部门,Šumava国家公园管理局,捷克) Department of Forest Ecology, Faculty of Forestry and Wood Technology, Mendel University in Brno, Czechia(森林生态学系,林业与木技术学院,梅德利大学布拉格,捷克) Friends of the Earth Czech Republic, Carnivore Conservation Programme, Czechia(捷克地球之友、食肉动物保护计划,捷克) Center for Machine Perception, Czech Technical University in Prague, Czechia(机器感知中心,布拉格捷克技术大学,捷克)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 CzechLynx数据集通过合成图像和生成管道,为欧亚猞猁的个体识别和姿态估计提供了大规模、开放的基准测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22135 2025-12-01 cs.CV 57%

EASL: Multi-Emotion Guided Semantic Disentanglement for Expressive Sign Language Generation

EASL: 多情绪引导的语义解耦用于表达性手语生成

Yanchao Zhao, Jihao Zhu, Yu Liu, Weizhuo Chen, Yuling Yang, Kun Peng

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) University of Health and Rehabilitation Sciences(康复科学大学) The University of Aberdeen(阿伯丁大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 EASL通过多情绪引导的语义解耦架构,提升手语生成的表达性和情感表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07769 2025-12-01 cs.CV 57%

Dream4D: Lifting Camera-Controlled I2V towards Spatiotemporally Consistent 4D Generation

Dream4D: 通过可控视频生成与神经4D重建提升I2V向时空一致4D生成

Xiaoyan Liu, Kangrui Li, Yuehao Song, Jiaxin Liu

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学) Huazhong University of Science and Technology(华中科技大学) The University of New South Wales(新南威尔士大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Dream4D通过可控视频生成与神经4D重建的协同,实现高质量的时空一致4D内容生成。

Comments Project Page: https://wanderer7-sk.github.io/Dream4D.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13911 2025-12-01 cs.CV 57%

GraspDiffusion: Synthesizing Realistic Whole-body Hand-Object Interaction

GraspDiffusion: 合成逼真的全身手-物体交互

Patrick Kwon, Chen Chen, Hanbyul Joo

机构 * University of Central Florida(中央佛罗里达大学) Seoul National University(首尔国立大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 GraspDiffusion通过结合身体和手姿态的生成先验知识,生成逼真的全身手-物体交互场景,优于现有方法。

Comments Paper has been accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01100 2025-12-01 math.OC math.PR 50%

Ergodic Risk Sensitive Control of Diffusions under a General Structural Hypothesis

扩散过程在一般结构假说下的遍历风险敏感控制

Sumith Reddy Anugu, Guodong Pang

专题命中 可控生成 :diffusion(abstract)

AI总结 本文在一般结构假说下研究扩散过程的遍历风险敏感控制问题,通过引入inf-紧扰动和变分公式,刻画最优平稳马尔可夫控制并解决紧性问题。

Comments The manuscript is 57 pages long

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22428 2025-12-01 math.OC 50%

A Variational Approach to Mean Field Type Control

一种变分方法用于均场类型控制

Alain Bensoussan, Ziyu Huang, Sheung Chi Phillip Yam

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种基于变分方法的均场控制理论新方法,替代传统耦合HJ-FP方程系统,扩展了控制问题的解决范围。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 2 篇

2511.23066 2025-12-01 cs.CV cs.AI 79%

Evaluating the Clinical Impact of Generative Inpainting on Bone Age Estimation

评估生成修复对骨龄估计的临床影响

Felipe Akio Matsuoka, Eduardo Moreno J. M. Farina, Augusto Sarquis Serpa, Soraya Monteiro, Rodrigo Ragazzini, Nitamar Abdala, Marcelo Straus Takahashi, Felipe Campos Kitamura

机构 * Universidade Federal de São Paulo(巴西圣保罗联邦大学) Universidade de São Paulo(巴西圣保罗大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Dasa Bunkerhill Health(Bunkerhill健康)

专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV

AI总结 生成修复技术虽能去除伪影,但可能干扰骨龄估计和性别分类的准确性,需严格验证以确保临床可靠性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22499 2025-12-01 cs.CV cs.CL cs.LG 57%

What Shape Is Optimal for Masks in Text Removal?

在文本去除中最优的形状是什么?

Hyakka Nakada, Marika Kubota

机构 * Recruit Co., Ltd.(Recruit公司) Beans Labo Co., Ltd.(Beans Labo公司)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 本研究通过贝叶斯优化开发了灵活的掩码建模方法,发现字符级掩码和文本区域最小覆盖并非最优,为手动掩码提供实用指南。

Comments 12 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 5 篇

2511.10555 2025-12-01 cs.CV cs.AI 85%

A Style is Worth One Code: Unlocking Code-to-Style Image Generation with Discrete Style Space

一种风格等同于一个代码:通过离散风格空间解锁代码到风格图像生成

Huijie Liu, Shuhao Cui, Haoxiang Cao, Shuai Ma, Kai Wu, Guoliang Kang

机构 * Beihang University(北航大学) Kolors Team, Kuaishou Technology(快手科技色彩团队) South China Normal University(华南师范大学)

专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出CoTyle,通过离散风格空间实现代码到风格图像生成,以数值代码控制图像风格,提升生成效率与多样性。

Comments Code: https://github.com/Kwai-Kolors/CoTyle Demo: https://huggingface.co/spaces/Kwai-Kolors/CoTyle Homepage: https://kwai-kolors.github.io/CoTyle/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05538 2025-12-01 cs.CV 85%

A Survey on Personalized Content Synthesis with Diffusion Models

扩散模型在个性化内容合成中的综述

Xulu Zhang, Xiaoyong Wei, Wentao Hu, Jinlin Wu, Jiaxin Wu, Wengyu Zhang, Zhaoxiang Zhang, Zhen Lei, Qing Li

机构 * Department of Computing(计算系) The Hong Kong Polytechnic University(香港理工大学) Center for Artificial Intelligence and Robotics(人工智能与机器人中心) Hong Kong Institute of Science & Innovation(香港科学创新研究院) Chinese Academy of Sciences(中国科学院) State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) Chinese Academy of Sciences Institute of Automation(中国科学院自动化研究所) School of Artificial Intelligence(人工智能学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 个性化与一致性 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文综述了扩散模型在个性化内容合成中的应用,分析了测试时微调和预训练适应方法,探讨了个性化任务的挑战与创新,并提出了未来发展方向。

Journal ref Machine intelligence research, Oct. 2025, v. 22, no. 5, p. 817-848

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17344 2025-12-01 cs.CV 70%

Loomis Painter: Reconstructing the Painting Process

Loomis Painter: 复原绘画过程

Markus Pobitzer, Chang Liu, Chenyi Zhuang, Teng Long, Bin Ren, Nicu Sebe

机构 * University of Trento(特伦托大学) University of Pisa(比萨大学)

专题命中 个性化与一致性 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 Loomis Painter通过统一框架和语义驱动的风格控制机制,实现多媒体绘画过程的复原,提升跨媒体一致性与生成流畅性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15258 2025-12-01 cs.CV 57%

SplitFlux: Learning to Decouple Content and Style from a Single Image

SplitFlux: 从单张图像中学习解耦内容与风格

Yitong Yang, Yinglin Wang, Changshuo Wang, Yongjun Zhang, Ziyang Chen, Shuting He

机构 * School of Computing and Artificial Intelligence(计算与人工智能学院) University College London, University of London(伦敦大学大学学院) College of Computer Science and Technology(计算机科学与技术学院)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 SplitFlux通过LoRA微调单流块,实现内容与风格的解耦,提升图像生成的质量和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16915 2025-12-01 cs.CV 57%

DreamO: A Unified Framework for Image Customization

DreamO:图像定制的统一框架

Chong Mou, Yanze Wu, Wenxu Wu, Zinan Guo, Pengze Zhang, Yufeng Cheng, Yiming Luo, Fei Ding, Shiwen Zhang, Xinghui Li, Mengtian Li, Mingcong Liu, Yi Zhang, Shaojin Wu, Songtao Zhao, Jian Zhang, Qian He, Xinglong Wu

机构 * Peking University(北京大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 DreamO提出了一种统一的图像定制框架,通过扩散变压器和渐进式训练策略,实现多种条件的无缝集成与高质量定制。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 5 篇

2511.22805 2025-12-01 cs.CV cs.LG cs.MM 62%

From Pixels to Feelings: Aligning MLLMs with Human Cognitive Perception of Images

从像素到感受:将MLLMs对齐于人类对图像的认知感知

Yiming Chen, Junlin Han, Tianyi Bai, Shengbang Tong, Filippos Kokkinos, Philip Torr

机构 * Oxford University(牛津大学) HKUST(香港科技大学) University College London(伦敦大学学院) New York University(纽约大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV、cs.MM

AI总结 本文提出CogIP-Bench基准,通过后训练提升MLLMs对图像认知属性的对齐能力,并展示其在图像生成中的应用。

Comments Project page with codes/datasets/models: https://follen-cry.github.io/MLLM-Cognition-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23241 2025-12-01 cs.CV 57%

Synthetic Industrial Object Detection: GenAI vs. Feature-Based Methods

合成工业目标检测:GenAI与基于特征的方法

Jose Moises Araya-Martinez, Adrián Sanchis Reig, Gautham Mohan, Sarvenaz Sardari, Jens Lambrecht, Jörg Krüger

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本研究比较了GenAI与基于特征的方法在合成工业目标检测中的效果,发现简单方法在准确性和效率上优于复杂GenAI方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22576 2025-12-01 cs.MM 57%

A Progressive Evaluation Framework for Multicultural Analysis of Story Visualization

一种用于故事可视化多元文化分析的渐进评估框架

Janak Kapuriya, Ali Hatami, Paul Buitelaar

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.MM

AI总结 本文提出一种渐进多元文化评估框架,通过五个新指标评估故事可视化模型在不同文化下的表现,揭示模型在文化适当性和视觉美学上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20330 2025-12-01 cs.RO cs.CV 57%

ArtiBench and ArtiBrain: Benchmarking Generalizable Vision-Language Articulated Object Manipulation

ArtiBench 和 ArtiBrain:可泛化的视觉-语言操纵基准测试

Yuhan Wu, Tiantian Wei, Shuo Wang, ZhiChao Wang, Yanyong Zhang, Daniel Cremers, Yan Xia

机构 * University of Science and Technology of China(中国科学技术大学) Technical University of Munich(慕尼黑技术大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 ArtiBench和ArtiBrain通过统一高层推理与自适应低层控制,提升可操纵物体操作的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏