arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-02 至 2026-02-02 共收录 66 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 45 篇

2601.22492 2026-02-02 cs.CV 57%

PromptMAD: Cross-Modal Prompting for Multi-Class Visual Anomaly Localization

PromptMAD: 多类视觉异常定位的跨模态提示

Duncan McCain, Hossein Kashiani, Fatemeh Afghah

机构 * Holcombe Department of Electrical and Computer Engineering(电气与计算机工程系) Computer Engineering Clemson University(计算机工程学系 哥伦比亚大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 PromptMAD通过跨模态提示和Focal损失函数,在多类视觉异常检测中实现高精度像素级定位与高效性能。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23284 2026-02-02 cond-mat.soft cond-mat.stat-mech 50%

Dynamical density functional theory for dense odd-diffusive fluids

稠密奇扩散流体的动力学密度泛函理论

Iman Abdoli, René Wittmann, Hartmut Löwen

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种用于稠密奇扩散流体的动力学密度泛函理论,揭示了奇扩散在集体弛豫和密度分布中的独特效应,并通过模拟验证了其在非平衡传输中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23191 2026-02-02 physics.optics physics.app-ph physics.comp-ph 50%

High-Efficiency Hexagonal Nanowire MAPbI3 Perovskite Solar Cell with Broadband Light Trapping

高效六边形纳米线MAPbI3钙钛矿太阳能电池及其宽波段光陷阱

Kawshik Nath, Bibekananda Nath, Ahmed Zubair

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究提出一种高效六边形纳米线钙钛矿太阳能电池,通过优化结构参数提升光吸收和载流子传输效率,实现24.2%的高功率转换效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23151 2026-02-02 cs.LG 50%

Manifold-Aware Perturbations for Constrained Generative Modeling

面向流形的扰动用于约束生成建模

Katherine Keegan, Lars Ruthotto

机构 * Department of XXX, University of YYY, Location, Country(YYY大学XXX系) School of ZZZ, Institute of WWW, Location, Country(WWW研究所ZZZ学院) Department of Mathematics, Emory University, Atlanta, Georgia, USA(埃默里大学数学系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种面向流形的扰动方法,用于改进约束生成模型的数据分布恢复与稳定采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22915 2026-02-02 eess.SP 50%

Intrinsic MIMO Particle Communication Channel with Random Advection

内在MIMO粒子通信信道与随机对流

Fatih Merdan, Ozgur B. Akan

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究揭示了对流在分子通信中增强接收端多样性的关键作用,通过多接收机组合策略提升低至中等信噪比下的检测性能。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22825 2026-02-02 math.NA cs.NA 50%

Approximation of PDE solution manifolds: Sparse-grid interpolation and quadrature

偏微分方程解流形的近似:稀疏网格插值与求积

Dinh Dũng, Van Kien Nguyen, Duong Thanh Pham, Christoph Schwab

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种基于稀疏网格张量积投影器的全离散近似方法,用于无限变量函数的高效求积和插值,通过反称项抵消提高了收敛速度。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05005 2026-02-02 cs.LG cs.AI cs.RO 50%

Multi-agent Coordination via Flow Matching

通过流匹配实现多智能体协调

Dongsu Lee, Daehee Lee, Amy Zhang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Sungkyunkwan University(松均大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 MAC-Flow通过流匹配方法实现多智能体协调,平衡了性能与计算效率,显著提升推理速度的同时保持良好表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25288 2026-02-02 physics.chem-ph math-ph math.MP math.SP 50%

Reactive capacitance of flat patches of arbitrary shape

任意形状平面区域的反应电容

Denis S. Grebenkov, Raphael Maurette

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种基于区域表面积和电静力电容的简单近似方法,用于计算任意形状平面区域的反应电容,为研究扩散控制反应提供了新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11825 2026-02-02 math.PR 50%

Rough stochastic filtering

粗糙随机过滤

Fabio Bugini, Peter K. Friz, Khoa Lê, Huilin Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种新的混合粗糙随机方法,解决非线性随机过滤方程的适定性问题,并推导出粗糙过滤方程,提供了一种稳健且统一的解决方案。

Comments 49 pages. This version includes a new section (Section 4) on Rough Kalman-Bucy theory

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22698 2026-02-02 physics.flu-dyn 50%

Fluid transport by a single active filament in a three-dimensional two-phase flow

单个活性纤维在三维两相流中驱动流体传输

Qian Mao, Umberto d'Ortona, Julien Favier

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究单个活性纤维在三维两相流中驱动流体传输的机制,探讨参数对传输效率的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22650 2026-02-02 stat.ML cs.LG 50%

Generative and Nonparametric Approaches for Conditional Distribution Estimation: Methods, Perspectives, and Comparative Evaluations

生成与非参数方法在条件分布估计中的应用:方法、视角与比较评估

Yen-Shiu Chin, Zhi-Yu Jou, Toshinari Morimoto, Chia-Tse Wang, Ming-Chung Chang, Tso-Jung Yen, Su-Yun Huang, Tailen Hsing

机构 * Institute of Statistical Science, Academia Sinica(学术院统计科学研究所) Department of Mathematics, National Taiwan University(台湾大学数学系) Data Science Degree Program, National Taiwan University and Academia Sinica(台湾大学数据科学学士学位计划) Department of Statistics, University of Michigan(密歇根大学统计学系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文比较了生成与非参数方法在条件分布估计中的应用,评估了不同方法的性能和适用性。

Comments 22 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22605 2026-02-02 math.NA cs.NA math.OC 50%

An inertial minimal-deformation-rate framework for shape optimization

一种惯性最小变形率框架用于形状优化

Falai Chen, Buyang Li, Jiajie Li, Rong Tang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种结合惯性流和最小变形率策略的框架,用于解决PDE约束形状优化和Willmore驱动表面孔填补问题,通过提高收敛速度和网格质量实现高效优化。

Comments 26 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22524 2026-02-02 cs.LG 50%

Variational Bayesian Flow Network for Graph Generation

变分贝叶斯流网络用于图生成

Yida Xiong, Jiameng Chen, Xiuwen Gong, Jia Wu, Shirui Pan, Wenbin Hu

机构 * School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院) Department of Computing, Macquarie University, Sydney, Australia(麦觉奎大学计算系) Griffith University, Gold Coast, Australia(格里菲斯大学) Wuhan University Shenzhen Research Institute, Shenzhen, China(武汉大学深圳研究院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 变分贝叶斯流网络通过结构化精度和线性系统求解,实现节点与边的耦合生成,提升图生成的保真度和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22177 2026-02-02 q-bio.PE math.DS 50%

Emergent spatial organization of competing species under environmental stress and cooperation

竞争物种在环境压力与合作下的自发空间组织

Ton Viet Ta

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种空间显式反应-扩散框架,研究竞争物种在环境压力与合作下的自发空间组织,通过混合反演建模框架实现高维参数推断,推动生物多样性预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21018 2026-02-02 math.NA cs.NA 50%

Identification of space-dependent coefficients in two competing terms of a nonlinear subdiffusion equation

识别非线性亚扩散方程中两个竞争项的空间依赖系数

Barbara Kaltenbacher, William Rundell

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种固定点方案,用于从内部观测中重建非线性亚扩散方程中两个竞争项的空间依赖系数,并通过数值实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17243 2026-02-02 physics.soc-ph econ.GN q-fin.EC 50%

Who Connects Global Aid? The Hidden Geometry of 10 Million Transactions

谁连接全球援助?1000万笔交易的隐藏几何结构

Paul X. McCarthy, Xian Gong, Marian-Andrei Rizoiu, Paolo Boldi

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过分析1000万笔全球援助交易,揭示了结构性连接在援助生态系统中的关键作用,发现知识中介和大学等机构在连接不同实施者和资助者中的核心作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19903 2026-02-02 cs.LG 50%

Latent Iterative Refinement Flow: A Geometric Constrained Approach for Few-Shot Generation

潜在迭代细化流:一种几何约束方法用于少样本生成

Songtao Li, Tianqi Hou, Zhenyu Liao, Ting Gao

机构 * School of Mathematics(数学学院) Statistics, Huazhong University of Science(统计学,华中科技大学) School of Electronic Information(电子信息学院) Communications, Huazhong University of Science(通信学院,华中科技大学) Center for Mathematical Science, Huazhong University of Science(数学科学中心,华中科技大学) Huawei(华为)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出LIRF框架,通过几何感知方法解决有限数据下扩散模型的生成多样性问题,提升生成质量与召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10961 2026-02-02 cs.RO 50%

EquiContact: A Hierarchical SE(3) Vision-to-Force Equivariant Policy for Spatially Generalizable Contact-rich Tasks

EquiContact: 一种用于空间通用接触密集任务的层次SE(3)视觉到力等价策略

Joohwan Seo, Arvind Kruthiventy, Soomi Lee, Megan Teng, Seoyeon Choi, Xiang Zhang, Jongeun Choi, Roberto Horowitz

专题命中 扩散模型 :diffusion(abstract)

AI总结 EquiContact通过分层策略和等价性设计,实现空间通用的接触密集任务视觉到力控制。

Comments Submitted to RSS

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17046 2026-02-02 astro-ph.HE 50%

Possible evidence for extended X-ray emission surrounding PSR B0656+14 with eROSITA

可能证据显示PSR B0656+14周围存在扩展X射线发射 with eROSITA

Shu Niu, Qiang Yuan, Shui-Nai Zhang, Lei Lei, Li Ji, Yi-Zhong Fan

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究发现PSR B0656+14周围可能有扩展X射线发射,其光谱特征和磁场梯度暗示了脉冲星周围环境的高能粒子传输机制。

Comments 21 pages, 3+8 figures, 1+1 tables; Published in ApJ

Journal ref Astrophys. J. 997 (2026) 324

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 6 篇

2601.22838 2026-02-02 cs.CV 79%

Neural Clothing Tryer: Customized Virtual Try-On via Semantic Enhancement and Controlling Diffusion Model

神经服装试穿器:通过语义增强和控制扩散模型实现定制虚拟试穿

Zhijing Yang, Weiwei Zhang, Mingliang Yang, Siyuan Peng, Yukai Shi, Junpeng Tan, Tianshui Chen, Liruo Zhong

机构 * Guangdong University of Technology, Guangzhou 510006, China Guangdong Provincial Key Laboratory of Intellectual Property \& Big Data, Guangzhou 510006, China South China University of Technology, Guangzhou 510006, China Genstoraige Technology (Beijing) Co., Ltd, Beijing 100000, China

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出NCT框架,通过语义增强和控制扩散模型实现定制虚拟试穿,提升虚拟试穿体验的灵活性和参与度。

Comments Accepted by Expert Systems with Applications. 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22961 2026-02-02 cs.CV 70%

Improving Supervised Machine Learning Performance in Optical Quality Control via Generative AI for Dataset Expansion

通过生成式人工智能扩展数据集以提升光学质量控制中的监督机器学习性能

Dennis Sprute, Hanna Senke, Holger Flatt

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文通过生成式人工智能扩展数据集,提升光学质量控制中监督机器学习的性能,使用Stable Diffusion实现4.6%的分割性能提升。

Comments Accepted at 19th CIRP Conference on Intelligent Computation in Manufacturing Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22887 2026-02-02 cs.LG cs.AI cs.CL cs.CV 57%

MoVE: Mixture of Value Embeddings -- A New Axis for Scaling Parametric Memory in Autoregressive Models

MoVE:价值嵌入的混合——扩展自回归模型参数内存的新轴

Yangyan Li

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 MoVE通过引入价值嵌入的混合机制,实现了自回归模型参数内存的独立扩展,提升了文本和图像生成任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19236 2026-02-02 cs.RO cs.CV 57%

MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation

MemoryVLA: 视觉-语言-动作模型中用于机器人操作的感知-认知记忆

Hao Shi, Bin Xie, Yingfei Liu, Lin Sun, Fengrong Liu, Tiancai Wang, Erjin Zhou, Haoqiang Fan, Xiangyu Zhang, Gao Huang

机构 * Department of Automation, BNRist, Tsinghua University(自动化系、BNRist、清华大学) Dexmal MEGVII Technology(MEGVII技术) Tianjin University(天津大学) Harbin Institute of Technology(哈尔滨工业大学) StepFun

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 MemoryVLA通过结合感知与认知记忆机制,提升机器人操作中长时间跨度任务的性能,实现对时间依赖任务的高效处理。

Comments ICLR 2026 | The project is available at https://shihao1895.github.io/MemoryVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22455 2026-02-02 cs.CV 57%

ScribbleSense: Generative Scribble-Based Texture Editing with Intent Prediction

ScribbleSense: 基于生成的涂鸦纹理编辑与意图预测

Yudi Zhang, Yeming Geng, Lei Zhang

机构 * School of Computer Science, Beijing Institute of Technology(计算机学院,北京理工大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 ScribbleSense通过结合多模态大语言模型和图像生成模型,实现了基于生成的涂鸦纹理编辑与意图预测,提升交互式编辑性能。

Comments Accepted by IEEE TVCG. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22986 2026-02-02 cond-mat.mtrl-sci 50%

Hydrogen at GaN(0001) surface control of Fermi level pinning: Mg activation of p-type conductivity -- Nakamura process deciphered

氮化镓(0001)表面氢原子控制费米能级钉扎:Mg激活p型导电性——纳克拉马过程解密

Konrad Sakowski, Pawel Strak, Pawel Kempisty, Izabella Grzegory, Stanislaw Krukowski

专题命中 可控生成 :diffusion(abstract)

AI总结 通过从头计算揭示了氮化镓(0001)表面氢原子控制费米能级钉扎机制,解析了Mg掺杂对p型导电性激活的纳克拉马过程。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 2 篇

2601.10214 2026-02-02 cs.CV cs.GR 84%

Beyond Inpainting: Unleash 3D Understanding for Precise Camera-Controlled Video Generation

超越修复:释放3D理解以实现精确的相机控制视频生成

Dong-Yu Chen, Yixin Guo, Shuojin Yang, Tai-Jiang Mu, Shi-Min Hu

机构 * BNRist, Department of Computer Science and Technology, Tsinghua University(BNRist,计算机科学与技术系,清华大学)

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 DepthDirector通过双流条件机制和LoRA适配器实现精确摄像机控制,提升视频生成的3D理解和视觉质量。

Comments Project page: https://eleanor6725.github.io/DepthDirector/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01305 2026-02-02 cs.CV cs.GR cs.LG 84%

DiffusionLight-Turbo: Accelerated Light Probes for Free via Single-Pass Chrome Ball Inpainting

DiffusionLight-Turbo: 通过单次通道球修复实现自由的加速光照

Worameth Chinchuthakun, Pakkapon Phongthawee, Amit Raj, Varun Jampani, Pramook Khungurn, Supasorn Suwajanakorn

机构 * Tokyo Institute of Technology(东京技术大学) Siam Commercial Bank(暹罗商业银行) School of Information Science and Technology, VISTEC(信息科学与技术学院,VISTEC) Google DeepMind(谷歌DeepMind)

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 DiffusionLight-Turbo通过单次通道球修复技术,利用LoRA交换技术实现快速生成HDR光照探针,提升光照估计效率。

Comments arXiv admin note: substantial text overlap with arXiv:2312.09168

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 3 篇

2601.22507 2026-02-02 cs.CV 85%

DreamVAR: Taming Reinforced Visual Autoregressive Model for High-Fidelity Subject-Driven Image Generation

DreamVAR: 镇压强化视觉自回归模型以实现高保真主体驱动图像生成

Xin Jiang, Jingwen Chen, Yehao Li, Yingwei Pan, Kezhou Chen, Zechao Li, Ting Yao, Tao Mei

机构 * Nanjing University of Science and Technology(南京理工大学) University of Science and Technology of China(中国科学技术大学) HiDream.ai Inc.(HiDream.ai公司)

专题命中 个性化与一致性 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 DreamVAR通过改进的自回归模型和强化学习,实现高保真主体驱动图像生成,优于现有扩散方法。

Comments Accepted By ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17008 2026-02-02 cs.CV 70%

FlashFace: Human Image Personalization with High-fidelity Identity Preservation

FlashFace: 通过高保真身份保留实现人像个性化

Shilong Zhang, Lianghua Huang, Xi Chen, Yifei Zhang, Zhi-Fan Wu, Yutong Feng, Wei Wang, Yujun Shen, Yu Liu, Ping Luo

机构 * The University of Hong Kong(香港大学) Alibaba Group(阿里巴巴集团) Ant Group(蚂蚁集团)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 FlashFace通过高保真身份保留和解耦整合策略,实现高效的人像个性化与虚拟角色真实化

Comments Project Page:https://jshilong.github.io/flashface-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22501 2026-02-02 cs.CV cs.SD 57%

MIRRORTALK: Forging Personalized Avatars Via Disentangled Style and Hierarchical Motion Control

MIRRORTALK: 通过解耦的风格和分层运动控制生成个性化虚拟形象

Renjie Lu, Xulong Zhang, Xiaoyang Qu, Jianzong Wang, Shangfei Wang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 MirrorTalk通过解耦风格与运动控制生成个性化虚拟形象,提升嘴唇同步准确性和个性化表达。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏