arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-11-25 至 2025-11-25 共收录 127 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 93 篇

2511.18004 2025-11-25 math.OC math.DG 50%

Moduli space of optimization algorithms

优化算法的模空间

Dmitry Pasechnyuk-Vilensky, Martin Takáč

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种几何框架,将优化算法视为离散连接,通过曲率阶控制扩展到多种算法,并提供精确的非渐近界和加速效应描述。

Comments 102 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17997 2025-11-25 math.AP 50%

The nonlinear porous medium equation for the f-Laplacian: Hamilton-Souplet-Zhang type gradient estimates and implications

f-Laplace非线性多孔介质方程的非线性多孔介质方程:Hamilton-Souplet-Zhang类型的梯度估计及其影响

Ali Taheri, Vahideh Vahidifar

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了f-Laplace非线性多孔介质方程的梯度估计,通过多种方法建立了Hamilton-Souplet-Zhang类型的估计,并探讨了其对抛物型Liouville型结果和古老解特征化的影响。

Comments 38 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17820 2025-11-25 math.NA cs.NA 50%

The Closest Point Method for Surface PDEs with General Boundary Conditions

用于一般边界条件的表面PDE最接近点方法

Tony Wong, Colin B. Macdonald, Byungjoon Lee

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种扩展的最接近点方法,用于处理一般边界条件下的表面PDE,通过数值实验验证了方法的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17611 2025-11-25 cs.LG q-bio.QM 50%

AI-driven Generation of MALDI-TOF MS for Microbial Characterization

基于人工智能的MALDI-TOF质谱生成用于微生物表征

Lucía Schmidt-Santiago, David Rodríguez-Temporal, Carlos Sevilla-Salcedo, Vanessa Gómez-Verdejo

机构 * Department of Signal Theory and Communications(信号理论与通信系) Universidad Carlos III de Madrid(卡洛斯三世大学) Instituto de Investigación Sanitaria Gregorio Marañón (IiSGM)(格雷戈里·马兰农卫生研究院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出基于深度生成模型合成MALDI-TOF质谱数据,以解决微生物鉴定中数据稀缺问题,提升机器学习模型的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17550 2025-11-25 cs.NE cs.AI cs.LG 50%

Gate-level boolean evolutionary geometric attention neural networks

门级布尔进化几何注意力神经网络

Xianshuai Shi, Jianfeng Zhu, Leibo Liu

机构 * School of Integrated Circuits, Tsinghua University(集成电路学院,清华大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种基于布尔域的门级进化几何注意力神经网络,通过布尔反应-扩散机制实现图像处理,结合自注意力与RoPE技术,具备高效率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10241 2025-11-25 cs.LG 50%

Kernel-Adaptive PI-ELMs for Forward and Inverse Problems in PDEs with Sharp Gradients

具有核适应性的PI-ELMs用于具有陡峭梯度的PDE的正向和反向问题

Vikas Dwivedi, Balaji Srinivasan, Monica Sigovan, Bruno Sixou

机构 * CREATIS Biomedical Imaging Laboratory INSA, CNRS UMR 5220, Inserm, Universit´e Lyon 1(CREATIS生物医学成像实验室,法国里昂大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 KAPI-ELM通过核适应性方法高效解决PDE正向和反向问题,尤其在陡峭梯度区域表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20319 2025-11-25 cs.LG 50%

Bayesian Experimental Design for Model Discrepancy Calibration: An Auto-Differentiable Ensemble Kalman Inversion Approach

贝叶斯实验设计用于模型偏差校准:一种自动可微的集合卡尔曼反演方法

Huchen Yang, Xinghao Dong, Jin-Long Wu

机构 * Department of Mechanical Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校机械工程系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种基于自动可微集合卡尔曼反演的混合贝叶斯实验设计框架,用于高效校准模型偏差并推断未知物理参数。

Comments 36 pages, 13 figures

Journal ref Journal of Computational Physics, Volume 545, 2026, Article 114469

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06174 2025-11-25 cond-mat.stat-mech 50%

Thermodynamic entropic uncertainty relation

热力学熵不确定关系

Yoshihiko Hasegawa, Tomohiro Nishiyama

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究建立了热力学熵与香农熵之间的不确定关系,揭示了决策准确性与熵产之间的权衡

Comments 10 pages, 5 figures; 3 pages of supplementary material

Journal ref Phys. Rev. E 112, 054140 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04589 2025-11-25 math.PR q-fin.MF 50%

Inverting the Markovian projection for pure jump processes

对纯跳过程的马尔可夫投影进行逆向处理

Martin Larsson, Shukun Long

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了纯跳过程的马尔可夫投影逆向问题,旨在构建用于信用风险的局部随机强度模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09698 2025-11-25 cs.SI 50%

Incentivized Network Dynamics in Digital Job Recruitment

激励的网络动态在数字招聘中的应用

Blas Kolic, Manuel Cebrian, Iñaki Ucar, Rosa E. Lillo

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出IHC模型,通过结合网络扩散与求职申请停止机制,有效提升被动候选人招募效率,理论和实践上均具创新性。

Comments 22 pages (16 main, 6 appendix), 10 figures (8 main, 2 appendix)

Journal ref Journal of Complex Networks, 13(6), cnaf047 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00651 2025-11-25 nlin.CD cs.CY cs.LG q-bio.QM 50%

Adapting Physics-Informed Neural Networks for Bifurcation Detection in Ecological Migration Models

适应于生态迁移模型中分支检测的物理信息神经网络

Lujie Yin, Xing Lv

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出利用物理信息神经网络检测生态迁移模型中的Hopf分支,通过DeepXDE框架提高高维PDE求解效率,并验证了其在分支预测和动态分析中的有效性。

Comments Upon further review, we have concluded that the study is not yet complete and requires additional data and validation to support its findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15643 2025-11-25 stat.ML cs.LG cs.NA math.AP math.NA math.PR 50%

An Unconditional Representation of the Conditional Score in Infinite-Dimensional Linear Inverse Problems

条件分数的无条件表示在无限维线性逆问题中

Fabian Schneider, Duc-Lam Duong, Matti Lassas, Maarten V. de Hoop, Tapio Helin

机构 * School of Engineering Science(工程科学学院) Lappeenranta-Lahti University of Technology(拉普兰塔-拉赫蒂技术大学) Vienna University of Technology (TU Wien)(维也纳技术大学) Department of Mathematics and Statistics(数学与统计学系) University of Helsinki(赫尔辛基大学) Department of Computational and Applied Mathematics(计算与应用数学系) Rice University(里士满大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种针对线性逆问题的无条件条件分数表示方法,通过离线训练避免正向模型评估,实现高效且精确的采样。

Comments 37 pages, 13 figures, 3 tables. Accepted in TMLR November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 8 篇

2511.19268 2025-11-25 cs.CV 85%

BideDPO: Conditional Image Generation with Simultaneous Text and Condition Alignment

BideDPO:基于文本和条件对齐的同时图像生成

Dewei Zhou, Mingwei Li, Zongxin Yang, Yu Lu, Yunqiu Xu, Zhizhong Wang, Zeyi Huang, Yi Yang

机构 * Zhejiang University(浙江大学) Harvard University(哈佛大学) Huawei Technologies Ltd., China(华为技术有限公司)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 BideDPO通过双向解耦的DPO框架解决文本与条件间的冲突,提升图像生成的准确性和一致性。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04726 2025-11-25 cs.CV cs.AI 85%

Backdoors in Conditional Diffusion: Threats to Responsible Synthetic Data Pipelines

条件扩散中的后门:对负责任的合成数据管道的威胁

Raz Lapid, Almog Dubin

机构 * Raz Lapid Almog Dubin

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种针对ControlNet的模型污染攻击,通过后门生成攻击者指定内容,并提出CFT方法作为防御措施。

Comments Accepted at RDS @ AAAI 2026

Journal ref AAAI 2026 Workshop on Shaping Responsible Synthetic Data in the Era of Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03596 2025-11-25 cs.CV 79%

ControlThinker: Unveiling Latent Semantics for Controllable Image Generation through Visual Reasoning

ControlThinker: 通过视觉推理揭示潜在语义以实现可控图像生成

Feng Han, Yang Jiao, Shaoxiang Chen, Junhao Xu, Jingjing Chen, Yu-Gang Jiang

机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) Shanghai Collaborative Innovation Center on Intelligent Visual Computing(上海智能视觉计算协同创新中心) MiniMax

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 ControlThinker通过视觉推理挖掘潜在语义,提升可控图像生成的语义一致性和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18204 2025-11-25 cs.CV 70%

Generating Synthetic Human Blastocyst Images for In-Vitro Fertilization Blastocyst Grading

生成合成人类囊胚图像用于体外受精囊胚分级

Pavan Narahari, Suraj Rajendran, Lorena Bori, Jonas E. Malmsten, Qiansheng Zhan, Zev Rosenwaks, Nikica Zaninovic, Iman Hajirasouliha

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 DIA框架通过生成高保真的合成囊胚图像,解决体外受精中囊胚分级的数据稀缺和类别不平衡问题,提升AI评估工具的性能和标准化。

Comments The manuscript is 23 pages, with five main figures and one table. The supplemental material includes 23 pages with fourteen figures and four tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18277 2025-11-25 cs.CV 57%

Point-to-Point: Sparse Motion Guidance for Controllable Video Editing

点到点:用于可控视频编辑的稀疏运动引导

Yeji Song, Jaehyun Lee, Mijin Koo, JunHoo Lee, Nojun Kwak

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Point-to-Point通过引入锚点标记,利用视频扩散模型的先验知识,实现可控视频编辑中运动与编辑的高质量保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18173 2025-11-25 cs.CV 57%

EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses

EgoControl: 通过3D全身姿态实现可控的目视视频生成

Enrico Pallotta, Sina Mokhtarzadeh Azar, Lars Doorenbos, Serdar Ozsoy, Umar Iqbal, Juergen Gall

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉玛尔人工智能与机器学习研究所) NVIDIA(NVIDIA公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 EgoControl通过3D全身姿态控制生成高质量的目视视频,实现对动作的精细控制,推动具身AI的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17273 2025-11-25 math.OC 50%

The LQR-Schr{ö}dinger Bridge

LQR-薛定谔桥

Marc Lambert

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种基于LQR成本的薛定谔桥问题求解方法,通过双Riccati方程系统闭式解,实现复杂高斯过程的构造与非均匀扩展。

Journal ref 64th IEEE Conference on Decision and Control, Dec 2025, Rio de Jaineiro, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17906 2025-11-25 cs.HC cs.AI 50%

AnimAgents: Coordinating Multi-Stage Animation Pre-Production with Human-Multi-Agent Collaboration

AnimAgents: 协调多阶段动画前期制作的人机多智能体协作

Wen-Fan Wang, Chien-Ting Lu, Jin Ping Ng, Yi-Ting Chiu, Ting-Ying Lee, Miaosen Wang, Bing-Yu Chen, Xiang 'Anthony' Chen

机构 * National Taiwan University(国立台湾大学) Google DeepMind(谷歌DeepMind) HCI Research, UCLA(人机交互研究, UCLA)

专题命中 可控生成 :image generation(abstract)

AI总结 AnimAgents通过人机多智能体协作系统,协调多阶段动画前期制作流程,提升协调性、一致性和信息管理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 5 篇

2511.14208 2025-11-25 cs.CV 83%

InstantViR: Real-Time Video Inverse Problem Solver with Distilled Diffusion Prior

InstantViR: 基于蒸馏扩散先验的实时视频逆问题求解器

Weimin Bai, Suzhe Xu, Yiwei Ren, Jinhua Hao, Ming Sun, Wenzheng Chen, He Sun

机构 * Peking University(北京大学) Huaqiao University(华侨大学) Kuaishou Technology(快手科技)

专题命中 图像修复 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 InstantViR通过蒸馏扩散先验实现高效实时视频重建,以35 FPS速度在NVIDIA A100 GPU上达到与基线相当的重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19437 2025-11-25 cs.CV 57%

LumiTex: Towards High-Fidelity PBR Texture Generation with Illumination Context

LumiTex: 向高保真PBR纹理生成迈进:基于照明上下文

Jingzhi Bao, Hongze Chen, Lingting Zhu, Chenyu Liu, Runze Zhang, Keyang Luo, Zeyu Hu, Weikai Chen, Yingda Yin, Xin Wang, Zehong Lin, Jun Zhang, Xiaoguang Han

机构 * CUHK(SZ)(香港中文大学(深圳)) HKUST(香港理工大学) HKU(香港大学) PKU(北京大学) LIGHTSPEED

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 LumiTex通过结合光照上下文和几何引导的修补模块,实现了高保真的PBR纹理生成,提升了材料分解和无缝纹理完成的性能。

Comments Project page: https://lumitex.vercel.app

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19169 2025-11-25 cs.CV 57%

Test-Time Preference Optimization for Image Restoration

测试时偏好优化用于图像恢复

Bingchen Li, Xin Li, Jiaqi Xu, Jiaming Guo, Wenbo Li, Renjing Pei, Zhibo Chen

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 本文提出测试时偏好优化方法,通过生成偏好数据和自动指标,提升图像恢复质量并适应多种任务。

Comments Accepted by AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18668 2025-11-25 cs.CV eess.IV 57%

Data Augmentation Strategies for Robust Lane Marking Detection

用于稳健车道标记检测的数据增强策略

Flora Lian, Dinh Quang Huynh, Hector Penades, J. Stephany Berrio Perez, Mao Shan, Stewart Worrall

机构 * The University of Sydney(悉尼大学) Australian Centre for Robotics(澳大利亚机器人中心)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 本文提出基于生成AI的数据增强方法,提升车道标记检测在不同视角下的鲁棒性,通过几何变换、图像修复和车辆叠加模拟部署场景,提升模型在阴影等干扰下的性能。

Comments 8 figures, 2 tables, 10 pages, ACRA, Australasian conference on robotics and automation

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08227 2025-11-25 cs.CV cs.AI 57%

OMGSR: You Only Need One Mid-timestep Guidance for Real-World Image Super-Resolution

OMGSR: 仅需一个中时步引导即可实现真实世界图像超分辨率

Zhiqiang Wu, Zhaomang Sun, Tong Zhou, Bingtao Fu, Ji Cong, Yitong Dong, Huaqi Zhang, Xuan Tang, Mingsong Chen, Xian Wei

机构 * East China Normal University(东华师范大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 OMGSR通过预计算中时步和引入LRR损失,提升真实世界图像超分辨率的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 5 篇

2504.06144 2025-11-25 cs.CV 85%

A Training-Free Style-aligned Image Generation with Scale-wise Autoregressive Model

无训练的风格对齐图像生成方法:基于尺度的自回归模型

Jihun Park, Jongmin Gim, Kyoungmin Lee, Minseok Oh, Minwoo Choi, Jaeyeul Kim, Woo Chool Park, Sunghoon Im

机构 * DGIST, Daegu, Republic of Korea(韩国大邱科学技术院) KETI, Republic of Korea(韩国科技信息院)

专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出一种无训练的风格对齐图像生成方法,通过基于尺度的自回归模型提升生成质量与推理速度,实现风格一致性与高效生成。

Comments 18 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18922 2025-11-25 cs.CV 57%

One4D: Unified 4D Generation and Reconstruction via Decoupled LoRA Control

One4D:通过解耦LoRA控制实现统一的4D生成与重建

Zhenxing Mi, Yuxin Wang, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 One4D通过解耦LoRA控制实现4D生成与重建的统一框架,提升视频扩散模型在几何重建中的性能

Comments Project page: https://mizhenxing.github.io/One4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23951 2025-11-25 cs.CV 57%

JointTuner: Appearance-Motion Adaptive Joint Training for Customized Video Generation

JointTuner: 用于定制视频生成的外观-运动自适应联合训练

Fangda Chen, Shanshan Zhao, Chuanfu Xu, Long Lan

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) Alibaba International Digital Commerce(阿里巴巴国际数字商业)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 JointTuner通过联合优化外观和运动组件,提出GLoRA和AiT Loss解决定制视频生成中的外观污染和运动模式学习问题。

Comments Project Page: https://fdchen24.github.io/JointTuner-Website

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18307 2025-11-25 cs.CV cs.AI cs.LG 57%

ScriptViT: Vision Transformer-Based Personalized Handwriting Generation

ScriptViT: 基于视觉变换器的个性化手写生成

Sajjan Acharya, Rajendra Baskota

机构 * Independent Researcher(独立研究者)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 ScriptViT通过基于视觉变换器的风格编码器和交叉注意力机制,实现更准确且风格一致的个性化手写生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21953 2025-11-25 cs.CV 57%

MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment

MultiCrafter: 通过解耦注意力和身份感知偏好对齐实现高保真的多主体生成

Tao Wu, Yibo Jiang, Yehao Lu, Zhizhong Wang, Zeyi Huang, Zequn Qin, Xi Li

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Software Technology, Zhejiang University(浙江大学软件技术学院) Huawei Technologies Ltd(华为技术有限公司)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 MultiCrafter通过解耦注意力和身份感知偏好对齐,提升多主体生成的保真度和人类偏好对齐能力。

Comments Project Page: https://wutao-cs.github.io/MultiCrafter/

详情

展开后加载摘要…

URL PDF HTML 收藏