arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-16 至 2026-02-16 共收录 62 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 43 篇

2602.11850 2026-02-16 cs.CV cs.LG 57%

Free Lunch for Stabilizing Rectified Flow Inversion

为稳定修正流反向操作获取免费午餐

Chenru Wang, Beier Zhu, Chi Zhang

机构 * Westlake University(西湖大学) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出PMI和mimic-CFG方法,通过稳定速度场提升修正流反向操作的稳定性与重建质量,减少计算资源消耗。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09600 2026-02-16 cs.CV 57%

Hand2World: Autoregressive Egocentric Interaction Generation via Free-Space Hand Gestures

Hand2World: 通过自由空间手势生成自主回归的视角交互

Yuxi Wang, Wenqi Ouyang, Tianyi Wei, Yi Dong, Zhiqi Shen, Xingang Pan

机构 * College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Hand2World通过自由空间手势生成视角交互,利用自回归框架解决遮挡、相机运动解耦和长视频生成问题,提升视觉生成的质量与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13174 2026-02-16 cs.LG math.AP 50%

Learning functional components of PDEs from data using neural networks

利用神经网络从数据中学习偏微分方程的功能组件

Torkel E. Loman, Yurij Salmaniw, Antonio Leon Villares, Jose A. Carrillo, Ruth E. Baker

机构 * Department of Mathematics, Physics and Geology(数学、物理与地质系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出利用神经网络从数据中学习偏微分方程的功能组件,通过非局部聚合-扩散方程案例研究,展示如何从稳态数据中恢复未知函数。

Comments 16 pages with 6 figures. Additional 24 pages and 19 figures supplementary information

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13079 2026-02-16 math.NA cs.NA 50%

Multi-physics Preconditioning for Thermally Activated Batteries

多物理场预条件化用于热激活电池

Malachi Phillips

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种多物理场预条件化方法,用于提高热激活电池模拟的计算效率和并行性能。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12829 2026-02-16 cs.LG cs.AI 50%

FLAC: Maximum Entropy RL via Kinetic Energy Regularized Bridge Matching

FLAC:通过动能正则化桥匹配实现最大熵强化学习

Lei Lv, Yunfei Li, Yu Luo, Fuchun Sun, Xiao Ma

机构 * Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 FLAC通过动能正则化桥匹配实现最大熵强化学习,无需显式密度估计,提升高维任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07738 2026-02-16 cs.LG cs.AI 50%

Learnable Chernoff Baselines for Inference-Time Alignment

可学习的Chernoff基线用于推理时间对齐

Sunil Madhow, Yuchen Liang, Ness Shroff, Yingbin Liang, Yu-Xiang Wang

机构 * Ohio State University(俄亥俄州立大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出可学习的Chernoff基线,通过高效采样实现生成模型的推理时间对齐,减少计算成本并提升对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21688 2026-02-16 astro-ph.SR 50%

The Effect of Magnetic Field Dissipation in the Inner Heliosheath: Reconciling Global Heliosphere Model and Voyager Data

内日鞘中磁场耗散的影响:协调全球日球模型与维加数据

Sergey D. Korolkov, Igor I. Baliukin, Merav Opher

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过引入现象学耗散项,协调全球日球模型与维加观测数据,解决内日鞘中磁场剖面的不一致问题。

Journal ref Advances in Space Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17576 2026-02-16 cond-mat.mtrl-sci 50%

Atomistic modeling of uranium monocarbide with a machine learning interatomic potential

铀单碳化物的原子级建模:一种机器学习互原子势能函数

Lorena Alzate-Vargas, Kashi N. Subedi, Roxanne M. Tutchton, Michael W. D. Cooper, Tammie Gibson, Richard A. Messerly

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过机器学习互原子势能函数建模铀单碳化物,实现了对其结构、热物理性质及扩散行为的高效预测,为反应堆燃料认证提供了计算工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00730 2026-02-16 cs.LG stat.ML 50%

Generating Physical Dynamics under Priors

在先验下生成物理动力学

Zihan Zhou, Xiaoxue Wang, Tianshu Yu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种整合物理先验的生成模型,通过分布和物理可行性先验生成符合物理规律的动态,提升数据驱动物理研究的准确性与鲁棒性。

Journal ref International Conference on Learning Representations (ICLR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.03411 2026-02-16 stat.CO 50%

Cosine Series Representation

余弦级数表示

Moo K. Chung

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出基于显式正交基展开的功能数据分析框架,用于建模和去噪复杂生物医学信号,展示其在可扩展和可解释的功能建模中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12616 2026-02-16 eess.SY cs.RO cs.SY 50%

When Environments Shift: Safe Planning with Generative Priors and Robust Conformal Prediction

当环境变化时:利用生成先验和鲁棒符合预测进行安全规划

Kaizer Rahaman, Jyotirmoy V. Deshmukh, Ashish R. Hota, Lars Lindemann

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种在分布偏移下具有鲁棒性的安全规划框架,通过生成先验和鲁棒符合预测方法,提供概率安全保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12599 2026-02-16 hep-ph 50%

Conservation laws and effective hadronization models

守恒定律与有效介子化模型

Tony Menzo

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究通过将介子化过程建模为受约束的随机扩散过程,揭示了守恒定律对碎片化步骤的非马尔可夫相关性,并通过h-变换重整化局部动力学,实现了紫外与红外效应的分离。

Comments 41+18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12545 2026-02-16 astro-ph.IM 50%

Guangqi: A two-dimensional radiation hydrodynamic code with realistic equation of states

广启:一种具有真实方程的二维辐射水动力学代码

Zhuo Chen, Xue-Ning Bai

专题命中 扩散模型 :diffusion(abstract)

AI总结 广启是一种用于高能天体物理模拟的二维辐射水动力学代码,支持复杂方程和角动量守恒,通过自适应网格细化和非均匀网格优化计算效率。

Comments 24 pages. Accepted by the ApJS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12456 2026-02-16 math.PR 50%

Strong solutions and sharp Euler--Maruyama approximations for SDEs with Lebesgue--Dini drift

强解与SDEs中Lebesgue-Dini漂移的精确Euler-Maruyama近似

Jinlong Wei, Junhao Hu, Guangying Lv, Chenggui Yuan

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了具有Lebesgue-Dini漂移的随机微分方程的强解及Euler-Maruyama近似,证明了强误差估计并展示了收敛阶的精确性。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12307 2026-02-16 astro-ph.IM astro-ph.EP 50%

GAMERA-OP: A three-dimensional finite-volume MHD solver for orthogonal curvilinear geometries

GAMERA-OP:一种用于正交曲线坐标系的三维有限体积磁流体动力学求解器

Hongyang Luo, Binzheng Zhang, Jiaxing Tian, Jinshu Cai, Junjie Chen, Enhao Feng, Zhiqi Zheng, Sheng Xi, John G. Lyon

专题命中 扩散模型 :diffusion(abstract)

AI总结 GAMERA-OP是一种基于正交曲线坐标系的高阶三维MHD求解器,采用约束传输方法保持磁场无散,支持多种数值通量和时间积分器,并具备高精度和低数值扩散的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09654 2026-02-16 cs.LG 50%

Membership and Dataset Inference Attacks on Large Audio Generative Models

成员和数据集推断攻击在大型音频生成模型上

Jakub Proboszcz, Paweł Kochanski, Karol Korszun, Donato Crisostomi, Giorgio Strano, Emanuele Rodolà, Kamil Deja, Jan Dubinski

机构 * Warsaw University of Technology(华沙技术大学) Sapienza University of Rome(罗马萨皮恩扎大学) IDEAS Research Institute(IDEAS研究所) NASK National Research Institute(NASK国家研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过数据集推断攻击探讨了大型音频生成模型中验证艺术家作品是否被训练所用的可行性,发现DI在音频领域具有实际应用价值。

Comments NeurIPS 2025 AI for Music Workshop NeurIPS 2025 Workshop on Creativity & Generative AI

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 6 篇

2602.12205 2026-02-16 cs.CV cs.AI 79%

DeepGen 1.0: A Lightweight Unified Multimodal Model for Advancing Image Generation and Editing

DeepGen 1.0: 一种轻量级统一多模态模型,用于推进图像生成与编辑

Dianyi Wang, Ruihang Li, Feng Han, Chaofan Ma, Wei Song, Siyuan Wang, Yibin Wang, Yi Xin, Hongjian Liu, Zhixiong Zhang, Shengyuan Ding, Tianhang Wang, Zhenglin Cheng, Tao Lin, Cheng Jin, Kaicheng Yu, Jingjing Chen, Wenjie Wang, Zhongyu Wei, Jiaqi Wang

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Nanjing University(南京大学) University of Southern California(南加州大学)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 DeepGen 1.0通过轻量级统一多模态模型在图像生成与编辑领域实现高性能,采用SCB框架和数据驱动训练策略,超越大参数模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05100 2026-02-16 cs.CE cs.CV cs.SC 57%

Rule-Based Spatial Mixture-of-Experts U-Net for Explainable Edge Detection

基于规则的时空专家混合U-Net可解释边缘检测

Bharadwaj Dogga, Kaaustaaub Shankar, Gibin Raju, Wilhelm Louw, Kelly Cohen

机构 * Ph.D. Candidate, AI Bio Lab, Digital Futures, University of Cincinnati, \ , OH 45221, USA e-mail: Research Student, AI Bio Lab, Digital Futures, University of Cincinnati, \ , OH 45221, USA e-mail: Postdoctoral Researcher, Department of Multidisciplinary Engineering, TA\&M University, \ Station, TX 77843, USA e-mail: Research Associate AI Bio Lab, Digital Futures, University of Cincinnati, \ , OH 45221, USA e-mail: Director AI Bio Lab, Digital Futures, University of Cincinnati, \ , OH 45221, USA e-mail

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 基于规则的时空专家混合U-Net通过融合深度语义特征与启发式边缘信号,实现边缘检测的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12401 2026-02-16 cs.CV 57%

ZeroDiff++: Substantial Unseen Visual-semantic Correlation in Zero-shot Learning

ZeroDiff++: 零样本学习中显著的未见视觉-语义相关性

Zihan Ye, Shreyank N Gowda, Kaile Du, Weijian Luo, Ling Shao

机构 * UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学Terminus AI实验室,中国科学院大学) School of Computer Science, the University of Nottingham(诺丁汉大学计算机学院) Southeast University(东南大学) hi-lab of Xiaohongshu Inc(小红书公司hi实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ZeroDiff++通过扩散生成框架提升零样本学习中视觉-语义相关性,解决虚假相关性和数据稀缺问题。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00741 2026-02-16 eess.IV cs.CV 57%

LesionDiffusion: Towards Text-controlled General Lesion Synthesis

LesionDiffusion:面向文本控制的通用病变合成

Wenhui Lei, Henrui Tian, Linrui Dai, Hanyu Chen, Xiaofan Zhang

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The First Hospital of China Medical University(中国医科大学第一医院)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 LesionDiffusion通过文本控制生成3D CT影像中的病变及掩码,提升病变分割性能,支持多种病变类型和器官,优于现有方法。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01504 2026-02-16 cs.LG 50%

Instruction-based Time Series Editing

基于指令的时间序列编辑

Jiaxing Qiu, Dongliang Guo, Brynne Sullivan, Teague R. Henry, Thomas Hartvigsen

机构 * University of Virginia(弗吉尼亚大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 InstructTime是一种基于指令的时间序列编辑器,通过自然语言指令实现灵活且可控的编辑,能够生成高质量的编辑结果并适应新条件。

Comments (KDD 26) Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05748 2026-02-16 cond-mat.mtrl-sci cond-mat.mes-hall 50%

Depth Profiling of Oxygen Migration in Ta/HfO2 Stacks During Ionic Liquid Gating

Ta/HfO2堆叠中氧迁移深度分析:在离子液体栅极下的研究

Beatrice Bednarz, Martin Wortmann, Olga Kuschel, Fabian Kammerbauer, Mathias Kläui, Andreas Hütten, Joachim Wollschläger, Gerhard Jakob, Timo Kuschel

专题命中 可控生成 :diffusion(abstract)

AI总结 研究通过IL栅极技术分析Ta/HfO2堆叠中氧迁移深度,揭示了氧掺杂与电场、氧化物厚度的关系,为磁离子和纳米离子器件设计提供理论依据。

Comments Document containing manuscript and supporting information

Journal ref ACS Appl. Mater. Interfaces 18, 6200 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 2 篇

2602.12742 2026-02-16 cs.CV cs.LG 70%

Synthetic Craquelure Generation for Unsupervised Painting Restoration

无监督绘画修复中的合成裂纹生成

Jana Cuch-Guillén, Antonio Agudo, Raül Pérez-Gonzalo

机构 * Universitat de Barcelona(巴塞罗那大学) Institut de Robòtica i Informàtica Industrial(机器人与信息技术研究所)

专题命中 图像修复 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出一种无标注的合成裂纹生成框架,结合形态检测与学习细化模块,通过各向异性扩散修复实现高质量绘画修复。

Comments Accepted to CAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12701 2026-02-16 cs.SD 50%

DisSR: Disentangling Speech Representation for Degradation-Prior Guided Cross-Domain Speech Restoration

DisSR:解构语音表示以指导降质先验引导的跨域语音修复

Ziqi Liang, Zhijun Jia, Chang Liu, Minghui Yang, Zhihong Lu, Jian Wang

机构 * AntGroup(蚂蚁集团) University of Science and Technology of China(中国科学技术大学)

专题命中 图像修复 :diffusion(abstract)

AI总结 DisSR通过降质先验引导和跨领域对齐训练,提升语音修复在不同降质和领域下的泛化能力与修复质量。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 4 篇

2602.13131 2026-02-16 cs.HC 86%

Preference-Guided Prompt Optimization for Text-to-Image Generation

基于偏好的提示优化用于文本到图像生成

Zhipeng Li, Yi-Chi Liao, Christian Holz

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(title)

AI总结 APPO通过用户偏好反馈实现高效提示优化,减少迭代次数和认知负担,提升人机协作生成任务的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13028 2026-02-16 cs.CV cs.CL 79%

Human-Aligned MLLM Judges for Fine-Grained Image Editing Evaluation: A Benchmark, Framework, and Analysis

面向细粒度图像编辑评估的人类对齐MLLM评判:一个基准、框架和分析

Runzhou Liu, Hailey Weingord, Sejal Mittal, Prakhar Dungarwal, Anusha Nandula, Bo Ni, Samyadeep Basu, Hongjie Chen, Nesreen K. Ahmed, Li Li, Jiayi Zhang, Koustava Goswami, Subhojyoti Mukherjee, Branislav Kveton, Puneet Mathur, Franck Dernoncourt, Yue Zhao, Yu Wang, Ryan A. Rossi, Zhengzhong Tu, Hongru Du

机构 * University of Virginia(弗吉尼亚大学) Columbia University(哥伦比亚大学) Vanderbilt University(范德比大学) Adobe Research(Adobe研究) Dolby Laboratories(杜比实验室) Cisco Research(思科研究) University of Southern California(南加州大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Oregon(俄勒冈大学) Texas A&M University(德克萨斯大学)

专题命中 图像生成评测 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出细粒度MLLM评判框架,通过分解十二个可解释因素,提升图像编辑评估的精度与实用性,为研究和改进图像编辑方法提供实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13066 2026-02-16 cs.CV 57%

A Calibrated Memorization Index (MI) for Detecting Training Data Leakage in Generative MRI Models

一种校准的记忆指数(MI)用于检测生成磁共振成像模型中的训练数据泄漏

Yash Deo, Yan Jia, Toni Lassila, Victoria J Hodge, Alejandro F Frang, Chenghao Qian, Siyuan Kang, Ibrahim Habli

机构 * Department of Computer Science, University of York(约克大学计算机科学系) School of Computer Science, University of Leeds(利兹大学计算机科学学院) Department of Computing and Mathematics, Manchester Metropolitan University(曼彻斯特 Metropolitan 大学计算与数学系) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Department of Cardiovascular Sciences, KU Leuven(鲁汶大学心血管科学系)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出了一种校准的记忆指数(MI)用于检测生成磁共振成像模型中的训练数据泄漏,通过图像特征提取和多层白化最近邻相似性分析,实现对复制数据的高效检测。

Comments Accepted in ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12563 2026-02-16 cs.CV 57%

The Constant Eye: Benchmarking and Bridging Appearance Robustness in Autonomous Driving

恒定的眼睛:自动驾驶中外观鲁棒性的基准测试与弥合

Jiabao Wang, Hongyu Zhou, Yuanbo Yang, Jiahao Shao, Yiyi Liao

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出navdream基准测试,通过生成像素对齐的风格迁移,评估自动驾驶算法在极端天气等外观变化下的鲁棒性,并提出通用感知接口实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 3 篇

2602.12640 2026-02-16 cs.CV 92%

ImageRAGTurbo: Towards One-step Text-to-Image Generation with Retrieval-Augmented Diffusion Models

ImageRAGTurbo: 向一步文本到图像生成迈进的检索增强扩散模型

Peijie Qiu, Hariharan Ramshankar, Arnau Ramisa, René Vidal, Amit Kumar K C, Vamsi Salaka, Rahul Bhagat

机构 * Amazon Core Search(亚马逊核心搜索)

专题命中 效率与蒸馏 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 ImageRAGTurbo通过检索增强扩散模型实现高效一步文本到图像生成,提升图像质量并减少延迟。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12624 2026-02-16 cs.LG cs.CV 79%

Formalizing the Sampling Design Space of Diffusion-Based Generative Models via Adaptive Solvers and Wasserstein-Bounded Timesteps

通过自适应求解器和Wasserstein有界时间步长形式化扩散基生成模型的采样设计空间

Sangwoo Jo, Sungjoon Choi

机构 * Department of Artificial Intelligence, Korea University, Seoul, South Korea(人工智能系,韩国大学,首尔,韩国)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 SDM通过自适应求解器和Wasserstein有界时间步长,提升扩散生成模型的采样效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏