arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-19 至 2026-02-19 共收录 45 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 37 篇

2602.15906 2026-02-19 math.NA cs.NA quant-ph 50%

Quantum-Inspired Tensor Networks for Approximating PDE Flow Maps

量子启发张量网络用于近似偏微分方程流映射

Nahid Binandeh Dehaghani, Ban Q. Tran, Rafal Wisniewski, Susan Mengel, A. Pedro Aguiar

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出利用量子启发张量网络近似偏微分方程的流映射,通过矩阵乘积态和矩阵乘积算子实现低秩结构,验证了其在流体动力学方程中的有效性。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21093 2026-02-19 stat.ML cs.LG math.OC math.PR math.ST stat.TH 50%

High-dimensional learning dynamics of multi-pass Stochastic Gradient Descent in multi-index models

多索引模型中多轮随机梯度下降高维学习动态

Zhou Fan, Leda Wang

机构 * Department of Statistics and Data Science, Yale University(统计与数据科学系,耶鲁大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究多索引模型中多轮SGD的高维学习动态,揭示其与SME和梯度流的动力学差异,提供渐近精确的均场方程描述。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06308 2026-02-19 cond-mat.mtrl-sci cond-mat.other 50%

Resistance of refractory high-entropy alloys to ultrafast laser irradiation

难熔高熵合金对超快激光辐照的抗性

Nikita Medvedev

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过建模揭示了难熔高熵合金在超快激光辐照下的抗性机制,发现其电子热容和耦合参数在高温下表现优异,且在高沉积剂量下未出现非热熔化,表明重元素高熵合金具有更强的辐射抗性。

Journal ref Radiation Physics and Chemistry 243 (2026) 113694

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20928 2026-02-19 stat.ML cs.LG 50%

Conditionally Whitened Generative Models for Probabilistic Time Series Forecasting

条件性白化生成模型用于概率时间序列预测

Yanfeng Yang, Siwei Chen, Pingping Hu, Zhaotong Shen, Yingjie Zhang, Zhuoran Sun, Shuai Li, Ziqi Chen, Kenji Fukumizu

机构 * Graduate University of Advanced Studies & The Institute of Statistical Mathematics(高级研究大学及统计数学研究所) East China Normal University(华东师范大学) The Institute of Statistical Mathematics(统计数学研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出条件性白化生成模型,通过整合条件均值和协方差信息,提升多变量时间序列预测性能。

Comments Accepted by the fourteenth International Conference on Learning Representations (ICLR 2026). https://openreview.net/forum?id=GG01lCopSK

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00454 2026-02-19 cs.LG 50%

Universal Properties of Activation Sparsity in Modern Large Language Models

现代大语言模型中激活稀疏性的通用性质

Filip Szatkowski, Patryk Będkowski, Alessio Devoto, Jan Dubiński, Pasquale Minervini, Mikołaj Piórczyński, Simone Scardapane, Bartosz Wójcik

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究提出了一种通用框架,系统研究了现代大语言模型中激活稀疏性的通用性质,并揭示了其随着模型规模增大而增强的潜力。

Comments ICLR 2026, main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05624 2026-02-19 math.NA cs.NA physics.ao-ph 50%

Stability analyses of divergence and vorticity damping on gnomonic cubed-sphere grids

立方体网格上的散度和涡度阻尼稳定性分析

Timothy C. Andrews, Christiane Jablonowski

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文分析了立方体网格上散度和涡度阻尼的稳定性限制,比较了理论与实际应用中的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20294 2026-02-19 math.AP 50%

Global well-posedness and relaxation for solutions of the Fokker-Planck-Alignment equations

Fokker-Planck-Alignment方程解的全局well-posed性与松弛性

R. Shvydkoy

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了Fokker-Planck-Alignment方程解的全局well-posed性,提出了一种新的厚度重正化方法,证明了在无正则性或无真空要求下,初始数据可生成全局光滑解并以指数速度松弛。

Comments 44 pages, updated version with many details added to renormalization and existence proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19205 2026-02-19 cs.DS cs.SI 50%

Overcoming Non-Submodularity: Towards Constant Approximation for Network Immunization

克服非子模性:面向网络免疫的常数近似方法

Ajitesh Srivastava, Shang-Hua Teng

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过利用扩散过程的随机结构,证明在稀疏级联网络中,经典贪心算法能够实现网络免疫问题的常数因子近似。

Comments Found a flaw in the proof making the derivation of the approximation incorrect

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 4 篇

2602.16664 2026-02-19 cs.CV 70%

Unpaired Image-to-Image Translation via a Self-Supervised Semantic Bridge

无配对图像到图像翻译的自监督语义桥

Jiaming Liu, Felix Petersen, Yunhe Gao, Yabin Zhang, Hyojin Kim, Akshay S. Chaudhari, Yu Sun, Stefano Ermon, Sergios Gatidis

机构 * Stanford University(斯坦福大学) LLNL(劳伦斯利弗莫尔国家实验室) Johns Hopkins University(约翰霍普金斯大学)

专题命中 可控生成 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出自监督语义桥框架,通过整合外部语义先验实现无配对图像到图像翻译的高保真度,提升医学图像合成效果。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15922 2026-02-19 cs.RO cs.CV cs.LG 57%

World Action Models are Zero-shot Policies

世界动作模型是零样本策略

Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George Kurian, Suneel Indupuru, You Liang Tan, Chuning Zhu, Jiannan Xiang, Ayaan Malik, Kyungmin Lee, William Liang, Nadun Ranawaka, Jiasheng Gu, Yinzhen Xu, Guanzhi Wang, Fengyuan Hu, Avnish Narayan, Johan Bjorck, Jing Wang, Gwanghyun Kim, Dantong Niu, Ruijie Zheng, Yuqi Xie, Jimmy Wu, Qi Wang, Ryan Julian, Danfei Xu, Yilun Du, Yevgen Chebotar, Scott Reed, Jan Kautz, Yuke Zhu, Linxi "Jim" Fan, Joel Jang

机构 * NVIDIA

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DreamZero通过世界动作模型实现零样本策略,有效提升机器人在新任务和环境中的泛化能力,同时支持跨身体转移和少样本适应。

Comments Project page: https://dreamzero0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17091 2026-02-19 cs.CV cs.AI cs.LG 57%

Ctrl-GenAug: Controllable Generative Augmentation for Medical Sequence Classification

Ctrl-GenAug: 可控生成增强用于医学序列分类

Xinrui Zhou, Yuhao Huang, Haoran Dou, Shijing Chen, Ao Chang, Jia Liu, Weiran Long, Jian Zheng, Erjiao Xu, Jie Ren, Alejandro F. Frangi, Ruobing Huang, Jun Cheng, Xiaomeng Li, Wufeng Xue, Dong Ni

机构 * National-Regional Key Technology Engineering Laboratory for Medical Ultrasound(国家级区域医疗超声关键技术工程实验室) School of Biomedical Engineering(生物医学工程学院) Medical School(医学院) Shenzhen University(深圳大学) Medical UltraSound Image Computing (MUSIC) Lab(医学超声图像计算(MUSIC)实验室) School of Artificial Intelligence(人工智能学院) The Hong Kong University of Science and Technology(香港科学与技术大学) Department of Electronic and Computer Engineering(电子与计算机工程系) The University of Manchester(曼彻斯特大学) The Third Affiliated Hospital of Sun Yat-sen University(中山大学第三附属医院) Longgang District People’s Hospital of Shenzhen(深圳龙岗区人民医院) The Second Affiliated Hospital of The Chinese University of Hong Kong(香港中文大学第二附属医院) School of Biomedical Engineering and Informatics(生物医学工程与信息学学院) NIHR Manchester Biomedical Research Centre(NIHR曼彻斯特生物医学研究中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Ctrl-GenAug通过可控生成增强方法提升医学序列分类性能,解决语义和序列可控性不足及噪声样本问题。

Comments Accepted by International Journal of Computer Vision, 30 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16092 2026-02-19 cs.LG cs.CL 50%

Why Any-Order Autoregressive Models Need Two-Stream Attention: A Structural-Semantic Tradeoff

为何任意顺序自回归模型需要双流注意力:一种结构-语义权衡

Patrick Pynadath, Ruqi Zhang

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出Decoupled RoPE,通过解耦位置与内容信息,揭示任意顺序生成中结构-语义权衡的本质,表明双流注意力的作用在于解决这一深层权衡而非单纯解耦位置与内容。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 1 篇

2502.17863 2026-02-19 cs.CV cs.AI 57%

A Survey: Spatiotemporal Consistency in Video Generation

综述:视频生成中的时空一致性

Zhiyu Yin, Kehai Chen, Xuefeng Bai, Ruili Jiang, Juntao Li, Hongdong Li, Jin Liu, Yang Xiang, Jun Yu, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Peng Cheng Laboratory(鹏城实验室) School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 本文综述了视频生成中时空一致性的最新进展,涵盖生成模型、特征表示、训练策略等,探讨了未来研究方向和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 效率与蒸馏 2 篇

2507.13074 2026-02-19 cs.CV 57%

Label-Consistent Dataset Distillation with Detector-Guided Refinement

带检测器引导的精修数据集蒸馏

Yawen Zou, Guang Li, Zi Wang, Chunzhi Gu, Chao Zhang

机构 * University of Toyama(东浓大学) Hokkaido University(北海道大学) Niigata University(新潟大学) Toyohashi University of Technology(toyohashi技术大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种检测器引导的数据集蒸馏方法,通过利用预训练检测器识别并精修异常合成样本,提升数据集的标签一致性和图像质量,实现更优的下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08822 2026-02-19 cs.RO cs.AI 50%

FreqPolicy: Efficient Flow-based Visuomotor Policy via Frequency Consistency

FreqPolicy: 通过频率一致性实现高效的基于流的视觉-运动策略

Yifei Su, Ning Liu, Dong Chen, Zhen Zhao, Kun Wu, Meng Li, Zhiyuan Xu, Zhengping Che, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) NLPR, MAIS, Institute of Automation of Chinese Academy of Sciences(神经语言处理实验室、人工智能研究所、中国科学院自动化研究所)

专题命中 效率与蒸馏 :image generation(abstract)

AI总结 FreqPolicy通过频率一致性约束提升基于流的视觉-运动策略的效率与质量,实现高效、高质量的动作生成。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏