arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-23 至 2026-01-23 共收录 46 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2601.16208 2026-01-23 cs.CV 88%

Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders

通过表征自编码器扩展文本到图像扩散变换器

Shengbang Tong, Boyang Zheng, Ziteng Wang, Bingda Tang, Nanye Ma, Ellis Brown, Jihan Yang, Rob Fergus, Yann LeCun, Saining Xie

机构 * New York University(纽约大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 通过扩展表征自编码器实现更高效的大规模文本到图像生成,RAE在预训练和微调中均优于VAE,且具有更快的收敛速度和更好的生成质量。

Comments website: https://rae-dit.github.io/scale-rae/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04548 2026-01-23 cs.CV 70%

Skywork UniPic 2.0: Building Kontext Model with Online RL for Unified Multimodal Model

Skywork UniPic 2.0: 通过在线强化学习构建 Kontext 模型以实现统一多模态模型

Hongyang Wei, Baixin Xu, Hongbo Liu, Size Wu, Jie Liu, Yi Peng, Peiyu Wang, Zexiang Liu, Jingwen He, Yidan Xietian, Chuanxin Tang, Zidong Wang, Yichen Wei, Liang Hu, Boyi Jiang, Wei Li, Ying He, Yang Liu, Xuchen Song, Yangguang Li, Yahui Zhou

机构 * Skywork Multimodality Team(Skywork多模态团队)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 Skywork UniPic 2.0 通过在线强化学习构建 Kontext 模型,实现统一多模态模型,提升图像生成与编辑能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15888 2026-01-23 cs.CV cs.AI 57%

Understanding the Transfer Limits of Vision Foundation Models

理解视觉基础模型的迁移限制

Shiqi Huang, Yipei Wang, Natasha Thorley, Alexander Ng, Shaheer Saeed, Mark Emberton, Shonit Punwani, Veeru Kasivisvanathan, Dean Barratt, Daniel Alexander, Yipeng Hu

机构 * University College London(伦敦大学学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文研究了视觉基础模型在迁移时的限制,发现预训练目标与下游任务需求的匹配程度影响迁移性能,提出通过改进预训练目标以提升模型效果。

Comments accepted in ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15859 2026-01-23 cs.LG cs.CV 57%

Uncertainty-guided Generation of Dark-field Radiographs

不确定性引导的暗场放射图像生成

Lina Felsner, Henriette Bast, Tina Dorosti, Florian Schaff, Franz Pfeiffer, Daniela Pfeiffer, Julia Schnabel

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出基于不确定性引导的生成对抗网络,从标准衰减X光片生成暗场图像,提升图像生成的可解释性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 2 篇

2508.10509 2026-01-23 cs.CV 70%

A Segmentation-driven Editing Method for Bolt Defect Augmentation and Detection

基于分割的螺栓缺陷增强与检测方法

Yangjie Xiao, Ke Zhang, Jiacun Wang, Xin Sheng, Yurong Guo, Meijuan Chen, Zehua Ren, Zhaoye Zheng, Zhenbing Zhao

专题命中 图像编辑 :image editing(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出基于分割的螺栓缺陷增强与检测方法,通过属性分割和编辑技术生成缺陷图像,提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15664 2026-01-23 cs.CV cs.AI 57%

Skywork UniPic 3.0: Unified Multi-Image Composition via Sequence Modeling

Skywork UniPic 3.0:通过序列建模实现统一的多图像合成

Hongyang Wei, Hongbo Liu, Zidong Wang, Yi Peng, Baixin Xu, Size Wu, Xuying Zhang, Xianglong He, Zexiang Liu, Peiyu Wang, Xuchen Song, Yangguang Li, Yang Liu, Yahui Zhou

机构 * Skywork

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 Skywork UniPic 3.0通过序列建模实现统一的多图像合成,采用新颖的训练范式和高效的数据流程,在单图像编辑和多图像合成任务中均取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 32 篇

2601.16060 2026-01-23 cs.CV 85%

ProGiDiff: Prompt-Guided Diffusion-Based Medical Image Segmentation

ProGiDiff: 基于提示引导的扩散模型医学图像分割

Yuan Lin, Murong Xu, Marc Hölle, Chinmay Prabhakar, Andreas Maier, Vasileios Belagiannis, Bjoern Menze, Suprosanna Shit

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学) University of Zurich(苏黎世大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 ProGiDiff通过提示引导的扩散模型实现医学图像分割,结合自定义编码器和多类条件化机制,提升分割性能和跨模态适应能力。

Comments 5 pages, 4 figures. It has been accepted by IEEE ISBI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15473 2026-01-23 cs.CV cs.LG eess.IV 85%

Emergence and Evolution of Interpretable Concepts in Diffusion Models

扩散模型中可解释概念的涌现与演化

Berk Tinaz, Zalan Fabian, Mahdi Soltanolkotabi

机构 * Dept. of Electrical and Computer Engineering University of Southern California(电气与计算机工程系 美国南加州大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究利用SAEs框架揭示扩散模型中可解释概念的涌现与演化,发现早期阶段可控制图像组成,中间阶段确定组成,后期仅能改变细节。

Comments 32 pages, 32 figures, published at the 39th Conference on Neural Information Processing Systems (NeurIPS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11355 2026-01-23 cs.CV 84%

Fine-Tuning Image-Conditional Diffusion Models is Easier than You Think

对图像条件扩散模型进行微调比你想象的更容易

Gonzalo Martin Garcia, Karim Knaebel, Christian Schmidt, Daan de Geus, Alexander Hermans, Bastian Leibe

机构 * RWTH Aachen University(亚琛工业大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文发现对图像条件扩散模型进行微调比预期更简单,并展示了其在深度和法线估计任务中的优越性能。

Comments WACV 2025 Oral. Project page at https://vision.rwth-aachen.de/diffusion-e2e-ft

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15872 2026-01-23 cs.SD cs.CV cs.LG cs.MM eess.AS 81%

PF-D2M: A Pose-free Diffusion Model for Universal Dance-to-Music Generation

PF-D2M:一种无姿态扩散模型用于通用舞蹈-音乐生成

Jaekwon Im, Natalia Polouliakh, Taketo Akama

机构 * Graduate School of Culture Technology, KAIST, South Korea(韩国科学技术院文化科技研究生院) Sony Computer Science Laboratories, Tokyo, Japan(东京索尼计算机科学实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 PF-D2M通过结合视觉特征和渐进训练策略,实现了通用舞蹈-音乐生成,提升了多舞者和非人类舞者场景下的同步性和音乐质量。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23494 2026-01-23 cs.CV cs.GR 81%

Yesnt: Are Diffusion Relighting Models Ready for Capture Stage Compositing? A Hybrid Alternative to Bridge the Gap

Yesnt:扩散重照明模型是否准备好用于捕获阶段合成?一种混合方法用于弥合差距

Elisabeth Jüttner, Janelle Pfeifer, Leona Krath, Stefan Korfhage, Hannah Dröge, Matthias B. Hullin, Markus Plack

机构 * University of Bonn(波恩大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种混合重照明框架,结合扩散先验与物理约束,实现更稳定的视频重照明效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15441 2026-01-23 cs.LG cs.CV 79%

CASL: Concept-Aligned Sparse Latents for Interpreting Diffusion Models

CASL: 用于解释扩散模型的概念对齐稀疏潜在表示

Zhenghao He, Guangzhi Xiong, Boyang Wang, Sanchit Sinha, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CASL通过监督框架将扩散模型的稀疏潜在维度与语义概念对齐,提升生成图像的解释性和编辑精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16121 2026-01-23 quant-ph math-ph math.MP 78%

Exceptional points in Gaussian channels: diffusion gauging and drift-governed spectrum

Gaussian通道中的例外点:扩散校准与漂移主导的谱

Frank Ernesto Quintela Rodríguez

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究在Gaussian通道中通过漂移主导的谱分析消除扩散,解析得到例外点流形及校准协方差。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15900 2026-01-23 math.AP 78%

Convergence to shock profiles for Burgers equation with singular fast-diffusion and boundary effect

Burgers方程中奇异快速扩散与边界效应下的激波剖面收敛性

Xiaowen Li, Ming Mei

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了Burgers方程在奇异快速扩散和边界效应下的激波剖面收敛性,通过新的加权能量估计技术克服奇异性与边界层影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15729 2026-01-23 cs.RO cs.AI cs.SY eess.SY 78%

DualShield: Safe Model Predictive Diffusion via Reachability Analysis for Interactive Autonomous Driving

DualShield: 通过可达性分析实现交互式自动驾驶的安全模型预测扩散

Rui Yang, Lei Zheng, Ruoyu Yao, Jun Ma

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(机器人与自主系统方向,香港科学与技术大学(广州))

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DualShield通过可达性分析实现交互式自动驾驶的安全模型预测扩散,结合前瞻性指导和反应性安全防护,提升安全性和任务效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15726 2026-01-23 cs.SI 78%

Profit Maximization for Viral Marketing in Online Social Networks using Two Phase Diffusion Approach

使用双阶段扩散方法实现在线社交网络中的利润最大化

Poonam Sharma, Suman Banerjee

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出双阶段扩散方法,通过分阶段分配预算以提高在线社交网络中病毒营销的利润

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15722 2026-01-23 cs.LG 78%

Communication-efficient Federated Graph Classification via Generative Diffusion Modeling

通过生成扩散建模实现高效的联邦图分类通信

Xiuling Wang, Xin Huang, Haibo Hu, Jianliang Xu

机构 * Hong Kong Baptist University(香港 Baptist 大学) Hong Kong Polytechnic University(香港 Polytechnic 大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 CeFGC通过生成扩散模型实现高效的联邦图分类,仅需三次通信轮次即可在非IID数据上提升GNN性能。

Journal ref In Proceedings of ACM SIGKDD Conference on Knowledge Discovery and Data Mining (SIGKDD), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15712 2026-01-23 cond-mat.mtrl-sci 78%

Segregation-Controlled Diffusion-Induced Grain Boundary Migration in Alloy 690

受 segregation 控制的扩散诱导晶界迁移在合金 690 中

Yuntian Jiang, Shuai Zhang, Zhuoming Xie, Xiaohan Bie, Huiqiu Deng, Wangyu Hu, Jie Hou

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究通过混合分子动力学和半大正则蒙特卡罗模拟,揭示了合金 690 中晶界迁移受溶质扩散和偏析耦合作用控制的机理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15440 2026-01-23 nlin.PS physics.comp-ph 78%

Numba-Accelerated 2D Diffusion-Limited Aggregation: Implementation and Fractal Characterization

基于Numba的2D扩散限制聚集体:实现与分形特性

Sandy H. S. Herho, Faiz R. Fajary, Iwan P. Anwar, Faruq Khadami, Nurjanna J. Trilaksono, Rusmawan Suwarman, Dasapta E. Irawan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于Numba加速的DLA模拟框架,揭示了高密度环境下分形维度的转折现象,并通过广义Rényi维度等指标量化聚集体的分形特性。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18763 2026-01-23 cs.LG 78%

GenPO: Generative Diffusion Models Meet On-Policy Reinforcement Learning

GenPO:生成扩散模型与在线策略强化学习相结合

Shutong Ding, Ke Hu, Shan Zhong, Haoyang Luo, Weinan Zhang, Jingya Wang, Jun Wang, Ye Shi

机构 * ShanghaiTech University(上海科技大学) University of Electronic Science and Technology of China(电子科技大学) Shanghai Jiao Tong University(上海交通大学) University College London(伦敦大学学院) MoE Key Laboratory of Intelligent Perception and Human Machine Collaboration(智能感知与人机协同联合实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 GenPO通过生成扩散模型与在线强化学习结合,解决了扩散策略在计算状态-动作对数似然中的挑战,实现了高效的可逆动作映射和熵正则化,提升了机器人任务的训练效果。

Comments Accepted by NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02448 2026-01-23 cs.LG 78%

Sparse Data Diffusion for Scientific Simulations in Biology and Physics

稀疏数据扩散用于生物学和物理学中的科学模拟

Phil Ostheimer, Mayank Nagda, Andriy Balinskyy, Jean Radig, Carl Herrmann, Stephan Mandt, Marius Kloft, Sophie Fellenz

机构 * RPTU University Kaiserslautern-Landau(赖兴大学) Heidelberg University(海德堡大学) University of California, Irvine(加州大学尔湾分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出稀疏数据扩散模型,通过显式建模精确零,实现高效生成与物理严谨性统一,提升科学模拟的准确性。

Comments This paper won the Best Paper Award at the SimBioChem workshop at EurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16064 2026-01-23 cs.CV 70%

Boosting Generative Image Modeling via Joint Image-Feature Synthesis

通过联合图像-特征合成提升生成图像建模

Theodoros Kouzelis, Efstathios Karypidis, Ioannis Kakogeorgiou, Spyros Gidaris, Nikos Komodakis

机构 * Archimedes, Athena RC National Technical University of Athens(阿提卡RC机构,国家技术大学雅典) IIT, NCSR "Demokritos"(IIT,NCSR "德摩多罗斯") University of Crete IACM-Forth(克里特大学IACM-第四研究机构)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种联合图像-特征合成的生成图像建模框架,通过结合低级图像潜在和高级语义特征,提升生成质量和训练效率,并引入表征引导策略。

Comments NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15417 2026-01-23 cs.LG cs.AI 67%

Ambient Dataloops: Generative Models for Dataset Refinement

环境数据循环:生成模型的数据集精修

Adrián Rodríguez-Muñoz, William Daspit, Adam Klivans, Antonio Torralba, Constantinos Daskalakis, Giannis Daras

机构 * Massachusetts Institute of Technology(麻省理工学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 Ambient Dataloops通过数据集与模型的共进化过程,提升数据质量并优化生成模型性能,实现高质量图像生成和蛋白质设计。

Comments 27 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16140 2026-01-23 cs.CV cs.AI cs.CR 57%

Learning to Watermark in the Latent Space of Generative Models

在生成模型的潜在空间中学习水印

Sylvestre-Alvise Rebuffi, Tuan Tran, Valeriu Lacatusu, Pierre Fernandez, Tomáš Souček, Nikola Jovanović, Tom Sander, Hady Elsahar, Alexandre Mourachko

机构 * Meta FAIR ETH Zurich(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出DistSeal,一种在生成模型潜在空间中实现高效且鲁棒的水印方法,通过蒸馏提升性能,比像素空间方法更高效。

Comments Code and models are available at https://github.com/facebookresearch/distseal

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16346 2026-01-23 cs.CV cs.AI 57%

From Canopy to Ground via ForestGen3D: Learning Cross-Domain Generation of 3D Forest Structure from Aerial-to-Terrestrial LiDAR

从树冠到地面:通过ForestGen3D实现跨领域生成3D森林结构:从航空到地面LiDAR

Juan Castorena, E. Louise Loudermilk, Scott Pokswinski, Rodman Linn

机构 * Los Alamos National Laboratories(洛斯阿拉莫斯国家实验室) Southern Research Station(南部研究站) Prescribed Fire Laboratory(规定火实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 ForestGen3D通过跨领域生成模型,从航空LiDAR数据推断地面细节,实现高精度的3D森林结构重建,提升生态分析和遥感应用的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16150 2026-01-23 cs.SD cs.AI 50%

Pay (Cross) Attention to the Melody: Curriculum Masking for Single-Encoder Melodic Harmonization

关注旋律的注意:单编码旋律和声的课程掩码

Maximos Kaliakatsos-Papakostas, Dimos Makris, Konstantinos Soiledis, Konstantinos-Theodoros Tsamis, Vassilis Katsouros, Emilios Cambouropoulos

机构 * Department of Music Technology(音乐技术系) Acoustics Hellenic Mediterranean University, Greece Archimedes, Athena RC, Greece(声学 希腊地中海大学 阿里卡斯萨斯) Institute of Language(语言研究所) School of Music Studies Aristotle University of Thessaloniki, Greece(音乐研究学院 阿里斯托芬大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究提出FF课程掩码方法,通过逐步解掩码强化旋律与和声的交互,提升单编码旋律和声生成的鲁棒性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16029 2026-01-23 cond-mat.stat-mech 50%

The flux of particles in a one-dimensional Fleming-Viot process

一维Fleming-Viot过程中粒子的通量

Éric Brunet, Bernard Derrida

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了一维Fleming-Viot过程中粒子通量的特性,通过显式计算解并分析扩散规则修改的影响,揭示了与行波中推动-拉伸相变相似的相变现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15438 2026-01-23 cond-mat.mtrl-sci 50%

First-Principles Study of Mg-Induced Phase Stabilization in Ga$_2$O$_3$ polymorphs

Ga$_2$O$_3$多形体中Mg诱导相稳定性的第一性原理研究

Viswesh Prakash, Jingyu Tang, Lisa M. Porter, Rachel C. Kurchin

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过第一性原理计算揭示Mg掺杂对Ga$_2$O$_3$多形体相稳定性的调控作用,发现熵驱动机制在高温或非平衡生长条件下促进γ相形成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15308 2026-01-23 cs.HC cs.AI 50%

When Generative AI Meets Extended Reality: Enabling Scalable and Natural Interactions

当生成式AI遇见扩展现实:实现可扩展和自然的交互

Mingyu Zhu, Jiangong Chen, Bin Li

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文探讨生成式AI与扩展现实的结合,通过三个用例展示如何通过语言驱动交互和自动化内容生成解决XR在可扩展性和自然交互方面的挑战。

Comments Accepted by IEEE Internet Computing (Oct. 2025); published in IEEE Xplore (Jan. 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08893 2026-01-23 cs.LG cs.CL 50%

Spectral Generative Flow Models: A Physics-Inspired Replacement for Vectorized Large Language Models

谱生成流模型:一种受物理启发的向量大语言模型替代方案

Andrew Kiruluta

机构 * UC Berkeley(伯克利大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 谱生成流模型通过物理启发的连续场演化机制,替代传统向量大语言模型,实现长程一致性、多模态通用性和物理结构归纳偏置。

详情

展开后加载摘要…

URL PDF HTML 收藏