arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-17 至 2025-12-17 共收录 59 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3 篇

2512.07829 2025-12-17 cs.CV cs.AI 85%

One Layer Is Enough: Adapting Pretrained Visual Encoders for Image Generation

一层就够:适应预训练视觉编码器进行图像生成

Yuan Gao, Chen Chen, Tianrong Chen, Jiatao Gu

机构 * Apple(苹果公司)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 FAE通过单层注意力机制将预训练视觉编码器适应到低维潜在空间,实现高效且高质量的图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13164 2025-12-17 cs.CV cs.AI 83%

A Semantically Enhanced Generative Foundation Model Improves Pathological Image Synthesis

语义增强的生成基础模型提升病理图像合成

Xianchao Guan, Zhiyuan Fan, Yifeng Wang, Fuqiang Chen, Yanjiang Zhou, Zengyang Che, Hongxue Meng, Xin Li, Yaowei Wang, Hongpeng Wang, Min Zhang, Heng Tao Shen, Zheng Zhang, Yongbing Zhang

专题命中 文生图 :image synthesis(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 CRAFTS通过语义增强的生成基础模型提升病理图像合成质量,生成多样化病理图像并增强多种临床任务性能。

Comments 68 pages, 9 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14102 2025-12-17 cs.CV cs.AI cs.IR 79%

Neurosymbolic Inference On Foundation Models For Remote Sensing Text-to-image Retrieval With Complex Queries

面向遥感文本到图像检索的神经符号推理:为复杂查询的基座模型

Emanuele Mezzi, Gertjan Burghouts, Maarten Kruithof

机构 * Vrije Universiteit Amsterdam(瓦赫宁根大学阿姆斯特丹) TNO(荷兰国防研究院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 RUNE通过结合大型语言模型和神经符号AI,利用逻辑推理提升遥感文本到图像检索的性能与可解释性,针对复杂查询和图像不确定性提出新的评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 2 篇

2512.14320 2025-12-17 cs.CV cs.AI cs.CY cs.LG 83%

Semantic Mismatch and Perceptual Degradation: A New Perspective on Image Editing Immunity

语义不匹配与感知退化:图像编辑免疫的新视角

Shuai Dong, Jie Zhang, Guoying Zhao, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of China Academy of Sciences(中国科学院大学) Center for Machine Vision and Signal Analysis, University of Oulu(信号分析中心,奥卢大学) School of Computer Science, China University of Geosciences(计算机科学学院,中国地质大学)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出SIFM方法和ISR度量标准,通过语义不匹配和感知退化来评估图像编辑免疫效果,提升对抗恶意扩散式操纵的能力。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14333 2025-12-17 cs.CV cs.AI cs.CY cs.LG 77%

Dual Attention Guided Defense Against Malicious Edits

双关注引导的对抗恶意编辑防御

Jie Zhang, Shuai Dong, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of China Academy of Sciences(中国科学院大学) School of Computer Science, China University of Geosciences(中国地质大学(武汉)计算机学院)

专题命中 图像编辑 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出双关注引导的噪声扰动方法,通过干扰模型的注意力和噪声预测机制,有效防御恶意编辑攻击。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 37 篇

2512.13039 2025-12-17 cs.CV cs.CR 85%

Bi-Erasing: A Bidirectional Framework for Concept Removal in Diffusion Models

双删除:一种用于扩散模型概念移除的双向框架

Hao Chen, Yiwei Wang, Songze Li

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 Bi-Erasing通过双向框架同时实现概念抑制与安全增强,提升扩散模型在移除有害概念与保持生成质量之间的平衡。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07345 2025-12-17 cs.CV 83%

Debiasing Diffusion Priors via 3D Attention for Consistent Gaussian Splatting

通过3D注意力解偏扩散先验以实现一致的高斯点散布

Shilong Jin, Haoran Duan, Litao Hua, Wentao Huang, Yuan Zhou

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 通过3D注意力解偏扩散先验以实现一致的高斯点散布,解决T2I模型中的视角偏见问题,提升3D任务的多视角一致性。

Comments Accepted by AAAI 2026, Code is available at: https://github.com/kimslong/AAAI26-TDAttn

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13991 2025-12-17 cs.CV 83%

Repurposing 2D Diffusion Models for 3D Shape Completion

将2D扩散模型用于3D形状补全

Yao He, Youngjoong Kwon, Tiange Xiang, Wenxiao Cai, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出利用2D扩散模型进行3D形状补全,通过Shape Atlas实现模态对齐,提升生成效果并验证其在点云补全和网格生成中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10767 2025-12-17 cs.LG cs.AI math.OC 82%

Understanding Sampler Stochasticity in Training Diffusion Models for RLHF

理解训练扩散模型用于RLHF中的采样随机性

Jiayuan Sheng, Hanyang Zhao, Haoxian Chen, David D. Yao, Wenpin Tang

机构 * Columbia University, IEOR Department(哥伦比亚大学,工业工程与运营研究系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 本文研究了在训练扩散模型用于RLHF时随机采样与确定性采样之间的不匹配问题,通过理论分析和实验验证,提出了非空的界限和更尖锐的收敛速率,并展示了高随机性SDE训练对ODE采样质量的提升作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14235 2025-12-17 cs.CV 79%

4D-RaDiff: Latent Diffusion for 4D Radar Point Cloud Generation

4D-RaDiff:用于4D雷达点云生成的潜在扩散

Jimmie Kwok, Holger Caesar, Andras Palffy

机构 * Delft University of Technology(代尔夫特理工大学) Perciv AI

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 4D-RaDiff通过潜在扩散生成4D雷达点云,提升目标检测性能并减少标注数据需求

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14068 2025-12-17 cs.CV cs.AI 79%

SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding

SDAR-VL: 稳定且高效的块状扩散用于视觉语言理解

Shuang Cheng, Yuhua Jiang, Zineng Zhou, Dawei Liu, Wang Tao, Linfeng Zhang, Biqing Qi, Bowen Zhou

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SDAR-VL通过高效的块状扩散方法,在视觉语言理解中实现了更高的训练效率、收敛稳定性及任务性能,优于传统块扩散并匹敌强AR基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11872 2025-12-17 cs.RO cs.AI cs.CV 79%

WAM-Diff: A Masked Diffusion VLA Framework with MoE and Online Reinforcement Learning for Autonomous Driving

WAM-Diff: 一种结合MoE和在线强化学习的掩码扩散VLA框架用于自动驾驶

Mingwang Xu, Jiahao Cui, Feipeng Cai, Hanlin Shang, Zhihao Zhu, Shan Luan, Yifang Xu, Neng Zhang, Yaoyi Li, Jia Cai, Siyu Zhu

机构 * Fudan University(复旦大学) Yinwang Intelligent Technology Co., Ltd(云网智能科技有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 WAM-Diff通过结合MoE和在线强化学习的掩码扩散框架,提升自动驾驶轨迹生成的性能与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14362 2025-12-17 math.AP math.PR 78%

Estimates for the distances between solutions to Kolmogorov equations with diffusion matrices of low regularity

Kolmogorov方程带有低正则性扩散矩阵的解间距离的估计

Vladimir I. Bogachev, Stanislav V. Shaposhnikov

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了Kolmogorov方程在低正则性扩散矩阵下的解间距离估计,提出了一种不依赖Sobolev导数的新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18865 2025-12-17 physics.flu-dyn 78%

Experimental investigation of turbulence and turbulent thermal diffusion in strongly inhomogeneous and anisotropic forced convection

强不均匀和各向异性强迫对流中湍流及湍流热扩散的实验研究

E. Zarbib, E. Elmakies, O. Shildkrot, N. Kleeorin, A. Levy, I. Rogachevskii

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究通过实验探讨强不均匀和各向异性对流中湍流及湍流热扩散特性,发现温度梯度与粒子数密度分布存在反相关关系。

Comments 14 pages, revtex4-2, revised paper

Journal ref Physics of Fluids 37, 115145 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22090 2025-12-17 eess.IV cs.LG 78%

High Volume Rate 3D Ultrasound Reconstruction with Diffusion Models

高体积率3D超声成像重建与扩散模型

Tristan S. W. Stevens, Oisín Nolan, Oudom Somphone, Jean-Luc Robert, Ruud J. G. van Sloun

机构 * Eindhoven University of Technology(埃因霍温理工大学) Philips Research(飞利浦研究)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散模型的3D超声重建方法,通过减少垂直平面数量提升体积率,同时提高空间和时间分辨率,并在图像质量和下游任务表现上优于传统方法。

Comments 13 pages, 10 figures, IEEE Transactions on Medical Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14240 2025-12-17 cs.LG math.AP math.OC 78%

Physically consistent model learning for reaction-diffusion systems

反应-扩散系统物理一致的模型学习

Erion Morina, Martin Holler

机构 * IDea_Lab - The Interdisciplinary Digital Lab at the University of Graz(跨学科数字实验室(格拉茨大学)) University of Graz(格拉茨大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种物理一致的模型学习方法,用于从数据中学习反应-扩散系统,确保模型满足质量守恒和非负性,同时保证学习过程的稳定性与物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13945 2025-12-17 cs.LG 78%

Pattern-Guided Diffusion Models

基于模式的扩散模型

Vivian Lin, Kuk Jin Jang, Wenwen Si, Insup Lee

机构 * PRECISE Center, University of Pennsylvania(PRECISE中心,宾夕法尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 基于模式的扩散模型通过利用时间序列中的固有模式进行预测,提升了模型在视网膜电图和运动捕捉任务中的预测精度和不确定性量化能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13831 2025-12-17 math.DS 78%

Dynamical analysis in a nonlocal delayed reaction-diffusion tumor model with therapy

非局部时滞反应扩散肿瘤模型中动力学分析

Dandan Hu, Yuan Yuan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了非局部时滞反应扩散肿瘤模型的动力学特性,通过Lyapunov-Schmidt方法分析稳态解的存在性,并探讨了延迟依赖的Hopf分岔现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11348 2025-12-17 cs.SD 78%

PhraseVAE and PhraseLDM: Latent Diffusion for Full-Song Multitrack Symbolic Music Generation

PhraseVAE 和 PhraseLDM:用于全曲多轨符号音乐生成的潜在扩散

Longshen Ou, Ye Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 PhraseVAE 和 PhraseLDM 提出了一种用于全曲多轨符号音乐生成的潜在扩散框架,通过短语级潜在表示实现高效生成和长序列建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15587 2025-12-17 cond-mat.mtrl-sci 78%

Quantifying non-Gaussian diffusion in transient microscopy using excess kurtosis

利用超额峰度量化瞬态显微镜中的非高斯扩散

Enrique Arévalo Rodríguez, Marc Meléndez Schofield, Jorge Cuadra, Ferry Prins

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 利用超额峰度量化瞬态显微镜中非高斯扩散,揭示激子传输的非高斯特性,并提出离散变量计算方法改进扩散系数分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13597 2025-12-17 cs.LG cs.AI 78%

Text-guided multi-property molecular optimization with a diffusion language model

基于扩散语言模型的文本引导多性质分子优化

Yida Xiong, Kun Li, Jiameng Chen, Hongzhi Zhang, Di Lin, Yan Che, Wenbin Hu

机构 * School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院) Engineering Research Center for Big Data Application in Private Health Medicine of Fujian Universities, Putian University, Putian, China(福建省高校大数据在私人医疗应用工程研究中心,莆田大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散语言模型的文本引导多性质分子优化方法,通过整合文本语义与分子表示,提升分子结构保留与属性增强的平衡能力。

Comments Accepted to Information Fusion, Vol. 127, 103907, 2026

Journal ref Information Fusion, Vol. 127, 103907, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13283 2025-12-17 math.OC cs.NA math.NA 78%

Optimal Control of a Sub-diffusion Model using Dirichlet-Neumann and Neumann-Neumann Waveform Relaxation Algorithms

使用狄利克雷-内曼和内曼-内曼波形松弛算法对子扩散模型进行最优控制

Soura Sana, Bankim C. Mandal

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出使用狄利克雷-内曼和内曼-内曼波形松弛算法解决子扩散模型的最优控制问题,并研究扩散系数对算法收敛性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16790 2025-12-17 cs.LG 78%

I-Diff: Structural Regularization for High-Fidelity Diffusion Models

I-Diff: 高保真扩散模型中的结构正则化

Shakthi Perera, Dilum Fernando, H. L. P. Malshan, H. M. P. S. Madushan, Roshan Godaliyadda, M. P. B. Ekanayake, Dhananjaya Jayasundara, Roshan Ragel

机构 * IEEE

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 I-Diff 通过引入结构正则化改进 DDPM,提升生成数据的保真度,实验显示在多个数据集上效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14225 2025-12-17 cs.CV 57%

OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving

OmniGen:面向自动驾驶的统一多模态传感器生成

Tao Tang, Enhui Ma, xia zhou, Letian Wang, Tianyi Yan, Xueyang Zhang, Kun Zhan, Peng Jia, XianPeng Lang, Jia-Wang Bian, Kaicheng Yu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Westlake University(西湖大学) Li Auto Inc.(Li汽车公司) The University of Toronto(多伦多大学) University of Macau(澳门大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 OmniGen通过统一框架生成对齐的多模态传感器数据,结合共享BEV空间和UAE方法,实现高效且灵活的传感器生成。

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14133 2025-12-17 cs.GR 57%

AnimaMimic: Imitating 3D Animation from Video Priors

AnimaMimic:从视频先验模仿3D动画

Tianyi Xie, Yunuo Chen, Yaowei Guo, Yin Yang, Bolei Zhou, Demetri Terzopoulos, Ying Jiang, Chenfanfu Jiang

专题命中 扩散模型 :diffusion(abstract);分类 cs.GR

AI总结 AnimaMimic通过视频扩散模型学习的运动先验,实现静态3D网格的自动动画生成,结合物理模拟提升真实感,整合进标准动画流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14056 2025-12-17 cs.CV cs.AI 57%

FacEDiT: Unified Talking Face Editing and Generation via Facial Motion Infilling

FacEDiT:通过面部运动填充实现统一的说话人脸编辑与生成

Kim Sung-Bin, Joohyun Chang, David Harwath, Tae-Hyun Oh

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 FacEDiT通过语音条件面部运动填充框架,实现说话人脸编辑与生成的统一,具备准确的语音对齐和强身份保持性。

Comments Project page: https://facedit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13970 2025-12-17 cs.CV 57%

Quality-Driven and Diversity-Aware Sample Expansion for Robust Marine Obstacle Segmentation

面向质量与多样性的样本扩展用于鲁棒的海洋障碍分割

Miaohua Zhang, Mohammad Ali Armin, Xuesong Li, Sisi Liang, Lars Petersson, Changming Sun, David Ahmedt-Aristizabal, Zeeshan Hayder

机构 * CSIRO Data61(CSIRO数据61) CSIRO Agriculture & Food(CSIRO农业与食品)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种质量驱动和多样性意识的样本扩展方法,通过生成高质量、多样化的合成样本提升海洋障碍分割的鲁棒性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13192 2025-12-17 cs.CV 57%

POLAR: A Portrait OLAT Dataset and Generative Framework for Illumination-Aware Face Modeling

POLAR:一个面向光照感知面部建模的 Portrait OLAT 数据集和生成框架

Zhuo Chen, Chengqun Yang, Zhuo Su, Zheng Lv, Jingnan Gao, Xiaoyuan Zhang, Xiaokang Yang, Yichao Yan

机构 * Shanghai Jiao Tong University(上海交通大学) PICO

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 POLAR 提出了一种基于大规模 OLAT 数据集和 POLARNet 生成模型的光照感知面部建模框架,实现可扩展和可控的面部重映射。

Comments 19 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24979 2025-12-17 cs.CV 57%

Video Generation with Stable Transparency via Shiftable RGB-A Distribution Learner

通过可移动的RGB-A分布学习实现稳定的透明度视频生成

Haotian Dong, Wenjing Wang, Chen Li, Jing Lyu, Di Lin

机构 * Tianjin University(天津大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种通过可移动RGB-A分布学习实现稳定透明度视频生成的方法,提升了视频质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14624 2025-12-17 math.ST stat.ML stat.TH 50%

Learning the score under shape constraints

在形状约束下学习分数

Rebecca M. Lewis, Oliver Y. Feng, Henry W. J. Reeve, Min Xu, Richard J. Samworth

专题命中 扩散模型 :diffusion(abstract)

AI总结 在形状约束下,研究了分数估计的最小最大风险,通过引入对数凹密度的子类,结合尾部行为和光滑性假设,提出了多尺度估计器以提高估计效率。

Comments 70 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏