arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-23 至 2025-12-23 共收录 111 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 84 篇

2512.19004 2025-12-23 cs.CL cs.AI cs.LG 78%

Context-Aware Initialization for Reducing Generative Path Length in Diffusion Language Models

基于上下文的初始化以减少扩散语言模型中的生成路径长度

Tongyuan Miao, Gary Huang, Kai Jun Han, Annie Jiang

机构 * University of Michigan(密歇根大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于上下文的初始化方法,通过注入提示条件先验来减少扩散语言模型生成路径长度,提升解码效率并解决预热启动的准确性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18867 2025-12-23 math.PR 78%

Diffusion Approximations to Schrödinger Bridges on Manifolds

流形上的Schrödinger桥的小温度扩散近似

Garrett Mulcahy, Soumik Pal

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了流形上Schrödinger桥的小温度扩散近似,证明了在特定条件下Schrödinger势能梯度收敛到流形类比的得分函数,并展示了欧几里得Schrödinger桥的近似方法。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18791 2025-12-23 cs.SD cs.AI cs.CR 78%

Smark: A Watermark for Text-to-Speech Diffusion Models via Discrete Wavelet Transform

Smark:通过离散小波变换实现文本到语音扩散模型的水印

Yichuan Zhang, Chengxin Li, Yujie Gu

机构 * Faculty of Information Science and Electrical Engineering, Kyushu University, Fukuoka, Japan(九州大学信息科学与电气工程学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Smark通过离散小波变换在TTS扩散模型的低频区域嵌入水印,实现高质量语音生成与知识产权保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18736 2025-12-23 cs.LG 78%

Is Your Conditional Diffusion Model Actually Denoising?

你的条件扩散模型真的在去噪吗?

Daniel Pfrommer, Zehao Dou, Christopher Scarvelis, Max Simchowitz, Ali Jadbabaie

机构 * MIT Cambridge, MA 02139(麻省理工学院) Yale University New Haven, CT 06520(耶鲁大学) CMU Pittsburgh, PA 15213(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了条件扩散模型的去噪过程偏差,提出Schedule Deviation度量方法,揭示了模型在不同条件下的去噪流程差异问题。

Comments 41 pages, 14 figures, published in Neural Information Processing Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18722 2025-12-23 cs.LG 78%

Generating Risky Samples with Conformity Constraints via Diffusion Models

通过扩散模型生成受约束的高风险样本

Han Yu, Hao Zou, Xingxuan Zhang, Zhengyi Wang, Yue He, Kehan Li, Peng Cui

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 RiskyDiff通过扩散模型生成受约束的高风险样本,通过嵌入筛选和危险梯度引导提高生成样本的风险,同时增强类别符合性以提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06263 2025-12-23 quant-ph 78%

Adiabaticity Crossover: From Anderson Localization to Planckian Diffusion

绝热性交叉:从安德森局域到普朗克扩散

Tiange Xiang, Yubo Zhang, Joonas Keski-Rahkonen, Anton M. Graf, Eric J. Heller

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过量子-声学视角揭示电子输运中绝热性与相位失真之间的交叉,发现普朗克域内扩散率与温度关系,为奇异金属电阻率提供新见解。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04798 2025-12-23 cs.LG 78%

TabRep: Training Tabular Diffusion Models with a Simple and Effective Continuous Representation

TabRep: 通过简单有效的连续表示训练表格扩散模型

Jacob Si, Zijing Ou, Mike Qu, Zhengrui Xiang, Yingzhen Li

机构 * Imperial College London(伦敦帝国学院) Columbia University(哥伦比亚大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 TabRep通过统一连续表示训练表格扩散模型,实现高效生成高质量表格数据并保持隐私。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18576 2025-12-23 math.AP 78%

Sharp criteria for a degenerate diffusion-aggregation system with the intermediate exponent

退化扩散-聚集体系统中具有中间指数的严格判据

Tiantian Zhou, Li Chen, Yutian Lei

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了退化扩散-聚集体系统中具有中间指数的严格判据,通过两种不同的初始数据假设,建立了两个等价的临界阈值条件,统一了分类结果。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18514 2025-12-23 physics.app-ph cond-mat.mtrl-sci 78%

Enhanced diffusion in self-nanoconfined water channels between periodically modulated surfaces: insights from molecular dynamics simulations

在周期性调制表面之间自纳米受限水通道中的扩散增强:分子动力学模拟的见解

Bruno H. S. Mendonça, Elizane E. de Moraes, Hélio Chacham

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过分子动力学模拟揭示了周期性调制表面间纳米限制水通道的自扩散增强机制,发现纳米管直径影响水通道扩散特性。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18377 2025-12-23 math.NA cs.NA 78%

Sixth-order explicit one-step methods for stiff ODEs via hybrid deferred correction involving RK2 and RK4: Application to reaction-diffusion equations

利用混合延迟修正方法构建六阶显式单步方法用于刚性常微分方程:应用于反应扩散方程

Saint Cyr E. R. Koyaguerebo-Imé

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种六阶显式单步方法DC6RK2/4,用于解决刚性ODE问题,尤其在强非线性和长期积分问题中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18358 2025-12-23 math.AP 78%

Ground states and phase transitions for an aggregation model with fast diffusion on sphere

球面上具有快速扩散的聚集体模型的地面状态与相变

Razvan C. Fetecau, Hansol Park

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了球面上具有快速扩散的聚集体模型的地面状态与相变,探讨了非局部相互作用强度对相变的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18133 2025-12-23 cs.LG cs.AI cs.CR 78%

Grad: Guided Relation Diffusion Generation for Graph Augmentation in Graph Fraud Detection

Grad: 图神经网络在图欺诈检测中的引导关系扩散生成用于图增强

Jie Yang, Rui Zhang, Ziyang Cheng, Dawei Cheng, Guang Yang, Bo Wang

机构 * Tongji University Shanghai China The University of New South Wales Sydney Australia Tongji University \& Shanghai Artificial Intelligence Laboratory Shanghai China Wechat Pay, Tencent Inc. Shenzhen China Tongji University The University of New South Wales Tongji University \& Shanghai Artificial Intelligence Laboratory Wechat Pay, Tencent Inc.

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Grad通过引导关系扩散生成和监督图对比学习,提升图欺诈检测中欺诈与良性用户差异,有效识别隐藏欺诈信号。

Comments Accepted by The Web Conference 2025 (WWW'25). 12 pages, includes implementation details. Code: https://github.com/AI4Risk/antifraud and https://github.com/Muyiiiiii/WWW25-Grad

Journal ref Proceedings of the ACM Web Conference 2025 (WWW '25), April 28-May 2, 2025, Sydney, NSW, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04717 2025-12-23 physics.gen-ph 78%

Finite-time gradient blow-up and shock formation in Israel-Stewart theory: Bulk, shear, and diffusion regimes

有限时间梯度爆炸和激波形成在以色列-斯图尔特理论中:体、剪切和扩散模式

Fábio S. Bemfica

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究首次在以色列-斯图尔特理论中展示有限时间梯度爆炸和激波形成,揭示了非线性效应主导粘性阻尼的早期动态阶段,为相对论粘性流体中的激波研究提供了基础见解。

Comments 25 pages, 8 figures. Some text added. Peer reviewed version

Journal ref Phys. Rev. E 112 (2025) 065105

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12520 2025-12-23 cs.CV 74%

Good Noise Makes Good Edits: A Training-Free Diffusion-Based Video Editing with Image and Text Prompts

好的噪声带来好的编辑:一种基于扩散的视频编辑方法,无需训练,结合图像和文本提示

Saemee Choi, Sohyun Jeong, Hyojin Jang, Jaegul Choo, Jinhee Kim

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 VINO是一种无需训练的视频编辑方法,结合图像和文本提示,通过ρ-启动采样和扩张双掩码实现结构化噪声地图,从而实现高质量视频编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17955 2025-12-23 cs.CV 70%

A Modular Framework for Single-View 3D Reconstruction of Indoor Environments

单视角室内环境3D重建的模块化框架

Yuxiao Li

机构 * Digital Humanities Lab(数字人文实验室) Photogrammetry and Remote Sensing Lab(摄影测量与遥感实验室)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散技术的模块化框架,用于单视角室内环境的3D重建,通过多个核心模块提升重建精度和质量。

Comments Master's thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18804 2025-12-23 cs.CV cs.MM cs.SD 62%

Tempo as the Stable Cue: Hierarchical Mixture of Tempo and Beat Experts for Music to 3D Dance Generation

节奏作为稳定的线索:基于节奏与节拍专家的分层混合用于音乐到3D舞蹈生成

Guangtao Lyu, Chenghao Xu, Qi Liu, Jiexi Yan, Muli Yang, Fen Fang, Cheng Deng

机构 * School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) Hohai university(河海大学) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Institute for Infocomm Research (I 2 R), A*STAR(新加坡科技研究局信息与通信研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出TempoMoE,通过分层混合专家模块提升音乐到3D舞蹈生成的节奏一致性与质量,无需手动流派标签。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11734 2025-12-23 cs.GR cs.CV 62%

Recent Advances in 3D Object and Scene Generation: A Survey

近年来3D对象和场景生成的最新进展:综述

Xiang Tang, Ruotong Li, Xiaopeng Fan

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文综述了3D对象和场景生成的最新进展,分析了主流生成模型和技术路径,指出了当前挑战与未来研究方向。

Comments 35 pages, 7 figures, 6 tables, Project page: https://github.com/xdlbw/Awesome-3D-Object-and-Scene-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18314 2025-12-23 cs.CV cs.GR 62%

MatSpray: Fusing 2D Material World Knowledge on 3D Geometry

MatSpray:将2D材料知识融合到3D几何中

Philipp Langsteiner, Jan-Niklas Dihlmann, Hendrik P. A. Lensch

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 MatSpray通过结合学习和投影方法,将2D材料数据融合到3D几何中,提升渲染的真实性和效率。

Comments Project page: https://matspray.jdihlmann.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09921 2025-12-23 cs.CV 61%

FaceShield: Defending Facial Image against Deepfake Threats

FaceShield:防御面部图像 against 深度伪造威胁

Jaehwan Jeong, Sumin In, Sieun Kim, Hannie Shin, Jongheon Jeong, Sang Ho Yoon, Jaewook Chung, Sangpil Kim

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Samsung Research(三星研究)

专题命中 扩散模型 :diffusion(abstract,comments);分类 cs.CV

AI总结 FaceShield通过操控扩散模型的注意力机制和面部特征提取器,提出了一种主动防御深度伪造的方案,有效提升对抗性扰动的鲁棒性和不可察觉性。

Comments Accepted to ICCV 2025. Keywords: Deepfake, Adversarial Attack, Diffusion Models, GANs, Face Swap, Proactive Defense

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00767 2025-12-23 cs.CV 57%

InterPose: Learning to Generate Human-Object Interactions from Large-Scale Web Videos

InterPose:从大规模网络视频中学习生成人-物体交互

Yangsong Zhang, Abdul Ahad Butt, Gül Varol, Ivan Laptev

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 InterPose通过大规模网络视频自动提取人-物体交互动作数据,提升人类动作生成的精度和多样性,同时开发LLM代理实现零样本动画生成。

Comments Accepted to 3DV 2026. Project page: https://mael-zys.github.io/InterPose/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19560 2025-12-23 cs.CV cs.AI 57%

BabyFlow: 3D modeling of realistic and expressive infant faces

BabyFlow:真实且富有表现力的婴儿面部的3D建模

Antonia Alomar, Mireia Masias, Marius George Linguraru, Federico M. Sukno, Gemma Piella

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 BabyFlow通过归一化流和跨年龄表情迁移,实现婴儿面部的高精度3D建模与表情生成,提升早期发育障碍检测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19522 2025-12-23 cs.CV 57%

A Convolutional Neural Deferred Shader for Physics Based Rendering

一种基于物理的卷积神经网络延迟着色器

Zhuo He, Yingdong Ru, Qianying Liu, Paul Henderson, Nicolas Pugeault

机构 * School of Computing Science, University of Glasgow(Glasgow大学计算机科学学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出pbnds+,一种基于物理的神经延迟着色管道,利用卷积神经网络减少参数并提升着色与重照明性能,同时引入能量正则化以应对黑暗照明场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17127 2025-12-23 stat.ML cs.CV cs.LG 57%

Disentangled representations via score-based variational autoencoders

通过基于分数的变分自编码器实现解耦表示

Benjamin S. H. Lyo, Eero P. Simoncelli, Cristina Savin

机构 * Center for Neural Science, New York University(纽约大学神经科学中心) Center for Computational Neuroscience, Flatiron Institute(Flatiron研究所计算神经科学中心) Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 SAMI通过结合扩散模型和VAEs的理论框架,实现无监督表示学习,能够从数据中提取有意义的结构信息,并在无需监督标签的情况下识别语义轴。

Comments 34 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06951 2025-12-23 cs.RO cs.AI cs.CV cs.LG 57%

Task adaptation of Vision-Language-Action model: 1st Place Solution for the 2025 BEHAVIOR Challenge

视觉-语言-动作模型的任务适应:2025 BEHAVIOR挑战第一名解决方案

Ilia Larchenko, Gleb Zarin, Akash Karnatak

机构 * Independent Researchers(独立研究者)

专题命中 扩散模型 :inpainting(abstract);分类 cs.CV

AI总结 本文提出了一种视觉-动作策略,通过相关噪声和混合层注意力等创新,实现了在2025 BEHAVIOR挑战中对50种家庭任务的高效处理。

Comments 2025 NeurIPS Behavior Challenge 1st place solution

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18947 2025-12-23 cs.CV 57%

OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language Model

OpenHOI: 基于多模态大语言模型的开放世界手-物体交互合成

Zhenhao Zhang, Ye Shi, Lingxiao Yang, Suting Ni, Qi Ye, Jingya Wang

机构 * ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 OpenHOI通过多模态大语言模型实现开放世界手-物体交互合成,能生成长周期操控序列并处理复杂语言指令。

Comments Accepted by NeurIPS 2025 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18527 2025-12-23 cs.CV cs.AI 57%

Detection of AI Generated Images Using Combined Uncertainty Measures and Particle Swarm Optimised Rejection Mechanism

利用综合不确定性度量和粒子群优化拒绝机制检测AI生成图像

Rahul Yumlembam, Biju Issac, Nauman Aslam, Eaby Kollonoor Babu, Josh Collyer, Fraser Kennedy

机构 * Northumbria University(北安普顿大学) The Alan Turing Institute(艾伦·图灵研究所) British Library(大英图书馆)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种结合多种不确定性度量和粒子群优化的AI生成图像检测方法,通过综合不确定性信号有效识别AI生成图像,实验表明其在对抗攻击和分布偏移下表现优异。

Comments Scientific Reports (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18386 2025-12-23 cs.CV 57%

RecurGS: Interactive Scene Modeling via Discrete-State Recurrent Gaussian Fusion

RecurGS: 通过离散状态递归高斯融合实现交互式场景建模

Wenhao Hu, Haonan Zhou, Zesheng Li, Liu Liu, Jiacheng Dong, Zhizhong Su, Gaoang Wang

机构 * Zhejiang University(浙江大学) Horizon Robotics Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 RecurGS通过递归融合框架实现离散状态的交互式场景建模,提升3D环境的更新效率和逼真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18312 2025-12-23 cs.CV 57%

MatE: Material Extraction from Single-Image via Geometric Prior

MatE:通过几何先验从单张图像中提取材料

Zeyu Zhang, Wei Zhai, Jian Yang, Yang Cao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 MatE通过几何先验从单张图像生成可拼接的PBR材料,实现对未知光照和透视的不变性,从而恢复真实世界材料属性。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19569 2025-12-23 econ.GN cs.AI q-fin.EC 50%

Owning the Intelligence: Global AI Patents Landscape and Europe's Quest for Technological Sovereignty

掌控智能:全球AI专利格局与欧洲技术主权的追求

Lapo Santarlasci, Armando Rungi, Loredana Fattorini, Nestor Maslej

机构 * Laboratory for the Analysis of Complex Economic Systems (AXES)(复杂经济系统分析实验室) IMT School for Advanced Studies Lucca(拉瓜迪亚高级研究学院) Institute for Human-Centered AI(以人为本的人工智能研究所) Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过分析全球AI专利格局,揭示了欧洲在技术主权追求中的挑战与现状,指出技术能力是参与全球AI创新网络的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19501 2025-12-23 math.PR math.AP 50%

Large deviations for stochastic evolution equations beyond the coercive case

关于非 coercive 情况下的随机演化方程的大偏差

Esmée Theewis

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种适用于非coercive情况的随机演化方程大偏差原理框架,通过引入well-posedness和先验估计,拓展了传统变分方法的应用范围,并应用于反应扩散系统和2D Allen-Cahn方程。

详情

展开后加载摘要…

URL PDF HTML 收藏