arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-01 至 2025-12-01 共收录 126 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 81 篇

2508.01873 2025-12-01 cs.CV 79%

DiffusionFF: A Diffusion-based Framework for Joint Face Forgery Detection and Fine-Grained Artifact Localization

DiffusionFF: 一种基于扩散的联合人脸伪造检测与细粒度特征定位框架

Siran Peng, Haoyuan Zhang, Li Gao, Tianshuo Zhang, Xiangyu Zhu, Bao Li, Weisong Zhao, Zhen Lei

机构 * MAIS, CASIA(CASIA人工智能研究所) SAI, UCAS(UCAS智能信息学院) CMFT(计算机视觉与模式识别技术研究所) IIE, CAS(中国科学院信息工程研究所) SCS, UCAS(UCAS安全学院) CAIR, HKISI, CAS(中国科学院自动化研究所) SCSE, FIE, M.U.S.T(慕苏尔科技大学安全与电子工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffusionFF通过结合预训练的伪造检测器和去噪扩散模型,实现人脸伪造检测与细粒度特征定位,提升检测能力和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17511 2025-12-01 cs.CV 79%

Accelerating Parallel Diffusion Model Serving with Residual Compression

通过残差压缩加速并行扩散模型服务

Jiajun Luo, Yicheng Xiao, Jianru Xu, Yangxiu You, Rongwei Lu, Chen Tang, Jingyan Jiang, Zhi Wang

机构 * Southern University of Science and Technology(南方科技大学) Jiangnan University(江南大学) Shenzhen Technology University(深圳技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CompactFusion通过残差压缩技术提升并行扩散模型服务效率,实现3倍加速并显著提高生成质量。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07073 2025-12-01 cs.CV cs.LG 79%

Discovering Concept Directions from Diffusion-based Counterfactuals via Latent Clustering

通过潜在聚类发现扩散基于的反事实概念方向

Payal Varshney, Adriano Lucieri, Christoph Balada, Andreas Dengel, Sheraz Ahmed

机构 * German Research Center for Artificial Intelligence GmbH (DFKI)(德国人工智能研究中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CDLC方法,通过潜在聚类提取概念方向,减少存储需求并加速概念发现,适用于高风险领域和多样化数据模态。

Comments Accepted at Pattern Recognition Letters Journal (14 Pages)

Journal ref Special Section on the 27th International Conference on Pattern Recognition (ICPR 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23061 2025-12-01 physics.soc-ph cs.SI 78%

The impact of anticonformity on the diffusion of innovation -- insights from the q-voter model

反从众对创新扩散的影响——来自q-投票模型的洞察

Angelika Abramiuk-Szurlej

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过扩展q-投票模型引入反从众行为,研究其对创新扩散的影响,发现反从众能加速早期采用并促进成功扩散,具有实际应用价值。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22970 2025-12-01 physics.ao-ph 78%

Technical Report: Towards Unified Diffusion Models for Multi-Model Climate Emulation at Scale

技术报告:迈向大规模多模型气候模拟的统一扩散模型

Francesco Immorlano, Elijah Tavares, Felix Draxler, Padhraic Smyth, Pierre Gentine, Stephan Mandt

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出统一扩散模型,通过学习多个气候模型和排放情景的共享分布模式,实现大规模多模型气候模拟,提高不确定性量化和处理效应分析的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22773 2025-12-01 cs.RO cs.AI 78%

CAPE: Context-Aware Diffusion Policy Via Proximal Mode Expansion for Collision Avoidance

CAPE:通过近端模式扩展实现上下文感知的扩散策略用于避障

Rui Heng Yang, Xuan Zhao, Leo Maxime Brunswic, Montgomery Alban, Mateo Clemente, Tongtong Cao, Jun Jin, Amir Rasouli

机构 * Huawei Technologies Canada(华为加拿大技术有限公司) Huawei(华为) Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 CAPE通过近端模式扩展实现上下文感知的扩散策略,提升避障任务中轨迹生成的泛化能力与碰撞规避性能。

Comments 4 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04966 2025-12-01 cs.SD cs.AI eess.AS 78%

LAPS-Diff: A Diffusion-Based Framework for Singing Voice Synthesis With Language Aware Prosody-Style Guided Learning

LAPS-Diff: 一种基于扩散的歌唱语音合成框架,具有语言感知的语调风格引导学习

Sandipan Dhar, Mayank Gupta, Preeti Rao

机构 * Department of Electrical Engineering, Indian Institute of Technology, Bombay.(电子工程系,印度理工学院,博亚姆)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 LAPS-Diff通过语言感知嵌入和语音风格引导学习,提升低资源环境下印地语歌唱语音合成的质量。

Comments 10 pages, 5 figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04208 2025-12-01 cond-mat.stat-mech 78%

Diffusion in a wedge geometry: First-Passage Statistics under Stochastic Resetting

在楔形几何中扩散:在随机重置下的首次通过统计

Fazil Najeeb, Arnab Pal, V. V. Prasad

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究在楔形几何中随机重置对扩散过程的影响,分析首次通过统计特性及重置对吸收或逃逸速率的增强作用。

Comments 10 pages, 7 figures, version 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01718 2025-12-01 cs.SI 78%

A Novel Dynamic Epidemic Model for Successive Opinion Diffusion in Social Networks

一种用于社交网络中连续意见扩散的新型动态流行病模型

Bin Han, Fabienne Renckens, C. Clark Cao, Hans D. Schotten

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种新型动态流行病模型,用于研究社交网络中连续意见扩散,通过考虑社会距离影响和谣言传播对网络结构的影响,揭示意见扩散动态及社会极化机制。

Comments To appear in IEEE GLOBECOM 2025, minor corrections in this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22293 2025-12-01 cs.SD cs.LG eess.AS eess.SP 78%

GLA-Grad++: An Improved Griffin-Lim Guided Diffusion Model for Speech Synthesis

GLA-Grad++: 一种改进的Griffin-Lim引导扩散模型用于语音合成

Teysir Baoueb, Xiaoyu Bie, Mathieu Fontaine, Gaël Richard

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 GLA-Grad++通过改进的Griffin-Lim算法优化语音合成,提升生成效率和稳定性,尤其在域外场景中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22156 2025-12-01 math.PR math.FA 78%

A non-canonical diffusion on the Sierpiński carpet

Sierpiński地毯上的非标准扩散过程

Shiping Cao, Hua Qiu, Bingshen Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种在Sierpiński地毯上满足亚高斯热核估计的非标准扩散过程,结合了欧几里得度量与自相似测度。

Comments 29 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22146 2025-12-01 cs.CL 78%

C$^2$DLM: Causal Concept-Guided Diffusion Large Language Models

C$^2$DLM: 基于因果概念的扩散大语言模型

Kairong Han, Nuanqiao Shan, Ziyu Zhao, Zijing Hu, Xinpeng Dong, Junjian Ye, Lujia Pan, Fei Wu, Kun Kuang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Noah’s Ark Lab, Huawei Technologies(华为技术有限公司诺亚实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 C$^2$DLM通过引入因果概念引导机制,提升大语言模型在推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21746 2025-12-01 cs.CL 78%

DELTA: Language Diffusion-based EEG-to-Text Architecture

DELTA: 基于语言扩散的EEG到文本架构

Mingyu Jeon, Hyobin Kim

机构 * Sungkyunkwan University(成均馆大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DELTA通过结合残差向量量化和语言扩散模型,提升了EEG到文本的语义对齐和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17741 2025-12-01 cs.LG stat.ML 78%

Diffusion Models are Molecular Dynamics Simulators

扩散模型是分子动力学模拟器

Justin Diamond, Markus Lill

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究证明扩散模型可作为分子动力学模拟器,通过学习分数与能量梯度建立精确对应,实现数据驱动的分子动力学模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20048 2025-12-01 cs.LG cs.AI eess.SP 78%

Manifold-Aware Diffusion-Augmented Contrastive Learning for Noise-Robust Biosignal Representation

面向流形的扩散增强对比学习用于噪声鲁棒生物信号表示

Rami Zewail

机构 * Computer Science \& Engineering Department Egypt-Japan University of Science \& Technology (E-JUST) New Borg El Arab, Alexandria, Egypt Email

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出面向流形的扩散增强对比学习框架,用于提升生物信号在噪声下的鲁棒性表示,实验显示其在心房颤动检测任务中达到0.9741的AUROC值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08956 2025-12-01 cs.LG math.ST stat.ML stat.TH 78%

Beyond Scores: Proximal Diffusion Models

超越分数:近端扩散模型

Zhenghan Fang, Mateo Díaz, Sam Buchanan, Jeremias Sulam

机构 * Mathematical Institute for Data Science, Johns Hopkins University(数据科学数学研究所,约翰霍普金斯大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出近端扩散模型,通过近端映射替代分数,实现理论和实践上的改进,显著提升收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09908 2025-12-01 quant-ph 78%

Laser-induced spectral diffusion and excited-state mixing of silicon T centres

激光诱导的光谱扩散和硅T中心的激发态混合

Camille Bowness, Simon A. Meynell, Michael Dobinson, Chloe Clear, Kais Jooya, Nicholas Brunelle, Mehdi Keshavarz, Katarina Boos, Melanie Gascoine, Shahrzad Taherizadegan, Christoph Simon, Mike L. W. Thewalt, Stephanie Simmons, Daniel B. Higginbottom

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究通过光谱相关性测量揭示了硅T中心的光谱漂移动力学,展示了通过共振检查方案将发射体线宽缩小至110 MHz,并探讨了激光诱导的激发态自旋混合对高效率纠缠生成的重要性。

Comments 18 pages, 12 figures

Journal ref PRX Quantum 6, 030350 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00802 2025-12-01 cs.CV 70%

TRACE: Temporally Reliable Anatomically-Conditioned 3D CT Generation with Enhanced Efficiency

TRACE: 基于时间可靠性的解剖条件3D CT生成与增强效率

Minye Shao, Xingyu Miao, Haoran Duan, Zeyu Wang, Jingkun Chen, Yawen Huang, Xian Wu, Jingjing Deng, Yang Long, Yefeng Zheng

机构 * Department of Computer Science, Durham University(杜伦大学计算机科学系) Department of Automation, Tsinghua University(清华大学自动化系) College of Computer Science and Engineering, Dalian Minzu University(大连民族大学计算机科学与工程学院) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Jarvis Research Center, Tencent YouTu Lab(腾讯YouTu实验室 Jarvis 研究中心) School of Engineering Mathematics and Technology, University of Bristol(布里斯托大学工程数学与技术学院) Medical Artificial Intelligence Laboratory, School of Engineering, Westlake University(西湖大学工程学院医学人工智能实验室)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 TRACE通过2D多模态条件扩散方法生成具有时空对齐的3D CT图像,提升生成效率和解剖保真度。

Comments Accepted to MICCAI 2025 (this version is not peer-reviewed; it is the extended version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23475 2025-12-01 cs.CV 57%

AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement

AnyTalker: 通过交互细化扩展多人物谈话视频生成

Zhizhou Zhong, Yicheng Ji, Zhe Kong, Yiying Liu, Jiarui Wang, Jiasun Feng, Lupeng Liu, Xiangyi Wang, Yanjia Li, Yuqing She, Ying Qin, Huan Li, Shuiyang Mao, Wei Liu, Wenhan Luo

机构 * Hong Kong University of Science and Technology(香港科技大学) Video Rebirth(视频重生) Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 AnyTalker通过引入身份感知注意力机制和高效训练流程,实现了多人物谈话视频生成的高可扩展性和自然交互性。

Comments Homepage: https://hkust-c4g.github.io/AnyTalker-homepage

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23469 2025-12-01 cs.CV 57%

Visual Generation Tuning

视觉生成微调

Jiahao Guo, Sinan Du, Jingfeng Yao, Wenyu Liu, Bo Li, Haoxiang Cao, Kun Gai, Chun Yuan, Kai Wu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) School of Artificial Intelligence, South China Normal University(华南师范大学人工智能学院) Kolors Team, Kuaishou Technology(快手科技Kolors团队)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VGT,通过视觉生成微调提升视觉语言模型的视觉生成能力,在图像重建和生成任务中均取得优异成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23450 2025-12-01 cs.CV 57%

Object-Centric Data Synthesis for Category-level Object Detection

面向类别级目标检测的对象中心数据合成

Vikhyat Agarwal, Jiayi Cora Guo, Declan Hoban, Sissi Zhang, Nicholas Moran, Peter Cho, Srilakshmi Pattabiraman, Shantanu Joshi

机构 * University of Richmond(里士满大学) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Berkeley(加州大学伯克利分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) Analog Devices, Inc(安森科技公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种面向类别级目标检测的对象中心数据合成方法,通过不同数据合成技术提升模型在新目标类别上的检测性能。

Comments 10 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23449 2025-12-01 cs.LG cs.AI cs.CE cs.CV 57%

Physics-Informed Neural Networks for Thermophysical Property Retrieval

具有物理信息的神经网络用于热物理性质检索

Ali Waseem, Malcolm Mielle

机构 * Schindler EPFL Lab(施耐德EPFL实验室) Schindler(施耐德)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于PINN的迭代框架,用于在实地条件下可靠估计材料的热导率,通过正向热问题求解与参数优化的交替过程,实现高精度的热物理性质检索。

Comments 26 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23113 2025-12-01 cs.CV cs.LG 57%

db-SP: Accelerating Sparse Attention for Visual Generative Models with Dual-Balanced Sequence Parallelism

db-SP: 通过双平衡序列并行加速视觉生成模型的稀疏注意力

Siqi Chen, Ke Hong, Tianchen Zhao, Ruiqi Xie, Zhenhua Zhu, Xudong Zhang, Yu Wang

机构 * Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 db-SP通过双平衡序列并行技术提升视觉生成模型的稀疏注意力效率,实现端到端加速1.25倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22948 2025-12-01 cs.CV 57%

Do We Need Perfect Data? Leveraging Noise for Domain Generalized Segmentation

我们真的需要完美数据吗?利用噪声进行领域泛化分割

Taeyeong Kim, SeungJoon Lee, Jung Uk Kim, MyeongAh Cho

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 FLEX-Seg通过利用生成图像与语义掩码的固有不一致,提出了一种鲁棒的领域泛化分割方法,提升了分割性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22863 2025-12-01 cs.CV 57%

CoordSpeaker: Exploiting Gesture Captioning for Coordinated Caption-Empowered Co-Speech Gesture Generation

CoordSpeaker: 利用手势描述生成协调的 caption-驱动的语音同步手势生成

Fengyi Fang, Sicheng Yang, Wenming Yang

机构 * Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 CoordSpeaker通过引入手势描述框架和条件潜在扩散模型,实现了协调的caption驱动的语音同步手势生成,解决了手势生成中的语义先验间隙和多模态控制难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21579 2025-12-01 cs.CV 57%

Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy

Harmony: 通过跨任务协同实现音频和视频生成

Teng Hu, Zhentao Yu, Guozhen Zhang, Zihan Su, Zhengguang Zhou, Youliang Zhang, Yuan Zhou, Qinglin Lu, Ran Yi

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan Project(腾讯文心项目)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Harmony通过跨任务协同机制和同步增强CFG,实现高效音频视频同步生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22549 2025-12-01 cs.CV 57%

Diff-ICMH: Harmonizing Machine and Human Vision in Image Compression with Generative Prior

Diff-ICMH: 在图像压缩中融合机器与人类视觉

Ruoyu Feng, Yunpeng Qi, Jinming Liu, Yixin Gao, Xin Li, Xin Jin, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Eastern Institute of Technology, Ningbo(宁波工程技术院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Diff-ICMH通过融合机器与人类视觉,提出了一种生成图像压缩框架,利用生成先验和语义一致性损失提升压缩质量,同时支持多种智能任务。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22357 2025-12-01 cs.CV 57%

AnchorFlow: Training-Free 3D Editing via Latent Anchor-Aligned Flows

AnchorFlow: 基于潜在锚点对齐流的无训练3D编辑

Zhenglin Zhou, Fan Ma, Chengzhuo Gui, Xiaobo Xia, Hehe Fan, Yi Yang, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 AnchorFlow通过潜在锚点对齐流实现无训练3D编辑,确保编辑过程中的稳定性和语义一致性,提升编辑效果和几何保真度。

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22330 2025-12-01 cs.CV cs.AI 57%

Prompt-based Consistent Video Colorization

基于提示的一致视频着色

Silvia Dani, Tiberio Uricchio, Lorenzo Seidenari

机构 * University of Firenze(佛罗伦萨大学) University of Pisa(比萨大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于提示的自动化视频着色方法,利用语言和分割信息指导,通过光流和修正步骤实现时间稳定和高质量着色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22249 2025-12-01 cs.CV 57%

Toward Diffusible High-Dimensional Latent Spaces: A Frequency Perspective

迈向可扩散的高维潜在空间:从频率视角出发

Bolin Lai, Xudong Wang, Saketh Rambhatla, James M. Rehg, Zsolt Kira, Rohit Girdhar, Ishan Misra

机构 * Meta AI Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出FreqWarm方法,通过增加高频潜在信号的早期曝光,提升高维潜在空间的可扩散性,有效改善生成质量。

Comments 11 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏