arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-10 至 2025-12-10 共收录 62 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2506.05872 2025-12-10 cs.CV 83%

Domain-RAG: Retrieval-Guided Compositional Image Generation for Cross-Domain Few-Shot Object Detection

领域-RAG:跨领域少样本目标检测的检索引导组合图像生成

Yu Li, Xingyu Qiu, Yuqian Fu, Jie Chen, Tianwen Qian, Xu Zheng, Danda Pani Paudel, Yanwei Fu, Xuanjing Huang, Luc Van Gool, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Fuzhou University(福州大学) East China Normal University(华东师范大学) HKUST(GZ)(香港科技大学(广州))

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 Domain-RAG通过检索引导的组合图像生成方法,解决跨领域少样本目标检测中的领域对齐与背景生成问题,实现高质量样本生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18123 2025-12-10 cs.CR cs.CL 78%

AEIOU: A Unified Defense Framework against NSFW Prompts in Text-to-Image Models

AEIOU:一种针对文本到图像模型中不适宜提示的统一防御框架

Yiming Wang, Jiahao Chen, Qingming Li, Tong Zhang, Rui Zeng, Xing Yang, Shouling Ji

专题命中 文生图 :text-to-image(title,abstract)

AI总结 AEIOU提出了一种针对文本到图像模型中不适宜提示的统一防御框架,通过高效提取NSFW特征实现高准确率和效率,有效应对适应性攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18331 2025-12-10 cs.CV 57%

End-to-End Fine-Tuning of 3D Texture Generation using Differentiable Rewards

使用可微奖励对3D纹理生成进行端到端微调

AmirHossein Zamani, Tianhao Xie, Amir G. Aghdam, Tiberiu Popa, Eugene Belilovsky

机构 * Mila – Quebec AI Institute(魁北克AI研究所) Concordia University(康科迪亚大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种端到端的可微框架,通过可微奖励函数优化3D纹理生成,提升对3D结构的理解和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22931 2025-12-10 cs.CY 50%

Visual Orientalism in the AI Era: From West-East Binaries to English-Language Centrism

人工智能时代视觉沙文主义:从东西二元对立到英语中心主义

Zhilong Zhao, Yindi Liu

专题命中 文生图 :text-to-image(abstract)

AI总结 本文探讨了人工智能时代视觉沙文主义的演变,揭示AI通过视觉表示强化东西方二元对立,转向英语中心主义,强调需重新审视算法治理与训练数据中的地缘政治结构。

Comments 43 pages, 8 figures, supplementary materials included

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 44 篇

2512.08774 2025-12-10 cs.CV cs.AI 89%

Refining Visual Artifacts in Diffusion Models via Explainable AI-based Flaw Activation Maps

通过可解释人工智能基于的缺陷激活图来改进扩散模型中的视觉伪影

Seoyeon Lee, Gwangyeol Yu, Chaewon Kim, Jonghyuk Park

机构 * Kookmin University(韩国庆熙大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);inpainting(abstract)

AI总结 通过可解释人工智能生成缺陷激活图,改进扩散模型中的视觉伪影问题,提升图像生成质量。

Comments 10 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12332 2025-12-10 cs.SD cs.AI cs.CV cs.MM eess.AS 81%

VoiceCloak: A Multi-Dimensional Defense Framework against Unauthorized Diffusion-based Voice Cloning

VoiceCloak:一种针对未经授权的基于扩散的语音克隆的多维防御框架

Qianyue Hu, Junyan Wu, Wei Lu, Xiangyang Luo

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 VoiceCloak通过多维防御机制有效对抗未经授权的基于扩散的语音克隆,通过扰动参考音频和破坏条件引导过程来混淆说话者身份并降低语音质量。

Comments 15 pages, 6 figures, 13 tables; Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08922 2025-12-10 cs.CV 79%

Unified Diffusion Transformer for High-fidelity Text-Aware Image Restoration

统一扩散变压器用于高质量文本感知图像恢复

Jin Hyeon Kim, Paul Hyunbin Cho, Claire Kim, Jaewon Min, Jaeeun Lee, Jihye Park, Yeji Choi, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Samsung Electronics(三星电子)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 UniT通过整合扩散变压器、视觉-语言模型和文本识别模块,实现高质量文本感知图像恢复,有效抑制文本幻觉并取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08897 2025-12-10 cs.CV 79%

UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation

UniLayDiff: 一种统一的扩散变换器用于内容感知的布局生成

Zeyang Liu, Le Wang, Sanping Zhou, Yuxuan Wu, Xiaolong Sun, Gang Hua, Haoxiang Li

机构 * College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) Amazon.com, Inc.(亚马逊公司) Pixocial Technology(Pixocial技术)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 UniLayDiff通过统一的扩散变换器框架,首次实现了内容感知布局生成任务的端到端统一生成,提升了布局质量和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08747 2025-12-10 cs.CV 79%

A Scalable Pipeline Combining Procedural 3D Graphics and Guided Diffusion for Photorealistic Synthetic Training Data Generation in White Button Mushroom Segmentation

可扩展的管道结合程序化3D图形和引导扩散用于白蘑菇分割的逼真合成训练数据生成

Artúr I. Károly, Péter Galambos

机构 * Antal Bejczy Center for Intelligent Robotics(安塔尔·贝茨奇智能机器人中心) Research and Innovation Center of Obuda University(奥布达大学研究与创新中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出结合程序化3D图形和引导扩散模型,生成高逼真合成数据以提升白蘑菇分割性能。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08547 2025-12-10 cs.CV 79%

An Iteration-Free Fixed-Point Estimator for Diffusion Inversion

无迭代固定点估计器用于扩散反向

Yifei Chen, Kaiyu Song, Yan Pan, Jianxing Yu, Jian Yin, Hanjiang Lai

机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学) School of Artificial Intelligence, Sun Yat-sen University(人工智能学院,中山大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种无迭代的固定点估计器用于扩散反向,通过误差近似方法提高重建性能,无需额外迭代或训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08506 2025-12-10 cs.CV 79%

OCCDiff: Occupancy Diffusion Model for High-Fidelity 3D Building Reconstruction from Noisy Point Clouds

OCCDiff:基于点云的高保真3D建筑重建的占用扩散模型

Jialu Sui, Rui Liu, Hongsheng Zhang

机构 * Department of Geography, Faculty of Social Science, the University of Hong Kong(地理系,社会科学学院,香港大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OCCDiff通过潜在扩散和函数自动编码器生成高保真3D建筑重建,结合点编码器与多任务训练提升鲁棒性与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08330 2025-12-10 cs.CV 79%

PointDico: Contrastive 3D Representation Learning Guided by Diffusion Models

PointDico: 通过扩散模型引导的对比3D表示学习

Pengbo Li, Yiding Sun, Haozhe Cheng

机构 * International School Beijing University of Posts(国际学校 北京邮电大学) School of Software Engineering Xi'an Jiaotong University Xi'an, China(软件工程学院 西安交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PointDico通过融合扩散模型和对比学习的方法,实现了3D表示学习的突破,达到了ScanObjectNN和ShapeNetPart上的新高精度。

Comments Accepted by IJCNN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08329 2025-12-10 cs.CV cs.AI cs.LG 79%

Interpreting Structured Perturbations in Image Protection Methods for Diffusion Models

在扩散模型图像保护方法中解释结构扰动

Michael R. Martin, Garrick Chan, Kwan-Liu Ma

专题命中 扩散模型 :diffusion(title);text-to-image(abstract);分类 cs.CV

AI总结 本研究通过分析扩散模型图像保护机制的结构化扰动,揭示其在特征层面的变形特性,为防御和检测策略设计提供新视角。

Comments 32 pages, 17 figures, 1 table, 5 algorithms, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08153 2025-12-10 cs.LG cs.AI cs.CV 79%

TreeGRPO: Tree-Advantage GRPO for Online RL Post-Training of Diffusion Models

TreeGRPO:基于树优势的在线强化学习后训练扩散模型

Zheng Ding, Weirui Ye

机构 * UC San Diego(圣迭戈大学) MIT(麻省理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TreeGRPO通过树结构提升扩散模型后训练效率,实现2.4倍加速并优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06670 2025-12-10 cs.CV 79%

Video Dataset Condensation with Diffusion Models

视频数据集压缩与扩散模型

Zhe Li, Hadrien Reynaud, Mischa Dombrowski, Sarah Cechnicka, Franciskus Xaverius Erick, Bernhard Kainz

机构 * Department AIBE FAU Erlangen-Nürnberg(FAU埃尔朗根-纽伦堡AIBE部门) Department of Computing Imperial College London(伦敦帝国理工学院计算系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散模型和VST-UNet的视频数据集压缩方法,结合训练免费聚类算法,有效提升视频数据集蒸馏性能,达到10.61%的性能提升。

Comments Accepted at BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08859 2025-12-10 cs.LG 78%

Refining Diffusion Models for Motion Synthesis with an Acceleration Loss to Generate Realistic IMU Data

通过加速度损失优化扩散模型以生成逼真的IMU数据

Lars Ole Häusler, Lena Uhlenberg, Göran Köber, Diyora Salimova, Oliver Amft

机构 * Intelligent Embedded Systems Lab, University of Freiburg, Germany(弗赖堡大学智能嵌入式系统实验室) Hahn-Schickard, Freiburg, Germany(弗赖堡Hahn-Schickard研究所) Department for Applied Mathematics, University of Freiburg, Germany(弗赖堡大学应用数学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 通过加速度损失优化扩散模型生成逼真IMU数据,提升运动合成与IMU合成的对齐效果,并提高人类活动识别性能。

Comments 7 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08705 2025-12-10 eess.SY cs.LG cs.SY math.OC 78%

Gradient-Informed Monte Carlo Fine-Tuning of Diffusion Models for Low-Thrust Trajectory Design

基于梯度信息的扩散模型微调用于低推力轨道设计

Jannik Graebner, Ryne Beeson

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出利用梯度信息的马尔可夫链蒙特卡罗方法,结合扩散模型微调,提升低推力轨道设计的效率与可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08510 2025-12-10 physics.bio-ph cond-mat.soft cs.LG physics.data-an 78%

Data-Efficient Learning of Anomalous Diffusion with Wavelet Representations: Enabling Direct Learning from Experimental Trajectories

高效学习异常扩散的小波表示:使能够直接从实验轨迹学习

Gongyi Wang, Yu Zhang, Zihan Huang

机构 * School of Physics and Electronics, Hunan University, Changsha 410082, China(物理电子学院,湖南大学,长沙410082,中国)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于小波表示的异常扩散学习方法,通过直接从实验轨迹中高效学习,提升了在真实数据上的性能。

Comments 23 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00339 2025-12-10 math.DS 78%

Global dynamics in a reaction-diffusion competition model with edge behavior

反应-扩散竞争模型中边缘行为的全局动态

Kuiyue Liu, Shanshan Chen

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了反应-扩散竞争模型中边缘行为的全局动态,发现IFD策略能稳定物种竞争,当入侵物种策略更接近IFD且扩散较慢时可消灭本地物种,而当两种物种策略位于IFD两侧时可共存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06395 2025-12-10 nlin.CD 78%

Scaling invariance for the diffusion coefficient in a billiard system

扩散系数在弹跳系统中的缩放不变性

Anne Kétri P. da Fonseca, Diego F. M. Oliveira, Edson D. Leonel

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究探讨了弹跳系统中扩散系数的缩放不变性,揭示了其在不同时间尺度下的行为特征及与控制参数的关系。

Comments Accepted for publication at Discontinuity, Nonlinearity, and Complexity in 05/12/2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20024 2025-12-10 cs.LG cs.AI physics.ao-ph stat.ML 78%

Elucidated Rolling Diffusion Models for Probabilistic Forecasting of Complex Dynamics

阐明的滚动扩散模型用于复杂动态的概率预报

Salva Rühling Cachay, Miika Aittala, Karsten Kreis, Noah Brenowitz, Arash Vahdat, Morteza Mardani, Rose Yu

机构 * UC San Diego(斯克利普斯海洋研究所(圣地亚哥)) NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 ERDM通过整合滚动预测结构与EDM设计,有效提升复杂动态的概率预报性能。

Comments NeurIPS 2025

Journal ref Advances in Neural Information Processing Systems (NeurIPS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14882 2025-12-10 math.ST cs.NA math.NA math.PR stat.CO stat.ML stat.TH 78%

Sampling and estimation on manifolds using the Langevin diffusion

在流形上使用兰格vin扩散进行采样和估计

Karthik Bharath, Alexander Lewis, Akash Sharma, Michael V Tretyakov

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种在流形上使用兰格vin扩散进行采样和估计的方法,推导了误差界并验证了其在不同曲率流形上的实用性。

Journal ref Journal of Machine Learning Research (JMLR) 26 (2025), 71:1-50

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07312 2025-12-10 cs.IT cs.AI cs.LG math.IT 78%

Diffusion Models for Wireless Communications

无线通信中的扩散模型

Mehdi Letafati, Samad Ali, Matti Latva-aho

机构 * Centre for Wireless Communications, University of Oulu(无线通信中心,奥卢大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出条件扩散模型用于提升无线通信系统中的数据重构性能,尤其在低SNR条件下实现10dB改进,并在语义通信中展现优于传统自编码器的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07914 2025-12-10 math.AP 78%

Inverse coefficient problem for a fully fractional diffusion equation with nonlinear and source nonlocal initial condition

完全分数扩散方程中非线性及源非局部初始条件的反系数问题

D. K. Durdiev, H. H. Turdiev

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了完全分数扩散方程中非线性及源非局部初始条件的反系数问题,通过傅里叶方法和固定点论证证明了解的适定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21058 2025-12-10 cs.GR cs.AI cs.CV 62%

Mixture of Contexts for Long Video Generation

上下文混合用于长视频生成

Shengqu Cai, Ceyuan Yang, Lvmin Zhang, Yuwei Guo, Junfei Xiao, Ziyan Yang, Yinghao Xu, Zhenheng Yang, Alan Yuille, Leonidas Guibas, Maneesh Agrawala, Lu Jiang, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出上下文混合(MoC)模块,通过稀疏注意力路由解决长视频生成中的长上下文记忆问题,提升模型在长序列中的效率与一致性。

Comments Project page: https://primecai.github.io/moc/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08269 2025-12-10 cs.CV 57%

EgoX: Egocentric Video Generation from a Single Exocentric Video

EgoX:从单个外视视频生成自视视频

Taewoong Kang, Kinam Kim, Dohyeon Kim, Minho Park, Junha Hyung, Jaegul Choo

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 EgoX通过轻量级LoRA适应和统一条件策略,从单个外视视频生成自视视频,实现几何一致且逼真的视频生成,具有高可扩展性和鲁棒性。

Comments 21 pages, project page : https://keh0t0.github.io/EgoX

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07720 2025-12-10 cs.CV 57%

ViSA: 3D-Aware Video Shading for Real-Time Upper-Body Avatar Creation

ViSA: 一种3D感知的视频着色方法用于实时上半身数字人生成

Fan Yang, Heyuan Li, Peihao Li, Weihao Yuan, Lingteng Qiu, Chaoyue Song, Cheng Chen, Yisheng He, Shifeng Zhang, Xiaoguang Han, Steven Hoi, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 ViSA结合3D重建与视频生成技术,实时生成高质量上半身数字人,减少模糊和僵硬问题,提升视觉质量。

Comments Project page: \url{https://lhyfst.github.io/visa}

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08664 2025-12-10 physics.flu-dyn astro-ph.SR 50%

Centrifugal instability of Taylor-Couette flow in stratified and diffusive fluids

分层和扩散流体中泰勒-库埃特流的离心不稳定性

Junho Park

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究了分层和扩散流体中泰勒-库埃特流的离心不性,发现热扩散和分层对不性的影响可通过参数PN=N²Pr描述,并通过DNS和LSA分析了非线性特征和混沌状态。

Comments accepted manuscript in Journal of Fluid Mecahnics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08660 2025-12-10 q-bio.PE math.DS 50%

Flow-Based Modelling of Population Dynamics with Consecutive Continuous Mutations

基于连续连续突变的种群动力学建模

Alexander Bratus, Tatiana Yakushkina, Vladimir Posvyanski

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种基于连续突变的种群动力学模型,结合非线性流和逻辑增长,通过分析突变率对种群前沿的影响,扩展了经典进化模型,适用于病毒学、细菌适应和肿瘤进展研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08655 2025-12-10 math.AP 50%

Global Weak Solutions for the High--Friction Quantum Navier--Stokes--Poisson Model

高摩擦量子纳维-斯托克斯-泊松模型的全局弱解

Giada Cianfarani Carnevale

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文证明了高摩擦量子纳维-斯托克斯-泊松模型在三维紧致流形上有限能量弱解的全局存在性。

详情

展开后加载摘要…

URL PDF HTML 收藏