arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-12 至 2025-12-12 共收录 46 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2412.02912 2025-12-12 cs.CV cs.AI cs.GR cs.LG 87%

ShapeWords: Guiding Text-to-Image Synthesis with 3D Shape-Aware Prompts

ShapeWords: 基于3D形状感知提示的文本到图像合成

Dmitry Petrov, Pradyumn Goyal, Divyansh Shivashok, Yuanming Tao, Melinos Averkiou, Evangelos Kalogerakis

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) CYENS CoE(CYENS联合学院) University of Cyprus(塞浦路斯大学) TU Crete(希腊技术大学)

专题命中 文生图 :image synthesis(title,abstract);text-to-image(title);分类 cs.CV、cs.GR

AI总结 ShapeWords通过融合3D形状信息与文本提示,提升文本到图像合成的准确性与3D结构感知能力。

Comments Project webpage: https://lodurality.github.io/shapewords/ (CVPR 2025 paper), this Author Accepted Manuscript version is made available under the Creative Commons Attribution 4.0 International License (CC BY 4.0) in accordance with the ERC / Horizon Europe open-access mandate

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07702 2025-12-12 cs.CV cs.AI 81%

Guiding What Not to Generate: Automated Negative Prompting for Text-Image Alignment

引导不应生成的内容:用于文本-图像对齐的自动化负提示

Sangha Park, Eunji Kim, Yeongtak Oh, Jooyoung Choi, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Amazon(亚马逊) IPAI, AIIS, ASRI, INMC, and ISRC, Seoul National University(IPAI、AIIS、ASRI、INMC 和 ISRC,首尔国立大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 本文提出NPC方法,通过自动化负提示生成提升文本-图像对齐效果,在GenEval++和Imagine-Bench上取得优异成绩。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 31 篇

2512.10954 2025-12-12 cs.CV 86%

Group Diffusion: Enhancing Image Generation by Unlocking Cross-Sample Collaboration

组扩散:通过解锁跨样本协作增强图像生成

Sicheng Mo, Thao Nguyen, Richard Zhang, Nick Kolkin, Siddharth Srinivasan Iyer, Eli Shechtman, Krishna Kumar Singh, Yong Jae Lee, Bolei Zhou, Yuheng Li

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe研究)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);分类 cs.CV

AI总结 组扩散通过解锁跨样本协作机制,提升图像生成质量,实现32.2%的FID改进。

Comments Project Page: https://sichengmo.github.io/GroupDiff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10655 2025-12-12 cs.AI 86%

CAPTAIN: Semantic Feature Injection for Memorization Mitigation in Text-to-Image Diffusion Models

CAPTAIN: 语义特征注入用于文本到图像扩散模型中的记忆抑制

Tong Zhang, Carlos Hinojosa, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title)

AI总结 CAPTAIN通过在去噪过程中直接修改潜在特征,有效减少文本到图像扩散模型的记忆问题,同时保持提示的保真度和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09441 2025-12-12 cs.GR cs.CV 84%

RectifiedHR: High-Resolution Diffusion via Energy Profiling and Adaptive Guidance Scheduling

RectifiedHR: 通过能量分析和自适应引导调度实现高分辨率扩散

Ankit Sanjyal

机构 * Fordham University(福特汉姆大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV、cs.GR

AI总结 RectifiedHR通过能量分析和自适应引导调度提升高分辨率扩散模型的稳定性和图像质量。

Comments 8 Pages, 10 Figures, Pre-Print Version, This version is under review for citation accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02899 2025-12-12 cs.CV 83%

Glance: Accelerating Diffusion Models with 1 Sample

Glance: 通过1个样本加速扩散模型

Zhuobai Dong, Rui Zhao, Songjie Wu, Junchao Yi, Linjie Li, Zhengyuan Yang, Lijuan Wang, Alex Jinpeng Wang

机构 * WHU(武汉大学) NUS(国立新加坡大学) CSU(中国科学技术大学) UESTC(电子科技大学) Microsoft(微软公司)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出通过轻量LoRA适配器实现扩散模型的高效加速,仅需1个样本训练即可获得强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10177 2025-12-12 cs.LG cond-mat.stat-mech cs.CV stat.ML 83%

Geometric Regularity in Deterministic Sampling Dynamics of Diffusion-based Generative Models

扩散生成模型确定性采样动态中的几何正则性

Defang Chen, Zhenyu Zhou, Can Wang, Siwei Lyu

机构 * University at Buffalo, State University of New York(纽约州立大学布法罗分校) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文揭示了扩散生成模型采样轨迹的几何正则性,提出动态规划方案提升图像生成性能。

Comments 57 pages. Accepted by Journal of Statistical Mechanics: Theory and Experiment (2025). The short version was published in ICML 2024. arXiv admin note: text overlap with arXiv:2405.11326

Journal ref J. Stat. Mech. (2025) 124002

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17230 2025-12-12 cs.CV 83%

ObjectAdd: Adding Objects into Image via a Training-Free Diffusion Modification Fashion

ObjectAdd:通过一种无需训练的扩散修改方法将对象添加到图像中

Ziyue Zhang, Mingbao Lin, Quanjian Song, Yuxin Zhang, Rongrong Ji

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 ObjectAdd通过无需训练的扩散修改方法,实现用户指定区域内的对象添加,保持图像一致性与无缝融合。

Comments 12 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10433 2025-12-12 cs.AI 82%

Targeted Data Protection for Diffusion Model by Matching Training Trajectory

通过匹配训练轨迹实现扩散模型的定向数据保护

Hojun Lee, Mijin Koo, Yeji Song, Nojun Kwak

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 本文提出TAFAP方法,通过控制扩散模型的训练轨迹实现有效的定向数据保护,同时保持图像质量,解决了现有方法可控性差的问题。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18665 2025-12-12 cs.CV cs.GR 81%

SpotLight: Shadow-Guided Object Relighting via Diffusion

SpotLight: 通过扩散模型实现阴影引导的物体光照

Frédéric Fortier-Chouinard, Zitian Zhang, Louis-Etienne Messier, Mathieu Garon, Anand Bhattad, Jean-François Lalonde

机构 * Université Laval(拉瓦尔大学) Depix Technologies(Depix技术公司) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 SpotLight通过提供粗略阴影提示,无需训练即可实现精确可控的物体光照,优于现有扩散模型在光照和阴影处理上的表现。

Comments Project page: https://lvsn.github.io/spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10038 2025-12-12 cs.CV cs.CL 79%

Diffusion Is Your Friend in Show, Suggest and Tell

在展示、建议和告知中,扩散是你的朋友

Jia Cheng Hu, Roberto Cavicchioli, Alessandro Capotondi

机构 * Department of Physics, Informatics and Mathematics(物理、信息学与数学系) Department of Communication and Economics(通信与经济学系) University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Show,Suggest和Tell模型,通过结合扩散模型与自回归生成,实现COCO数据集上的先进结果,无需强化学习。

Journal ref 2025 IEEE International Conference on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05991 2025-12-12 cs.CV 79%

EmoDiffTalk:Emotion-aware Diffusion for Editable 3D Gaussian Talking Head

EmoDiffTalk:面向可编辑3D高斯说话头的情绪感知扩散

Chang Liu, Tianjiao Jing, Chengcheng Ma, Xuanqi Zhou, Zhengxuan Lian, Qin Jin, Hongliang Yuan, Shi-Sheng Huang

机构 * Beijing Normal University(北京师范大学) Renmin University of China(中国人民大学) Tencent AI Lab(腾讯AI实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 EmoDiffTalk通过情绪感知高斯扩散实现细粒度面部动画与多模态情绪编辑,提升3D说话头的情绪表达精度和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10880 2025-12-12 math.CA math-ph math.AP math.FA math.MP 78%

Spectral Theory of the Weighted Fourier Transform with respect to a Function in $\mathbb{R}^n$: Uncertainty Principle and Diffusion-Wave Applications

关于函数在R^n上的加权傅里叶变换的谱理论:不确定性原理与扩散-波应用

Gustavo Dorrego, Luciano Luque

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种加权傅里叶变换的谱理论,用于定义加权分数阶拉普拉斯算子,并应用于求解广义时间-空间分数扩散-波方程。

Comments 16pages. Submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10773 2025-12-12 cs.RO 78%

AERMANI-Diffusion: Regime-Conditioned Diffusion for Dynamics Learning in Aerial Manipulators

AERMANI-Diffusion:用于空中机械臂动态学习的制度条件扩散

Samaksh Ujjawal, Shivansh Pratap Singh, Naveen Sudheer Nair, Rishabh Dev Yadav, Wei Pan, Spandan Roy

机构 * Robotics Research Center, International Institute of Information Technology Hyderabad(国际信息科技学院海得拉巴分校机器人研究中心) Department of Computer Science, The University of Manchaster(曼彻斯特大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 AERMANI-Diffusion通过条件扩散框架和轻量级时间编码器,实现对空中机械臂动态不确定性的补偿,提升实际测试中的跟踪精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10515 2025-12-12 q-bio.BM 78%

UNAAGI: Atom-Level Diffusion for Generating Non-Canonical Amino Acid Substitutions

UNAAGI:原子级扩散用于生成非编码氨基酸替代

Han Tang, Wouter Boomsma

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 UNAAGI通过原子级扩散模型生成非编码氨基酸替代,提升突变效应预测性能并促进蛋白质工程与结构药物设计的统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04522 2025-12-12 cs.LG cs.AI 78%

Toward a Unified Geometry Understanding: Riemannian Diffusion Framework for Graph Generation and Prediction

迈向统一几何理解:图生成与预测的黎曼扩散框架

Yisen Gao, Xingcheng Fu, Qingyun Sun, Jianxin Li, Xianxian Li

机构 * Key Lab of Education Blockchain and Intelligent Technology, Guangxi Normal University(教育区块链与智能技术重点实验室,广西师范大学) Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程,香港科学与技术大学) Guangxi Key Lab of Multi-source Information Mining & Security, Guangxi Normal University(广西多源信息挖掘与安全重点实验室,广西师范大学) School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北京航空航天大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出GeoMancer框架,通过黎曼扩散方法解决图数据生成与预测中的几何潜力释放问题,提升模型对复杂流形结构的学习能力。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16878 2025-12-12 cs.HC 78%

Enhancing EEG Signal-Based Emotion Recognition with Synthetic Data: Diffusion Model Approach

通过合成数据增强EEG信号基于情绪识别:扩散模型方法

Gourav Siddhad, Masakazu Iwamura, Partha Pratim Roy

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出基于扩散模型的合成数据生成方法,用于提升EEG信号的情绪识别准确率,实验结果显示在DEAP数据集上分类准确率提高5.6%,优于传统GAN和DDPM方法。

Comments 10 Pages, 10 Figures, 4 Tables

Journal ref IEEE Trans. Artif. Intell., 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10099 2025-12-12 cs.RO cs.LG 78%

Push Smarter, Not Harder: Hierarchical RL-Diffusion Policy for Efficient Nonprehensile Manipulation

推智而非推力:用于高效非抓取操作的分层RL-扩散策略

Steven Caro, Stephen L. Smith

机构 * Department of Electrical and Computer Engineering, University of Waterloo(电子与计算机工程系,滑铁卢大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出HeRD,一种分层RL-扩散策略,用于高效非抓取操作,通过分层目标选择与轨迹生成提升成功率和泛化能力。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23972 2025-12-12 cs.LG cs.AI 71%

An efficient probabilistic hardware architecture for diffusion-like models

一种高效的概率硬件架构用于扩散模型

Andraž Jelinčič, Owen Lockwood, Akhil Garlapati, Peter Schillinger, Isaac Chuang, Guillaume Verdon, Trevor McCourt

机构 * Extropic Corp.(Extropic公司) Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) Massachusetts Institute of Technology(麻省理工学院)

专题命中 扩散模型 :diffusion(title)

AI总结 本文提出了一种高效的概率硬件架构,通过全晶体管设计在硬件层面实现强大的去噪模型,使设备在低能耗下达到与GPU相当的性能。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10939 2025-12-12 cs.CV 70%

GaussianHeadTalk: Wobble-Free 3D Talking Heads with Audio Driven Gaussian Splatting

GaussianHeadTalk: 无抖动的3D说话头:基于音频驱动的高斯点云法

Madhav Agarwal, Mingtian Zhang, Laura Sevilla-Lara, Steven McDonagh

机构 * University of Edinburgh(爱丁堡大学) University College London(伦敦大学学院)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出基于音频驱动的3D说话头生成方法,利用高斯点云法和Transformer模型实现高保真、实时的虚拟角色生成。

Comments IEEE/CVF Winter Conference on Applications of Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10794 2025-12-12 cs.CV cs.AI cs.GR cs.LG stat.ML 66%

What matters for Representation Alignment: Global Information or Spatial Structure?

表示对齐什么更重要:全局信息还是空间结构?

Jaskirat Singh, Xingjian Leng, Zongze Wu, Liang Zheng, Richard Zhang, Eli Shechtman, Saining Xie

机构 * Adobe Research(Adobe研究院) ANU(澳大利亚国立大学) New York University(纽约大学)

专题命中 扩散模型 :diffusion(abstract,comments);分类 cs.CV、cs.GR

AI总结 研究发现空间结构比全局语义信息对生成效果更重要,提出iREPA方法提升生成模型训练效率。

Comments Project page: https://end2end-diffusion.github.io/irepa

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10860 2025-12-12 cs.CV 57%

SWiT-4D: Sliding-Window Transformer for Lossless and Parameter-Free Temporal 4D Generation

SWiT-4D: 用于无损和参数无关的时序4D生成的滑动窗口变换器

Kehong Gong, Zhengyu Wen, Mingxi Xu, Weixia He, Qi Wang, Ning Zhang, Zhengyu Li, Chenbin Li, Dongze Lian, Wei Zhao, Xiaoyu He, Mingyuan Zhang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) Huawei Central Media Technology Institute(华为中央媒体技术研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 SWiT-4D通过滑动窗口变换器实现无损、无参数的时序4D网格生成,结合扩散变换器生成3D模型,提升视频到4D网格的生成效果。

Comments Project page: https://animotionlab.github.io/SWIT4D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10765 2025-12-12 cs.CV 57%

Blood Pressure Prediction for Coronary Artery Disease Diagnosis using Coronary Computed Tomography Angiography

使用冠状动脉计算机断层扫描血管造影进行冠状动脉疾病诊断的血压预测

Rene Lisasi, Michele Esposito, Chen Zhao

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的端到端流程,通过CCTA数据直接预测冠状动脉血压,实现非侵入性CAD诊断

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10572 2025-12-12 cs.GR 57%

DeMapGS: Simultaneous Mesh Deformation and Surface Attribute Mapping via Gaussian Splatting

DeMapGS:通过高斯散射实现同时的网格变形与表面属性映射

Shuyi Zhou, Shengze Zhong, Kenshi Takayama, Takafumi Taketomi, Takeshi Oishi

专题命中 扩散模型 :diffusion(abstract);分类 cs.GR

AI总结 DeMapGS通过高斯散射实现网格变形与表面属性映射的联合优化,提升重建质量与下游应用能力。

Comments Project page see https://shuyizhou495.github.io/DeMapGS-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14527 2025-12-12 cs.CV 57%

diffDemorph: Extending Reference-Free Demorphing to Unseen Faces

diffDemorph: 通过扩展参考自由变形来处理未见过的面孔

Nitish Shukla, Arun Ross

机构 * Michigan State University, USA(密歇根州立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 diffDeMorph通过扩散模型实现参考自由变形,有效解耦复合图像中的组件,跨变形技术和面部风格提升性能,达到现有最佳水平的59.46%提升。

Journal ref IEEE International Conference on Image Processing (ICIP), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10905 2025-12-12 hep-th 50%

Viscoelastic hydrodynamics of charged black holes

带电黑洞的粘弹性流体动力学

Richard A. Davison, André Oliveira Pinheiro

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究通过粘弹性流体动力学理论分析带电AdS黑洞的动力学,揭示了其在参数空间中的不稳定性来源及热扩散模式的集体激发特性。

Comments 46 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10716 2025-12-12 math.NA cs.NA 50%

Dynamically consistent finite volume scheme for a bimonomeric simplified model with inflammation processes for Alzheimer's disease

具有炎症过程的阿尔茨海默病简化双单体模型的动态一致有限体积方案

Juan Barajas-Calonge, Mauricio A. Sepulveda Cortes, Nicolas Torres, Luis Miguel Villada

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种动态一致的有限体积方案,用于求解包含炎症过程的阿尔茨海默病简化双单体模型,通过半隐式策略保证了方案的稳定性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10500 2025-12-12 cond-mat.stat-mech 50%

Discreteness-induced spatial chaos versus fluctuation-induced spatial order in stochastic Turing pattern formation

离散性诱导的空间混沌与波动性诱导的空间秩序在随机图示模式形成中的对比

Yusuke Yanagisawa, Shin-ichi Sasa

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究比较了随机图示模式形成中离散性和波动性对空间结构的不同影响,揭示了不同极限过程导致空间混沌与周期性模式的差异。

Comments 8 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10407 2025-12-12 stat.ML cs.LG 50%

Supervised Learning of Random Neural Architectures Structured by Latent Random Fields on Compact Boundaryless Multiply-Connected Manifolds

在紧致无边界多连通流形上由潜在随机场结构化的随机神经架构的监督学习

Christian Soize

机构 * Université Gustave Eiffel, MSME UMR 8208(法国埃菲尔大学MSME UMR 8208)

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究提出了一种在紧致无边界多连通流形上由潜在随机场结构化的随机神经架构的监督学习框架,通过几何感知和场驱动的生成过程实现神经拓扑和突触权重的联合生成。

Comments 46 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09606 2025-12-12 physics.soc-ph 50%

A unified framework for identifying influential nodes in hypergraphs

超图中识别影响性节点的统一框架

Yajing Hao, Longzhao Liu, Xin Wang, Zhihao Han, Ming Wei, Zhiming Zheng, Shaoting Tang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种统一框架,通过将传播动态嵌入高阶网络中,以更准确地识别影响性节点,提升了方法的鲁棒性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏