arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-29 至 2025-12-29 共收录 35 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2509.23022 2025-12-29 cs.CV 88%

Copyright Infringement Detection in Text-to-Image Diffusion Models via Differential Privacy

通过差分隐私在文本到图像扩散模型中检测版权侵权

Xiafeng Man, Zhipeng Wei, Jingjing Chen

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DPM框架,通过差分隐私概念检测文本到图像扩散模型中的版权侵权,无需原始数据集即可实现可靠检测。

Comments AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21675 2025-12-29 cs.CV 70%

UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture

UniPercept:迈向跨美学、质量、结构和纹理的统一感知级图像理解

Shuo Cao, Jiayang Li, Xiaohui Li, Yuandong Pu, Kaiwen Zhu, Yuanting Gao, Siqi Luo, Yi Xin, Qi Qin, Yu Zhou, Xiangyu Chen, Wenlong Zhang, Bin Fu, Yu Qiao, Yihao Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学) Sun Yat-sen University(中山大学) Tele-AI Website(Tele-AI网站)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 UniPercept通过领域自适应预训练和任务对齐强化学习,实现跨美学、质量、结构和纹理的统一感知级图像理解,优于现有多模态大语言模型。

Comments 27 pages, 14 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 5 篇

2507.04584 2025-12-29 cs.CV 85%

S$^2$Edit: Text-Guided Image Editing with Precise Semantic and Spatial Control

S$^2$Edit: 基于文本引导的图像编辑与精确语义和空间控制

Xudong Liu, Zikun Chen, Ruowei Jiang, Ziyi Wu, Kejia Yin, Han Zhao, Parham Aarabi, Igor Gilitschenski

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) ModiFace Inc.(ModiFace公司) Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系)

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 S$^2$Edit通过精确语义和空间控制实现文本引导的图像编辑,解决了身份信息丢失和无关区域修改的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21637 2025-12-29 cs.CV 79%

Training-Free Disentangled Text-Guided Image Editing via Sparse Latent Constraints

无需训练的解耦文本引导图像编辑:通过稀疏潜在约束

Mutiara Shabrina, Nova Kurnia Putri, Jefri Satria Ferdiansyah, Sabita Khansa Dewi, Novanto Yudistira

机构 * Department of Informatics Engineering Universitas Brawijaya Malang, Indonesia(信息工程系 乌姆拉大学 马拉邦,印度尼西亚)

专题命中 图像编辑 :image editing(title);image generation(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的解耦文本引导图像编辑方法,通过引入稀疏潜在约束减少属性纠缠问题,提升编辑的可控性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18699 2025-12-29 cs.CV 79%

Affective Image Editing: Shaping Emotional Factors via Text Descriptions

情感图像编辑:通过文本描述塑造情感因素

Peixuan Zhang, Shuchen Weng, Chengxuan Zhu, Binghao Tang, Zijian Jia, Si Li, Boxin Shi

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications, China(北京邮电大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Laboratory for Multimedia Information Processing and National Engineering Research Center of Visual Technology, School of Computer Science, Peking University, China(多媒体信息处理国家重点实验室和视觉技术国家工程研究中心,北京大学计算机学院)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 AIEdiT通过文本描述实现情感图像编辑,利用情感映射器和MLLM生成符合用户情感需求的图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21560 2025-12-29 cs.CV 70%

Toward Intelligent Scene Augmentation for Context-Aware Object Placement and Sponsor-Logo Integration

迈向智能场景增强以实现情境感知的对象放置和赞助商-标志集成

Unnati Saraswat, Tarun Rao, Namah Gupta, Shweta Swami, Shikhar Sharma, Prateek Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science(巴里尔理工学院和科学研究院)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出两个新任务:情境感知的对象插入和赞助商-产品标志增强,并构建了相应数据集以支持这些任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20987 2025-12-29 cs.CV 57%

Webly-Supervised Image Manipulation Localization via Category-Aware Auto-Annotation

通过类别感知自动标注实现Web监督的图像操纵定位

Chenfan Qu, Yiwu Zhong, Huiguo He, Bin Li, Lianwen Jin

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 通过类别感知自动标注和网络监督,提出 Web-IML 模型以有效定位图像操纵区域,显著提升性能并扩大数据集规模。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 19 篇

2512.21865 2025-12-29 cs.CV 88%

EasyOmnimatte: Taming Pretrained Inpainting Diffusion Models for End-to-End Video Layered Decomposition

EasyOmnimatte:驯服预训练的修复扩散模型以实现端到端的视频分层分解

Yihan Hu, Xuelin Chen, Xiaodong Cun

机构 * GVC Lab, Great Bay University(大西洋湾大学GVC实验室) Adobe Research(Adobe研究院)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 EasyOmnimatte通过双专家策略实现端到端视频分层分解,利用Effect Expert和Quality Expert提升分解质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21593 2025-12-29 stat.ML cs.AI cs.CV cs.LG 83%

Residual Prior Diffusion: A Probabilistic Framework Integrating Coarse Latent Priors with Diffusion Models

残差先验扩散:整合粗粒度潜在先验与扩散模型的概率框架

Takuro Kutsuna

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 残差先验扩散通过整合粗粒度潜在先验与扩散模型,有效捕捉数据分布的细粒度细节并保持大型结构,提升生成质量。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21905 2025-12-29 cs.CV 79%

High-Fidelity and Long-Duration Human Image Animation with Diffusion Transformer

高保真长时长人类图像动画

Shen Zheng, Jiaran Cai, Yuansheng Guan, Shenneng Huang, Xingpei Ma, Junjie Cao, Hanfeng Zhao, Qiang Zhang, Shunsi Zhang, Xiao-Ping Zhang

机构 * Guangzhou Quwan Network Technology(广州 quirwan 网络技术公司) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散变压器的框架,通过混合引导信号和位置移适应模块,实现高保真长时长人类图像动画生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21797 2025-12-29 cs.CV 79%

Diffusion Posterior Sampling for Super-Resolution under Gaussian Measurement Noise

在高斯测量噪声下用于超分辨率的扩散后验采样

Abu Hanif Muhammad Syarubany

机构 * Korea Advanced Institute of Science \& Technology (KAIST) Daejeon, South Korea

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种在高斯噪声下通过扩散后验采样实现超分辨率的方法,通过优化指导尺度和噪声水平提升重建质量,平衡先验与梯度强度以获得稳定高质量结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21514 2025-12-29 cs.CV cs.AI 79%

DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO

DiverseGRPO: 通过多样性感知的GRPO缓解图像生成中的模式崩溃

Henglin Liu, Huijuan Huang, Jing Wang, Chang Liu, Xiu Li, Xiangyang Ji

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

专题命中 扩散模型 :image generation(title,abstract);分类 cs.CV

AI总结 DiverseGRPO通过引入分布性创造力奖励和结构感知正则化,提升图像生成的多样性与质量平衡。

Comments Project Page: https://henglin-liu.github.io/DiverseGRPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22015 2025-12-29 cond-mat.stat-mech 78%

Diffusion in Rugged Energy Landscapes in the Presence of Spatial Correlations : A Surprising Route to Zwanzig's Mean-Field Prediction

在存在空间相关性的情况下,粗糙能量景观中的扩散:一个令人惊讶的通往Zwanzig平均场预测的路线

Biman Bagchi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出统一理论框架,阐明空间相关性如何重塑粗糙度并恢复平均场扩散,同时揭示不相关无序对Zwanzig理论的破坏作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21475 2025-12-29 cs.NI 78%

Physics-informed Diffusion Models for Multi-scale Prediction of Reference Signal Received Power in Wireless Networks

基于物理信息的扩散模型用于无线网络中参考信号接收功率的多尺度预测

Xiaoqian Qi, Haoye Chai, Yue Wang, Zhaocheng Wang, Yong Li

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Channel-Diff框架,通过物理信息条件扩散模型实现无线网络中参考信号接收功率的多尺度预测,提升预测精度与模型可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.03115 2025-12-29 physics.flu-dyn 78%

Investigation of Numerical Diffusion in Aerodynamic Flow Simulations with Physics Informed Neural Networks

利用物理信息神经网络研究气动流动模拟中的数值扩散

Alok Warey, Taeyoung Han, Shailendra Kaushik

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了使用物理信息神经网络在气动流动模拟中是否产生数值扩散,发现其能准确模拟流体方向的迎风法,具有提升求解器精度的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21185 2025-12-29 cs.CV cs.GR 62%

UltraShape 1.0: High-Fidelity 3D Shape Generation via Scalable Geometric Refinement

UltraShape 1.0:通过可扩展的几何细化实现高保真的3D形状生成

Tanghui Jia, Dongyu Yan, Dehao Hao, Yang Li, Kaiyi Zhang, Xianyi He, Lanjiong Li, Yuhan Wang, Jinnan Chen, Lutao Jiang, Qishen Yin, Long Quan, Ying-Cong Chen, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) The Hong Kong University of Science(香港科学大学) National University of Singapore(新加坡国立大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 UltraShape 1.0通过可扩展的几何细化方法实现高质量3D形状生成,采用两阶段流程提升几何质量,支持公开数据集的精细化处理。

Comments 14 pages, 10 figures, Technical Report,

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21691 2025-12-29 cs.CV 57%

Analyzing the Mechanism of Attention Collapse in VGGT from a Dynamics Perspective

从动力学角度分析VGGT中注意力崩溃的机制

Huan Li, Longjun Luo, Yuling Shi, Xiaodong Gu

机构 * Huazhong University of Science and Technology(华中科技大学) Guangdong University of Technology(广东工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 VGGT中注意力崩溃现象从动力学角度进行数学解释,揭示token特征流收敛规律及token合并方法对延迟崩溃的作用。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21495 2025-12-29 cs.CV 57%

Generative Multi-Focus Image Fusion

生成式多焦点图像融合

Xinzhe Xie, Buyu Guo, Bolin Li, Shuangyan He, Yanzhen Gu, Qingyan Jiang, Peiliang Li

机构 * State Key Laboratory of Ocean Sensing & Ocean College, Zhejiang University(海洋传感国家重点实验室与海洋学院,浙江大学) Donghai Laboratory(东海实验室) Hainan Institute, Zhejiang University(海南学院,浙江大学) Hainan Provincial Observatory of Ecological Environment and Fishery Resource in Yazhou Bay(三亚市生态环境与渔业资源省级观测站)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出GMFF框架,通过确定性融合和生成式修复两个阶段,实现高效多焦点图像融合,解决边缘伪影问题并提升实际应用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17376 2025-12-29 cs.CV 57%

Towards Deeper Emotional Reflection: Crafting Affective Image Filters with Generative Priors

迈向更深层次的情感反思:基于生成先验的富有情感的图像滤镜

Peixuan Zhang, Shuchen Weng, Jiajun Tang, Si Li, Boxin Shi

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Laboratory of Multimedia Information Processing and National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室和视觉技术国家工程研究中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出AIF任务,通过生成先验提升图像情感表达,实现更深层次的情感反思。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22031 2025-12-29 cs.LG cs.AI 50%

From In Silico to In Vitro: Evaluating Molecule Generative Models for Hit Generation

从计算机模拟到体外:评估分子生成模型用于命中生成

Nagham Osman, Vittorio Lembo, Giovanni Bottegoni, Laura Toni

机构 * University College London(伦敦大学学院) University of Urbino Carlo Bo(乌尔比诺卡尔洛·博大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文评估分子生成模型在命中生成中的有效性,通过实验验证其在药物发现流程中的应用潜力及局限性。

Journal ref NeurIPS 2025 AI for Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21974 2025-12-29 physics.plasm-ph 50%

Revealing the transient ionization dynamics and mode-coupling mechanisms of helicon discharge through a self-consistent multiphysics model

通过自洽多物理模型揭示回旋放电的瞬态离子化动力学及模式耦合机制

Jing-Jing Ma, Lei Chang, Ming-Yang Wu, Hua Zhou, Yi-Wei Zhang, Ilya Zadiriev, Elena Kralkina, Shogo Isayama, Shin-Jae You

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过自洽多物理模型揭示回旋放电的瞬态离子化动力学及模式耦合机制,为等离子体源设计与优化提供预测工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16499 2025-12-29 cs.LG 50%

A Closer Look at Model Collapse: From a Generalization-to-Memorization Perspective

对模型崩溃的深入观察:从泛化到记忆的视角

Lianghe Shi, Meng Wu, Huijie Zhang, Zekai Zhang, Molei Tao, Qing Qu

机构 * University of Michigan(密歇根大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出基于熵的数据选择策略,缓解扩散模型中从泛化到记忆的转变,防止模型崩溃。

Comments NeurIPS 2025 Spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00741 2025-12-29 cond-mat.mtrl-sci 50%

Accelerated Inorganic Materials Design with Generative AI Agents

利用生成式AI代理加速无机材料设计

Izumi Takahara, Teruyasu Mizoguchi, Bang Liu

专题命中 扩散模型 :diffusion(abstract)

AI总结 MatAgent通过结合生成模型和预测模型,利用大语言模型的推理能力,实现高效、可解释的无机材料设计与发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18356 2025-12-29 math.AP 50%

Short-time existence and uniqueness for some infinite-dimensional Nash systems

一些无限维纳什系统短期存在性和唯一性的证明

Davide Francesco Redaelli

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了无限维纳什系统在时间局部的存在性和唯一性,同时给出了传输-扩散方程的先验估计结果。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21435 2025-12-29 stat.AP cs.LG 50%

Dynamic Attention (DynAttn): Interpretable High-Dimensional Spatio-Temporal Forecasting (with Application to Conflict Fatalities)

动态注意力(DynAttn):可解释的高维时空预测(应用于冲突死亡人数)

Stefano M. Iacus, Haodong Qi, Marcello Carammia, Thomas Juneau

机构 * Harvard University, Institute for Quantitative Social Science(哈佛大学量化社会科学研究所) Stockholm University Demography Unit(斯德哥尔摩大学人口学单位) Malmö University, Department of Global Political Studies(马尔默大学全球政治研究系) University of Catania, Department of Political and Social Sciences(卡塔尼亚大学政治与社会科学系) University of Toronto, Graduate School of Public and International Affairs(多伦多大学公共与国际事务研究生院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 DynAttn通过动态注意力机制实现高维时空预测,应用于冲突死亡人数预测,提供可解释的预测结果和结构化分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21353 2025-12-29 physics.soc-ph nlin.SI 50%

Exact $q$-exponential Multi-Mode Solutions with Independent Centres and Power-Law Relaxation in the Plastino-Plastino Equation

精确的q-指数多模式解:具有独立中心和幂律松弛的Plastino-Plastino方程

Airton Deppman

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种精确的q-指数多模式解,通过独立中心和幂律松弛机制,统一了非线性扩散、分形空间和多尺度松弛动力学。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 可控生成 1 篇

2512.20619 2025-12-29 cs.CV 57%

SemanticGen: Video Generation in Semantic Space

SemanticGen: 语义空间中的视频生成

Jianhong Bai, Xiaoshi Wu, Xintao Wang, Xiao Fu, Yuanxing Zhang, Qinghe Wang, Xiaoyu Shi, Menghan Xia, Zuozhu Liu, Haoji Hu, Pengfei Wan, Kun Gai

机构 * Zhejiang University(浙江大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) CUHK(香港中文大学) DLUT(大连理工大学) HUST(华中科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SemanticGen通过在语义空间中生成视频,提高了长视频生成的效率和质量,优于现有方法。

Comments Project page: https://jianhongbai.github.io/SemanticGen/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像修复 1 篇

2512.21618 2025-12-29 cs.CV cs.RO 70%

SymDrive: Realistic and Controllable Driving Simulator via Symmetric Auto-regressive Online Restoration

SymDrive: 通过对称自回归在线修复实现逼真且可控的驾驶模拟器

Zhiyuan Liu, Daocheng Fu, Pinlong Cai, Lening Wang, Ying Liu, Yilong Ren, Botian Shi, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) State Key Lab of Intelligent Transportation System, Beihang University(北航智能交通系统国家重点实验室)

专题命中 图像修复 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 SymDrive通过对称自回归在线修复技术,实现了逼真可控的驾驶模拟,解决了高保真渲染与交互式交通编辑的难题。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 图像生成评测 1 篇

2312.02519 2025-12-29 cs.AI cs.LG 50%

Creative Agents: Empowering Agents with Imagination for Creative Tasks

创意代理:通过想象力赋能代理以完成创意任务

Penglin Cai, Chi Zhang, Yuhui Fu, Haoqi Yuan, Zongqing Lu

机构 * School of Computer Science Peking University(北京大学计算机学院)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本研究提出通过增强想象力的创意代理,首次在Minecraft生存模式中实现多样化建筑创建,利用大语言模型和扩散模型提升创造力表现。

Comments The first two authors contribute equally

Journal ref Proceedings of the 41st Conference on Uncertainty in Artificial Intelligence (UAI 2025), PMLR 244:471-496

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 效率与蒸馏 6 篇

2508.21019 2025-12-29 cs.CV 79%

Phased One-Step Adversarial Equilibrium for Video Diffusion Models

相位单步对抗均衡用于视频扩散模型

Jiaxiang Cheng, Bing Ma, Xuhua Ren, Hongyi Henry Jin, Kai Yu, Peng Zhang, Wenyue Li, Yuan Zhou, Tianxiang Zheng, Qinglin Lu

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 V-PAE通过相位单步对抗均衡方法提升大规模视频模型的生成质量与效率,实现高质量视频生成并显著降低扩散延迟。

Comments Accepted by AAAI 2026. Project Page: https://v-pae.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏