arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-03 至 2025-12-03 共收录 55 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 36 篇

2510.02977 2025-12-03 astro-ph.IM physics.ao-ph 50%

Multi-faceted light pollution modelling and its application to the decline of artificial illuminance in France

多维光污染建模及其在法国人工照度下降中的应用

Rolf Buhler, Philippe Deverchère, Christophe Plotard, Sébastien Vauclair

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出Otus 3软件,通过地面辐射数据建模法国光污染,发现夜间人工照度在2013-2018年与2019-2024年间下降了23%。

Journal ref Journal of Quantitative Spectroscopy and Radiative Transfer, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08917 2025-12-03 physics.comp-ph 50%

The Alamo multiphysics solver for phase field simulations with strong-form mechanics and block structured adaptive mesh refinement

Alamo 多物理场求解器用于具有强形式力学的相场模拟及块结构自适应网格细化

Brandon Runnels, Vinamra Agrawal, Maycon Meier

专题命中 扩散模型 :diffusion(abstract)

AI总结 Alamo 通过块结构自适应网格细化技术,高效求解多物理场耦合的相场模拟问题,尤其适用于固体力学与流体、热扩散等物理过程的耦合计算。

Journal ref Journal of Open Source Software (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03898 2025-12-03 math.AP math.DS math.OC 50%

Feedback stabilization for a spatial-dependent Sterile Insect Technique model with Allee Effect

具有Allee效应的时空依赖性灭蚊技术模型的反馈稳定化

Kala Agbo Bidi, Luís Almeida, Jean-Michel Coron

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种基于反应-扩散模型的反馈控制策略,用于通过灭蚊技术稳定化害虫种群,以实现长期低水平的害虫控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18581 2025-12-03 cond-mat.stat-mech math-ph math.MP 50%

Relativistic Lévy processes

相对论莱维过程

Lucas G. B. de Souza, M. G. E. da Luz, E. P. Raposo, Evaldo M. F. Curado, G. M. Viswanathan

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出相对论莱维过程,通过研究相对论中随机速度的和,揭示了一种新的随机过程,用于评估实际实验中相对论效应的相关性。

Comments 15 pages, 7 figures

Journal ref Phys. Rev. E 112, 044125 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02538 2025-12-03 math.PR 50%

On the spectral geometry of Liouville quantum gravity

李群量子引力的谱几何

Nathanaël Berestycki

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了李群量子引力的谱几何,介绍了其本征值构造、韦伊定律及热迹相关工作,并提出了新的开放问题。

Comments Submitted to Journal of Mathematical Physics for the proceedings of ICMP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02033 2025-12-03 q-bio.BM cs.AI 50%

CONFIDE: Hallucination Assessment for Reliable Biomolecular Structure Prediction and Design

CONFIDE:用于可靠生物分子结构预测和设计的幻觉评估

Zijun Gao, Mutian He, Shijia Sun, Hanqun Cao, Jingjie Zhang, Zihao Luo, Xiaorui Wang, Xiaojun Yao, Chang-Yu Hsieh, Chunbin Gu, Pheng Ann Heng

专题命中 扩散模型 :diffusion(abstract)

AI总结 CONFIDE通过结合能量和拓扑视角,提升AlphaFold3等模型的可靠性,显著提高分子结构预测质量评估,并拓展至多种药物设计任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01860 2025-12-03 astro-ph.HE hep-ph 50%

Does the high-energy AMS-02 positron flux originate from the dark matter density spikes around nearby black holes?

高能AMS-02正电子通量是否源自附近黑洞周围的暗物质密度峰值?

Man Ho Chan, Chak Man Lee

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文探讨了高能AMS-02正电子通量可能源自附近黑洞周围暗物质密度峰值的可能性,并通过暗物质湮灭机制提出新解释。

Comments Accepted in Phys. Rev. D

Journal ref Phys. Rev. D, 112, 063035 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03719 2025-12-03 cs.LG stat.ML 50%

On the Closed-Form of Flow Matching: Generalization Does Not Arise from Target Stochasticity

流匹配的闭式形式:泛化并不源于目标随机性

Quentin Bertrand, Anne Gagneux, Mathurin Massias, Rémi Emonet

机构 * Université Jean Monnet Saint-Étienne, CNRS, Institut d’Optique Graduate School, Inria, Laboratoire Hubert Curien UMR 5516 ENS de Lyon, CNRS, Université Claude Bernard Lyon 1, Inria, LIP UMR 5668 Inria, ENS de Lyon, CNRS, Université Claude Bernard Lyon 1, LIP UMR 5668 Institut Universitaire de France

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过实验证明,流匹配中闭式形式的损失在高维情况下与随机形式效果相近,且可能提升性能,反驳了目标随机性驱动泛化的观点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20517 2025-12-03 cond-mat.supr-con cond-mat.mtrl-sci 50%

Solid-State Reactions at Niobium-Germanium Interfaces in Hybrid Superconductor-Semiconductor Devices

铌-锗界面在混合超导-半导体器件中的固态反应

Bernardo Langa, Deepak Sapkota, Ivan Lainez, Richard Haight, Bernadeta Srijanto, Leonard Feldman, Hussein Hijazi, Xiangyu Zhu, Lifang Hu, Moon Kim, Kasra Sardashti

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过低温蒸发铌并分析其与锗界面的固态反应,揭示了锗扩散对超导电子性能的影响,强调了低温生长对减少界面混入和能带弯曲的重要性。

Comments 8 pages including 3 for supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 6 篇

2410.12669 2025-12-03 cs.CV 88%

3DIS: Depth-Driven Decoupled Instance Synthesis for Text-to-Image Generation

3DIS: 基于深度的解耦实例合成用于文本到图像生成

Dewei Zhou, Ji Xie, Zongxin Yang, Yi Yang

机构 * CCAI, Zhejiang University(中国浙江大学计算机辅助智能学院)

专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 3DIS提出了一种基于深度的解耦实例合成方法,通过分阶段生成场景深度图和渲染细粒度属性,提升文本到图像生成中多实例的布局精度和属性渲染效果。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02143 2025-12-03 cs.GR cs.CV cs.LG 73%

CoatFusion: Controllable Material Coating in Images

CoatFusion:图像中的可控材料涂层

Sagie Levy, Elad Aharoni, Matan Levy, Ariel Shamir, Dani Lischinski

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Reichman University(雷赫曼大学)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV、cs.GR

AI总结 CoatFusion通过结合2D纹理和PBR参数控制,实现图像中可控的材料涂层生成,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04634 2025-12-03 cs.GR cs.AI cs.CV cs.LG 62%

Walk Before You Dance: High-fidelity and Editable Dance Synthesis via Generative Masked Motion Prior

先走再跳舞:通过生成性遮蔽动作先验实现高保真可编辑舞蹈合成

Foram N Shah, Parshwa Shah, Muhammad Usama Saleem, Ekkasit Pinyoanuntapong, Pu Wang, Hongfei Xue, Ahmed Helmy

专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR

AI总结 本研究提出一种生成性遮蔽动作先验模型,实现高保真且可编辑的舞蹈合成,通过多塔结构提升动作生成质量与编辑能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02972 2025-12-03 cs.CV cs.RO 57%

BEVDilation: LiDAR-Centric Multi-Modal Fusion for 3D Object Detection

BEVDilation:以LiDAR为中心的多模态融合用于3D目标检测

Guowen Zhang, Chenhang He, Liyi Chen, Lei Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 BEVDilation提出以LiDAR为中心的多模态融合方法,通过稀疏体素扩张和语义引导BEV扩张模块提升3D目标检测性能,有效缓解深度误差带来的空间错位问题。

Comments Accept by AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02542 2025-12-03 cond-mat.soft cond-mat.stat-mech physics.bio-ph 50%

Size control guidelines for chemically active droplets

化学活性液滴的尺寸控制指南

Guido Kusters, David Zwicker

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种通过化学反应控制液滴尺寸的理论框架,揭示了两种不同类别的尺寸控制机制,并确定了液滴变小的参数范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02467 2025-12-03 math.OC 50%

Theory and Design of Extended PID Control for Stochastic Systems with Structural Uncertainties

随机系统中具有结构不确定性的扩展PID控制的理论与设计

Baoyou Qu, Cheng Zhao

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种针对具有结构不确定性的非线性随机系统的扩展PID控制器设计方法,证明其在均方意义下的全局稳定性及跟踪误差可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 2 篇

2511.16024 2025-12-03 cs.CV 57%

Mixture of Ranks with Degradation-Aware Routing for One-Step Real-World Image Super-Resolution

稀疏专家混合与退化感知路由用于一步现实图像超分辨率

Xiao He, Zhijun Tu, Kun Cheng, Mingrui Zhu, Jie Hu, Nannan Wang, Xinbo Gao

机构 * State Key Laboratory of Integrated Services Networks, Xidian University(信息服务网络国家重点实验室,西安电子科技大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于稀疏MoE和退化感知路由的单步现实图像超分辨率框架,通过细粒度专家分区和动态负载均衡提升超分辨率效果。

Comments 16 pages, Accepted by AAAI 2026, v2: corrected typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08096 2025-12-03 cs.CV 57%

MegaSR: Mining Customized Semantics and Expressive Guidance for Real-World Image Super-Resolution

MegaSR: 为真实世界图像超分辨率挖掘定制语义和表达引导

Xinrui Li, Jinrong Zhang, Jianlong Wu, Chong Chen, Liqiang Nie, Zhouchen Lin

专题命中 图像修复 :text-to-image(abstract);分类 cs.CV

AI总结 MegaSR通过定制语义和表达引导提升真实世界图像超分辨率的重建质量与结构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 4 篇

2512.02713 2025-12-03 cs.AI 71%

Training Data Attribution for Image Generation using Ontology-Aligned Knowledge Graphs

利用本体对齐的知识图谱训练数据归因于图像生成

Theodoros Aivalis, Iraklis A. Klampanos, Antonis Troumpoukis, Joemon M. Jose

机构 * National Centre for Scientific Research ``Demokritos''(国家科学研究中心「德莫克里特」) University of Glasgow(格拉斯哥大学)

专题命中 个性化与一致性 :image generation(title)

AI总结 本文提出利用本体对齐的知识图谱方法,通过多模态大语言模型提取图像中的结构化三元组,以追踪生成模型中训练数据的影响,从而提升透明度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03013 2025-12-03 cs.CV cs.AI cs.GR 62%

In-Context Sync-LoRA for Portrait Video Editing

上下文同步LoRA用于肖像视频编辑

Sagi Polaczek, Or Patashnik, Ali Mahdavi-Amiri, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学) Simon Fraser University(Simon Fraser大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 Sync-LoRA通过上下文LoRA实现肖像视频编辑,保持帧同步和身份一致性,支持多样化的修改如外观变化和物体添加。

Comments Project page: https://sagipolaczek.github.io/Sync-LoRA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02781 2025-12-03 cs.CV cs.GR cs.LG 62%

LumiX: Structured and Coherent Text-to-Intrinsic Generation

LumiX: 结构化和一致的文本到内在生成

Xu Han, Biao Zhang, Xiangjun Tang, Xianzhi Li, Peter Wonka

机构 * HUST(华中科技大学) KAUST(科威特大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 LumiX通过结构化扩散框架实现文本到内在生成,结合查询广播注意力和张量LoRA,提升生成的物理一致性和效率。

Comments The code will be available at https://github.com/xhanxu/LumiX

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10786 2025-12-03 eess.IV cs.CV cs.LG 57%

ContourDiff: Unpaired Medical Image Translation with Structural Consistency

ContourDiff: 无配对医学图像翻译与结构一致性

Yuwen Chen, Nicholas Konz, Hanxue Gu, Haoyu Dong, Yaqian Chen, Lin Li, Jisoo Lee, Maciej A. Mazurowski

机构 * Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系) Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系) Department of Radiology, Duke University(杜克大学放射学系) Department of Computer Science, Duke University(杜克大学计算机科学系)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 ContourDiff通过空间一致的引导扩散框架,实现了无配对医学图像翻译,保持解剖结构一致性,优于其他方法。

Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2025:031

Journal ref Machine.Learning.for.Biomedical.Imaging. 3 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 3 篇

2511.03317 2025-12-03 cs.CV 84%

Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models

Diffusion-SDPO:用于扩散模型的受保护直接偏好优化

Minghao Fu, Guo-Hua Wang, Tianyu Cui, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 图像生成评测 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 Diffusion-SDPO通过保护性更新规则提升扩散模型对人类偏好的对齐效果。

Comments The code is publicly available at https://github.com/AIDC-AI/Diffusion-SDPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02790 2025-12-03 cs.CV 57%

UnicEdit-10M: A Dataset and Benchmark Breaking the Scale-Quality Barrier via Unified Verification for Reasoning-Enriched Edits

UnicEdit-10M: 一个通过统一验证打破规模-质量壁垒的数据集和基准

Keming Ye, Zhipeng Huang, Canmiao Fu, Qingyang Liu, Jiani Cai, Zheqi Lv, Chen Li, Jing Lyu, Zhou Zhao, Shengyu Zhang

机构 * Zhejiang University(浙江大学) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 UnicEdit-10M通过统一验证方法构建大规模高质量数据集和基准,解决图像编辑中规模与质量的矛盾,评估模型在空间和知识推理中的表现。

Comments 31 pages, 15 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03692 2025-12-03 cs.CV cs.RO 57%

LiDARCrafter: Dynamic 4D World Modeling from LiDAR Sequences

LiDARCrafter:从LiDAR序列动态构建4D世界模型

Ao Liang, Youquan Liu, Yu Yang, Dongyue Lu, Linfeng Li, Lingdong Kong, Huaici Zhao, Wei Tsang Ooi

机构 * WorldBench Team(WorldBench团队)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 LiDARCrafter通过自然语言输入生成和编辑4D LiDAR数据,实现高保真度、可控性和时间一致性,为自动驾驶数据增强和模拟提供新方法。

Comments AAAI 2026 Oral Presentation; 38 pages, 18 figures, 12 tables; Project Page at https://lidarcrafter.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 1 篇

2512.02931 2025-12-03 cs.CV 79%

DiverseAR: Boosting Diversity in Bitwise Autoregressive Image Generation

DiverseAR: 提升位级自回归图像生成中的多样性

Ying Yang, Zhengyao Lv, Tianlin Pan, Haofan Wang, Binxin Yang, Hubery Yin, Chen Li, Chenyang Si

机构 * PRLab, Nanjing University(南京大学PRLab) The University of Hong Kong(香港大学) University of Chinese Academy of Sciences(中国科学院大学) Lovart AI WeChat, Tencent Inc.(腾讯公司)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

AI总结 DiverseAR通过自适应logits分布缩放和能量基生成路径搜索算法,提升位级自回归图像生成的样本多样性,同时保持视觉质量。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏