arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-21 至 2026-01-21 共收录 134 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 96 篇

2601.12342 2026-01-21 math.AP 50%

Asymptotic Behavior of the Principal Eigenvalue Problems with Large Divergence-Free Drifts

大散度无漂移漂移问题的渐进行为

Yujin Guo, Yuan Lou, Hongfei Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了大散度无漂移漂移问题的主特征值问题的渐进行为,证明了主特征对的收敛性并分析了其极限轮廓。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20339 2026-01-21 cs.SD 50%

MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model

MMEDIT: 一种基于音频语言模型的多类型音频编辑统一框架

Ye Tao, Wen Wu, Chao Zhang, Mengyue Wu, Shuai Wang, Xuenan Xu

机构 * MoE Key Lab of Artificial Intelligence, X-LANCE Lab, Shanghai Jiao Tong University(人工智能莫埃实验室、X-LANCE实验室、上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 MMEdit提出一种基于音频语言模型的统一框架,通过扩展任务定义和设计数据合成管道,实现多类型音频编辑的高精度与高保真度。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07660 2026-01-21 math.DG math.GN 50%

Entropy-Smooth Structures on Topological Manifolds

拓扑流形上的熵平滑结构

Amandip Sangha

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出基于熵的信息论框架,用于拓扑流形上的光滑结构,通过局部概率探针的小尺度熵数据重建光滑大纲,并证明其等价于经典光滑结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23333 2026-01-21 math.PR math.AP math.FA 50%

Convergence rates of self-repelling diffusions on Riemannian manifolds

黎曼流形上自排斥扩散的收敛速度

Francis Lörler

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了黎曼流形上自排斥扩散的收敛速度,通过二阶提升框架和流波尔卡里亚不等式,得到了收敛速率的上下界,并在周期性情况下改进了已有结果。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02809 2026-01-21 cs.SI 50%

Predicting Movie Success with Multi-Task Learning: A Hybrid Framework Combining GPT-Based Sentiment Analysis and SIR Propagation

基于多任务学习的电影成功预测:结合GPT情感分析与SIR传播的混合框架

Wenlan Xie

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出结合GPT情感分析与SIR传播模型的混合框架,通过多任务学习预测电影成功,展现信息扩散的流行病学建模和多维情感特征优化。

Comments The manuscript in its current form suffers from critical methodological flaws regarding temporal precedence and data leakage that fundamentally undermine the validity of the reported performance metrics. The definition of input variables relative to the target variable introduces severe look-ahead bias

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10211 2026-01-21 cond-mat.mtrl-sci physics.comp-ph 50%

Going beyond density functional theory accuracy: Leveraging experimental data to refine pre-trained machine learning interatomic potentials

超越密度泛函理论精度:利用实验数据来优化预训练的机器学习原子势

Shriya Gumber, Lorena Alzate-Vargas, Benjamin T. Nebgen, Arjen van Veelen, Smit Kadvani, Tammie Gibson, Richard Messerly

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出利用实验数据优化预训练的机器学习原子势,以提高与EXAFS光谱的一致性,并验证其在核燃料性质预测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12328 2026-01-21 quant-ph cond-mat.mes-hall physics.optics 50%

Decoherence of Schrödinger cat states in light of wave/particle duality

关于薛定谔猫态的退相干问题:在波动/粒子二象性背景下

Th. K. Mavrogordatos

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过波-粒子相关子揭示了薛定谔猫态退相干中波动与粒子性质的显著差异,指出测量位置和动量时的量子干涉表现与电磁场振幅的上下文扩散。

Comments 9 pages (main), 3 figures, with two Appendices

Journal ref Comptes Rendus. Physique, Vol. 27, p.17-40 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04134 2026-01-21 cs.LG 50%

M2PDE: Compositional Generative Multiphysics and Multi-component PDE Simulation

M2PDE:基于扩散模型的组合生成多物理场与多组分PDE仿真

Tao Zhang, Zhenhai Liu, Feipeng Qi, Yongjun Jiao, Tailin Wu

机构 * State Key Laboratory of Advanced Nuclear Energy Technology, Nuclear Power Institute of China, China(先进核能技术国家重点实验室,中国核工业研究院) Department of Artificial Intelligence, Westlake University, China(人工智能学院,西湖大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 M2PDE通过基于扩散模型的生成方法,实现多物理场与多组分PDE仿真的高效准确模拟。

Comments 29pages,14 figures

Journal ref Proceedings of the 42nd International Conference on Machine Learning, PMLR 267:75638-75666, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02650 2026-01-21 cs.CL cs.AI 50%

Undesirable Memorization in Large Language Models: A Survey

大语言模型中的不良记忆现象:综述

Ali Satvaty, Suzan Verberne, Fatih Turkmen

机构 * University of Groningen(Groningen大学) Leiden University(莱顿大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文综述了大语言模型中记忆化现象的文献,探讨了其分类、度量方法、成因及缓解策略,并提出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13707 2026-01-21 cond-mat.mes-hall quant-ph 50%

The origins of noise in the Zeeman splitting of spin qubits in natural-silicon devices

自旋量子比特在自然硅器件中Zeeman分裂噪声的起源

Juan S. Rojas-Arias, Yohei Kojima, Kenta Takeda, Peter Stano, Takashi Nakajima, Jun Yoneda, Akito Noiri, Takashi Kobayashi, Daniel Loss, Seigo Tarucha

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究揭示了自然硅器件中自旋量子比特Zeeman分裂噪声的起源,发现低频噪声主要由超精细耦合主导,同时揭示了电荷噪声和谷自由度的影响。

Comments 12 pages, 10 figures

Journal ref npj Quantum Inf 12, 9 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15651 2026-01-21 math.AP 50%

Propagating front solutions in a time-fractional Fisher-KPP equation

时间分数阶Fisher-KPP方程中前沿解的传播

Hiroshi Ishii

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了时间分数阶Fisher-KPP方程中解的传播问题,通过渐近行波解和数值模拟分析了解的传播特性。

Comments Revised version. Minor corrections to the published paper (DCDS-B, DOI: 10.3934/dcdsb.2024173). Main results unchanged

Journal ref Discrete and Continuous Dynamical Systems - B, 2025, 30(7): 2460-2482

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.15894 2026-01-21 math.OC math.PR 50%

Value existence for zero-sum ergodic stochastic differential games

零和ergodic随机微分博弈的价值存在性

Juan Li, Wenqiang Li, Yanwei Li, Huaizhong Zhao

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了零和ergodic随机微分博弈的价值存在性,通过建立粘性解并结合近似过程与卷积技术,证明了博弈价值的存在,并应用于污染累积问题。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12218 2026-01-21 math.AP 50%

Stabilization of arbitrary structures in a three-dimensional doubly degenerate nutrient taxis system

在三维双重退化营养趋动系统中稳定任意结构

De-Ji-Xiang-Mao, Ai Huang, Yifu Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了三维双重退化营养趋动系统中任意结构的稳定性,通过新函数不等式证明了特定条件下初边值问题存在全局弱解,并在适当拓扑设置下收敛到非均匀平衡态。

Comments 34

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11885 2026-01-21 cs.AI 50%

MyGram: Modality-aware Graph Transformer with Global Distribution for Multi-modal Entity Alignment

MyGram: 多模态实体对齐的模态感知图变换器与全局分布

Zhifei Li, Ziyue Qin, Xiangyu Luo, Xiaoju Hou, Yue Zhao, Miao Zhang, Zhifang Huang, Kui Xiao, Bing Yang

专题命中 扩散模型 :diffusion(abstract)

AI总结 MyGram通过模态感知图变换器与全局分布机制,提升多模态实体对齐的性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11683 2026-01-21 cs.CR cs.AI cs.SE 50%

Attesting Model Lineage by Consisted Knowledge Evolution with Fine-Tuning Trajectory

通过细调轨迹与持续知识演化认证模型谱系

Zhuoyi Shang, Jiasen Li, Pengzhen Chen, Yanwei Liu, Xiaoyan Gu, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出通过细调轨迹与持续知识演化认证模型谱系,利用模型编辑和知识向量化机制实现稳健的谱系验证。

Comments Accepted to the 35th USENIX Security Symposium (USENIX Security 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11562 2026-01-21 cs.CY 50%

Dynamics of Socio-Institutional Asynchrony in Generative AI: Analyzing the Relative Importance of Intervention Timing vs. Enforcement Efficiency via the Socio-Institutional Asynchrony Model (SIAM)

生成AI中社会制度异步动态:通过社会制度异步模型(SIAM)分析干预时机与执行效率的相对重要性

Taeyoon Kim

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过SIAM模型分析生成AI中干预时机与执行效率的相对重要性,发现提前干预能更有效地减少社会负担。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08848 2026-01-21 q-bio.QM math.OC q-bio.PE 50%

RDA-PSO: A computational method to quantify the diffusive dispersal of insects

RDA-PSO:一种量化昆虫扩散传播的计算方法

Lidia Mrad, Joceline Lega

专题命中 扩散模型 :diffusion(abstract)

AI总结 RDA-PSO是一种用于量化昆虫扩散的计算方法,能有效处理低回收率和不均捕获分布,优于基于扩散方程的现有技术。

Comments 52 pages, 15 figures

Journal ref Bull Math Biol 88, 24 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08166 2026-01-21 math.NA cs.NA 50%

Asymptotic-Preserving Neural Networks based on Even-odd Decomposition for Multiscale Gray Radiative Transfer Equations

基于偶奇分解的渐近保持神经网络用于多尺度灰辐射传输方程

Keke Wu, Xizhe Xie, Wengu Chen, Han Wang, Zheng Ma

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出基于偶奇分解的渐近保持神经网络方法,用于高效求解多尺度灰辐射传输方程,实现对小Knudsen数下的稳定收敛与守恒要求的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 7 篇

2601.14056 2026-01-21 cs.CV cs.AI 83%

POCI-Diff: Position Objects Consistently and Interactively with 3D-Layout Guided Diffusion

POCI-Diff: 通过3D布局引导扩散实现位置对象一致性和交互

Andrea Rigo, Luca Stornaiuolo, Weijie Wang, Mauro Martino, Bruno Lepri, Nicu Sebe

机构 * DISI, University of Trento(DISI,特伦托大学) Toretei S.r.l.(Toretei公司) Visual AI Lab, MIT-IBM Watson AI Lab(视觉人工智能实验室,MIT-IBM沃森人工智能实验室) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 可控生成 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 POCI-Diff通过3D布局引导扩散实现一致性和交互性的物体位置控制,提升文本到图像生成的布局一致性和编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21788 2026-01-21 cs.CV cs.AI 83%

InstructMoLE: Instruction-Guided Mixture of Low-rank Experts for Multi-Conditional Image Generation

InstructMoLE:基于指令的低秩专家混合用于多条件图像生成

Jinqi Xiao, Qing Yan, Liming Jiang, Zichuan Liu, Hao Kang, Shen Sang, Tiancheng Zhi, Jing Liu, Cheng Yang, Xin Lu, Bo Yuan

机构 * ByteDance Inc.(字节跳动公司) Rutgers University(罗格斯大学)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 InstructMoLE通过指令引导的全局路由策略和输出空间正交损失,提升多条件图像生成任务的性能和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13245 2026-01-21 cs.CV 79%

CymbaDiff: Structured Spatial Diffusion for Sketch-based 3D Semantic Urban Scene Generation

CymbaDiff:基于结构化的空间扩散用于基于草图的3D语义城市场景生成

Li Liang, Bo Miao, Xinyu Wang, Naveed Akhtar, Jordan Vice, Ajmal Mian

机构 * The University of Western Australia(西澳大学) AIML, The University of Adelaide(阿德莱德大学) The University of Melbourne(墨尔本大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 CymbaDiff通过结构化空间扩散提升基于草图的3D语义城市场景生成的语义一致性与空间真实性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16869 2026-01-21 cs.GR cs.CV 62%

Controllable Video Generation: A Survey

可控视频生成:综述

Yue Ma, Kunyu Feng, Zhongyuan Hu, Xinyu Wang, Yucheng Wang, Mingzhe Zheng, Bingyuan Wang, Qinghe Wang, Xuanhua He, Hongfa Wang, Chenyang Zhu, Hongyu Liu, Yingqing He, Zeyu Wang, Zhifeng Li, Xiu Li, Sirui Han, Yike Guo, Wei Liu, Dan Xu, Linfeng Zhang, Qifeng Chen

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology(Guang Zhou)(香港科技大学(广州)) Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Tencent(腾讯)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文综述了可控视频生成领域,探讨了视频扩散模型中的控制机制及不同控制信号类型的方法分类。

Comments project page: https://github.com/mayuelala/Awesome-Controllable-Video-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11074 2026-01-21 cs.CV 57%

Evaluating Latent Generative Paradigms for High-Fidelity 3D Shape Completion from a Single Depth Image

评估用于从单个深度图像生成高保真3D形状补全的潜在生成范式

Matthias Humt, Ulrich Hillenbrand, Rudolph Triebel

机构 * German Aerospace Center(德国航空航天中心) TU Munich(慕尼黑技术大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文比较了扩散模型和自回归模型在单个深度图像生成高保真3D形状补全任务中的性能,发现扩散模型在连续潜在空间中表现更优,而自回归模型在离散潜在空间中可匹敌或超越扩散模型。

Comments 16 pages, 4 figures, 19 tables. To appear in 3DV 2026. Project page: https://hummat.github.io/2026-3dv-genz/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09371 2026-01-21 astro-ph.SR 50%

Constraining the outer boundary condition for the Babcock-Leighton dynamo models

约束Babcock-Leighton动力学模型的外边界条件

Yukun Luo, Jie Jiang, Binghang Li, Zebin Zhang, Ruihui Wang

专题命中 可控生成 :diffusion(abstract)

AI总结 提出零径向扩散外边界条件,使BL动力学模型与表面磁流输送模拟一致,再现太阳周期特性并更符合观测结果。

Comments 8 pages, 4 figures, 1 table, accepted by A&A

Journal ref A&A 705, A237 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01493 2026-01-21 cs.RO 50%

Floor Plan-Guided Visual Navigation Incorporating Depth and Directional Cues

结合深度和方向线索的平面图引导视觉导航

Weiqi Huang, Jiaxin Li, Zan Wang, Huijun Di, Wei Liang, Zhu Yang

机构 * Beijing Institute of Technology(北京理工大学) Yangtze Delta Region Academy of Beijing Institute of Technology(北京理工大学长江三角洲地区学院)

专题命中 可控生成 :diffusion(abstract)

AI总结 GlocDiff通过结合局部深度线索和全局方向指导,实现高效的平面图引导视觉导航。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 2 篇

2601.13513 2026-01-21 cs.SD eess.AS 78%

Event Classification by Physics-informed Inpainting for Distributed Multichannel Acoustic Sensor with Partially Degraded Channels

通过物理指导的补全进行分布式多通道声学传感器事件分类

Noriyuki Tonami, Wataru Kohno, Yoshiyuki Yajima, Sakiko Mishima, Yumi Arai, Reishi Kondo, Tomoyuki Hino

机构 * NEC Corporation(日本 NEC 公司) NEC Laboratories America, Inc.(美国 NEC 实验室)

专题命中 图像修复 :inpainting(title,abstract)

AI总结 本文提出一种基于反时间迁移的物理指导补全前端,通过重建和投影预处理提升分布式多通道声学传感在布局开放和通道退化下的事件分类准确率。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13987 2026-01-21 eess.IV cs.CV 57%

SHARE: A Fully Unsupervised Framework for Single Hyperspectral Image Restoration

SHARE: 一种完全无监督的单超光谱图像恢复框架

Jiangwei Xie, Zhang Wen, Mike Davies, Dongdong Chen

机构 * School of Mathematical and Computer Sciences, Heriot-Watt University(数学与计算机科学学院,赫里奥特-瓦特大学) School of Engineering, University of Edinburgh(工程学院,爱丁堡大学)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 SHARE提出了一种完全无监督的单超光谱图像恢复框架,结合几何等变原理和低秩光谱建模,无需地面真实数据,通过自监督信号和动态自适应光谱注意力模块提升恢复性能。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 4 篇

2601.13846 2026-01-21 cs.AI cs.CY cs.LG 78%

Virtual Urbanism: An AI-Driven Framework for Quantifying Urban Identity. A Tokyo-Based Pilot Study Using Diffusion-Generated Synthetic Environments

虚拟城市主义:一种基于AI的量化城市身份框架。以东京为基础的试点研究,使用扩散生成的合成环境

Glinskaya Maria

专题命中 个性化与一致性 :diffusion(title,abstract)

AI总结 本文提出虚拟城市主义框架,利用AI生成合成环境量化城市身份,通过东京试点研究验证其有效性,揭示核心身份形成元素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12895 2026-01-21 cs.CV cs.LG 57%

TwoHead-SwinFPN: A Unified DL Architecture for Synthetic Manipulation, Detection and Localization in Identity Documents

TwoHead-SwinFPN:一种统一的深度学习架构,用于身份文档中的合成操纵、检测和定位

Chan Naseeb, Adeel Ashraf Cheema, Hassan Sami, Tayyab Afzal, Muhammad Omair, Usman Habib

机构 * IBM Germany(IBM德国分公司) FAST NUCES(FAST努赛斯大学) Askolay Pakistan(Askolay巴基斯坦)

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV

AI总结 TwoHead-SwinFPN通过双头架构和Swin Transformer结合FPN与Unet解码器,实现身份文档中合成操纵的高效检测与定位,具有高精度和计算效率。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13861 2026-01-21 cs.CV 57%

PositionIC: Unified Position and Identity Consistency for Image Customization

PositionIC: 统一的位置和身份一致性用于图像定制

Junjie Hu, Tianyang Han, Kai Ma, Jialin Gao, Song Yang, Xianhua He, Junfeng Luo, Xiaoming Wei, Wenqiang Zhang

机构 * MeiGen AI Team, Meituan(美团MeiGen AI团队) Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University(上海智能信息处理关键实验室,计算机科学与人工智能学院,复旦大学) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(智能机器人与先进制造学院,复旦大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 PositionIC通过统一框架实现高保真、空间可控的多主体图像定制,引入BMPDS数据合成和可视化感知注意力机制,提升空间精度与身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏