arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-07 至 2026-01-07 共收录 57 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2509.00642 2026-01-07 cs.DC 90%

HADIS: Hybrid Adaptive Diffusion Model Serving for Efficient Text-to-Image Generation

HADIS:混合自适应扩散模型服务用于高效的文本到图像生成

Qizheng Yang, Tung-I Chen, Siyu Zhao, Ramesh K. Sitaraman, Hui Guan

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(title)

AI总结 HADIS通过混合自适应架构优化扩散模型服务,提升响应质量和降低延迟违规率

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15002 2026-01-07 cs.CV 79%

How Many Images Does It Take? Estimating Imitation Thresholds in Text-to-Image Models

需要多少张图片?文本到图像模型中模仿阈值的估计

Sahil Verma, Royi Rassin, Arnav Das, Gantavya Bhatt, Preethi Seshadri, Chirag Shah, Jeff Bilmes, Hannaneh Hajishirzi, Yanai Elazar

机构 * University of Washington, Seattle(华盛顿大学) Bar-Ilan University(巴伊兰大学) University of California, Irvine(加州大学伊文斯顿分校) Allen Institute of AI(人工智能研究院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 研究通过评估文本到图像模型的模仿阈值,探讨其在版权和隐私合规中的应用。

Comments Accepted at TMLR 2025, ATTRIB, RegML, and SafeGenAI workshops at NeurIPS 2024 and NLLP Workshop 2024. https://openreview.net/forum?id=x0qJo7SPhs

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02771 2026-01-07 cs.CV 70%

AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs

AbductiveMLLM: 提升多模态大语言模型中的视觉归纳推理

Boyu Chang, Qi Wang, Xi Guo, Zhixiong Nan, Yazhou Yao, Tianfei Zhou

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 AbductiveMLLM通过结合REASONER和IMAGINER组件,提升多模态大语言模型在视觉归纳推理中的性能。

Comments Accepted by AAAI 2026 as Oral. Code:https://github.com/ChangPtR/AbdMLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18867 2026-01-07 cs.AI 67%

Topological Perspectives on Optimal Multimodal Embedding Spaces

拓扑视角下的最优多模态嵌入空间

Abdul Aziz A. B, A. B Abdul Rahim

专题命中 文生图 :image generation(abstract);text-to-image(abstract)

AI总结 本文通过拓扑数据分析比较CLIP和CLOOB的嵌入空间,揭示其模态差距驱动因素和维度坍缩的影响,为多模态模型优化提供新视角。

Comments This manuscript contains substantive technical inaccuracies and an incomplete treatment of the stated topic. Subsequent developments and a reassessment of the problem indicate that the scope and framing of the work do not adequately reflect the current state of research, and the analysis is therefore incomplete and outdated

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 3 篇

2601.02987 2026-01-07 cs.CV cs.AI 87%

LAMS-Edit: Latent and Attention Mixing with Schedulers for Improved Content Preservation in Diffusion-Based Image and Style Editing

LAMS-Edit: 基于调度器的潜在与注意力混合用于改进扩散模型图像和风格编辑中的内容保留

Wingwa Fu, Takayuki Okatani

机构 * Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院)

专题命中 图像编辑 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 LAMS-Edit通过调度器结合潜在表示和注意力图,实现扩散模型中更精确的内容保留与编辑应用,支持区域掩码编辑和风格迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03114 2026-01-07 cs.GR 57%

Stroke Patches: Customizable Artistic Image Styling Using Regression

笔触补丁:通过回归实现可定制的艺术图像风格化

Ian Jaffray, John Bronskill

专题命中 图像编辑 :diffusion(abstract);分类 cs.GR

AI总结 本文提出了一种基于回归的图像风格化方法,通过可扩展的笔触补丁集实现对图像风格的定制化控制。

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Creative AI Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02566 2026-01-07 cs.CV 57%

Shallow- and Deep-fake Image Manipulation Localization Using Vision Mamba and Guided Graph Neural Network

使用视觉Mamba和引导图神经网络进行浅层和深层伪造图像篡改定位

Junbin Zhang, Hamid Reza Tohidypour, Yixiao Wang, Panos Nasiopoulos

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出利用视觉Mamba和引导图神经网络,实现对浅层和深层伪造图像中篡改区域的高效定位与区分。

Comments Under review for journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 42 篇

2507.12318 2026-01-07 cs.CV cs.AI cs.LG 85%

Compositional Discrete Latent Code for High Fidelity, Productive Diffusion Models

组合式离散潜在代码用于高保真、高效的扩散模型

Samuel Lavoie, Michael Noukhovitch, Aaron Courville

机构 * Mila, Université de Montréal(蒙特利尔大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出离散潜在代码(DLC)以提升扩散模型的生成保真度,通过组合性实现分布外样本生成,并展示其在图像生成和文本到图像生成中的应用。

Comments Published at NeurIPS, 22 pages, 7 tables, 12 figures, code and models available

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03178 2026-01-07 cs.CV 79%

DiffBench Meets DiffAgent: End-to-End LLM-Driven Diffusion Acceleration Code Generation

DiffBench 与 DiffAgent:端到端的 LLM 驱动扩散加速代码生成

Jiajun jiao, Haowei Zhu, Puyuan Yang, Jianghui Wang, Ji Liu, Ziqiong Liu, Dong Li, Yuejian Fang, Junhai Yong, Bin Wang, Emad Barsoum

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiffBench和DiffAgent,通过LLM驱动的闭环流程,实现端到端的扩散模型加速代码生成,显著提升生成策略的有效性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02881 2026-01-07 cs.CV 79%

Towards Agnostic and Holistic Universal Image Segmentation with Bit Diffusion

面向无偏和整体通用图像分割的位差分扩散

Jakob Lønborg Christensen, Morten Rieger Hannemose, Anders Bjorholm Dahl, Vedrana Andersen Dahl

机构 * Technical University of Denmark(丹麦技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散的通用图像分割框架,通过位置感知调色板和tanh激活函数提升性能,缩小了与基于掩码方法的性能差距,并引入了原理化的模糊建模能力。

Comments Accepted at NLDL 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23171 2026-01-07 cs.CV 79%

RoboTransfer: Controllable Geometry-Consistent Video Diffusion for Manipulation Policy Transfer

RoboTransfer: 可控的几何一致视频扩散用于操控策略迁移

Liu Liu, Xiaofeng Wang, Guosheng Zhao, Keyu Li, Wenkang Qin, Jiagang Zhu, Jiaxiong Qiu, Zheng Zhu, Guan Huang, Zhizhong Su

机构 * Horizon Robotics GigaAI CASIA

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 RoboTransfer通过可控的几何一致视频扩散技术,提升机器人操控策略在真实环境中的泛化能力。

Comments 20 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03199 2026-01-07 cs.CL cs.AI 78%

DIP: Dynamic In-Context Planner For Diffusion Language Models

DIP: 用于扩散语言模型的动态上下文规划器

Yang Li, Han Meng, Chenan Wang, Haipeng Chen

机构 * College of William & Mary(威廉姆斯堡学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DIP是一种用于扩散语言模型的上下文优化方法,通过动态选择和插入上下文示例提升生成效率,实现显著的推理加速。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02935 2026-01-07 math.PR cond-mat.stat-mech 78%

Dimension-decaying diffusion processes as the scaling limit of condensing zero-range processes

降维扩散过程作为凝聚零范围过程的标度极限

Johel Beltrán, Kyuhyeon Choi, Claudio Landim

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了凝聚零范围过程在扩散时间尺度下的极限行为,证明其收敛于一个在简单形上退化的扩散过程,并通过一种扩展鞅问题的方法进行证明。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19407 2026-01-07 math.NA cs.NA physics.comp-ph physics.flu-dyn 78%

A Cartesian Cut-Cell Two-Fluid Method for Two-Phase Diffusion Problems

一个笛卡尔切割单元双流体方法用于两相扩散问题

Louis Libat, Can Selçuk, Eric Chénier, Vincent Le Chenadec

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种笛卡尔切割单元双流体方法,用于解决两相扩散问题,通过局部守恒和界面耦合实现高精度和鲁棒性。

Comments 31 pages, 19 figures. v2: Minor editorial corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12275 2026-01-07 math.NA cs.NA 78%

A Stochastic Genetic Interacting Particle Method for Reaction-Diffusion-Advection Equations

一种用于反应-扩散-对流方程的随机遗传交互粒子方法

Boyi Hu, Zhongjian Wang, Jack Xin, Zhiwen Zhang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种随机遗传交互粒子方法,用于高效求解反应-扩散-对流方程,通过自适应重采样提升稳定性与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19500 2026-01-07 cs.RO cs.LG 78%

RobotDiffuse: Diffusion-Based Motion Planning for Redundant Manipulators with the ROP Obstacle Avoidance Dataset

RobotDiffuse: 基于扩散模型的冗余机械臂运动规划与ROP障碍避让数据集

Xudong Mou, Xiaohan Zhang, Tiejun Wang, Tianyu Wo, Cangbai Xu, Ningbo Gu, Rui Wang, Xudong Liu

机构 * School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院) School of Software, Beihang University, Beijing, China(北京航空航天大学软件学院) Hangzhou Innovation Institute, Beihang University, Hangzhou, China(北京航空航天大学杭州创新研究院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 RobotDiffuse通过扩散模型实现冗余机械臂运动规划,结合物理约束与点云编码器,并发布ROP数据集提升障碍避让性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06802 2026-01-07 q-bio.TO 78%

A reaction-diffusion model for relapsing-remitting multiple sclerosis with a treatment term

复发缓解型多发性硬化症的反应扩散模型及治疗项

Romina Travaglini

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种用于复发缓解型多发性硬化症的反应扩散模型,引入治疗项并利用廷丁安不稳定性分析研究空间模式的形成。

Journal ref Numerical Mathematics and Advanced Applications ENUMATH 2023, Volume 2. ENUMATH 2023. Lecture Notes in Computational Science and Engineering, vol 154 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05119 2026-01-07 math.AP cs.SY eess.SY 78%

Reaction-diffusion systems derived from kinetic theory for Multiple Sclerosis

源自动力学理论的多重硬化症发展反应-扩散系统

Romina Travaglini, João Miguel Oliveira

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于动力学理论的多重硬化症发展模型,通过时空动力学理论描述细胞相互作用,并利用图灵不稳定性分析揭示空间图案形成机制。

Journal ref Mathematical Models and Methods in Applied Sciences 2024 34:07, 1279-1308

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02809 2026-01-07 math.PR 78%

Diffusion on homogeneous ultrametric spaces: the contributions of Alessandro Figà-Talamanca

在同质超度量空间上的扩散:阿莱西奥·菲加-塔拉曼卡的贡献

Wolfgang Woess

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文探讨了阿莱西奥·菲加-塔拉曼卡在同质超度量空间上扩散过程的研究贡献,特别是通过树上的离散时间行走构造此类过程的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02790 2026-01-07 cs.LG eess.SP 78%

RadioDiff-Flux: Efficient Radio Map Construction via Generative Denoise Diffusion Model Trajectory Midpoint Reuse

RadioDiff-Flux:通过生成式去噪扩散模型轨迹中点重用高效构建无线电地图

Xiucheng Wang, Peilin Zheng, Honggang Jia, Nan Cheng, Ruijin Sun, Conghao Zhou, Xuemin Shen

机构 * State Key Laboratory of ISN and School of Telecommunications Engineering, Xidian University(信息与通信工程国家重点实验室和西安电子科技大学电信工程学院) Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 RadioDiff-Flux通过生成式去噪扩散模型轨迹中点重用,高效构建无线电地图,实现快速且高保真的RM生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02705 2026-01-07 math.PR 78%

Diffusion limit for the stationary distribution of a history-dependent two-level M/M/1 queue

历史依赖的两级M/M/1队列平稳分布的扩散极限

Masahiro Kobayashi, Masakiyo Miyazawa, Yutaka Sakuma

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了历史依赖的两级M/M/1队列平稳分布的扩散极限,推导了其平稳分布的闭式表达式并分析了在重载情况下的扩散极限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02518 2026-01-07 math.SP cs.CR 78%

Diffusion Computation versus Quantum Computation: A Comparative Model for Order Finding and Factoring

扩散计算与量子计算:一种用于顺序寻找和因数分解的比较模型

Carlos A. Cadavid, Paulina Hoyos, Jay Jorgenson, Lejla Smajlović, J. D. Vélez

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于扩散过程的混合计算模型,用于解决顺序寻找和因数分解问题,通过对比量子计算,探讨了不同计算模型的复杂性和实际应用。

Comments This is a major revision of arXiv:2104.11616

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02499 2026-01-07 cs.LG 78%

Polynomial Convergence of Riemannian Diffusion Models

黎曼扩散模型的多项式收敛性

Xingyu Xu, Ziyi Zhang, Yorie Nakahira, Guannan Qu, Yuejie Chi

机构 * CMU Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系) Yale Department of Statistics and Data Science, Yale University(耶鲁大学统计与数据科学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出黎曼扩散模型,证明在$ L_2 $-准确分数估计下,多项式小步长可保证总变差距离下的小采样误差,无需数据分布的平滑性或正性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02450 2026-01-07 cond-mat.mtrl-sci 78%

Strain effects on the binding and diffusion energies of Au adatoms and CeO2 admolcules on Au, CeO2, MgO and SrTiO3 surfaces

应变对Au原子和CeO2分子在Au、CeO2、MgO和SrTiO3表面的结合能和扩散能的影响

Ahmad Ahmad, Ying-Cheng Chen, Jie Peng, Anter El-Azab

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究利用DFT计算探讨了应变对不同表面吸附物结合能和扩散能的影响,揭示了应变诱导的各向异性及对表面扩散行为的调控作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02444 2026-01-07 cs.SD cs.AI cs.CR cs.LG eess.AS 78%

VocalBridge: Latent Diffusion-Bridge Purification for Defeating Perturbation-Based Voiceprint Defenses

VocalBridge: 基于扩散桥的潜在空间净化用于对抗基于扰动的语音指纹防御

Maryam Abbasihafshejani, AHM Nazmus Sakib, Murtuza Jadliwala

机构 * Department of Computer Science University of Texas at San Antonio San Antonio, Texas(计算机科学系德克萨斯大学圣安东尼奥分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 VocalBridge通过学习潜在空间映射实现高效净化,提升对抗基于扰动的语音指纹防御的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02417 2026-01-07 cond-mat.stat-mech cond-mat.mes-hall cond-mat.mtrl-sci 78%

A Unified Computational Framework for Two Dimensional Diffusion Limited Aggregation via Finite-Size Scaling, Multifractality, and Morphological Analysis

二维扩散受限聚集体的统一计算框架:通过有限尺寸标度、多标度性和形态学分析

Satish Prajapati

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种统一的计算框架,通过有限尺寸标度、多标度性和形态学分析,验证DLA作为稳健普遍性类,并为跨学科的扩散控制模式分析提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22234 2026-01-07 cs.LG cs.AI 78%

DiRL: An Efficient Post-Training Framework for Diffusion Language Models

DiRL:一种高效的扩散语言模型后训练框架

Ying Zhu, Jiaxin Wan, Xiaoran Liu, Siyang He, Qiqi Wang, Xu Guo, Tianyi Liang, Zengfeng Huang, Ziwei He, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) OpenMoss Team(OpenMoss团队)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DiRL是一种高效的扩散语言模型后训练框架,通过整合FlexAttention加速的分块训练与LMDeploy优化的推理,实现了高效的两阶段后训练,提升了在复杂推理任务如数学中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21361 2026-01-07 cs.LG 78%

Compositional Monte Carlo Tree Diffusion for Extendable Planning

组合蒙特卡洛树扩散用于可扩展规划

Jaesik Yoon, Hyeonseo Cho, Sungjin Ahn

机构 * KAIST(韩国科学技术院) SAP(SAP公司) NYU(纽约大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 C-MCTD通过引入三个互补组件,将规划从单轨迹优化提升到完整计划组合推理,实现更高效和可扩展的规划方法。

Comments 24 pages, 4 figures, NeurIPS 25 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01473 2026-01-07 cs.CL 78%

TreeDiff: AST-Guided Code Generation with Diffusion LLMs

TreeDiff: 基于扩散大语言模型的AST引导代码生成

Yiming Zeng, Jinghan Cao, Zexin Li, Yiming Chen, Tao Ren, Zhuochun Li, Dawei Xiang, Xidong Wu, Shangqian Gao, Tingting Yu

机构 * University of Connecticut(康涅狄格大学) San Francisco State University(旧金山州立大学) University of California, Riverside(加州大学河滨分校) National University of Singapore(新加坡国立大学) University of Pittsburgh(匹兹堡大学) Florida State University(佛罗里达州立大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 TreeDiff通过整合AST结构先验,改进扩散模型在代码生成中的语法精确性和长距离依赖捕捉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.00902 2026-01-07 cond-mat.mes-hall physics.app-ph 78%

Selectable diffusion direction with topologically protected edge modes

可选择的扩散方向与拓扑保护的边缘模式

Keita Funayama, Jun Hirotani, Atsushi Miura, Hiroya Tanaka

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 通过量子自旋霍尔效应在蜂窝状结构中,利用拓扑保护的边缘模式实现热扩散方向的可选择控制,并展示其对缺陷的鲁棒性。

Comments 8 pages, 5 figures

Journal ref Communicaitions Physics, 6, 364 (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏