arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-30 至 2026-01-30 共收录 84 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 1 篇

2601.20354 2026-01-30 cs.CV 83%

Everything in Its Place: Benchmarking Spatial Intelligence of Text-to-Image Models

万物皆有其位:文本到图像模型空间智能基准测试

Zengbin Wang, Xuecai Hu, Yong Wang, Feng Xiong, Man Zhang, Xiangxiang Chu

机构 * AMAP, Alibaba Group(AMAP、阿里巴巴集团)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出SpatialGenEval基准测试,通过信息密集的提示评估文本到图像模型的空间智能,揭示高阶空间推理的瓶颈,并构建SpatialT2I数据集提升模型性能。

Comments Accepted by ICLR 2026, URL: https://github.com/AMAP-ML/SpatialGenEval

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 65 篇

2601.22094 2026-01-30 cs.CV 88%

RefAny3D: 3D Asset-Referenced Diffusion Models for Image Generation

RefAny3D: 3D资产参考扩散模型用于图像生成

Hanzhuo Huang, Qingyang Bao, Zekai Gu, Zhongshuo Du, Cheng Lin, Yuan Liu, Sibei Yang

机构 * ShanghaiTech University(上海科技大学) Sun Yat-sen University(中山大学) University of Toronto(多伦多大学) The Hong Kong University of Science and Technology(香港科学与技术大学) SynWorld Macau University of Science and Technology(澳门科学理工学院)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 RefAny3D通过整合3D资产,提出一种双分支扩散模型,实现2D图像与3D资产的协同生成,提升图像生成的精确性和多样性。

Comments ICLR 2026. Project page: https://judgementh.github.io/RefAny3D Codes: https://github.com/JudgementH/RefAny3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22127 2026-01-30 cs.CV cs.GR cs.LG cs.MM 85%

EditYourself: Audio-Driven Generation and Manipulation of Talking Head Videos with Diffusion Transformers

EditYourself: 基于音频驱动的谈话头视频生成与操控的扩散变换器

John Flynn, Wolfgang Paier, Dimitar Dinev, Sam Nhut Nguyen, Hayk Poghosyan, Manuel Toribio, Sandipan Banerjee, Guy Gafni

机构 * Pipio AI Amazon(亚马逊)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 EditYourself通过音频驱动的视频到视频编辑框架,实现基于脚本的谈话头视频修改,包括内容的添加、删除和重新定时,同时保持唇同步和时间一致性。

Comments Project page: https://edit-yourself.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22135 2026-01-30 cs.CV 83%

PI-Light: Physics-Inspired Diffusion for Full-Image Relighting

PI-Light:基于物理的扩散用于全图像重照明

Zhexin Liang, Zhaoxi Chen, Yongwei Chen, Tianyi Wei, Tengfei Wang, Xingang Pan

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 PI-Light通过结合物理引导的神经渲染模块和基于物理的损失函数,提升全图像重照明的泛化能力与现实场景适应性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21517 2026-01-30 cs.CV 83%

HERS: Hidden-Pattern Expert Learning for Risk-Specific Vehicle Damage Adaptation in Diffusion Models

HERS:隐藏模式专家学习用于扩散模型中特定风险车辆损伤适应

Teerapong Panboonyuen

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 HERS通过领域特定专家学习提升扩散模型中车辆损伤生成的保真度与可控性,提高保险领域应用的安全性与可靠性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20766 2026-01-30 cs.CV 83%

DyPE: Dynamic Position Extrapolation for Ultra High Resolution Diffusion

DyPE: 用于超高清扩散的动态位置外推

Noam Issachar, Guy Yariv, Sagie Benaim, Yossi Adi, Dani Lischinski, Raanan Fattal

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 DyPE通过动态调整位置编码实现超高清扩散图像生成,无需额外训练成本,显著提升高分辨率图像保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05216 2026-01-30 eess.AS cs.SD 82%

Do We Need EMA for Diffusion-Based Speech Enhancement? Toward a Magnitude-Preserving Network Architecture

我们是否需要EMA用于基于扩散的语音增强?迈向一种保持幅度的网络架构

Julius Richter, Danilo de Oliveira, Timo Gerkmann

机构 * University of Hamburg, Germany, Department of Informatics, Signal Processing Group(汉堡大学,德国,信息学院,信号处理组)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文研究了基于扩散的语音增强中是否需要EMA,提出了一种保持幅度的网络架构,并通过实验验证了短或无EMA在语音增强中的有效性。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21922 2026-01-30 cs.CV 79%

Zero-Shot Video Restoration and Enhancement with Assistance of Video Diffusion Models

借助视频扩散模型的零样本视频修复与增强

Cong Cao, Huanjing Yue, Shangbin Xie, Xin Liu, Jingyu Yang

机构 * School of Electrical and Information Engineering, Tianjin University(电子信息工程学院,天津大学) Computer Vision and Pattern Recognition Laboratory, School of Engineering Science, Lappeenranta-Lahti University of Technology LUT(计算机视觉与模式识别实验室,工程科学学院,拉佩兰塔-拉赫蒂技术大学LUT)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种无训练的框架,利用视频扩散模型提升零样本视频修复与增强的时序一致性,通过潜在融合与后处理策略增强效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21857 2026-01-30 cs.CV 79%

Trajectory-Guided Diffusion for Foreground-Preserving Background Generation in Multi-Layer Documents

轨迹引导扩散:多层文档中保留前景的背景生成

Taewon Kang

机构 * University of Maryland at College Park(马里兰大学学院市分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出轨迹引导扩散方法,通过潜在空间设计实现多层文档中前景保留和背景生成的风格一致性。

Comments 47 pages, 36 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21248 2026-01-30 cs.CV 79%

NFCDS: A Plug-and-Play Noise Frequency-Controlled Diffusion Sampling Strategy for Image Restoration

NFCDS: 一种插件式噪声频率控制扩散采样策略用于图像修复

Zhen Wang, Hongyi Liu, Jianing Li, Zhihui Wei

机构 * Nanjing University of Science and Technology(南京理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 NFCDS通过控制噪声频率提升图像修复的保真度与感知质量,无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17868 2026-01-30 cs.CV cs.AI 79%

VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding

VidLaDA:双向扩散大型语言模型用于高效视频理解

Zhihao He, Tieyuan Chen, Kangyu Wang, Ziran Qin, Yang Shao, Chaofan Gan, Shijie Li, Zuxuan Wu, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) ZhongguanCun Academy(中关村学院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 VidLaDA通过双向注意力和MARS-Cache技术,提升视频理解效率,实现比现有方法更优的性能与速度

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11229 2026-01-30 cs.CV cs.SD 79%

REST: Diffusion-based Real-time End-to-end Streaming Talking Head Generation via ID-Context Caching and Asynchronous Streaming Distillation

REST:基于扩散模型的实时端到端流式说话人生成方法:通过ID上下文缓存和异步流式蒸馏

Haotian Wang, Yuzhe Weng, Jun Du, Haoran Xu, Xiaoyan Wu, Shan He, Bing Yin, Cong Liu, Qingfeng Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 REST通过ID-Context缓存和异步流式蒸馏,实现高效实时端到端流式说话人生成。

Comments 27 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25731 2026-01-30 cs.CV 79%

LaTo: Landmark-tokenized Diffusion Transformer for Fine-grained Human Face Editing

LaTo:基于地标token化的扩散变换器用于精细的人脸编辑

Zhenghao Zhang, Ziying Zhang, Junchao Liao, Xiangyu Meng, Qiang Hu, Siyu Zhu, Xiaoyun Zhang, Long Qin, Weizhi Wang

机构 * Alibaba Cloud Computing(阿里云计算) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 LaTo通过地标token化扩散变换器实现精细的人脸编辑,提升身份保持与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06625 2026-01-30 cs.CV 79%

CycleDiff: Cycle Diffusion Models for Unpaired Image-to-image Translation

CycleDiff: 基于循环扩散模型的无配对图像到图像翻译

Shilong Zou, Yuhang Huang, Renjiao Yi, Chenyang Zhu, Kai Xu

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) College of Future Information Technology, Fudan University(未来信息技术学院,复旦大学) School of Computer, National University of Defense Technology(计算机学院,国防科技大学) Xiangjiang Laboratory(湘江实验室) Institute of AI for Industries, Chinese Academy of Sciences(产业人工智能研究院,中国科学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CycleDiff通过联合学习扩散与翻译过程,提升跨域图像翻译的全局优化与生成质量。

Comments Accepted by IEEE TIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07720 2026-01-30 cs.CV 79%

ACDiT: Interpolating Autoregressive Conditional Modeling and Diffusion Transformer

ACDiT:插值自回归条件建模与扩散变换器

Jinyi Hu, Shengding Hu, Yuxuan Song, Yufei Huang, Mingxuan Wang, Hao Zhou, Zhiyuan Liu, Wei-Ying Ma, Maosong Sun

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ACDiT通过结合自回归和扩散范式,实现连续视觉信息的灵活插值生成,优于现有自回归基线,在视觉生成任务中表现最佳。

Comments TMLR camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22035 2026-01-30 cs.CL cs.AI 78%

Thinking Out of Order: When Output Order Stops Reflecting Reasoning Order in Diffusion Language Models

脱离顺序思考:当输出顺序不再反映推理顺序时扩散语言模型的表现

Longxuan Yu, Yu Fu, Shaorong Zhang, Hui Liu, Mukund Varma T, Greg Ver Steeg, Yue Dong

机构 * University of California, Riverside, CA, USA(加州大学河滨分校) Independent Researcher(独立研究者) University of California, San Diego, CA, USA(加州大学圣地亚哥分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出屏蔽扩散语言模型(MDLMs)在处理输出顺序与推理顺序不一致时展现出的顺序鲁棒性,通过实验验证其在不同基准上的稳定性能。

Comments 18 pages, 13 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22031 2026-01-30 cs.CL 78%

Causal Autoregressive Diffusion Language Model

因果自回归扩散语言模型

Junhao Ruan, Bei Li, Yongjing Yin, Pengcheng Huang, Xin Chen, Jingang Wang, Xunliang Cai, Tong Xiao, JingBo Zhu

机构 * Meituan Inc.(美团公司) School of Computer Science(计算机科学学院) Engineering, Northeastern University, Shenyang, China(工程学院,东北大学,沈阳,中国) NiuTrans Research, Shenyang, China(NiuTrans研究,沈阳,中国)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出CARD,一种结合自回归模型训练效率和扩散模型推理效率的新型语言模型,通过因果掩码和动态并行解码实现高效生成与高数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21985 2026-01-30 cs.LG 78%

Elign: Equivariant Diffusion Model Alignment from Foundational Machine Learning Force Fields

Elign:从基础机器学习力场中等效扩散模型对齐

Yunyang Li, Lin Huang, Luojia Xia, Wenhe Zhang, Mark Gerstein

机构 * Department of Computer Science, Yale University, New Haven, USA(计算机科学系,耶鲁大学,新 Haven,USA) Program in Computational Biology and Biomedical Informatics, Yale University, New Haven, USA(计算生物学与生物医学信息学项目,耶鲁大学,新 Haven,USA) IQuestLab

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Elign通过结合基础机器学习力场和强化学习优化,实现了等效扩散模型的对齐,提升分子构象生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21943 2026-01-30 cs.LG cs.IT math.IT 78%

Entropy-Based Dimension-Free Convergence and Loss-Adaptive Schedules for Diffusion Models

基于熵的无维度收敛和损失自适应调度方法用于扩散模型

Ahmad Aghapour, Erhan Bayraktar, Ziqing Zhang

机构 * Department of Mathematics, University of Michigan(数学系,密歇根大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于熵的无维度收敛方法和损失自适应调度,通过信息论方法提升扩散模型的采样效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21940 2026-01-30 eess.AS 78%

DisContSE: Single-Step Diffusion Speech Enhancement Based on Joint Discrete and Continuous Embeddings

DisContSE:基于联合离散和连续嵌入的单步扩散语音增强

Yihui Fu, Tim Fingscheidt

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DisContSE通过联合离散和连续嵌入实现高效单步扩散语音增强,提升语音保真度和可懂度,并在多个评估指标中取得领先。

Comments Accepted by IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21851 2026-01-30 cs.LG 78%

Visual Disentangled Diffusion Autoencoders: Scalable Counterfactual Generation for Foundation Models

视觉解耦扩散自编码器:用于基础模型的可扩展反事实生成

Sidney Bender, Marco Morik

机构 * Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DiDAE通过解耦字典学习和扩散自编码器实现高效无梯度反事实生成,提升基础模型的鲁棒性和下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21768 2026-01-30 cs.CL 78%

Zonkey: A Hierarchical Diffusion Language Model with Differentiable Tokenization and Probabilistic Attention

Zonkey:一种具有可微分分词和概率注意力的分层扩散语言模型

Alon Rozental

机构 * Alon Rozental(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Zonkey是一种通过可微分分词和概率注意力机制实现的分层扩散语言模型,能够从噪声中生成连贯文本并提升领域适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15596 2026-01-30 cs.LG 78%

Corrective Diffusion Language Models

纠正扩散语言模型

Shuibai Zhang, Fred Zhangzhi Peng, Yiheng Zhang, Jin Pan, Grigorios G. Chrysos

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Duke University(杜克大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 纠正扩散语言模型通过明确监督可见错误token,实现判别性置信度和针对性细化,显著提升代码修订和并行解码任务性能。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01515 2026-01-30 physics.ao-ph 78%

Ocean neutral transport: sub-Riemannian geometry and hypoelliptic diffusion

海洋中性输送:子黎曼几何与次椭圆扩散

Matthieu Chatelain, Isambard Goodbody, Nived Rajeev Saritha, Jacques Vanneste

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于子黎曼几何的中性输送模型,通过次椭圆扩散理论解释海洋中性平面的非可积性,揭示中性输送的三维特性及强各向异性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08488 2026-01-30 cs.LG 78%

One-Shot Federated Learning with Classifier-Free Diffusion Models

单次联邦学习与无分类器扩散模型

Obaidullah Zaland, Shutong Jin, Florian T. Pokorny, Monowar Bhuyan

机构 * Linköping University(_linköping大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 OSCAR通过无分类器扩散模型实现单次联邦学习,减少通信开销并提升性能。

Comments Published in IEEE ICME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21647 2026-01-30 cs.CL cs.AI cs.LG 78%

ILRR: Inference-Time Steering Method for Masked Diffusion Language Models

ILRR: 用于掩码扩散语言模型的推理时间引导方法

Eden Avrahami, Eliya Nachmani

机构 * School of Computer Science, Tel Aviv University, Israel(特拉维夫大学计算机科学学院) Department of Electrical and Computer Engineering, Ben Gurion University, Beer Sheva, Israel(本· Gurion大学电气与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 ILRR是一种无需学习的引导方法,通过单个参考序列在去噪过程中动态对齐生成序列与参考序列的激活,实现对扩散语言模型属性的高效控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21585 2026-01-30 math.DS 78%

Stability analysis of nontrivial stationary solution and constant equilibrium point of reaction-diffusion neural networks with time delays under Dirichlet zero boundary value

具有时间延迟的反应扩散神经网络在Dirichlet零边界值下的非平凡稳态解和常数平衡点稳定性分析

Ruofeng Rao, Jialin Huang, Xiaodi Li

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过多种数学方法研究了具有时间延迟的反应扩散神经网络在Dirichlet零边界值下的稳定性问题,揭示了扩散对系统稳定性的影响,并通过实例验证了方法的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21348 2026-01-30 cs.LG cs.AI 78%

Memorization Control in Diffusion Models from Denoising-centric Perspective

从去噪视角看扩散模型中的记忆控制

Thuy Phuong Vu, Mai Viet Hoang Do, Minhhuy Le, Dinh-Cuong Hoang, Phan Xuan Tan

机构 * Department of Computer Science(计算机科学系) Brunel University of London(布鲁内尔大学) Hanoi University of Science and Technology(河内科学技术大学) Faculty of Electrical and Electronic Engineering School of Engineering(电气电子工程系工程学院) Phenikaa University(Phenikaa大学) Greenwich Vietnam FPT University(格林威治越南FPT大学) College of Engineering(工程学院) Shibaura Institute of Technology(Shibaura技术学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出从去噪视角控制扩散模型记忆性的策略,通过调整时间步采样策略减少记忆性并提升分布对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21251 2026-01-30 cs.RO 78%

Abstracting Robot Manipulation Skills via Mixture-of-Experts Diffusion Policies

通过混合专家扩散策略抽象机器人操作技能

Ce Hao, Xuanran Zhai, Yaohua Liu, Harold Soh

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Smart Systems Institute, NUS(NUS智能系统研究所) Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Beijing Zhongguancun Academy(北京中关村学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于扩散的混合专家策略,通过学习紧凑的技能基础和粘性路由机制,实现高效多任务机器人操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21242 2026-01-30 cs.LG cs.AI 78%

Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks

通过基于比率的函数近似理解扩散模型与SignReLU网络

Luwei Sun, Dongrui Shen, Jianfe Li, Yulong Zhao, Han Feng

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过基于比率的函数近似与SignReLU网络,研究扩散模型的理论框架,推导了生成模型的KL风险界限及收敛性保证。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏