arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-10 至 2026-02-10 共收录 145 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3 篇

2509.16748 2026-02-10 cs.CV 79%

HyPlaneHead: Rethinking Tri-plane-like Representations in Full-Head Image Synthesis

HyPlaneHead:重新思考全头图像合成中的三平面表示

Heyuan Li, Kenkun Liu, Lingteng Qiu, Qi Zuo, Keru Zheng, Zilong Dong, Xiaoguang Han

机构 * Tongyi Lab, Alibaba Inc.(阿里云实验室) SSE, CUHK (Shenzhen)(城市大学(深圳)信息科学与工程学院) FNii-Shenzhen Guangdong Provincial Key Laboratory of Future Networks of Intelligence(未来网络智能化广东省重点实验室)

专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV

AI总结 HyPlaneHead通过引入混合平面表示,解决三平面表示中的特征纠缠和映射不均问题,提升全头图像合成性能。

Comments Accepted by NeurIPS 2025. Project page: https://lhyfst.github.io/hyplanehead/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08127 2026-02-10 cs.CV 70%

TIPO: Text to Image with Text Presampling for Prompt Optimization

TIPO: 文本到图像的文本预采样用于提示优化

Shih-Ying Yeh, Yi Li, Sang-Hyun Park, Giyeong Oh, Xuehai Wang, Min Song, Youngjae Yu, Shang-Hong Lai

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 TIPO通过文本预采样优化提示,提升文本到图像生成的视觉质量和人类偏好度。

Comments 50 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08145 2026-02-10 cs.LG cs.AI cs.CL cs.CV cs.CY 57%

Reliable and Responsible Foundation Models: A Comprehensive Survey

可靠且负责任的基础模型:全面综述

Xinyu Yang, Junlin Han, Rishi Bommasani, Jinqi Luo, Wenjie Qu, Wangchunshu Zhou, Adel Bibi, Xiyao Wang, Jaehong Yoon, Elias Stengel-Eskin, Shengbang Tong, Lingfeng Shen, Rafael Rafailov, Runjia Li, Zhaoyang Wang, Yiyang Zhou, Chenhang Cui, Yu Wang, Wenhao Zheng, Huichi Zhou, Jindong Gu, Zhaorun Chen, Peng Xia, Tony Lee, Thomas Zollo, Vikash Sehwag, Jixuan Leng, Jiuhai Chen, Yuxin Wen, Huan Zhang, Zhun Deng, Linjun Zhang, Pavel Izmailov, Pang Wei Koh, Yulia Tsvetkov, Andrew Wilson, Jiaheng Zhang, James Zou, Cihang Xie, Hao Wang, Philip Torr, Julian McAuley, David Alvarez-Melis, Florian Tramèr, Kaidi Xu, Suman Jana, Chris Callison-Burch, Rene Vidal, Filippos Kokkinos, Mohit Bansal, Beidi Chen, Huaxiu Yao

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文综述了基础模型的可靠和负责任发展,探讨了偏见、安全、不确定性等关键问题,并提出了未来研究方向。

Comments TMLR camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 5 篇

2602.08388 2026-02-10 cs.CV 91%

Geometric Image Editing via Effects-Sensitive In-Context Inpainting with Diffusion Transformers

通过扩散变换器实现的基于效果敏感的上下文内修补图像编辑

Shuo Zhang, Wenzhuo Wu, Huayu Zhang, Jiarong Cheng, Xianghao Zang, Chao Ban, Hao Sun, Zhongjiang He, Tianwei Cao, Kongming Liang, Zhanyu Ma

机构 * PRIS, Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院) Beijing Institute of Technology(北京理工大学)

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);inpainting(title);分类 cs.CV

AI总结 GeoEdit通过扩散变换器实现基于效果敏感的上下文内修补,解决复杂场景中几何变换和光照阴影建模的问题,提升图像编辑的真实感和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08785 2026-02-10 cs.CV cs.AI 83%

DeltaSpace: A Semantic-aligned Feature Space for Flexible Text-guided Image Editing

DeltaSpace: 一种语义对齐的特征空间用于灵活的文本引导图像编辑

Yueming Lyu, Kang Zhao, Bo Peng, Huafeng Chen, Yue Jiang, Yingya Zhang, Jing Dong, Caifeng Shan

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 DeltaSpace通过语义对齐的特征空间实现文本引导图像编辑的灵活训练和推理,支持零样本推理和无需文本的训练。

Comments 18 pages. arXiv admin note: text overlap with arXiv:2303.06285

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07993 2026-02-10 cs.CV cs.AI 79%

MCIE: Multimodal LLM-Driven Complex Instruction Image Editing with Spatial Guidance

MCIE: 多模态大语言模型驱动的复杂指令图像编辑与空间引导

Xuehai Bai, Xiaoling Gu, Akide Liu, Hangjie Yuan, YiFan Zhang, Jack Ma

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 MCIE通过空间引导和背景一致性模块,提升复杂指令图像编辑的指令合规性,实现23.96%的性能提升。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07095 2026-02-10 cs.CV cs.AI 79%

WorldEdit: Towards Open-World Image Editing with a Knowledge-Informed Benchmark

WorldEdit: 向开放世界图像编辑迈进的基于知识的基准

Wang Lin, Feng Wang, Majun Zhang, Wentao Hu, Tao Jin, Zhou Zhao, Fei Wu, Jingyuan Chen, Alan Yuille, Sucheng Ren

机构 * Zhejiang University(浙江大学) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 WorldEdit通过引入基于知识的基准,提升模型在开放世界图像编辑中对隐式指令的理解和处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25682 2026-02-10 cs.CL 67%

PairUni: Pairwise Training for Unified Multimodal Language Models

PairUni: 用于统一多模态语言模型的成对训练

Jiani Zheng, Zhiyang Teng, Kunpeng Qiu, Xiangtai Li, Anran Wang, Yu Tian, Ye Tian, Haochen Wang, Zhuochen Wang

机构 * ByteDance(字节跳动)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract)

AI总结 PairUni通过成对训练提升统一多模态语言模型的理解与生成能力,采用配对数据集和PairGRPO算法实现更有效的策略学习。

Comments 22 pages, 11 figures, and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 109 篇

2602.07022 2026-02-10 eess.IV cs.CV cs.LG 88%

Condition Errors Refinement in Autoregressive Image Generation with Diffusion Loss

在扩散损失下自回归图像生成中的条件误差细化

Yucheng Zhou, Hao Li, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS、大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出基于最优传输理论的条件细化方法,通过理论分析和实验验证,有效缓解条件不一致问题并提升图像生成稳定性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00036 2026-02-10 cs.LG cs.CV 87%

A-FloPS: Accelerating Diffusion Models via Adaptive Flow Path Sampler

A-FloPS:通过自适应流路径采样器加速扩散模型

Cheng Jin, Zhenyu Xiao, Yuantao Gu

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 A-FloPS通过自适应流路径采样器提升扩散模型的生成质量和效率,实现低计算成本的高质量生成。

Comments published on AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08249 2026-02-10 eess.IV cs.CV 85%

A Unified Framework for Multimodal Image Reconstruction and Synthesis using Denoising Diffusion Models

基于去噪扩散模型的多模态图像重建与合成统一框架

Weijie Gan, Xucheng Wang, Tongyao Wang, Wenshang Wang, Chunwei Ying, Yuyang Hu, Yasheng Chen, Hongyu An, Ulugbek S. Kamilov

机构 * Department of Computer Science and Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校计算机科学与工程系) Mallinckrodt Institute of Radiology, Washington University in St. Louis(华盛顿大学圣路易斯分校马林克罗德特放射医学研究所) Department of Electrical and Systems Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校电气与系统工程系) Department of Neurology, Washington University in St. Louis(华盛顿大学圣路易斯分校神经病学系) Department of Biomedical Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校生物医学工程系) Division of Biology and Biomedical Sciences, Washington University in St. Louis(华盛顿大学圣路易斯分校生物学与生物医学科学 division) Department of Electrical and Computer Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校电气与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

AI总结 Any2all通过统一框架实现多模态图像重建与合成,利用去噪扩散模型提升性能与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09411 2026-02-10 cs.CV cs.GR 84%

ImageRAG: Dynamic Image Retrieval for Reference-Guided Image Generation

ImageRAG:用于参考引导图像生成的动态图像检索

Rotem Shalev-Arkushin, Rinon Gal, Amit H. Bermano, Ohad Fried

机构 * Tel-Aviv University(特拉维夫大学) Tel Aviv University(特拉维夫大学) Reichman University(里奇曼大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 ImageRAG通过动态图像检索提升参考引导图像生成的质量,无需专门训练即可适应不同模型类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06250 2026-02-10 cs.LG cs.CV 83%

Test-Time Iterative Error Correction for Efficient Diffusion Models

测试时迭代误差校正用于高效扩散模型

Yunshan Zhong, Weiqi Yan, Yuxin Zhang

机构 * School of Computer Science and Technology, Hainan University(海南大学计算机科学与技术学院) MAC Lab, Department of Artificial Intelligence, School of Informatics, Xiamen University(厦门大学信息学院人工智能系)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出迭代误差校正方法,通过测试时迭代优化减少扩散模型生成误差,提升生成质量与效率的平衡。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04162 2026-02-10 cs.CV cs.AI eess.IV 79%

Improving 2D Diffusion Models for 3D Medical Imaging with Inter-Slice Consistent Stochasticity

通过跨切片一致的随机性改进2D扩散模型用于3D医学影像

Chenhe Du, Qing Wu, Xuanyu Tian, Jingyi Yu, Hongjiang Wei, Yuyao Zhang

机构 * ShanghaiTech University(上海科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过引入跨切片一致的随机性策略,改进2D扩散模型以提升3D医学影像重建的保真度与一致性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08059 2026-02-10 cs.CV cs.AI 79%

DICE: Disentangling Artist Style from Content via Contrastive Subspace Decomposition in Diffusion Models

DICE: 通过对比子空间分解在扩散模型中解构艺术家风格与内容

Tong Zhang, Ru Zhang, Jianyi Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DICE通过对比子空间分解在扩散模型中解构艺术家风格与内容,实现无需训练的实时风格消除,提升部署端安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07980 2026-02-10 cs.CV 79%

Continuity-driven Synergistic Diffusion with Neural Priors for Ultra-Sparse-View CBCT Reconstruction

基于神经先验的连续驱动协同扩散用于超稀疏视角CBCT重建

Junlin Wang, Jiancheng Fang, Peng Peng, Shaoyu Wang, Qiegen Liu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CSDN方法,利用神经先验和协同扩散策略,有效提升超稀疏视角CBCT重建的图像质量和连续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07979 2026-02-10 cs.CV 79%

FSP-Diff: Full-Spectrum Prior-Enhanced DualDomain Latent Diffusion for Ultra-Low-Dose Spectral CT Reconstruction

FSP-Diff: 全谱先验增强双域潜在扩散用于超低剂量能谱CT重建

Peng Peng, Xinrui Zhang, Junlin Wang, Lei Li, Shaoyu Wang, Qiegen Liu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FSP-Diff通过全谱先验增强双域潜在扩散框架,提升超低剂量能谱CT重建的图像质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07967 2026-02-10 cs.CV 79%

EasyTune: Efficient Step-Aware Fine-Tuning for Diffusion-Based Motion Generation

EasyTune: 为基于扩散的运动生成实现高效的步感知微调

Xiaofeng Tan, Wanjiang Weng, Haodong Lei, Hongsong Wang

机构 * Southeast University(东南大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 EasyTune通过在去噪每一步进行微调,解决扩散模型在运动生成中的优化效率和内存消耗问题,并引入自我完善偏好学习机制提升训练效率。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03881 2026-02-10 cs.CV cs.AI cs.LG 79%

DiGAN: Diffusion-Guided Attention Network for Early Alzheimer's Disease Detection

DiGAN:基于扩散引导的注意力网络用于早期阿尔茨海默病检测

Maxx Richard Rahman, Mostafa Hammouda, Wolfgang Maass

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiGAN通过结合扩散建模与注意力卷积网络,有效提升了早期阿尔茨海默病检测的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17616 2026-02-10 cs.CV 79%

Towards Stabilized and Efficient Diffusion Transformers through Long-Skip-Connections with Spectral Constraints

通过谱约束的长跳连接实现稳定高效的扩散变换器

Guanjie Chen, Xinyu Zhao, Yucheng Zhou, Xiaoye Qu, Tianlong Chen, Yu Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过引入长跳连接和谱约束,Skip-DiT实现了图像和视频生成中的稳定高效扩散变换器,显著提升了训练和推理效率。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14639 2026-02-10 cs.CV cs.CR cs.LG 79%

Differentially Private Adaptation of Diffusion Models via Noisy Aggregated Embeddings

基于噪声聚合嵌入的差分隐私扩散模型适应

Pura Peetathawatchai, Wei-Ning Chen, Berivan Isik, Sanmi Koyejo, Albert No

机构 * Stanford University(斯坦福大学) ETH Zurich(苏黎世联邦理工学院) Microsoft(微软公司) Google DeepMind(谷歌DeepMind) Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DPAgg-TI方法,利用文本逆向技术在差分隐私约束下实现扩散模型的高效个性化,优于传统DP-SGD方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07057 2026-02-10 cs.CV 79%

RECITYGEN -- Interactive and Generative Participatory Urban Design Tool with Latent Diffusion and Segment Anything

RECITYGEN -- 交互式和生成式参与式城市设计工具与潜在扩散与分割任何物

Di Mo, Mingyang Sun, Chengxiu Yin, Runjia Tian, Yanhong Wu, Liyan Xu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 RECITYGEN通过结合潜在扩散模型和交互式语义分割,为城市设计提供交互式生成工具,帮助公众参与城市更新项目。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07866 2026-02-10 cs.IT math.IT math.PR 79%

Capacity Scaling Laws for Boundary-Induced Drift-Diffusion Noise Channels

边界诱导漂差扩散噪声通道的容量缩放定律

Yen-Chi Lee

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了边界诱导噪声通道的容量缩放定律,揭示了几何驱动模型中漂移强度和边界维度对容量的影响,以及熵主导的普遍性。

Comments This preprint studies boundary-induced additive noise channels arising from drift-diffusion processes and establishes high-power capacity scaling laws

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07546 2026-02-10 cs.CL cs.LG 79%

Improving Variable-Length Generation in Diffusion Language Models via Length Regularization

通过长度正则化改进扩散语言模型的变长生成

Zicong Cheng, Ruixuan Jia, Jia Li, Guo-Wei Yang, Meng-Hao Guo, Shi-Min Hu

机构 * Tsinghua University(清华大学) Proxseer Inc.(Proxseer公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出LR-DLLM,通过长度正则化改进扩散语言模型的变长生成能力,提升了在未知长度下的生成效果。

Comments diffusion language models

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00781 2026-02-10 cs.LG stat.ML 78%

Categorical Reparameterization with Denoising Diffusion models

基于去噪扩散模型的分类重参数化

Samson Gourevitch, Alain Durmus, Eric Moulines, Jimmy Olsson, Yazid Janati

机构 * KTH Royal Institute of Technology(皇家理工学院) Institute of Foundation Models, MBZUAI(基础模型研究所) Mohamed Bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 ReDGE是一种基于扩散模型的新型软重参数化方法,用于高效优化分类分布的梯度估计。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08905 2026-02-10 cs.AI 78%

Efficient and Stable Reinforcement Learning for Diffusion Language Models

高效且稳定的扩散语言模型强化学习

Jiawei Liu, Xiting Wang, Yuanyuan Zhong, Defu Lian, Yu Yang

机构 * State Key Laboratory of Cognitive Intelligence, University of Science(认知智能国家重点实验室,科学大学) City University of Hong Kong, Hong Kong, China(香港城市大学,香港,中国) Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(人工智能学院,中国人民大学,北京,中国) School of Software and Microelectronics, Peking University, Beijing, China(软件与微电子学院,北京大学,北京,中国)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出STP框架,通过空间和时间剪枝提升扩散语言模型强化学习的效率和稳定性。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08904 2026-02-10 eess.SP physics.app-ph physics.bio-ph 78%

Denoise Stepwise Signals by Diffusion Model Based Approach

通过扩散模型方法逐步去噪信号

Xingdi Tong, Chenyu Wen

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于扩散模型的算法,用于去噪单分子检测中的逐步信号,通过多尺度卷积网络和注意力机制提升信号水平和转换点的重建效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08815 2026-02-10 cs.AI 78%

Negative-Aware Diffusion Process for Temporal Knowledge Graph Extrapolation

面向时间知识图谱外推的负感知扩散过程

Yanglei Gan, Peng He, Yuxiang Cai, Run Lin, Guanyu Zhou, Qiao Liu

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 NADEx通过引入负感知扩散模型,改进时间知识图谱外推中正负上下文的平衡与去噪嵌入校准,实现更准确的未来事实预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08607 2026-02-10 cs.CL cs.SD 78%

VocalNet-MDM: Accelerating Streaming Speech LLM via Self-Distilled Masked Diffusion Modeling

VocalNet-MDM:通过自蒸馏掩码扩散建模加速流式语音大语言模型

Ziyang Cheng, Yuhao Wang, Heyang Liu, Ronghua Wu, Qunshan Gu, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 VocalNet-MDM通过自蒸馏掩码扩散建模实现流式语音LLM的高效解码与低延迟

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08583 2026-02-10 cond-mat.stat-mech math-ph math.MP math.PR 78%

Uphill transport in competitive drift-diffusion models with volume exclusion

竞争漂扩散模型中具有体积排斥的 uphill 传输

Francesco Casini, Cristian Giardinà, Jacopo Nicolini, Luca Selmi, Cecilia Vernia

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了在体积排斥约束下的漂扩散模型中 uphill 传输现象,通过 SHDL 模型与修改的泊松-涅斯特-普朗克模型的收敛,揭示了其在纳米尺度电解质和离子电子设备中的潜在作用。

Comments 24 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏