arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-06 至 2026-01-06 共收录 81 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2508.10710 2026-01-06 cs.CV 89%

CountCluster: Training-Free Object Quantity Guidance with Cross-Attention Map Clustering for Text-to-Image Generation

CountCluster: 无训练对象数量引导与跨注意力图聚类用于文本到图像生成

Joohyeon Lee, Jin-Seop Lee, Jee-Hyong Lee

机构 * Sungkyunkwan University(釜山大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 CountCluster通过无训练的跨注意力图聚类方法提升文本到图像生成中对象数量的准确性与控制性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01441 2026-01-06 physics.app-ph cs.CV 83%

Image Synthesis Using Spintronic Deep Convolutional Generative Adversarial Network

利用自旋电子深度卷积生成对抗网络进行图像合成

Saumya Gupta, Abhinandan, Venkatesh vadde, Bhaskaran Muralidharan, Abhishek Sharma

机构 * Department of Electrical Engineering, IIT Bombay(印度比哈尔理工学院电气工程系) Department of Electrical Engineering, IIT Ropar(印度罗帕尔理工学院电气工程系) School of Computing and Electrical Engineering (SCEE), IIT Mandi(印度曼迪理工学院计算与电气工程学院)

专题命中 文生图 :image synthesis(title);image generation(abstract);generative vision(abstract);分类 cs.CV

AI总结 本文提出了一种混合CMOS-自旋电子深度卷积生成对抗网络,通过自旋电子硬件实现高效图像合成,降低了能耗并提升了性能。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12595 2026-01-06 cs.CV 83%

Vision-Enhanced Large Language Models for High-Resolution Image Synthesis and Multimodal Data Interpretation

增强视觉能力的大型语言模型用于高分辨率图像合成和多模态数据解释

Karthikeya KV

专题命中 文生图 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究提出了一种增强视觉能力的大型语言模型,通过整合修正流机制和混合序列建模方法,实现高分辨率图像合成和多模态数据解释的高效生成与高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02219 2026-01-06 eess.SP 67%

Beam-Brainstorm: A Generative Site-Specific Beamforming Approach

Beam-Brainstorm: 一种生成式特定地点波束成形方法

Zihao Zhou, Zhaolin Wang, Yuanwei Liu

专题命中 文生图 :diffusion(abstract);image synthesis(abstract)

AI总结 本文提出了一种生成式特定地点波束成形方法,通过联合结构建模和自定义扩散模型,实现高效且高质量的用户特定波束生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 4 篇

2601.01915 2026-01-06 cs.CV 80%

TalkPhoto: A Versatile Training-Free Conversational Assistant for Intelligent Image Editing

TalkPhoto: 一种多功能的无需训练的对话式智能图像编辑助手

Yujie Hu, Zecheng Tang, Xu Jiang, Weiqi Li, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 TalkPhoto通过对话交互实现无需训练的多功能图像编辑,利用提示模板分层调用现有高级编辑方法,提升编辑精度与质量。

Comments a Conversational Assistant for Intelligent Image Editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17681 2026-01-06 cs.CV cs.AI 79%

PICABench: How Far Are We from Physically Realistic Image Editing?

PICABench: 我们距离物理真实图像编辑还有多远?

Yuandong Pu, Le Zhuo, Songhao Han, Jinbo Xing, Kaiwen Zhu, Shuo Cao, Bin Fu, Si Liu, Hongsheng Li, Yu Qiao, Wenlong Zhang, Xi Chen, Yihao Liu

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 PICABench通过系统评估物理真实感,探索图像编辑中物理效应的挑战与解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02242 2026-01-06 cs.CV cs.AI cs.LG 77%

VIBE: Visual Instruction Based Editor

基于视觉指令的编辑器:VIBE

Grigorii Alekseenko, Aleksandr Gordeev, Irina Tolstykh, Bulat Suleimanov, Vladimir Dokholyan, Georgii Fedorov, Sergey Yakubson, Aleksandra Tsybina, Mikhail Chernyshov, Maksim Kuprashevich

机构 * R&D Department, SALUTEDEV(SALUTEDEV 研发部)

专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 VIBE提出一种轻量级基于指令的图像编辑方法,使用2B参数模型和1.6B参数扩散模型,在保持高质量的同时实现低推理成本和源一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02204 2026-01-06 cs.CV cs.AI 70%

NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation

NextFlow:统一的序列建模激活多模态理解和生成

Huichao Zhang, Liao Qu, Yiheng Liu, Hang Chen, Yangyang Song, Yongsheng Dong, Shikun Sun, Xian Li, Xu Wang, Yi Jiang, Hu Ye, Bo Chen, Yiming Gao, Peng Liu, Akide Liu, Zhipeng Yang, Qili Deng, Linjie Xing, Jiyang Liu, Zhao Wang, Yang Zhou, Mingcong Liu, Yi Zhang, Qian He, Xiwei Hu, Zhongqi Qi, Jie Shao, Zhiye Fu, Shuai Wang, Fangmin Chen, Xuezhi Chai, Zhihua Wu, Yitong Wang, Zehuan Yuan, Daniel K. Du, Xinglong Wu

机构 * TsingHua University(清华大学) Monash University(墨尔本大学)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 NextFlow通过统一的自回归架构实现多模态理解和生成,以高效生成高分辨率图像并提升视觉质量。

Comments Project page: https://github.com/ByteVisionLab/NextFlow

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 60 篇

2601.02098 2026-01-06 cs.CV 88%

InpaintHuman: Reconstructing Occluded Humans with Multi-Scale UV Mapping and Identity-Preserving Diffusion Inpainting

InpaintHuman: 通过多尺度UV映射和身份保持扩散修复重建被遮挡的人类

Jinlong Fan, Shanshan Zhao, Liang Zheng, Jing Zhang, Yuxiang Yang, Mingming Gong

机构 * Hangzhou Dianzi University(杭州电子科技大学) Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) Wuhan University(武汉大学) University of Melbourne(墨尔本大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 InpaintHuman通过多尺度UV映射和身份保持扩散修复技术,从被遮挡的单目视频中生成高保真、完整且可动画的3D人类化身。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02036 2026-01-06 cs.LG cs.CV 83%

GDRO: Group-level Reward Post-training Suitable for Diffusion Models

GDRO:适用于扩散模型的组级奖励后训练

Yiyang Wang, Xi Chen, Xiaogang Xu, Yu Liu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Tongyi Lab(通义实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 GDRO通过组级奖励后训练优化,提升扩散模型奖励分数并增强抗奖励黑客能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23239 2026-01-06 cs.CV 83%

RS-Prune: Training-Free Data Pruning at High Ratios for Efficient Remote Sensing Diffusion Foundation Models

RS-Prune: 无需训练的数据裁剪以高比例提升高效遥感扩散基础模型

Fan Wei, Runmin Dong, Yushan Lai, Yixiang Yang, Zhaoyang Luo, Jinxiao Zhang, Miao Yang, Shuai Yuan, Jiyao Zhao, Bin Luo, Haohuan Fu

机构 * Department of Earth System Science, Tsinghua University(清华大学地球系统科学系) School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) National Supercomputing Center in Shenzhen(深圳国家超算中心) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院) Department of Geography, The University of Hong Kong(香港大学地理系) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 RS-Prune提出一种无需训练的高比例数据裁剪方法,通过局部信息与全局多样性结合,提升遥感扩散模型的收敛性和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01487 2026-01-06 cs.CV cs.AI 83%

DeepInv: A Novel Self-supervised Learning Approach for Fast and Accurate Diffusion Inversion

DeepInv: 一种用于快速准确扩散逆向的新型自监督学习方法

Ziyue Zhang, Luxi Lin, Xiaolin Hu, Chao Chang, HuaiXi Wang, Yiyi Zhou, Rongrong Ji

机构 * Xiamen University(厦门大学) National University of Defense Technology(国防科技大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 DeepInv通过自监督学习和数据增强策略,实现快速准确的扩散逆向,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00546 2026-01-06 cs.CV 83%

Seal2Real: Prompt Prior Learning on Diffusion Model for Unsupervised Document Seal Data Generation and Realisation

Seal2Real: 基于扩散模型的提示先验学习用于无监督文档印章数据生成与实现

Mingfu Yan, Jiancheng Huang, Shifeng Chen

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Shenzhen University of Advanced Technology(深圳大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 Seal2Real通过基于预训练扩散模型的提示先验学习,生成大规模标注的文档印章数据,提升真实数据中印章相关任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01914 2026-01-06 cs.CV 79%

Learning Action Hierarchies via Hybrid Geometric Diffusion

通过混合几何扩散学习动作层次结构

Arjun Ramesh Kaushik, Nalini K. Ratha, Venu Govindaraju

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HybridTAS框架,通过混合欧几里得和双曲几何提升时间动作分割的层次结构建模能力,实验表明其在多个数据集上达到最优性能。

Comments Accepted at WACV-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24015 2026-01-06 cs.CV 79%

On Exact Editing of Flow-Based Diffusion Models

关于基于流的扩散模型的精确编辑

Zixiang Li, Yue Song, Jianing Peng, Ting Liu, Jun Huang, Xiaochao Qu, Luoqi Liu, Wei Wang, Yao Zhao, Yunchao Wei

机构 * Institute of Information Science, Beijing Jiaotong University(信息科学学院,北京交通大学) Visual Intelligence +X International Cooperation Joint Laboratory of MOE(视觉智能+X国际合作联合实验室) MT Lab, Meitu Inc(美图实验室,美图公司) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CVC通过双视角速度转换机制改进基于流的扩散编辑,实现更稳定的潜在动态和更准确的图像转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01507 2026-01-06 cs.CV 79%

DiffKD-DCIS: Predicting Upgrade of Ductal Carcinoma In Situ with Diffusion Augmentation and Knowledge Distillation

DiffKD-DCIS:基于扩散增强与知识蒸馏的导管癌原位癌升级预测

Tao Li, Qing Li, Na Li, Hui Xie

机构 * School of Medical Imaging, Laboratory Medicine and Rehabilitation, Xiangnan University(医学影像学院、实验室医学与康复学院,湘南大学) Department of Radiotherapy, Affiliated Hospital (Clinical College) of Xiangnan University(放疗科,湘南大学附属医院(临床学院)) Faculty of Applied Sciences, Macao Polytechnic University(应用科学学院,澳门 polytechnic 大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffKD-DCIS通过扩散增强与知识蒸馏方法,实现对导管癌原位癌升级的准确预测,提升诊断效率与临床价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01425 2026-01-06 cs.CV 79%

DreamID-V:Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer

DreamID-V:弥合图像到视频的差距,通过扩散变换器实现高保真的面部交换

Xu Guo, Fulong Ye, Xinghui Li, Pengqi Tu, Pengze Zhang, Qichao Sun, Songtao Zhao, Xiangwang Hou, Qian He

机构 * Tsinghua University(清华大学) Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DreamID-V通过扩散变换器框架实现高保真视频面部交换,结合新型数据管道和强化学习策略,提升身份一致性和视觉真实性。

Comments Project: https://guoxu1233.github.io/DreamID-V/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01141 2026-01-06 eess.IV cs.CV 79%

YODA: Yet Another One-step Diffusion-based Video Compressor

YODA: 另一种一步扩散视频压缩器

Xingchen Li, Junzhe Zhang, Junqi Shi, Ming Lu, Zhan Ma

机构 * School of Electronic Science and Engineering, Nanjing University(电子科学与工程学院,南京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 YODA通过嵌入时间参考的多尺度特征,结合线性扩散变换器,实现了更高效的视频压缩,其在多个感知指标上均优于现有方法。

Comments Code will be available at https://github.com/NJUVISION/YODA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22615 2026-01-06 cs.CV cs.CL 79%

Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone

Dream-VL & Dream-VLA: 基于扩散语言模型的开放视觉语言和视觉语言-动作模型

Jiacheng Ye, Shansan Gong, Jiahui Gao, Junming Fan, Shuang Wu, Wei Bi, Haoli Bai, Lifeng Shang, Lingpeng Kong

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 基于扩散语言模型构建的Dream-VL和Dream-VLA在视觉语言和视觉语言-动作任务中表现出色,实现了领先的性能。

Comments Add real-world experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14681 2026-01-06 eess.IV cs.CV 79%

Virtual Multiplex Staining for Histological Images using a Marker-wise Conditioned Diffusion Model

使用标记条件扩散模型进行虚拟多标记染色

Hyun-Jic Oh, Junsik Kim, Zhiyi Shi, Yichen Wu, Yu-An Chen, Peter K Sorger, Hanspeter Pfister, Won-Ki Jeong

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于条件扩散模型的虚拟多标记染色方法,利用预训练模型生成多标记图像,提升了H&E图像的分子层面分析能力。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02043 2026-01-06 cs.CV 79%

Conditional Diffusion Model with Anatomical-Dose Dual Constraints for End-to-End Multi-Tumor Dose Prediction

具有解剖剂量双约束的条件扩散模型用于端到端多肿瘤剂量预测

Hui Xie, Haiqin Hu, Lijuan Ding, Qing Li, Yue Sun, Tao Tan

机构 * Faculty of Applied Sciences, Macao Polytechnic University(澳门理工大学应用科学学院) Affiliated Hospital of Xiangnan University(湘南大学附属医院) Jiangxi Cancer Hospital(江西省肿瘤医院) Chenzhou Third People's Hospital(郴州第三人民医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ADDiff-Dose通过条件扩散模型实现多肿瘤剂量预测,结合解剖和剂量约束,提升预测精度与临床适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01799 2026-01-06 math.AP cs.NA math.NA 79%

Self-Similar Solutions and Global Existence for Nonlinear Reaction-Diffusion Systems in Industrial Ammonia Synthesis

自相似解与非线性反应扩散系统在工业氨合成中的全局存在性

Jamshid Khasanov, Sokhibjan Muminov, Sardor Jumaniyozov, Oybek Djabborov, Khudayberganov Shuhrat

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过李群分析和比较原理,研究非线性反应扩散方程组的自相似解及全局解存在性,揭示浓度剖面的幂律行为并验证其在氨合成中的应用。

Comments 15 pages, numerical simulations, Keywords: Nonlinear parabolic systems; Reaction-diffusion; Ammonia production; Self-similar reduction; Global solutions; Asymptotic expansions

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01948 2026-01-06 cs.RO 78%

Learning Diffusion Policy from Primitive Skills for Robot Manipulation

从基本技能学习扩散策略用于机器人操作

Zhihao Gu, Ming Yang, Difan Zou, Dong Xu

机构 * Dong Xu(东旭教授)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出SDP,一种基于技能的扩散策略,通过整合可解释的技能学习与条件动作规划,提升机器人操作中技能一致性与性能。

Comments Accepted to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21170 2026-01-06 cs.CL 78%

Cosmos: Compressed and Smooth Latent Space for Text Diffusion Modeling

Cosmos: 用于文本扩散建模的压缩和平滑潜在空间

Viacheslav Meshchaninov, Egor Chimbulatov, Alexander Shabalin, Aleksandr Abramov, Dmitry Vetrov

机构 * HSE University(俄罗斯高等经济大学) Constructor University(建设大学) SaluteDevices

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Cosmos通过压缩和平滑的潜在空间提升文本生成效率,实现比传统方法更快的推理速度和相当的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09922 2026-01-06 cs.LG 78%

Improving the Euclidean Diffusion Generation of Manifold Data by Mitigating Score Function Singularity

通过缓解分数函数奇异性和改进欧几里得扩散生成流形数据

Zichen Liu, Wei Zhang, Tiejun Li

机构 * Center for Data Science, Peking University(北京大学数据科学中心) Zuse Institute Berlin(柏林泽尼茨研究所) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) LMAM and School of Mathematical Sciences, Peking University(北京大学数学科学学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Niso-DM和Tango-DM方法,通过缓解分数函数的奇异性和改进欧几里得扩散生成流形数据的准确性。

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.07348 2026-01-06 cond-mat.str-el cond-mat.mtrl-sci 78%

Stability and diffusion of oxygen vacancies in LaNiO$_3$: a DMFT study

LaNiO$_3$中氧空位的稳定性与扩散:一种DMFT研究

Uthpala Herath, Vijay Singh, Soumya S. Bhat, Hyowon Park, Aldo H. Romero

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文利用DMFT研究LaNiO$_3$中氧空位对金属-绝缘体转变的影响,揭示了量子涨落对能垒高度的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.10970 2026-01-06 math.AP 78%

The combined non-equilibrium diffusion and low Mach number limits of the compressible Navier-Stokes-Fourier-P1 approximation radiation model

可压缩Navier-Stokes-Fourier-P1辐射模型的非平衡扩散与低马赫数极限的结合

Fucai Li, Shuxing Zhang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了NSF-P1模型在非平衡扩散和低马赫数极限下的收敛性,通过引入等效压力和速度平衡奇异性和建立统一估计,证明其收敛到热传导粘性流系统耦合扩散方程。

Comments 30 pages

Journal ref Mathematical Methods in the Applied Sciences, 49(2026), 694--712

详情

展开后加载摘要…

URL PDF HTML 收藏
1109.1935 2026-01-06 math.AP 78%

Local Hadamard well-posedness and blow-up for reaction-diffusion equations with non-linear dynamical boundary conditions

局部Hadamard可解性及反应扩散方程非线性动态边界条件下的爆破研究

Alessio Fiscella, Enzo Vitillaro

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了非线性动态边界条件下反应扩散方程的局部可解性、全局存在性及爆破问题。

Journal ref Discrete Continuous Dynamical Systems 33 5015 - 5047 (2013)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01731 2026-01-06 math.NA cs.NA 78%

A generalized Scharfetter-Gummel scheme for nonlocal cross-diffusion systems

非局部交叉扩散系统的广义Scharfetter-Gummel方案

Ansgar Jüngel, Panchi Li, Zhiwei Sun

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种广义Scharfetter-Gummel方案用于非局部交叉扩散系统,通过统一估计离散Fisher信息克服了退化问题,并验证了方案的收敛性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01475 2026-01-06 cs.LG 78%

Multi-Subspace Multi-Modal Modeling for Diffusion Models: Estimation, Convergence and Mixture of Experts

多子空间多模态建模用于扩散模型:估计、收敛与专家混合

Ruofeng Yang, Yongcan Li, Bo Jiang, Cheng Chen, Shuai Li

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于多子空间多模态建模的扩散模型,通过引入低秩混合高斯混合结构,有效捕捉多模态信息并提升生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏