arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-21 至 2026-01-21 共收录 134 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 7 篇

2504.13745 2026-01-21 cs.CV cs.AI 88%

ESPLoRA: Enhanced Spatial Precision with Low-Rank Adaption in Text-to-Image Diffusion Models for High-Definition Synthesis

ESPLoRA: 基于低秩适应的文本到图像扩散模型中增强空间精度以实现高清晰度合成

Andrea Rigo, Luca Stornaiuolo, Mauro Martino, Bruno Lepri, Nicu Sebe

机构 * DISI, University of Trento(DISI,特伦托大学) Toretei S.r.l.(Toretei公司) Visual AI Lab, MIT-IBM Watson AI Lab(视觉人工智能实验室,MIT-IBM Watson人工智能实验室) Fondazione Bruno Kessler(布鲁诺·凯撒基金会)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 ESPLoRA通过低秩适应提升文本到图像扩散模型的空间一致性,利用改进的评估指标和TORE算法优化生成图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13866 2026-01-21 cs.CV 88%

SAGA: Learning Signal-Aligned Distributions for Improved Text-to-Image Generation

SAGA:学习信号对齐的分布以提高文本到图像生成

Paul Grimal, Michaël Soumm, Hervé Le Borgne, Olivier Ferret, Akihiro Sugimoto

机构 * Université Paris-Saclay, CEA, List(巴黎-萨克雷大学,CEA,List) Télécom Paris(巴黎电信学院) National Institute of Informatics, Japan(日本信息处理研究所)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 SAGA 通过学习信号对齐的分布,提高文本到图像生成的准确性与控制性,支持多种条件模式并优于现有方法。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13462 2026-01-21 cs.AI 88%

SpatialBench-UC: Uncertainty-Aware Evaluation of Spatial Prompt Following in Text-to-Image Generation

SpatialBench-UC: 文本到图像生成中空间提示遵循的不确定性感知评估

Amine Rostane

机构 * ESIEA

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract)

AI总结 SpatialBench-UC通过评估文本到图像生成中空间提示遵循的不确定性,提出了一个可重复的基准测试,以提高模型在空间指令下的表现和置信度评估。

Comments 19 pages, includes figures and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00591 2026-01-21 cs.CV cs.AI cs.CR 87%

Wukong Framework for Not Safe For Work Detection in Text-to-Image systems

Wukong框架用于文本到图像系统中的不安全内容检测

Mingrui Liu, Sixiao Zhang, Cheng Long

机构 * Nanyang Technological University(南洋理工大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 Wukong通过利用扩散过程早期的去噪步骤和U-Net的预训练交叉注意力参数,实现高效的不安全内容检测,优于传统文本和图像过滤方法。

Comments Accepted by KDD'26 (round 1)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21099 2026-01-21 cs.CV cs.AI cs.CR 86%

Beyond the Safety Tax: Mitigating Unsafe Text-to-Image Generation via External Safety Rectification

超越安全税:通过外部安全校正缓解不安全的文本到图像生成

Xiangtao Meng, Yingkai Dong, Ning Yu, Li Wang, Zheng Li, Shanqing Guo

机构 * Shandong University(山东大学) Netflix Eyeline Studios

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出SafePatch,通过外部安全校正机制有效抑制文本到图像生成中的不安全内容,同时保持生成质量与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11614 2026-01-21 cs.CV cs.LG q-bio.NC 83%

Multi-modal MRI-Based Alzheimer's Disease Diagnosis with Transformer-based Image Synthesis and Transfer Learning

基于多模态MRI的阿尔茨海默病诊断:基于Transformer的图像合成与迁移学习

Jason Qiu

机构 * Marvin Ridge High School(马文岭高中)

专题命中 文生图 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究提出基于Transformer的图像合成方法,利用T1w MRI预测FA和MD,提升AD诊断准确率和MCI检测能力。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08835 2026-01-21 cs.CV cs.AI cs.CL 79%

CulturalFrames: Assessing Cultural Expectation Alignment in Text-to-Image Models and Evaluation Metrics

CulturalFrames: 评估文本到图像模型与评估指标中的文化期望一致性

Shravan Nayak, Mehar Bhatia, Xiaofeng Zhang, Verena Rieser, Lisa Anne Hendricks, Sjoerd van Steenkiste, Yash Goyal, Karolina Stańczak, Aishwarya Agrawal

机构 * Mila – Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) Google Research(谷歌研究) Google DeepMind(谷歌DeepMind) Samsung - SAIT AI Lab(三星-SAIT人工智能实验室) ETH AI Center(苏黎世联邦理工学院人工智能中心)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 CulturalFrames研究了文本到图像模型在文化期望一致性方面的表现,发现模型在显性和隐性文化期望上均存在显著遗漏,揭示了现有评估指标与人类判断的相关性不足,提出了改进文化意识模型的方向。

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 5 篇

2411.13794 2026-01-21 cs.CV 89%

GalaxyEdit: Large-Scale Image Editing Dataset with Enhanced Diffusion Adapter

GalaxyEdit: 大规模图像编辑数据集与增强扩散适配器

Aniruddha Bala, Rohan Jaiswal, Siddharth Roheda, Rohit Chowdhury, Loay Rashid

机构 * Samsung R&D Institute India(三星印度研发院) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 图像编辑 :image editing(title,abstract);diffusion(title);image generation(abstract);text-to-image(abstract)

AI总结 GalaxyEdit通过自动化数据生成和增强ControlNet-xs,提升大规模图像编辑任务的性能与效率。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14124 2026-01-21 cs.CL cs.AI 78%

Style Transfer as Bias Mitigation: Diffusion Models for Synthetic Mental Health Text for Arabic

风格迁移作为偏见缓解:用于阿拉伯语合成心理健康文本的扩散模型

Saad Mankarious, Aya Zirikly

机构 * School of Engineering and Applied Science(工程与应用科学学院) George Washington University(乔治·华盛顿大学)

专题命中 图像编辑 :diffusion(title,abstract)

AI总结 本文提出基于扩散模型的风格迁移方法,用于生成阿拉伯语心理健康文本,以缓解性别偏见问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13551 2026-01-21 cs.CV 74%

DiffFace-Edit: A Diffusion-Based Facial Dataset for Forgery-Semantic Driven Deepfake Detection Analysis

DiffFace-Edit: 一种基于扩散的面部数据集用于伪造-语义驱动的深度伪造检测分析

Feng Ding, Wenhui Yi, Xinan He, Mengyao Xiao, Jianfeng Xu, Jianqiang Du

机构 * NanChang University(南昌大学)

专题命中 图像编辑 :diffusion(title);分类 cs.CV

AI总结 DiffFace-Edit数据集通过引入细粒度面部编辑和检测器逃避样本分析,提升深度伪造检测的鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12234 2026-01-21 cs.GR cs.AI cs.CV 62%

Proc3D: Procedural 3D Generation and Parametric Editing of 3D Shapes with Large Language Models

Proc3D: 基于大语言模型的3D形状过程生成与参数编辑

Fadlullah Raji, Stefano Petrangeli, Matheus Gadelha, Yu Shen, Uttaran Bhattacharya, Gang Wu

专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.GR

AI总结 Proc3D利用大语言模型实现3D形状的可编辑生成,通过参数化编辑提升设计效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14259 2026-01-21 cs.CV 57%

ManipShield: A Unified Framework for Image Manipulation Detection, Localization and Explanation

ManipShield: 一种用于图像篡改检测、定位和解释的统一框架

Zitong Xu, Huiyu Duan, Xiaoyu Wang, Zhaolin Cai, Kaiwei Zhang, Qiang Hu, Jing Liu, Xiongkuo Min, Guangtao Zhai

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) University of Electronic and Science Technology of China(电子科技大学) Tianjin University(天津大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 ManipShield基于多模态大语言模型,通过对比学习LoRA微调和任务特定解码器,实现图像篡改的统一检测、定位和解释。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 96 篇

2601.13683 2026-01-21 cs.CV 88%

Dynamic Differential Linear Attention: Enhancing Linear Diffusion Transformer for High-Quality Image Generation

动态微分线性注意力:增强线性扩散变换器以实现高质量图像生成

Boyuan Cao, Xingbo Yao, Chenhui Wang, Jiaxin Ye, Yujie Wei, Hongming Shan

机构 * Fudan University(复旦大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出动态微分线性注意力机制,通过缓解过度平滑问题提升线性扩散变换器的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14866 2026-01-21 cs.CV 88%

Controllable Localized Face Anonymization Via Diffusion Inpainting

可控的局部化面部匿名化通过扩散修复

Ali Salar, Qing Liu, Guoying Zhao

机构 * Center for Machine Vision and Signal Analysis (CMVS)(机器视觉与信号分析中心) University of Oulu(奥卢大学) ELLIS Institute Finland(芬兰ELLIS研究所) The Machine Learning Group(机器学习小组) UiT The Arctic University of Norway(挪威北冰洋大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 本文提出了一种可控的局部化面部匿名化方法,利用扩散修复生成逼真的匿名图像,通过自适应属性引导模块实现精准控制,无需额外训练即可优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14833 2026-01-21 cs.CV cs.AI 88%

Paired Image Generation with Diffusion-Guided Diffusion Models

配对图像生成与扩散引导扩散模型

Haoxuan Zhang, Wenju Cui, Yuzhu Cao, Tao Tan, Jie Liu, Yunsong Peng, Jian Zheng

机构 * University of Science and Technology of China(科学技术大学) Suzhou Institute of Biomedical Engineering and Technology(生物医学工程与技术研究所) Macao Polytechnic University(澳门 polytechnic 大学) Suzhou Municipal Hospital(苏州 municipal 医院) Guizhou Provincial People's Hospital(贵州省人民医院)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种无需外部条件的配对图像生成方法,通过训练额外的扩散引导器提升生成质量并缓解标注数据不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12283 2026-01-21 cs.CV 85%

SDiT: Semantic Region-Adaptive for Diffusion Transformers

SDiT:语义区域自适应的扩散变换器

Bowen Lin, Fanjiang Ye, Yihua Liu, Zhenghui Guo, Boyuan Zhang, Weijian Zheng, Yufan Xu, Tiancheng Xing, Yuke Wang, Chengming Zhang

机构 * University of Houston(德克萨斯大学奥斯汀分校) Rice University(里奇大学) Indiana University Bloomington(印第安纳大学布卢明顿分校) Argonne National Laboratory(阿贡国家实验室) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 SDiT通过语义区域自适应技术,在不重新训练模型的情况下,实现去噪加速,同时保持高质量的图像生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13416 2026-01-21 cs.CV 83%

Diffusion Representations for Fine-Grained Image Classification: A Marine Plankton Case Study

扩散表示用于细粒度图像分类:一个海洋浮游生物案例研究

A. Nieto Juscafresa, Á. Mazcuñán Herreros, J. Sullivan

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出利用冻结的扩散模型作为特征编码器,通过多层特征和时间步探测提升细粒度图像分类性能,在浮游生物监测中验证了其有效性。

Comments 21 pages, 6 figures, CVPR format

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11689 2026-01-21 eess.IV cs.CV 83%

Bridging Modalities: Joint Synthesis and Registration Framework for Aligning Diffusion MRI with T1-Weighted Images

弥合模态:联合合成与配准框架用于对齐扩散磁共振成像与T1加权图像

Xiaofan Wang, Junyi Wang, Yuqian Chen, Lauren J. O' Donnell, Fan Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学) Brigham and Women’s Hospital(布里奇沃特医院) Harvard Medical School(哈佛医学院)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出一种基于生成配准网络的无监督框架,通过图像合成和变形场学习,提升扩散MRI与T1加权图像的配准精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14565 2026-01-21 cs.GR cs.CV 81%

ReflectanceFusion: Diffusion-based text to SVBRDF Generation

反射融合:基于扩散的文本到SVBRDF生成

Bowen Xue, Giuseppe Claudio Guarnera, Shuang Zhao, Zahra Montazeri

机构 * University of Manchester, UK(曼彻斯特大学) University of York, UK(约克大学) University of California, Irvine, USA(加州大学伊尔弗分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 ReflectanceFusion通过双模块神经方法生成高保真SVBRDF地图,结合预训练扩散模型和ReflectanceUNet实现文本到材料的高精度生成与编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12257 2026-01-21 cs.CV cs.AI cs.CG cs.GR 81%

Soft Shadow Diffusion (SSD): Physics-inspired Learning for 3D Computational Periscopy

软阴影扩散(SSD):面向3D计算望远镜的物理启发学习

Fadlullah Raji, John Murray-Bruce

机构 * University of South Florida(佛罗里达州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 SSD通过物理启发的学习方法,实现了从普通NLOS照片中对隐藏场景的3D重建,具有良好的鲁棒性和泛化能力。

Journal ref European Conference on Computer Vision (ECCV 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14161 2026-01-21 cs.CV 79%

One-Shot Refiner: Boosting Feed-forward Novel View Synthesis via One-Step Diffusion

单步扩散提升馈送式新视角合成

Yitong Dong, Qi Zhang, Minchao Jiang, Zhiqiang Wu, Qingnan Fan, Ying Feng, Huaqi Zhang, Hujun Bao, Guofeng Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过单步扩散提升馈送式新视角合成,解决高分辨率图像处理与高频细节保留问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14030 2026-01-21 cs.CV 79%

Likelihood-Separable Diffusion Inference for Multi-Image MRI Super-Resolution

基于似然分离的扩散推理用于多图像MRI超分辨率

Samuel W. Remedios, Zhangxing Bian, Shuwen Wei, Aaron Carass, Jerry L. Prince, Blake E. Dewey

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散模型的多图像MRI超分辨率方法,通过分离似然校正实现高效推理,显著提升了各向异性退化下的超分辨率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13371 2026-01-21 cs.CV 79%

Spherical Geometry Diffusion: Generating High-quality 3D Face Geometry via Sphere-anchored Representations

球面几何扩散:通过球锚定表示生成高质量3D人脸几何

Junyi Zhang, Yiming Wang, Yunhong Lu, Qichao Wang, Wenzhe Qian, Xiaoyin Xu, David Gu, Min Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出球面几何扩散方法,通过球锚定表示生成高质量3D人脸几何,结合2D生成模型实现可控生成。

Comments Association for the Advancement of Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21498 2026-01-21 cs.LG cs.CV 79%

SlimDiff: Training-Free, Activation-Guided Hands-free Slimming of Diffusion Models

SlimDiff: 不需要训练的激活引导式扩散模型无手瘦身

Arani Roy, Shristi Das Biswas, Kaushik Roy

机构 * Purdue University(普渡大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SlimDiff通过激活引导的结构压缩方法,无需训练即可显著提升扩散模型的效率,实现参数减少和加速,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12761 2026-01-21 cs.CV 79%

Moaw: Unleashing Motion Awareness for Video Diffusion Models

Moaw:释放视频扩散模型中的运动感知

Tianqi Zhang, Ziyi Wang, Wenzhao Zheng, Weiliang Chen, Yuanhui Huang, Zhengyang Huang, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) Beihang University(北航)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Moaw通过训练视频扩散模型进行运动感知,实现零样本运动迁移,推动生成建模与运动理解的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09527 2026-01-21 cs.CV 79%

Generative Diffusion Contrastive Network for Multi-View Clustering

多视图聚类的生成扩散对比网络

Jian Zhu, Xin Zou, Xi Wang, Lei Liu, Chang Tang, Li-Rong Dai

机构 * Zhejiang Lab(浙江实验室) Hong Kong University of Science and Technology(香港科技大学) University of Science and Technology of China(中国科学技术大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出生成扩散对比网络GDCN,通过多重生成机制解决多视图聚类中的低质量数据问题,实现深度多视图聚类任务的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05685 2026-01-21 cs.GR 79%

DogFit: Domain-guided Fine-tuning for Efficient Transfer Learning of Diffusion Models

DogFit: 域引导微调用于扩散模型高效迁移学习

Yara Bahram, Mohammadhadi Shateri, Eric Granger

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 DogFit通过域感知引导微调提升扩散模型在小目标领域迁移学习的效率与效果,减少计算开销并提高生成质量。

Comments Accepted for poster presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12233 2026-01-21 cs.CV 79%

DiffusionQC: Artifact Detection in Histopathology via Diffusion Model

DiffusionQC:通过扩散模型在病理学中检测伪影

Zhenzhen Wang, Zhongliang Zhou, Zhuoyu Wen, Jeong Hwan Kook, John B Wojcik, John Kang

机构 * Johns Hopkins University Dept. of Biomedical Engineering(约翰霍普金斯大学生物医学工程系) Merck & Co., Inc. Biometrics Research(默克公司生物度量研究) Merck & Co., Inc. Translational Medicine(默克公司转化医学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffusionQC通过扩散模型检测病理学图像中的伪影,无需大量标注数据,实现高效且泛化的伪影识别。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12020 2026-01-21 cs.CV 79%

DIAMOND-SSS: Diffusion-Augmented Multi-View Optimization for Data-efficient SubSurface Scattering

DIAMOND-SSS: 用于数据高效次表面散射的扩散增强多视图优化

Guillermo Figueroa-Araneda, Iris Diana Jimenez, Florian Hofherr, Manny Ko, Hector Andrade-Loarca, Daniel Cremers

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DIAMOND-SSS通过扩散模型实现高保真透明重建,利用极稀疏监督生成逼真增强效果,将实际捕获需求降低90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09609 2026-01-21 eess.IV cs.CV 79%

I2I-PR: Deep Iterative Refinement for Phase Retrieval using Image-to-Image Diffusion Models

I2I-PR: 基于图像到图像扩散模型的深度迭代细化用于相位恢复

Mehmet Onurcan Kaya, Figen S. Oktem

机构 * Department of Electrical Engineering, Middle East Technical University (METU)(电子工程系,中东技术大学) Department of Applied Mathematics and Computer Science, Technical University of Denmark(应用数学与计算机科学系,丹麦技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 I2I-PR利用图像到图像扩散模型实现深度迭代细化,通过物理一致的初始估计和学习的扩散过程提升相位恢复的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏