arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-16 至 2025-12-16 共收录 116 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 9 篇

2512.12501 2025-12-16 cs.AI 89%

SafeGen: Embedding Ethical Safeguards in Text-to-Image Generation

SafeGen: 在文本到图像生成中嵌入伦理保障

Dang Phuong Nam, Nguyen Kieu, Pham Thanh Hieu

机构 * Posts and Telecommunications Institute of Technology(电信技术研究所)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract)

AI总结 SafeGen通过整合BGE-M3和Hyper-SD,实现文本到图像生成中的伦理保障,有效过滤有害提示并生成高质量图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19791 2025-12-16 cs.CV 87%

Color Bind: Exploring Color Perception in Text-to-Image Models

Color Bind: 探索文本到图像模型中的颜色感知

Shay Shomer-Chai, Wenxuan Peng, Bharath Hariharan, Hadar Averbuch-Elor

机构 * Tel Aviv University(特拉维夫大学) Cornell University(康奈尔大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);image editing(abstract)

AI总结 本文提出了一种专门的图像编辑技术,用于解决多对象提示中颜色属性的语义对齐问题,并在多种指标上提升了性能。

Comments Project webpage: https://tau-vailab.github.io/color-edit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16763 2025-12-16 cs.CV 86%

Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation

自奖励的大型视觉-语言模型用于优化文本到图像生成中的提示

Hongji Yang, Yucheng Zhou, Wencheng Han, Jianbing Shen

机构 * University of Macau(澳门大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出了一种自奖励的大型视觉-语言模型框架,用于优化文本到图像生成中的提示,通过统一求解器和奖励模型实现自我改进,实验表明其优于其他方法。

Comments Accepted by ACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19534 2025-12-16 cs.CV cs.LG 83%

QUOTA: Quantifying Objects with Text-to-Image Models for Any Domain

QUOTA: 通过文本到图像模型对任意领域的对象进行量化

Wenfang Sun, Yingjun Du, Gaowen Liu, Yefeng Zheng, Cees G. M. Snoek

机构 * University of Amsterdam(阿姆斯特丹大学) Cisco Research(思科研究) Westlake University(西湖大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 QUOTA通过双循环元学习策略,实现无需重新训练即可在任意领域中高效量化对象数量。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13427 2025-12-16 cs.CV cs.LG 79%

MineTheGap: Automatic Mining of Biases in Text-to-Image Models

MineTheGap: 自动挖掘文本到图像模型中的偏见

Noa Cohen, Nurit Spingarn-Eliezer, Inbar Huberman-Spiegelglas, Tomer Michaeli

机构 * Technion – Israel Institute of Technology(技术学院–以色列理工学院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 MineTheGap通过遗传算法自动挖掘文本到图像模型中导致偏见的提示,利用偏见评分评估并优化提示池以暴露偏见。

Comments Code and examples are available on the project's webpage at https://noa-cohen.github.io/MineTheGap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12800 2025-12-16 cs.CV 77%

Learning Common and Salient Generative Factors Between Two Image Datasets

学习两个图像数据集之间的共同和显著生成因素

Yunlong He, Gwilherm Lesné, Ziqian Liu, Michaël Soumm, Pietro Gori

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院)

专题命中 文生图 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出了一种新的对比分析框架,用于学习两个图像数据集之间的共同和显著生成因素,适用于GAN和扩散模型,提升了生成质量与分离能力。

Comments This is the author's version of a work submitted to IEEE for possible publication. The final version may differ from this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12465 2025-12-16 cs.LG cs.AI 67%

Exploring the Design Space of Transition Matching

探索过渡匹配的设计空间

Uriel Singer, Yaron Lipman

机构 * FAIR at Meta(Meta 的 FAIR)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract)

AI总结 本文研究了过渡匹配中头部模块的设计,发现MLP头部结合特定时间加权和高频采样器在生成质量、训练和推理效率上达到最佳效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07219 2025-12-16 cs.CR 67%

Approximate Gaussian Mapping for Generative Image Steganography

近似高斯映射用于生成性图像隐写术

Yuhua Xu, Wei Sun, Chengpei Tang, Jiaxing Lu, Jingying Zhou, Chen Gu

专题命中 文生图 :diffusion(abstract);image synthesis(abstract)

AI总结 本文提出近似高斯映射用于生成性图像隐写术,通过调节噪声尺度和方差嵌入秘密信息,并通过两阶段解耦优化策略提升鲁棒性和安全性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25387 2025-12-16 cs.CV 57%

Instance-Level Composed Image Retrieval

实例级组合图像检索

Bill Psomas, George Retsinas, Nikos Efthymiadis, Panagiotis Filntisis, Yannis Avrithis, Petros Maragos, Ondrej Chum, Giorgos Tolias

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 BASIC通过无训练方法利用预训练视觉-语言模型,在实例级组合图像检索中实现了新的状态。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 2 篇

2512.10284 2025-12-16 cs.CV cs.AI cs.CL 84%

MotionEdit: Benchmarking and Learning Motion-Centric Image Editing

MotionEdit: 动作导向图像编辑的基准测试与学习

Yixin Wan, Lei Ke, Wenhao Yu, Kai-Wei Chang, Dong Yu

机构 * Tencent AI(腾讯AI) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 MotionEdit提出一个动作导向图像编辑数据集及评估基准,通过MotionNFT框架提升编辑质量和运动保真度。

Comments Technical Report. We propose MotionEdit, a dataset and benchmark for motion-centric image editing. We also introduce MotionNFT, a reward training framework to improve existing models with motion-aware guidance. Github: https://github.com/elainew728/motion-edit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13276 2025-12-16 cs.CV 83%

CogniEdit: Dense Gradient Flow Optimization for Fine-Grained Image Editing

CogniEdit: 密集梯度流优化用于细粒度图像编辑

Yan Li, Lin Liu, Xiaopeng Zhang, Wei Xue, Wenhan Luo, Yike Guo, Qi Tian

机构 * Hongkong University of Science and Technology(香港科学与技术大学) Huawei Company(华为公司)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 CogniEdit通过密集梯度流优化实现细粒度图像编辑,结合多模态推理与动态令牌焦点重新定位,提升指令遵循与视觉质量的平衡

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 86 篇

2512.11203 2025-12-16 cs.CV 83%

AutoRefiner: Improving Autoregressive Video Diffusion Models via Reflective Refinement Over the Stochastic Sampling Path

AutoRefiner: 通过在随机采样路径上的反思细化改进自回归视频扩散模型

Zhengyang Yu, Akio Hayakawa, Masato Ishii, Qingtao Yu, Takashi Shibuya, Jing Zhang, Yuki Mitsufuji

机构 * Australian National University(澳大利亚国立大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 AutoRefiner通过路径噪声细化和反射式KV缓存改进AR-VDMs的样本保真度

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08987 2025-12-16 cs.CV 83%

WDT-MD: Wavelet Diffusion Transformers for Microaneurysm Detection in Fundus Images

WDT-MD:用于视网膜图像微动脉瘤检测的小波扩散变换器

Yifei Sun, Yuzhi He, Junhao Jia, Jinhong Wang, Ruiquan Ge, Changmiao Wang, Hongxia Xu

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 WDT-MD 通过小波扩散变换器框架,解决微动脉瘤检测中的身份映射、区分困难和重建效果差问题,提升视网膜图像筛查性能。

Comments 9 pages, 6 figures, 8 tables, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13080 2025-12-16 cs.CV 83%

Counting Hallucinations in Diffusion Models

扩散模型中hallucination的计数

Shuai Fu, Jian Zhou, Qi Chen, Huang Jing, Huy Anh Nguyen, Xiaohan Liu, Zhixiong Zeng, Lin Ma, Quanshi Zhang, Qi Wu

机构 * University of Adelaide(阿德莱德大学) Meituan(美团) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出了一种针对扩散模型中计数hallucination的评估方法,通过构建CountHalluSet数据集,系统分析不同采样条件对hallucination的影响,并揭示FID等指标无法捕捉计数hallucination的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13690 2025-12-16 cs.CV cs.AI cs.GR cs.LG 81%

DiffusionBrowser: Interactive Diffusion Previews via Multi-Branch Decoders

DiffusionBrowser: 通过多分支解码器实现交互式扩散预览

Susung Hong, Chongjian Ge, Zhifei Zhang, Jui-Hsien Wang

机构 * University of Washington(华盛顿大学) Adobe Research(Adobe研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 DiffusionBrowser通过多分支解码器实现交互式视频生成预览,提升生成效率与可控性。

Comments Project page: https://susunghong.github.io/DiffusionBrowser

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13290 2025-12-16 cs.CV cs.AI cs.LG 79%

LINA: Learning INterventions Adaptively for Physical Alignment and Generalization in Diffusion Models

LINA: 为扩散模型中的物理对齐和泛化学习适应性干预

Shu Yu, Chaochao Lu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 LINA通过学习适应性干预,提升扩散模型在物理对齐和超出分布指令跟随方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03439 2025-12-16 cs.CV 79%

CleanDIFT: Diffusion Features without Noise

CleanDIFT: 没有噪声的扩散特征

Nick Stracke, Stefan Andreas Baumann, Kolja Bauer, Frank Fundel, Björn Ommer

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CleanDIFT通过无监督微调方法,实现无噪声的高质量扩散特征,显著提升多种任务的性能。

Comments for the project page and code, view https://compvis.github.io/cleandift/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12604 2025-12-16 cs.CV 79%

No Cache Left Idle: Accelerating diffusion model via Extreme-slimming Caching

无空闲缓存:通过极端瘦身缓存加速扩散模型

Tingyan Wen, Haoyu Li, Yihuang Chen, Xing Zhou, Lifei Zhu, Xueqian Wang

机构 * Tsinghua University(清华大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 X-Slim通过双阈值缓存策略,高效利用时间步、块和令牌层面的冗余,实现扩散模型加速,减少延迟并提升生成质量。

Comments Project page: https://thu-accdiff.github.io/xslim-page/ Code: https://github.com/THU-AccDiff/xslim

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12386 2025-12-16 cs.CV 79%

Speedrunning ImageNet Diffusion

ImageNet Diffusion 的速run

Swayam Bhanded

机构 * Swayam Bhanded(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SR-DiT通过整合多种技术,在140M参数模型下达到ImageNet-256的优异性能,为扩散模型研究提供了新的基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12375 2025-12-16 cs.CV 79%

V-Warper: Appearance-Consistent Video Diffusion Personalization via Value Warping

V-Warper:通过价值扭曲实现外观一致的视频扩散个性化

Hyunkoo Lee, Wooseok Jang, Jini Yang, Taehwan Kim, Sangoh Kim, Sangwon Jung, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Korea University(韩国大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 V-Warper通过价值扭曲实现视频扩散模型的无训练粗到细个性化,提升外观一致性与生成质量。

Comments Project Page: https://cvlab-kaist.github.io/V-Warper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12339 2025-12-16 cs.CV cs.LG 79%

Unified Control for Inference-Time Guidance of Denoising Diffusion Models

统一控制用于去噪扩散模型推理时的引导

Maurya Goyal, Anuj Singh, Hadi Jamali-Rad

机构 * Delft University of Technology(代尔夫特理工大学) Shell Global Solutions International B.V.(壳牌全球解决方案国际有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 UniCoDe通过整合采样和梯度引导的方法,实现了更高效的去噪扩散模型推理时引导,提升了任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19004 2025-12-16 cs.CV 79%

A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation

一种用于真实文本到LiDAR场景生成的自条件表示引导扩散模型

Wentao Qu, Guofeng Mei, Yang Wu, Yongshun Gong, Xiaoshui Huang, Liang Xiao

机构 * NJUST(南京理工大学) FBK(弗拉·恩里科·拉达基金会) SDU(山东大学) SJTU(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出T2LDM模型,通过自条件表示引导技术提升文本到LiDAR场景生成的质量和可控性,构建了T2nuScenes基准并改进了生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21531 2025-12-16 eess.IV cs.CV 79%

Patch-Based Diffusion for Data-Efficient, Radiologist-Preferred MRI Reconstruction

基于补丁的扩散模型用于数据高效、放射科医师偏好的MRI重建

Rohan Sanda, Asad Aali, Andrew Johnston, Eduardo Reis, Gordon Wetzstein, Sara Fridovich-Keil

机构 * Stanford University(斯坦福大学) Stanford University School of Medicine(斯坦福大学医学院) Stanford Center for Artificial Intelligence in Medicine and Imaging(斯坦福大学医学与成像人工智能中心) Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于补丁的扩散模型用于高效MRI重建,在小数据集上表现优于现有方法,且被放射科医师认为诊断效果更优。

Comments Code is available at: https://github.com/voilalab/PaDIS-MRI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08783 2025-12-16 cs.CV 79%

DiffPose-Animal: A Language-Conditioned Diffusion Framework for Animal Pose Estimation

DiffPose-Animal: 一种基于语言条件的扩散框架用于动物姿态估计

Tianyu Xiong, Dayi Tan, Wei Tian

机构 * Guanghua Cambridge International School Shanghai(广华剑桥国际学校上海) Shanghai World Foreign Language Academy, WFLA(上海世界外语学院,WFLA) School of Automotive Studies Tongji University(同济大学汽车学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffPose-Animal提出了一种基于语言条件的扩散框架,通过结合大型语言模型和交叉注意力模块,提升动物姿态估计的鲁棒性和泛化能力。

Comments 13pages,2figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20506 2025-12-16 cs.CV 79%

DPBridge: Latent Diffusion Bridge for Dense Prediction

DPBridge: 用于密集预测的潜在扩散桥梁

Haorui Ji, Taojun Lin, Hongdong Li

机构 * The Australian National University(澳大利亚国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DPBridge通过整合结构化视觉先验和改进的反向转移核,提出首个用于密集预测的潜在扩散桥梁框架,有效提升深度估计和表面法线预测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21600 2025-12-16 eess.IV cs.AI cs.CV eess.SP physics.med-ph 79%

Robust Simultaneous Multislice MRI Reconstruction Using Slice-Wise Learned Generative Diffusion Priors

基于切片学习生成扩散先验的鲁棒同时多切片MRI重建

Shoujin Huang, Guanxiong Luo, Yunlin Zhao, Yilong Liu, Yuwan Wang, Kexin Yang, Jingzhe Liu, Hua Guo, Min Wang, Lingyan Zhang, Mengye Lyu

机构 * College of Health Science and Environmental Engineering, Shenzhen Technology University(深圳科技大学健康科学与环境工程学院) University Medical Center Göttingen(哥廷根大学医学中心) Guangdong-Hongkong-Macau CNS Regeneration Institute, Key Laboratory of CNS Regeneration (Jinan University)-Ministry of Education, Jinan University(广东-港澳-澳门神经科学再生研究所,神经科学再生重点实验室(暨南大学)-教育部,暨南大学) Department of Radiology, The First Hospital of Tsinghua University(清华大学第一医院放射科) Center for Biomedical Imaging Research, Department of Biomedical Engineering, School of Medicine, Tsinghua University(清华大学生物医学成像研究中心,生物医学工程系,医学院) Key Laboratory for Biomedical Engineering of Ministry of Education, College of Biomedical Engineering and Instrument Science, Zhejiang University(教育部生物医学工程重点实验室,生物医学工程与仪器科学学院,浙江大学) Department of Endocrinology and Metabolism, Sir Run Run Shaw Hospital, Zhejiang University School of Medicine(浙江大学医学院邵逸夫医院内分泌科) Lab of Molecular Imaging and Medical Intelligence, Department of Radiology, Longgang Central Hospital of Shenzhen (Shenzhen Clinical Medical College, Guangzhou University of Chinese Medicine(分子成像与医学智能实验室,放射科,深圳龙岗中心医院(深圳临床医学院,广州中医药大学;龙岗临床学院,汕头大学医学院)) Longgang Clinical Institute of Shantou University Medical College)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ROGER通过深度生成先验和低频增强模块,实现鲁棒的同时多切片MRI重建,提升解剖和功能成像质量。

Journal ref Published in Medical Image Analysis, Volume 108, 2026, 103851

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13199 2025-12-16 eess.IV cs.CV 79%

Tau Anomaly Detection in PET Imaging via Bilateral-Guided Deterministic Diffusion Model

通过双侧引导确定性扩散模型进行PET成像中的Tau异常检测

Lujia Zhong, Shuo Huang, Jiaxin Yue, Jianwei Zhang, Zhiwei Deng, Wenhao Chi, Yonggang Shi

机构 * Stevens Neuroimaging and Informatics Institute, Keck School of Medicine, University of Southern California(斯蒂文斯神经影像与信息学研究所,凯克医学院,南加州大学) Ming Hsieh Department of Electrical and Computer Engineering, Viterbi School of Engineering, University of Southern California(明希部门电气与计算机工程系,维特比工程学院,南加州大学) Alfred E. Mann Department of Biomedical Engineering, Viterbi School of Engineering, University of Southern California(阿尔弗雷德·E·曼生物医学工程系,维特比工程学院,南加州大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出双侧引导确定性扩散模型,用于提高tau PET成像中局部tau病理的异常检测精度,并在前期筛查中展现应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08930 2025-12-16 cs.CV cs.AI 79%

PADS: Plug-and-Play 3D Human Pose Analysis via Diffusion Generative Modeling

PADS: 通过扩散生成建模实现即插即用的3D人体姿态分析

Haorui Ji, Hongdong Li

机构 * The Australian National University(澳大利亚国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PADS通过扩散生成建模提出了一种即插即用的3D人体姿态分析框架,能够在无需任务特定监督的情况下适应多种姿态分析任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12080 2025-12-16 cs.CV cs.LG 79%

BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models

BAgger: 逆向聚合用于缓解自回归视频扩散模型中的漂移

Ryan Po, Eric Ryan Chan, Changan Chen, Gordon Wetzstein

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 BAgger通过自监督方法缓解自回归视频扩散模型中的漂移问题,利用标准分数或流匹配目标提升长期运动稳定性与视觉一致性。

Comments Project page here: https://ryanpo.com/bagger

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11928 2025-12-16 cs.CV cs.AI 79%

MONET -- Virtual Cell Painting of Brightfield Images and Time Lapses Using Reference Consistent Diffusion

MONET -- 利用参考一致扩散进行明场图像和时间序列的虚拟细胞成像

Alexander Peysakhovich, William Berman, Joseph Rufo, Felix Wong, Maxwell Z. Wilson

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MONET通过参考一致扩散模型从明场图像预测细胞成像通道,解决细胞成像的劳动密集和化学固定限制,实现动态细胞研究的虚拟成像技术。

详情

展开后加载摘要…

URL PDF HTML 收藏