arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-11-25 至 2025-11-25 共收录 127 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 6 篇

2511.18378 2025-11-25 cs.CV 88%

Synthetic Curriculum Reinforces Compositional Text-to-Image Generation

合成课程强化组合文本到图像生成

Shijian Wang, Runhao Fu, Siyi Zhao, Qingqin Zhan, Xingjian Wang, Jiarui Jin, Yuan Lu, Hanqian Wu, Cunjian Chen

机构 * Southeast University(东南大学) Xiaohongshu Inc.(小红书公司) Monash University(墨尔本大学) Shanghai Jiao Tong University(上海交通大学) Anhui University(安徽大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 CompGen通过课程强化学习框架提升文本到图像生成的组合能力,采用场景图和自适应采样算法优化模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17615 2025-11-25 cs.CV cs.AI 88%

Plug-and-Play Multi-Concept Adaptive Blending for High-Fidelity Text-to-Image Synthesis

即插即用多概念自适应混合用于高保真文本到图像合成

Young-Beom Woo

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title,abstract);分类 cs.CV

AI总结 PnP-MIX通过引导外观注意力和掩码引导噪声混合策略,实现高保真文本到图像合成中多概念的无缝整合,无需额外调优。

Comments [Master's thesis, Korea University, 2025]

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17888 2025-11-25 cs.CV 83%

MINDiff: Mask-Integrated Negative Attention for Controlling Overfitting in Text-to-Image Personalization

MINDiff: 集成掩码的负关注用于控制文本到图像个性化中的过拟合

Seulgi Jeong, Jaeil Kim

机构 * Kyungpook National University(庆尚国立大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 MINDiff通过在推理过程中引入负关注机制,有效控制文本到图像个性化中的过拟合问题,无需修改模型架构即可提升文本对齐度和主题保真度。

Comments Accepted at ICCV 2025 Personalization in Generative AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18684 2025-11-25 cs.CV 79%

Now You See It, Now You Don't - Instant Concept Erasure for Safe Text-to-Image and Video Generation

现在你看见它,现在你又看不见 - 用于安全文本到图像和视频生成的即时概念消除

Shristi Das Biswas, Arani Roy, Kaushik Roy

机构 * Purdue University(普渡大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 ICE通过无需训练的一次性权重修改方法,实现文本到图像和视频生成中精确且持久的概念消除,无需额外开销,提升安全性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03726 2025-11-25 cs.CV 77%

DICE: Distilling Classifier-Free Guidance into Text Embeddings

DICE: 将分类器无关引导 distilling 进文本嵌入

Zhenyu Zhou, Defang Chen, Can Wang, Chun Chen, Siwei Lyu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 DICE通过减少计算开销,在保持生成质量的同时,将基于CFG的文本到图像扩散模型转换为无CFG版本,提升图像生成效率。

Comments AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17547 2025-11-25 eess.SP cs.AI cs.CV cs.HC cs.LG 77%

SYNAPSE: Synergizing an Adapter and Finetuning for High-Fidelity EEG Synthesis from a CLIP-Aligned Encoder

SYNAPSE: 适配器与微调协同实现高保真EEG信号到图像的合成

Jeyoung Lee, Hochul Kang

机构 * The Catholic University of Korea(韩国天主大学)

专题命中 文生图 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 SYNAPSE通过结合适配器与微调技术,实现了高保真EEG信号到图像的合成,提升了EEG数据的图像生成质量和跨受体泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 3 篇

2511.18131 2025-11-25 cs.CV 85%

Video4Edit: Viewing Image Editing as a Degenerate Temporal Process

Video4Edit: 将图像编辑视为一种退化的时间过程

Xiaofan Li, Yanpeng Sun, Chenming Wu, Fan Duan, YuAn Wang, Weihao Bo, Yumeng Zhang, Dingkang Liang

机构 * Baidu Inc.(百度公司)

专题命中 图像编辑 :image editing(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 Video4Edit通过将图像编辑视为退化的时间过程,利用视频预训练的单帧演化先验,实现高效的数据微调,从而在性能上与主流模型相当,但仅需1%的监督数据。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18055 2025-11-25 cs.CV cs.AI cs.CL 83%

IE-Critic-R1: Advancing the Explanatory Measurement of Text-Driven Image Editing for Human Perception Alignment

IE-Critic-R1: 推动文本驱动图像编辑的解释性测量以实现人类感知对齐

Bowen Qu, Shangkun Sun, Xiaoyu Liang, Wei Gao

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) Peng Cheng Laboratory, China(鹏城实验室,中国)

专题命中 图像编辑 :image editing(title,abstract);image generation(abstract);分类 cs.CV

AI总结 IE-Critic-R1通过强化学习从可验证奖励提升文本驱动图像编辑的解释性评估,实现与人类感知的对齐。

Comments 18 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17614 2025-11-25 cs.CV cs.LG 57%

HSMix: Hard and Soft Mixing Data Augmentation for Medical Image Segmentation

HSMix:用于医学图像分割的硬软混合数据增强

Danyang Sun, Fadi Dornaika, Nagore Barrena

机构 * University of the Basque Country(巴斯克大学) IKERBASQUE(ikerbasque研究所)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 HSMix通过硬软混合数据增强技术提升医学图像分割性能,结合同质区域混合与亮度调整,增强数据多样性并保留语义信息。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 93 篇

2511.18673 2025-11-25 cs.CV 89%

Edit2Perceive: Image Editing Diffusion Models Are Strong Dense Perceivers

Edit2Perceive: 图像编辑扩散模型是强大的密集感知器

Yiqing Shi, Yiren Song, Mike Zheng Shou

机构 * Peking University(北京大学) Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 Edit2Perceive通过统一的扩散框架,利用图像编辑模型实现更高效的密集感知任务,展示了在深度、法线和磨边任务上的最新成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18262 2025-11-25 cs.CV 85%

MammothModa2: A Unified AR-Diffusion Framework for Multimodal Understanding and Generation

MammothModa2: 一种用于多模态理解和生成的统一AR-扩散框架

Tao Shen, Xin Wan, Taicai Chen, Rui Zhang, Junwen Pan, Dawei Lu, Fanding Lei, Zhilin Lu, Yunfei Yang, Chen Cheng, Qi She, Chang Liu, Zhenbang Sun

机构 * ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 MammothModa2通过统一的AR-扩散框架实现多模态理解和生成,结合自回归语义规划与扩散生成,取得文本到图像和指令编辑的优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16986 2025-11-25 cs.CV 85%

VCE: Safe Autoregressive Image Generation via Visual Contrast Exploitation

VCE:通过视觉对比利用实现安全的自回归图像生成

Feng Han, Chao Gong, Zhipeng Wei, Jingjing Chen, Yu-Gang Jiang

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 VCE通过视觉对比利用方法,有效保护自回归图像生成模型,实现对不安全内容的精确擦除并保持安全内容的完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19434 2025-11-25 cs.CV cs.LG stat.ML 83%

Breaking the Likelihood-Quality Trade-off in Diffusion Models by Merging Pretrained Experts

通过合并预训练专家打破扩散模型中似然-质量权衡

Yasin Esfandiari, Stefan Bauer, Sebastian U. Stich, Andrea Dittadi

机构 * Saarland University(萨尔兰大学) Helmholtz AI(亥姆霍兹人工智能研究所) Technical University of Munich(慕尼黑技术大学) CISPA Helmholtz Center for Information Security(亥姆霍兹信息安全部分研究所) MPI for Intelligent Systems, Tübingen(图宾根智能系统研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 通过在去噪过程中切换预训练专家,该方法有效打破扩散模型中似然与质量的权衡,提升图像生成质量和似然

Comments ICLR 2025 DeLTa workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01421 2025-11-25 cs.CV 83%

InfoScale: Unleashing Training-free Variable-scaled Image Generation via Effective Utilization of Information

InfoScale: 通过有效利用信息实现免训练可变尺度图像生成

Guohui Zhang, Jiangtong Tan, Linjiang Huang, Zhonghang Yuan, Mingde Yao, Jie Huang, Feng Zhao

机构 * USTC(中国科学技术大学) Beihang University(北京航空航天大学) CUHK MMLab(香港中文大学多媒体实验室) Kuaishou Technology(快手科技)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 InfoScale通过有效利用信息解决扩散模型在可变尺度图像生成中的信息丢失、聚合不灵活和分布不匹配问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19379 2025-11-25 cs.LG 82%

Efficiency vs. Fidelity: A Comparative Analysis of Diffusion Probabilistic Models and Flow Matching on Low-Resource Hardware

效率与保真度:扩散概率模型与流匹配在低资源硬件上的比较分析

Srishti Gupta, Yashasvee Taiwade

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 本研究通过比较流匹配与扩散模型在低资源硬件上的性能,发现流匹配在效率和保真度上更优,适合实时生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18900 2025-11-25 cs.GR cs.CV 81%

MatMart: Material Reconstruction of 3D Objects via Diffusion

通过扩散模型进行3D物体的材质重建

Xiuchao Wu, Pengfei Zhu, Jiangjing Lyu, Xinguo Liu, Jie Guo, Yanwen Guo, Weiwei Xu, Chengfei Lyu

机构 * Zhejiang University(浙江大学) Nanjing University(南京大学) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出了一种基于扩散模型的3D物体材质重建框架,通过两阶段重建和视图-材质交叉注意力机制,实现高保真材质预测与生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19274 2025-11-25 cs.CV 79%

Diffusion Reconstruction-based Data Likelihood Estimation for Core-Set Selection

基于扩散重建的数据似然估计的核心集选择

Mingyang Chen, Jiawei Du, Bo Huang, Yi Wang, Xiaobo Zhang, Wei Wang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散重建的数据似然估计方法,通过重建偏差作为评分标准,有效提升核心集选择性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19049 2025-11-25 cs.CV 79%

Beyond Reward Margin: Rethinking and Resolving Likelihood Displacement in Diffusion Models via Video Generation

超越奖励边际:通过视频生成重新思考和解决扩散模型中的似然位移

Ruojun Xu, Yu Kai, Xuhua Ren, Jiaxiang Cheng, Bing Ma, Tianxiang Zheng, Qinhlin Lu

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出PG-DPO方法,通过结合ARS和IPR缓解扩散模型中的似然位移问题,提升视频生成任务的偏好对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18991 2025-11-25 cs.CV 79%

View-Consistent Diffusion Representations for 3D-Consistent Video Generation

用于3D一致视频生成的视图一致扩散表示

Duolikun Danier, Ge Gao, Steven McDonagh, Changjian Li, Hakan Bilen, Oisin Mac Aodha

机构 * University of Edinburgh(爱丁堡大学) University of Bristol(布里斯托大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ViCoDR通过学习多视图一致的扩散表示,提升视频生成的3D一致性,适用于图像到视频、文本到视频和多视图生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18786 2025-11-25 cs.CV 79%

STCDiT: Spatio-Temporally Consistent Diffusion Transformer for High-Quality Video Super-Resolution

STCDiT:一种时空一致的扩散变换器用于高质量视频超分辨率

Junyang Chen, Jiangxin Dong, Long Sun, Yixin Yang, Jinshan Pan

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 STCDiT通过结合运动感知的VAE重建和锚帧指导方法,实现了高质量视频超分辨率,提升了结构保真度和时间一致性。

Comments Project page: https://jychen9811.github.io/STCDiT_page

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18516 2025-11-25 cs.CV 79%

Breaking Forgetting: Training-Free Few-Shot Class-Incremental Learning via Conditional Diffusion

打破遗忘:通过条件扩散实现无训练的少样本类增量学习

Haidong Kang, Ketong Qian, Yi Lu

机构 * Northeastern University(东北大学) School of Information and Intelligent Science(信息与智能科学学院) Whiting School of Engineering(工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出无训练的少样本类增量学习方法,通过条件扩散过程替代梯度优化,缓解灾难性遗忘并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01047 2025-11-25 cs.CV cs.AI cs.CL cs.LG 79%

In-Situ Tweedie Discrete Diffusion Models

原位 Tweedie 离散扩散模型

Xiao Li, Jiaqi Zhang, Shuxiang Zhang, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出原位 Tweedie 离散扩散模型,通过在离散一热空间中直接执行扩散过程,实现对离散任务的有效建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00062 2025-11-25 cs.CV cs.AI cs.LG 79%

Scaffold Diffusion: Sparse Multi-Category Voxel Structure Generation with Discrete Diffusion

Scaffold Diffusion: 通过离散扩散模型生成稀疏多类体素结构

Justin Jung

机构 * Biohub Redwood City, USA(Biohub 红木城,美国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Scaffold Diffusion通过离散扩散模型生成稀疏多类3D体素结构,克服稀疏性带来的挑战,生成逼真且连贯的结构。

Comments Accepted at NeurIPS 2025 Structured Probabilistic Inference & Generative Modeling Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03177 2025-11-25 cs.CV 79%

PanoDiffusion: 360-degree Panorama Outpainting via Diffusion

PanoDiffusion:通过扩散模型实现360度全景补全

Tianhao Wu, Chuanxia Zheng, Tat-Jen Cham

机构 * Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PanoDiffusion通过双模潜在扩散模型实现360度全景补全,提升全景环绕一致性并生成高质量深度全景图。

Comments Project Page: https://sm0kywu.github.io/panodiffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18473 2025-11-25 cs.CV 79%

Uncertainty Quantification in HSI Reconstruction using Physics-Aware Diffusion Priors and Optics-Encoded Measurements

利用物理感知扩散先验和光学编码测量的超光谱图像重建不确定性量化

Juan Romero, Qiang Fu, Matteo Ravasi, Wolfgang Heidrich

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术学院) Shearwater Geoservices(Shearwater地服务公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HSDiff框架,利用物理感知扩散先验和光学编码测量,提升超光谱图像重建的不确定性校准能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18104 2025-11-25 cs.CV 79%

Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning

通过统一多模态伪造学习巩固扩散生成视频检测

Xiaohong Liu, Xiufeng Song, Huayu Zheng, Lei Bai, Xiaoming Liu, Guangtao Zhai

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出MM-Det++算法,通过统一多模态学习检测扩散生成视频,结合时空分支和多模态分支,提升视频伪造检测的准确性和泛化能力。

Comments Code and dataset are available at https://github.com/SparkleXFantasy/MM-Det-Plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17839 2025-11-25 cs.CV 79%

Show Me: Unifying Instructional Image and Video Generation with Diffusion Models

Show Me: 用扩散模型统一指令图像和视频生成

Yujiang Pu, Zhanbo Huang, Vishnu Boddeti, Yu Kong

机构 * Michigan State University(密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ShowMe通过统一视频扩散模型的空间和时间组件,提升指令图像和视频生成的性能与一致性。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13848 2025-11-25 cs.CV cs.LG 79%

SpecDiff: Accelerating Diffusion Model Inference with Self-Speculation

SpecDiff: 通过自推测加速扩散模型推理

Jiayi Pan, Jiaming Xu, Yongkang Zhou, Guohao Dai

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SpecDiff通过自推测引入未来信息,提出无需训练的多级特征缓存策略,实现扩散模型推理的高效加速。

Comments Accepted by AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12953 2025-11-25 cs.CV 79%

Frame-wise Conditioning Adaptation for Fine-Tuning Diffusion Models in Text-to-Video Prediction

基于帧级条件的微调扩散模型用于文本到视频预测

Zheyuan Liu, Junyan Wang, Zicheng Duan, Cristian Rodriguez-Opazo, Anton van den Hengel

专题命中 扩散模型 :diffusion(title);text-to-image(abstract);分类 cs.CV

AI总结 本文提出帧级条件适应方法,通过引入帧级文本嵌入提升文本到视频预测的连续性与生成质量。

Comments Accepted by TMLR, 11/2025. 29 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03931 2025-11-25 cs.CV 79%

MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers

MagicMirror: 视频扩散变换器中的身份保留视频生成

Yuechen Zhang, Yaoyang Liu, Bin Xia, Bohao Peng, Zexin Yan, Eric Lo, Jiaya Jia

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MagicMirror通过双分支特征提取器和两阶段训练策略,在视频扩散变换器中实现高质量身份保留视频生成,优于现有方法。

Comments ICCV 2025, It is best viewed in Acrobat. Project Page: https://julianjuaner.github.io/projects/MagicMirror/

详情

展开后加载摘要…

URL PDF HTML 收藏