arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4228 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4228 篇

2604.21291 2026-04-24 cs.CV cs.AI 57%

Exploring the Role of Synthetic Data Augmentation in Controllable Human-Centric Video Generation

探索合成数据增强在可控人类中心视频生成中的作用

Yuanchen Fei, Yude Zou, Zejian Kang, Ming Li, Jiaying Zhou, Xiangru Huang

机构 * Hunan University(湖南大学) Westlake University(西湖大学) Shanghai Jiaotong University(上海交通大学) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Sun Yat-Sen University(中山大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文研究合成数据对可控人类视频生成的影响,提出基于扩散的框架实现细粒度控制,并通过实验揭示合成与真实数据的互补作用,为高效选择合成样本提升视频真实感提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19129 2026-04-22 cs.CV 57%

PortraitDirector: A Hierarchical Disentanglement Framework for Controllable and Real-time Facial Reenactment

PortraitDirector: 一种用于可控和实时面部重演的分层解耦框架

Chaonan Ji, Jinwei Qi, Sheng Xu, Peng Zhang, Bang Zhang

机构 * Tongyi Lab(通义实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出PortraitDirector框架,通过分层解耦策略实现高保真可控的面部重演,采用空间层和语义层解耦面部运动,并通过优化实现20FPS的实时重演。

Comments accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18267 2026-04-21 cs.CV 57%

MARCO: Navigating the Unseen Space of Semantic Correspondence

MARCO:导航语义对应未知空间

Claudia Cuttano, Gabriele Trivigno, Carlo Masone, Stefan Roth

机构 * Politecnico di Torino(都灵理工大学) TU Darmstadt(德累斯顿理工大学) ELIZA

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 MARCO通过新颖的训练框架提升语义对应泛化能力,在多个数据集上取得新突破,同时更高效且更小。

Comments CVPR 2026 Oral. Project page: https://visinf.github.io/MARCO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01643 2026-04-21 cs.CV 57%

ViT$^3$: Unlocking Test-Time Training in Vision

ViT$^3$:解锁视觉中的测试时间训练

Dongchen Han, Yining Li, Tianyu Li, Zixuan Cao, Ziming Wang, Jun Song, Yu Cheng, Bo Zheng, Gao Huang

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出ViT$^3$,一种线性复杂度的纯测试时间训练模型,通过系统研究揭示了视觉序列建模中TTT设计的六个实用原则,并在多个视觉任务中验证其性能。

Comments CVPR 2026, oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17802 2026-04-21 eess.IV cs.CV 57%

Optimally Bridging Semantics and Data: Generative Semantic Communication via Schrödinger Bridge

最优地弥合语义与数据:通过施罗德桥的生成语义通信

Dahua Gao, Ruichao Liu, Minxi Yang, Shuai Ma, Youlong Wu, Guangming Shi

机构 * School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) Pazhou Lab(琶洲实验室) Peng Cheng Laboratory(鹏城实验室) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于施罗德桥的生成语义通信框架,通过优化传输轨迹减少幻觉和计算成本,改进FID和SSIM并加速推理速度。

Comments 23 pages, 10 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17005 2026-04-21 cs.CV cs.SD 57%

TeMuDance: Contrastive Alignment-Based Textual Control for Music-Driven Dance Generation

TeMuDance: 基于对比对齐的文本控制音乐驱动舞蹈生成

Xinran Liu, Diptesh Kanojia, Wenwu Wang, Zhenhua Feng

机构 * University of Surrey, Guildford, Surrey, UK(萨里大学) Jiangnan University, Wuxi, Jiangsu, China(江南大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出TeMuDance框架,通过统一嵌入空间对齐音乐、文本和运动数据,实现无需手动标注数据的文本控制音乐驱动舞蹈生成,提升语义可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16796 2026-04-21 cs.CV cs.IT eess.SP math.IT 57%

Generative Semantic Communication via Alternating Dual-Domain Posterior Sampling

通过交替双域后验采样实现生成语义通信

Shunpu Tang, Qianqian Yang

机构 * College of Information Science and Electronic Engineering(信息科学与电子工程学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出通过交替双域后验采样提升无线图像传输的感知质量,解决传统方法在数据分布保留和领域间冲突的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13581 2026-04-16 cs.CV 57%

SocialMirror: Reconstructing 3D Human Interaction Behaviors from Monocular Videos with Semantic and Geometric Guidance

SocialMirror: 从单目视频中利用语义和几何引导重建3D人体交互行为

Qi Xia, Peishan Cong, Ziyi Wang, Yujing Sun, Qin Sun, Xinge Zhu, Mao Ye, Ruigang Yang, Yuexin Ma

机构 * ShanghaiTech University(上海科技大学) Nanyang Technological University(南洋理工大学) Guangzhou Institute of Energy Conversion, CAS(广州能源研究所,中国科学院) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Inceptio Technology(Inceptio科技) Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SocialMirror框架,通过语义和几何引导解决单目视频中人体重建的挑战,实现高精度交互行为重建,展现强大的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16385 2026-04-16 cs.CV 57%

Adaptive Multi-Scale Channel-Spatial Attention Aggregation Framework for 3D Indoor Semantic Scene Completion Toward Assisting Visually Impaired

自适应多尺度通道-空间注意力聚合框架用于3D室内语义场景补全以协助视障人士

Qi He, XiangXiang Wang, Jingtao Zhang, Yongbin Yu, Hongxiang Chu, Manping Fan, JingYe Cai, Zhenglin Yang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出自适应多尺度注意力聚合框架,解决2D到3D特征提升中的噪声扩散和多尺度融合结构不稳定问题,通过通道-空间注意力机制和分层自适应门控策略提升小物体和桌子的识别精度,实验表明在NYUv2基准上mIoU达27.88%。

Comments We need to optimize the experiment, the changes are quite significant

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13028 2026-04-15 cs.CV 57%

Conflated Inverse Modeling to Generate Diverse and Temperature-Change Inducing Urban Vegetation Patterns

融合反演建模生成多样且能引起温度变化的城区植被模式

Baris Sarper Tezcan, Hrishikesh Viswanath, Rubab Saher, Daniel Aliaga

机构 * Computer Science(计算机科学) Forestry and Natural Resources(林业与自然资源)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出融合预测正模与扩散基生成反模的反演框架,用于生成多样且符合特定温度目标的城区植被模式,解决传统方法在数据稀少时无法捕捉模糊性的不足。

Comments Accepted to the CVPR 2026 EarthVision Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12322 2026-04-15 cs.CV 57%

Self-Adversarial One Step Generation via Condition Shifting

通过条件位移实现自对抗一步生成

Deyuan Liu, Peng Sun, Yansen Han, Zhenglin Cheng, Chuyan Chen, Tao Lin

机构 * Westlake University(西拉丘学院) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Peking University(北京大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出APEX框架,通过条件位移内生提取对抗信号,实现无需外部判别器的一步生成,提升生成质量与推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11964 2026-04-15 cs.HC cs.MM 57%

When Drawing Is Not Enough: Exploring Spontaneous Speech with Sketch for Intent Alignment in Multimodal LLMs

当绘画不够时:探索通过草图进行意图对齐的自发性言语在多模态大语言模型中的应用

Weiyan Shi, Dorien Herremans, Kenny Tsu Wei Choo

专题命中 可控生成 :image generation(abstract);分类 cs.MM

AI总结 本文探讨了在多模态大语言模型中,通过草图与自发性言语的结合来提升设计初期意图对齐的效果,通过实验表明加入自发性言语能显著提高生成图像的意图匹配度。

Comments Accepted at DIS 2026 PWiP

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11843 2026-04-15 cs.CV 57%

UniMark: Unified Adaptive Multi-bit Watermarking for Autoregressive Image Generators

UniMark: 为自回归图像生成器设计的统一自适应多比特水印方案

Yigit Yilmaz, Elena Petrova, Mehmet Kaya, Lucia Rossi, Amir Rahman

机构 * Bandırma Onyedi Eylül University(班迪马奥克西迪埃普大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 UniMark提出一种无需训练的统一水印框架,解决自回归图像生成中水印嵌入能力弱、安全性和通用性差的问题,通过自适应语义分组、块级多比特编码和统一令牌替换接口实现高质量图像保护和多比特信息传输。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10940 2026-04-14 cs.CV 57%

AmodalSVG: Amodal Image Vectorization via Semantic Layer Peeling

AmodalSVG:基于语义层剥离的模态图像向量化

Juncheng Hu, Ziteng Xue, Guotao Liang, Anran Qi, Buyu Li, Sheng Wang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University(北京航空航天大学软件学院) Igarashi Lab, The University of Tokyo(东京大学五十岚实验室) Bambu Lab Department of Computer Science, The University of Hong Kong(香港大学计算机科学系)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 AmodalSVG通过语义层剥离技术,实现对自然图像中遮挡区域的完整几何向量化,提升SVG的结构编辑能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14671 2026-04-14 cs.CV 57%

Mirai: Autoregressive Visual Generation Needs Foresight

Mirai: 自回归视觉生成需要前瞻性

Yonghao Yu, Lang Huang, Zerun Wang, Runyi Li, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国立信息学研究所) Peking University(北京大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 研究探讨前瞻性训练信号对自回归视觉生成的影响,提出Mirai框架通过注入未来信息提升生成质量与收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10132 2026-04-14 cs.CV cs.AI 57%

Semantic Manipulation Localization

语义操控定位

Zhenshan Tan, Chenhan Lu, Yuxiang Huang, Ziwen He, Xiang Zhang, Yuzhe Sha, Xianyi Chen, Tianrun Chen, Zhangjie Fu

机构 * Engineering Research Center of Digital Forensics, Ministry of Education, Nanjing University of Information Science and Technology(南京信息工程大学数字取证教育部工程研究中心) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) KOKONI3D, Moxin (Hangzhou) Technology Company Ltd.(KOKONI3D,魔芯(杭州)科技有限公司)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 本文提出语义操控定位任务,通过TRACE框架实现对图像中微妙语义编辑的定位,优于传统IML方法,提供更完整的定位结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10030 2026-04-14 cs.CV 57%

Prompt Relay: Inference-Time Temporal Control for Multi-Event Video Generation

提示中继:多事件视频生成的推理时时间控制

Gordon Chen, Ziqi Huang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Prompt Relay方法,通过在交叉注意力机制中引入惩罚项,实现多事件视频生成中的细粒度时间控制,提升文本-视频对齐和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22437 2026-04-13 cs.CV 57%

EmoCtrl: Controllable Emotional Image Content Generation

EmoCtrl:可控的情感图像内容生成

Jingyuan Yang, Weibin Luo, Hui Huang

机构 * CSSE, Shenzhen University(深圳大学计算机科学与软件工程学院)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 EmoCtrl通过结合内容描述与目标情绪生成图像,实现内容忠实与情绪表达的平衡,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09201 2026-04-13 cs.CV 57%

CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation

CT-1:视觉-语言-相机模型将空间推理知识转移到相机可控的视频生成

Haoyu Zhao, Zihao Zhang, Jiaxi Gu, Haoran Chen, Qingping Zheng, Pin Tang, Yeyin Jin, Yuang Zhang, Junqi Cheng, Zenghui Lu, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent(腾讯) Xiamen University(厦门大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CT-1模型,通过准确估计相机轨迹将空间推理知识转移到视频生成中,利用小波正则化损失和视频扩散模型提升相机控制精度,实验显示其生成的视频质量高且控制准确率提升25.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06982 2026-04-13 cs.CV cs.AI 57%

IntrinsicWeather: Controllable Weather Editing in Intrinsic Space

IntrinsicWeather: 内在空间中可控的天气编辑

Yixin Zhu, Zuo-Liang Zhu, Jian Yang, Miloš Hašan, Jin Xie, Beibei Wang

机构 * Nanjing University(南京大学) Nankai University(南开大学) NVIDIA(英伟达)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出IntrinsicWeather框架,通过内在空间编辑实现可控天气生成,利用内在映射提升大场景控制能力,并在合成与真实数据集上验证其优越性。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05091 2026-04-13 cs.CV 57%

PoseGen: In-Context LoRA Finetuning for Pose-Controllable Long Human Video Generation

PoseGen: 一种基于上下文LoRA微调的长人类视频生成框架

Jingxuan He, Busheng Su, Finn Wong

机构 * Xiaoice, China(小冰公司,中国) The University of Sydney, Australia(悉尼大学,澳大利亚)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PoseGen通过上下文LoRA微调实现对人物姿态的精细控制,生成长时长视频,解决了身份漂移和视频长度限制问题。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12623 2026-04-10 cs.CV cs.CL 57%

Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space

思维中的推理:潜在空间中的动态多模态交错

Chengzhi Liu, Yuzhe Yang, Yue Fan, Qingyue Wei, Sheng Liu, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Stanford University(斯坦福大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出DMLR框架,通过动态潜在策略梯度优化和视觉注入策略,在潜在空间中实现视觉与文本的动态交错推理,提升多模态推理性能并保持高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07966 2026-04-10 cs.CV 57%

Lighting-grounded Video Generation with Renderer-based Agent Reasoning

基于渲染的视频生成与基于代理的推理

Ziqi Cai, Taoyu Yang, Zheng Chang, Si Li, Han Jiang, Shuchen Weng, Boxin Shi

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(北京大学计算机学院国家视觉技术工程研究中心) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) OpenBayes Information Technology Co., Ltd.(北京开贝信息技术有限公司) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LiVER框架,通过显式3D场景属性条件生成可控视频,结合轻量条件模块和渐进训练策略,实现高保真和精确控制,适用于图像到视频和视频到视频的合成。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07900 2026-04-10 cs.CV cs.AI 57%

AnomalyAgent: Agentic Industrial Anomaly Synthesis via Tool-Augmented Reinforcement Learning

AnomalyAgent:通过工具增强强化学习进行代理工业异常合成

Jiaming Su, Tengchao Yang, Ruikang Zhang, Zhengan Yan, Haoyu Sun, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学) Fudan University(复旦大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出AnomalyAgent,通过工具增强强化学习生成高语义真实性的工业异常样本,采用闭环优化和两阶段训练框架,实现自我反思与迭代改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11633 2026-04-10 cs.CV 57%

MV-SAM3D: Adaptive Multi-View Fusion for Layout-Aware 3D Generation

MV-SAM3D:面向布局感知的多视图融合3D生成

Baicheng Li, Dong Wu, Jun Li, Shunkai Zhou, Zecui Zeng, Lusong Li, Hongbin Zha

机构 * Peking University(北京大学) JD Explore Academy(京东探索研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 MV-SAM3D通过多视图一致性与物理合理性提升3D生成质量,无需额外训练,实现更可信的布局生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21714 2026-04-09 cs.CV 57%

AstraNav-World: World Model for Foresight Control and Consistency

AstraNav-World:面向前瞻性控制与一致性的世界模型

Jintao Chen, Junjun Hu, Haochen Bai, Minghua Luo, Xinda Xue, Botao Ren, Chengyu Bai, Shichao Xie, Ziyi Chen, Fei Liu, Zedong Chu, Xiaolong Wu, Mu Xu, Shanghang Zhang

机构 * Amap Alibaba(高德阿里巴巴)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出AstraNav-World,通过统一的概率框架联合推理未来视觉状态与动作序列,提升开放动态环境中的导航轨迹精度与成功率,实验表明其在真实场景中具备零样本适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09646 2026-04-09 cs.CV 57%

VHOI: Controllable Video Generation of Human-Object Interactions from Sparse Trajectories via Motion Densification

VHOI:通过运动稠密化从稀疏轨迹生成可控的人-物交互视频

Wanyue Zhang, Lin Geng Foo, Thabo Beeler, Rishabh Dabral, Christian Theobalt

机构 * MPI for Informatics, SIC(马克斯·普朗克信息学研究所,SIC) VIA Center(VIA中心) Google(谷歌)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 VHOI通过运动稠密化将稀疏轨迹转化为HOI掩码序列,再通过视频扩散模型生成可控的人-物交互视频,提出了一种新颖的HOI-aware运动表示,增强了模型对真实交互动态的理解与生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00503 2026-04-08 cs.CV 57%

Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models

Diff4Splat:基于潜在动态重建模型的可控4D场景生成

Panwang Pan, Chenguo Lin, Jingjing Zhao, Chenxin Li, Yuchen Lin, Haopeng Li, Honglei Yan, Kairun Wen, Yunlong Lin, Yixuan Yuan, Yadong Mu

机构 * Peking University(北京大学) Xiamen University(厦门大学) CUHK(香港中文大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Diff4Splat通过单张图像和相机轨迹生成可控的4D场景,结合视频扩散模型的生成先验与大规模4D数据集学习的几何和运动约束,在单次前向传递中直接预测可变形3D高斯场,无需测试时优化。

Comments Accepted to CVPR 2026. Project page: https://paulpanwang.github.io/Diff4Splat

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05731 2026-04-08 cs.CV 57%

FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips

FoleyDesigner:基于精确时空对齐的沉浸式立体声 Foley 生成

Mengtian Li, Kunyan Dai, Yi Ding, Ruobing Ni, Ying Zhang, Wenwu Wang, Zhifeng Xie

机构 * Shanghai Film Academy, Shanghai University(上海大学上海电影学院) Shanghai Engineering Research Center of Motion Picture Special Effects(上海电影特效工程技术研究中心) University of Surrey, UK(英国萨里大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出 FoleyDesigner 框架,结合视频分析与可控 Foley 生成,引入 FilmStereo 数据集,实现高质量立体声生成与专业音频混合,提升电影沉浸体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18093 2026-04-08 cs.CV 57%

One-to-More: High-Fidelity Training-Free Anomaly Generation with Attention Control

一至多:基于注意力控制的高保真无训练异常生成

Haoxiang Rao, Zhao Wang, Chenyang Si, Yan Lyu, Yuanyi Duan, Fang Zhao, Caifeng Shan

机构 * Nanjing University(南京大学) China Mobile Zijin Innovation Institute(中国移动紫金创新研究院) Shandong University of Science and Technology(山东科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出O2MAG方法,通过自注意力机制生成更真实的异常,解决传统方法训练耗时且分布不真实的问题,实验表明其在下游任务中表现更优。

Comments Accepted by CVPR2026. Code: https://github.com/echrao/O2MAG

详情

展开后加载摘要…

URL PDF HTML 收藏