arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3080 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2359 篇

2607.25275 2026-07-29 cs.CV cs.AI 新提交 70%

ScaleResfusion: Residual Rectified Flow based on Residual Vector Field

ScaleResfusion:基于残差向量场的残差整流流

Zhenning Shi, Chen Xu, Junhao Zhang, Kefei Zhang, Linjie Liu, Zhedong Zheng, Tao Li

机构 * Nankai University(南开大学) University of Macau(澳门大学) Csiro Data 61(联邦科学与工业研究组织数据61部) Beihang University(北京航空航天大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究旨在解决现实世界图像恢复问题,提出ScaleResfusion框架,核心是残差整流流,从低质量图像出发学习残差向量场,结合知识蒸馏降低采样成本,实验证明其高效且性能优,为图像恢复提供实用可扩展方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23492 2026-07-28 cs.CV cs.LG 新提交 70%

To Erase, or Not to Erase: Robust Training-Free Concept Erasure with Preservation aware Adaptive Ranked Subspace Expansion

擦除还是不擦除:基于保留感知自适应排序子空间扩展的无训练鲁棒概念擦除

Shaswati Saha, Rajasekhar Anguluri, Manas Gaur

机构 * University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究针对文本到图像扩散模型的概念擦除技术面临的鲁棒性与效用权衡问题,提出无训练框架PARSE,通过自适应发现擦除与保留概念、编辑交叉注意力值空间及迭代搜索触发因素来实现鲁棒概念擦除,引入BEUS评估,实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22531 2026-07-27 cs.CV 新提交 70%

Twins: Learn to Predict Unified Representations with Focal Loss

Twins:使用焦点损失学习预测统一表示

Kaixiong Gong, Xin Cai, Bin Lin, Hao Wang, Yunlong Lin, Mingzhe Zheng, Bohao Li, Jian-Wei Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Xiangyu Yue

机构 * Tencent-Hunyuan(腾讯混元)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究统一多模态模型潜在空间不匹配问题,提出Twins统一连续令牌空间。因联合建模有优化不平衡,采用焦点回归目标解决,在ImageNet上有gFID增益,在多模态理解基准测试中表现好,还提高了重建保真度。

Comments ICML 2026. Code: https://github.com/Tencent-Hunyuan/Twins

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21326 2026-07-24 cs.CV 新提交 70%

SlerpFlow: Spherical Trajectory Correction for Rectified Flow Inversion

SlerpFlow:用于整流流反演的球形轨迹校正

Wenbin Duan, Yan Shu, Zhuoyuan Fu, Fangmin Zhao, Yan Li, Yaru Zhao, Binyang Li

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究针对基于整流流的图像生成中反演难题,提出SlerpFlow方法,基于流形假设,整合球形线性插值校正流速度方向,缓存校正速度,实现高精度反演,提升重建保真度与编辑语义对齐,无需额外训练。

Comments 16 pages. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18516 2026-07-22 cs.LG cs.CV 新提交 70%

Signed Rectified Flow: Negativity-Controlled Generation

带符号整流流:负性控制生成

Runlong Liao, Baiyu Su, Lizhang Chen, Qiang Liu

机构 * UT Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 研究提出带符号整流流(Signed RF),通过推广整流流,基于带符号测度构建生成模型,能将概率集中在正区域并排除负区域。分析其连续性方程并给出解释,推动实用算法,在多应用中提升性能,改进了保真度 - 多样性权衡等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17833 2026-07-21 cs.CV 新提交 70%

Consistent Feature Transport for Image Relighting

用于图像重光照的一致特征传输

Bohan Zhang, Huanwei Liang, Yuhan He, Hongteng Xu, Quxiao Chao, Luoqi Liu, Dixin Luo, Ting Liu

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) MT Lab, Meitu Inc.(美图公司MT实验室) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究图像重光照问题,提出一致特征传输(CFT)方法,基于整流流通过轨迹级监督联合建模噪声到图像生成及光照一致的源到目标传输,构建数据集实验验证,该方法能改进重光照并推广到其他编辑任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13685 2026-07-16 cs.CV 新提交 70%

DNA: Dual-stage Native Attribution for Generated Image Source Tracing

DNA:用于生成图像源追踪的双阶段原生归因

Chao Wang, Kejiang Chen, Zijin Yang, Yaofei Wang, Yuang Qi, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对图像生成中家族内变体源追踪难题,提出双阶段原生归因(DNA)框架。粗粒度用 AEDR 筛选,细粒度用 NPC 归因。构建 DNA-30K 基准,实验表明 DNA 准确率高,优于基线,为图像源追踪提供有效方法。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13300 2026-07-16 cs.CV 新提交 70%

Improving Medical Image Generative Models with Fréchet Distance Loss

用弗雷歇距离损失改进医学图像生成模型

Andrew Marshall, Xuanang Xu, Xiaoran Zhang, Rui Wang, Lawrence Staib, James Duncan

机构 * Yale University(耶鲁大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究针对扩散生成模型难以捕捉异质性肿瘤复杂形态特征的问题,提出用弗雷歇距离损失微调模型,通过在多数据集上集成该损失,提升了下游分割网络性能,证明其是改进医学图像生成模型临床工作流程的有效正则化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11233 2026-07-14 cs.CV 新提交 70%

Structure-Detail Decoupled Autoregressive Generation for Fast and High-Fidelity Virtual Try-On

用于快速和高保真虚拟试穿的结构-细节解耦自回归生成

Lu Yang, Xiaonan Hu, Yanan Li, Daqi Liu, Xiang Bai, Hao Lu

机构 * Huazhong University of Science and Technology(华中科技大学) Wuhan Institute of Technology(武汉工程大学) Xiaomi EV(小米汽车)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究虚拟试穿问题,提出STAR-VTON框架,通过解耦潜在空间结构合成与像素空间细节恢复,结合匹配信息细化器,实现高效高保真虚拟试穿,其中VAR-VTON效率高,像素空间细化器能有效恢复细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11196 2026-07-14 cs.CV 新提交 70%

Slot-RAE: Streamlining Object-Centric Learning via Direct Representation Auto-Encoders

Slot-RAE:通过直接表示自动编码器简化以对象为中心的学习

Alexandre Chapin, Emmanuel Dellandrea, Liming Chen

机构 * LIRIS(里昂图像与信息系统实验室) Ecole Centrale de Lyon(里昂中央理工学院)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 研究针对以对象为中心的模型部署问题,提出Slot-RAE框架,直接在视觉基础模型特征空间运行,采用特征空间扩散过程及独特训练方式,在COCO数据集实验中取得领先成果,实现高效无监督对象发现等,速度和计算效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06432 2026-07-08 cs.LG cs.AI cs.CV 新提交 70%

TILDE: TILt-based Distributional Erasure for Concept Unlearning

TILDE:基于倾斜的概念遗忘分布擦除

Naveen George, Naoki Murata, Yuhta Takida, Konda Reddy Mopuri, Yuki Mitsufuji

机构 * Indian Institute of Technology Hyderabad(印度理工学院海得拉巴分校) Sony AI(索尼人工智能公司) Sony Group Corporation(索尼集团公司)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 文本到图像扩散模型的概念遗忘研究中,提出TILDE方法,将概念遗忘视为分布对齐问题,通过能量倾斜的无锚点目标抑制概念图像,用残差∇-GFlowNet训练实例化,实验显示其在多方面实现强大遗忘效果,提升保留率和分布保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05088 2026-07-07 cs.CV 新提交 70%

RADIANCE: Relative Adaptive Denoising with IP-Adapter for Novel Concept Enhancement

RADIANCE:使用IP-适配器进行相对自适应去噪以增强新颖概念

Zi-Xiang Ni, Bo-Lun Huang, Teng-Fang Hsiao, Bo-Kai Ruan, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对文本到图像扩散模型合成罕见概念的问题,提出无训练框架RADIANCE,通过三个模块组件增强预训练主干,经实验验证其能提升合成效果。

Comments Accepted to ECCV 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04674 2026-07-07 cs.CV 新提交 70%

Video Generation Models Are Inherent Lighting Estimators

视频生成模型是内在的光照估计器

Ziqi Cai, Shuchen Weng, Kaiqi Liu, Zifeng Wang, Zhiquan Zhang, Minggui Teng, Han Jiang, Boxin Shi

机构 * Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) OpenBayes Information Technology Co., Ltd.(北京智谱华章科技有限公司)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 研究从单张自然视频恢复动态环境图的问题,核心方法是将光照估计重构为引导视频修复任务,贡献是提出V-LITE框架,能生成连贯HDR环境图,证明视频扩散模型可估计物理场景光照。

Comments Project Page: https://caiziqi.com/research/vlite/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03580 2026-07-07 cs.LG cs.CV 新提交 70%

When Geometry Aligns: Dihedral Hidden-State Transformations in UNet, ViT, and DiT Architectures

当几何对齐时:UNet、ViT和DiT架构中的二面体隐藏状态变换

Mojtaba Faramarzi, Alex Lamb, Irina Rish

机构 * University of Montreal(蒙特利尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 研究通过将二面体群基于反射的元素应用于中间隐藏状态作为受控内部干预,对比几何一致和不一致变体,分析特征稳定性和几何漂移,发现一致变换可提高稳定性,为稳定隐藏状态干预确立关键原则。

Comments Accepted at the Conference on Lifelong Learning Agents (CoLLAs), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03488 2026-07-07 cs.CV 新提交 70%

Learning to Generate Multiple Objects from Dense and Occluded Layouts

从密集和遮挡布局中学习生成多个对象

Bach-Hoang Ngo, Si-Tri Ngo, Hieu Le, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City(胡志明市科学大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究文本到图像扩散模型在密集场景中对象计数错误问题,提出布局感知注意力偏差和无模态平衡损失方法,引入基准测试,提高计数准确性并防止实例合并且保持图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03470 2026-07-07 cs.CV 新提交 70%

PhysMirror: Physics-Aware Mirror Object Generation

物理镜像:物理感知镜像对象生成

Xuan-Bach Mai, Duy-Phuc Nguyen, Quoc-Van Le, Tam V. Nguyen, Thanh-Toan Do, Huu Le, Duong-Van Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City(胡志明市科学大学) Vietnam National University, Ho Chi Minh City(胡志明市越南国家大学) University of Dayton(代顿大学) Monash University(莫纳什大学) VinFast(VinFast公司) VinUniversity(Vin大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对现代文本到图像扩散模型合成物理精确镜像反射的挑战,提出物理感知生成框架PhysMirror,通过3D空间先验执行投影几何,引入评估指标,实验表明其在反射精度等方面优于基线。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00832 2026-07-07 cs.CV cs.AI 新提交 70%

Pano2World: End-to-End 3D Generation via Unified Multi-View Sequences

Pano2World: 通过统一多视图序列进行端到端三维生成

Zhenjia Li, Jinrang Jia, Yifeng Shi

机构 * Ke Holdings Inc.(贝壳找房)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出Pano2World方法,利用全景扩散模型和视图感知注意力路由,从单张室内全景图直接生成可探索的三维高斯场景,解决多步管道误差累积和视频模型灵活性不足的问题。

Comments 10 pages, 3 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02322 2026-07-03 cs.RO cs.CV 新提交 70%

The Moving Eye: Enhancing VLA Spatial Generalization via Hybrid Dynamic Data Collection

移动之眼:通过混合动态数据收集增强VLA空间泛化能力

Jincheng Tang, Yilong Zhu, Zhengyuan Xie, Jiang-Jiang Liu, Jiaxing Zhang

机构 * Lion Rock AI Lab, China Merchants Research Institute of Advanced Technology(狮岩人工智能实验室,中国商人先进科技研究院) The Hong Kong University of Science and Technology(香港科学与技术大学) Nankai University(南开大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 针对VLA模型空间泛化脆弱性问题,提出混合动态数据策略,结合连续相机运动与多样静态视角,减少虚假相关性,提升对未见相机位姿和物体配置的泛化能力。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02428 2026-07-03 eess.IV cs.CV physics.med-ph 新提交 70%

Self-Auditing Residual Drifting for Pathology-Preserving Accelerated Knee MRI

自审计残差漂移模型用于保留病理特征的加速膝关节MRI

Qing Lyu, Jianxu Wang, Mohammad Kawas, Ge Wang, Christopher T. Whitlow

机构 * Department of Radiology & Biomedical Imaging, Yale School of Medicine(放射学与生物医学成像系,耶鲁医学院) Department of Biomedical Engineering, Rensselaer Polytechnic Institute(生物医学工程系,伦塞拉尔理工学院)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 提出SA-RDM-DC模型,通过物理条件残差漂移生成和自审计机制,在加速膝关节MRI中实现高保真重建并保留病理特征,优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00428 2026-07-02 cs.CV 新提交 70%

HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding

HyFL-CLIP: 用于鲁棒长上下文理解的CLIP双曲微调

Ji Ha Jang, Hayeon Kim, Chulwon Lee, Junghun James Kim, Se Young Chun

机构 * Dept. of Electrical and Computer Engineering(电气与计算机工程系) IPAI INMC & AIIS(智能计算与人工智能研究所) Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 提出HyFL-CLIP,通过双曲空间微调CLIP,利用跨流形相似性蒸馏和爱因斯坦中点聚合建模层次蕴含关系,提升长上下文理解鲁棒性,在文本扰动下长文本跨模态检索提升高达19.5%。

Comments Accepted to ECCV 2026. Project page: https://janeyeon.github.io/hyflclip

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31326 2026-07-01 cs.CV 新提交 70%

Bridging Video Understanding and Generation in a Unified Framework

桥接视频理解与生成的统一框架

Yuqi Wang, Runyi Li, Ruoyu Feng, Renjie Chen, Wenfeng Lin, Mingyu Guo

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出Vega统一框架,通过共享词汇表联合建模文本与视觉表示,结合自回归预测关键帧语义令牌与扩散模型渲染密集视频帧,在视频生成和理解基准上均取得强性能。

Comments technical blog

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25234 2026-06-25 cs.CV 新提交 70%

Structuring Sparsity: Block-Sparse Featurizers Capture Visual Concept Manifolds

结构化稀疏:块稀疏特征化器捕获视觉概念流形

Thomas Fel, Matthew Kowal, Mozes Jacobs, Dron Hazra, Usha Bhalla, Lee Sharkey, Lucius Bushnaq, Satchel Grant, Tal Haklay, Thomas Icard, Can Rager, Michael Pearce, Daniel Wurgaft, Aiden Swann, Fenil Doshi, Siddharth Boppana, Curt Tigges, Nick Cammarata, Thomas Serre, Vasudev Shyam, Owen Lewis, Thomas McGrath, Jack Merullo, Ekdeep Singh Lubana, Atticus Geiger

机构 * Goodfire Harvard University(哈佛大学) Stanford University(斯坦福大学) Brown University(布朗大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出块稀疏特征化器(BSF)来建模视觉概念流形,通过最小描述长度分析证明其比方向基特征化器更紧凑,并应用于解释曲线检测、发现新流形及控制图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24206 2026-06-24 cs.CV cs.AI 新提交 70%

Inclusive Interactive Collisions for Multi-View Consistent Compositional 3D Generation

包容性交互碰撞:多视图一致组合式3D生成

Chang Liu, Mingwen Shao, Xiang Lv, Xinyuan Chen, Lingzhuang Meng, Qiao Zhang, Zhengyi Gong, Jinghao Hu

机构 * School of Computer Science and Technology, China University of Petroleum (East China)(中国石油大学(华东)计算机科学与技术学院) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳理工大学人工智能研究院) College of Computer Science, Northwest University(西北大学计算机科学学院)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出I2C-3D方法,通过包容性交互碰撞策略和多视图自适应分数蒸馏采样,实现多视图一致、物理合理的组合式3D场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21146 2026-06-23 cs.CV 新提交 70%

ChronoLock: Protecting Videos from Unauthorized Text-to-Video Personalization

ChronoLock: 保护视频免受未经授权的文本到视频个性化

Jiaming He, Jiashu Zhang, Guanyu Hou, Shuhan Ye, Hanwei Zhu, Yi Yu, Xudong Jiang

机构 * Nanyang Technological University(南洋理工大学) Jilin University(吉林大学) The University of Manchester(曼彻斯特大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对文本到视频个性化中的未经授权微调风险,提出ChronoLock框架,通过扰动时间去噪轨迹破坏运动学习过程,有效降低运动模仿质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19676 2026-06-19 cs.CV cs.AI 新提交 70%

TeleMorpher: Toward Robust Simultaneous Motion-Location Editing

TeleMorpher: 迈向鲁棒的同步运动-位置编辑

Haengbok Chung

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出TeleMorpher,一种基于扩散模型的一步式框架,通过运动先验、姿态扭曲和基线运动编辑器注入,实现视频中主角运动与位置的同步编辑,在定量和定性评估中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18765 2026-06-18 cs.CV 新提交 70%

SpectralDiT: Timestep-Conditioned Spectral Residual Correction for Flow-Matching DiTs

SpectralDiT:流匹配DiT的时间步条件谱残差校正

Jiayu Tian

机构 * Peking University(北京大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 提出SpectralDiT,通过时间步条件谱残差校正模块,在CIFAR-10和ImageNet-100上以极少额外计算和参数提升流匹配DiT的生成质量,FID分别降低5.1%和8.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14700 2026-06-15 cs.CV 新提交 70%

RepFusion: Leveraging Multimodal Priors for Denoising in Representation Space

RepFusion:利用多模态先验在表示空间中进行去噪

Xichen Pan, Aashu Singh, Satya Narayan Shukla, Xiangjun Fan, Shlok Kumar Mishra, Saining Xie

机构 * Meta AI New York University(纽约大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出RepFusion方法,利用多模态大语言模型作为噪声表示编码器,为扩散变压器提供条件信号,在相似推理预算下优于新初始化解码器基线。

Comments Project Page: https://xichenpan.com/repfusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12213 2026-06-11 cs.CV 新提交 70%

SHERPA: Seam-aware Harmonized ERP Adaptation for Open-Domain 360$^\circ$ Panorama Generation

SHERPA: 面向开放域360°全景生成的无缝感知协调ERP适配

Jungwoon Kang, Jaehun Kim, Yiwon Yu, Hyungyum Jang, Sanghoon Lee, Jongyoo Kim

机构 * Yonsei University(延世大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出SHERPA框架,通过频率选择性圆形RoPE、圆形潜编码/解码、图像侧FFN适配器和双路径训练方案,实现从平面扩散模型到360°全景的轻量级适配,支持逼真和风格化全景生成。

Comments 29 pages, 23 figures, 5 tables. Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10892 2026-06-10 cs.CV cs.AI 新提交 70%

Improving Text-Instance Alignment Of Foreground Conditioned Out-Painting Via Customized Concept Embedding

通过定制化概念嵌入改进前景条件外绘中的文本-实例对齐

Yihao Zhao, Xuan Han, Bin He, Mingyu You

机构 * College of Electronic and Information Engineering, Tongji University, Shanghai, China(电子信息工程学院,同济大学,上海,中国) State Key Laboratory of Autonomous Intelligent Unmanned Systems, Frontiers Science Center for Intelligent Autonomous Systems, Ministry of Education, Shanghai, China(自主智能无人系统国家重点实验室,智能自主系统前沿科学中心,教育部,上海,中国)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 针对前景条件外绘中文本驱动方法产生的伪影问题,提出定制化概念嵌入扩散框架,通过实例感知损失和语义保持提示模板定制概念嵌入,显著减少伪影并提升图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07145 2026-06-08 cs.CV 新提交 70%

Consistent-Inversion: Reverse Consistency Guidance for Structure-Preserving Visual Editing

Consistent-Inversion: 用于结构保持视觉编辑的反向一致性引导

Xiaocheng Lu, Jingcai Guo, Song Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 提出Consistent-Inversion,一种无训练的反向一致性引导框架,通过检查中间目标轨迹能否在源提示下反向到源反转轨迹,并利用反向一致性差异校正早期去噪步骤,在保持结构的同时提升编辑效果。

Comments Submitted to IEEE Transactions on Multimedia; 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏