arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3280 信号源:cs.CV, cs.GR, cs.MM

1. 图像修复 51 篇

2607.05354 2026-07-07 cs.CV 新提交 57%

Geometric Reciprocity: Unlocking Self-Supervision for Stereoscopic Video Generation

几何互易性:解锁立体视频生成的自监督能力

Jingyi Lu, Kai Han

机构 * Visual AI Lab, The University of Hong Kong, Hong Kong, China(香港大学视觉人工智能实验室)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 针对单目转立体任务中立体修复依赖稀缺标注数据的问题,提出几何互易性定理,构建自监督框架,从海量单目视频学习,性能远超现有无监督、监督SOTA方法。

Comments Accepted to ICML 2026. Project page: https://visual-ai.github.io/grt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02952 2026-07-07 cs.CV cs.AI 新提交 57%

Pooling-Based Context Modeling for Convolution-Free Deep Image Prior

基于池化的无卷积深度图像先验的上下文建模

Gihyun Kim, Jong-Seok Lee

机构 * Yonsei University(延世大学)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 研究提出Pool-DIP,一种无卷积架构,通过基于池化的对比建模捕捉空间上下文,提升去噪性能,减少参数和计算复杂度,在多数据集表现良好,还能用于其他图像恢复任务。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00522 2026-07-02 cs.CV 新提交 57%

Restore3D: Breathing Life into Broken Objects with Shape and Texture Restoration

Restore3D:通过形状和纹理修复为破损物体注入生机

Xiaolong Shen, Zongxin Yang, Yi Yang

机构 * ReLER, CCAI, Zhejiang University(ReLER、CCAI、浙江大学)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 提出Restore3D框架,利用多视图图像同时修复破损物体的几何形状和纹理,通过自动数据生成、掩码自感知模块和深度感知掩码修正器生成高分辨率多视图图像,再经粗到细重建获得带纹理的3D网格。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27576 2026-06-29 cs.CV 新提交 57%

DeLux: Cross-Modal Local Artifact Restoration in Video Using Neuromorphic Data

DeLux: 利用神经形态数据进行视频中的跨模态局部伪影修复

Bartosz Stachowiak, Dariusz Brzezinski

机构 * Institute of Computing Science, Poznan University of Technology(波兹南技术大学计算机科学学院)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 提出DeLux,一种利用神经形态事件流作为结构先验,引导RGB视频中光照伪影检测与修复的跨模态修复方法,在合成和真实数据上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21910 2026-06-23 cs.CV 新提交 57%

Fidelity- and Perception-Aware Local Implicit Attention for Arbitrary-Scale Image Super-Resolution

保真度与感知感知的局部隐式注意力用于任意尺度图像超分辨率

Yu-Syuan Xu, Hao-Lun Sun, Hao-Wei Chen, Hsien-Kai Kuo, Chun-Yi Lee

机构 * National Taiwan University(国立台湾大学) MediaTek Inc.(联发科技股份有限公司)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 提出FPLIA框架,通过融合保真度导向特征与扩散管道,结合FPAM和FPSM模块,在任意尺度超分辨率中实现高感知真实度与重建精度。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17557 2026-06-17 cs.CV 新提交 57%

Universal Image Restoration via Internalized Chain-of-Thought Reasoning

通过内化思维链推理的通用图像恢复

Yu Guo, Zhengru Fang, Shengfeng He, Senkang Hu, Yihang Tao, Phone Lin, Yuguang Fang

机构 * Hong Kong JC Lab of Smart City and Department of Computer Science, City University of Hong Kong(香港城市大学智慧城市香港联合实验室及计算机科学系) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院) Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与信息工程学系)

专题命中 图像修复 :image editing(abstract);分类 cs.CV

AI总结 提出CoTIR框架,将思维链推理内化到单个预训练编辑模型中,通过可微拉格朗日优化实现混合退化下的通用图像恢复,在5.2M样本基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16396 2026-06-16 cs.CV eess.IV 新提交 57%

SP$^3$: Spherical Priors for Plug-and-Play Restoration

SP$^3$:用于即插即用恢复的球面先验

Sean Man, Ron Raphaeli, Matan Kleiner, Or Ronai

机构 * Technion – Israel Institute of Technology(以色列理工学院) Independent Researcher(独立研究员)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 提出SP$^3$算法,用球面编码器替代去噪器作为生成先验,通过半二次分裂实现快速图像恢复,速度比零样本扩散方法快3-630倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09516 2026-06-09 cs.CV 新提交 57%

SwiftVR: Real-Time One-Step Generative Video Restoration

SwiftVR:实时一步生成式视频恢复

Jiaqi Yan, Xiangyu Chen, Xinlin Zhong, Haibin Huang, Chi Zhang, Jie Liu, Jiantao Zhou, Xuelong Li

机构 * State Key Laboratory of Internet of Things for Smart City, Department of Computer and Information Science, University of Macau(澳门大学智慧城市物联网国家重点实验室) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI)) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 提出SwiftVR,一种流式一步生成式视频恢复框架,通过因果分块协议、无掩码移位窗口自注意力和轻量级恢复感知自编码器,在消费级GPU上实现实时高清视频恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07090 2026-06-08 cs.CV 新提交 57%

Detecting Temporally Localized Manipulations in Authentic Video Streams

检测真实视频流中的时间局部操纵

Okan Umur, Ali Emre Güşlü, Ibrahim Delibasoglu

机构 * Okan Umur Ali Emre Güşlü Ibrahim Delibasoglu

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 针对真实视频中插入短时逼真操纵片段难以检测的问题,提出新数据集并评估两种方法:基于DINOv3特征的线性探针和连续帧相似性方法,建立初步基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11572 2026-08-13 cs.LG physics.comp-ph 新提交 50%

RECAST: A Machine-Learning Framework for Correction and Super-Resolution of Coarse-Grid PDE Solvers

RECAST:用于粗网格PDE求解器校正与超分辨率的机器学习框架

Maryam Reza, Farbod Faraji

专题命中 图像修复 :diffusion(abstract)

AI总结 该研究提出机器学习框架RECAST,可在保留粗网格PDE演化的同时降低约50%-92%的时间平均相对误差,实现更粗网格的高精度PDE模拟,为高维数值模拟加速提供概念验证。

Comments 29 pages, 24 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04378 2026-08-06 cs.SD cs.LG eess.AS 新提交 50%

Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation

助力音乐协同创作智能体“良好聆听”:用于理解与生成的分层自监督世界模型

Scott H. Hawley

机构 * Belmont University(贝尔蒙特大学)

专题命中 图像修复 :inpainting(abstract)

AI总结 本研究提出分层自监督世界模型,通过Swin V2编码器与条件流匹配模型构建协同音乐创作智能体,提升了和弦与调式检测准确率,可快速生成音乐建议并支持交互演示。

Comments 20 pages, 14 figures. A 6-page version was submitted to the NeurIPS 2026 Creative AI Track. Supplemental website with listening examples: https://drscotthawley.github.io/midi-rae-jepa-son/. Live demo: https://drscotthawley-midi-rae-jepa-son.hf.space/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27308 2026-07-31 cs.LG q-bio.NC 新提交 50%

ZUNA1.1: A more flexible EEG foundation model for Denoising and Super-resolution

ZUNA1.1:一种更灵活的用于去噪和超分辨率的脑电图(EEG)基础模型

Christopher Warner, Jonas Mago, JR Huml, Beren Millidge

机构 * Zyphra

专题命中 图像修复 :diffusion(abstract)

AI总结 研究推出3.8亿参数的EEG基础模型ZUNA1.1,其灵活性远超原模型ZUNA1,在EEG去噪与重建任务中性能达标且显著优于MNE包的球形样条插值,已以Apache 2.0许可开源发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25147 2026-07-29 cs.AI 新提交 50%

Inferring Missing Trajectory Data with Temporal Convolutional Networks

使用时间卷积网络推断缺失的轨迹数据

Ilinca Tiriblecea, Gabriel Turinici

机构 * CEREMADE, Université Paris Dauphine - PSL, CNRS(巴黎第九大学 - 巴黎文理研究大学、法国国家科学研究中心决策数学与经济实验室)

专题命中 图像修复 :inpainting(abstract)

AI总结 针对现实中轨迹数据常缺失的问题,提出用带对称扩张的时间卷积网络进行轨迹修复,放宽因果关系约束,利用组合损失训练,在含随机掩码片段的合成数据集上训练,取得良好的R²、MSE和MAE指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12571 2026-07-15 cs.RO 新提交 50%

TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action Backdoors

TrustVLA:针对视觉-语言-动作后门的机制引导推理时防御

Pinhan Fu, Xianda Guo, Xuetao Li, Wenke Huang, Ruilin Wang, Weiheng Zhao, Wei Sui, Mang Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机科学学院) D-Robotics(D-机器人公司) HUST(华中科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 图像修复 :inpainting(abstract)

AI总结 研究视觉-语言-动作模型中毒后门问题,通过两种攻击识别出紧凑因果足迹机制,基于此提出TrustVLA防御,能检测异常证据演变、定位支持并恢复观测,在多评估中降低攻击成功率且保持干净任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14800 2026-06-16 stat.ME cs.LG eess.IV stat.ML 新提交 50%

Bridging data-driven priors via the score function for posterior sampling -- Comparative review and experimental study

通过得分函数桥接数据驱动先验进行后验采样——比较综述与实验研究

Elhadji Cisse Faye, Mame Diarra Fall, Sylvain Delchini, Nicolas Dobigeon

机构 * IDP, Univ Orléans(IDP,奥尔良大学) LITIS, Univ Rouen Normandie(LITIS,鲁昂-诺曼底大学) Bureau de Recherches Géologiques et Minières Orléans, France(奥尔良地质与矿业研究局,法国) IRIT, Univ Toulouse(图卢兹大学IRIT)

专题命中 图像修复 :inpainting(abstract)

AI总结 本文综述了贝叶斯逆问题中多种数据驱动先验如何通过得分函数统一,并展示其在采样算法中的有效集成,通过图像修复和超分辨率实验验证了方法的效率与通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 个性化与一致性 76 篇

2607.07173 2026-07-09 cs.CV 新提交 90%

Stage-Aware Adaptation and Distribution Calibration for Subject-Driven Personalized Text-to-Image Generation

用于主题驱动的个性化文本到图像生成的阶段感知适应与分布校准

Wenyan Xu, Alizer Wong

机构 * School of Computer Science, Guangdong University of Technology(广东工业大学计算机学院) School of Computer Science, Peking University(北京大学计算机学院) ManXis(未知)

专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);personalized generation(abstract)

AI总结 研究主题驱动的个性化文本到图像生成问题,提出将其分解为训练端的 SPaRa 和推理端的 DCAL 两个互补组件的框架 SPaRa-DCAL,通过理论分析和实验表明该框架能提升相关指标,并指出应综合多方面评估个性化生成。

Comments 16 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09244 2026-08-11 cs.CV 新提交 89%

In-Loop Model Adaptation with Coupled Latent-Noise Guidance for High-Fidelity Subject-Driven Text-to-Image Generation

用于高保真主体驱动文本到图像生成的耦合潜在噪声引导的循环内模型适配

Yushun Tang, Weiming Chen, Siyi Liu, Yi Zhang, Feng Wu, Zhihai He

机构 * Southern University of Science and Technology(南方科技大学) University of Science and Technology of China(中国科学技术大学) Pengcheng Lab(鹏城实验室)

专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究针对主体驱动文本到图像生成中参考图像变化时模型难适配且难保持主体身份的问题,提出IMA方法,通过耦合潜在噪声损失引导循环内模型适配,提升了生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26171 2026-06-26 cs.CV cs.AI 新提交 85%

LCG: Long-Context Consistent Image Generation with Sparse Relational Attention

LCG: 基于稀疏关系注意力的一致长上下文图像生成

Zihao Wang, Yijia Xu, Haoze Zheng, Xuran Ma, Haokun Gui, Harry Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出LCG框架,利用稀疏关系注意力(SRA)和路由一致性约束(RCC),在长序列图像生成中保持语义和外观一致性,并构建了大规模数据集LCCD进行训练和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11885 2026-07-14 cs.CV cs.GR 新提交 84%

Latent-Identity Tuning in Text-to-Image Personalization Models

文本到图像个性化模型中的潜在身份调整

Daniel Garibi, Ronen Kamenetsky, Hadar Averbuch-Elor, Daniel Cohen-Or, Or Patashnik

机构 * Tel Aviv University(特拉维夫大学) Cornell University(康奈尔大学)

专题命中 个性化与一致性 :text-to-image(title,abstract);image editing(abstract);分类 cs.CV、cs.GR

AI总结 研究文本到图像个性化模型中细粒度身份调整问题,利用预训练冻结编码器潜在空间,无需额外训练,通过揭示潜在语义方向实现局部、细粒度且语义连贯的面部编辑,经实验验证有效。

Comments Project page at: https://garibida.github.io/IdentityTuning/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20336 2026-08-21 cs.CV 新提交 83%

WithEveryone: Unified Planning and Identity Grounding for Group Image Generation

WithEveryone:面向群体图像生成的统一规划与身份定位

Hengyuan Xu, Qixun Wang, Yiji Cheng, Miles Yang, Zhao Zhong, Wei Cheng, Xingjun Ma, Yu-gang Jiang

机构 * Fudan University(复旦大学) Hunyuan, Tencent(腾讯混元) The University of Hong Kong(香港大学)

专题命中 个性化与一致性 :image generation(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对多人物群体图像生成的身份保留难题,提出WithEveryone框架,通过布局定位身份损失等技术,提升了人脸相似度并降低伪影,实现高身份覆盖率与低重复率。

Comments Project Page: doby-xu.github.io/WithEveryone/ ;Code will be released: github.com/Doby-Xu/WithEveryone/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26742 2026-07-30 eess.AS cs.AI cs.SD 新提交 82%

Zero-Shot Face-to-Speech Synthesis via Latent Space Adaptation of a Style-Diffusion TTS Model

基于Style-Diffusion TTS模型潜在空间适配的零样本人脸到语音合成

Carlos Muñoz-Romero, Jose A. Gonzalez-Lopez

专题命中 个性化与一致性 :diffusion(title,title_cn)

AI总结 该研究提出基于StyleTTS 2的人脸到语音合成框架,通过人脸适配器实现静态人脸到语音的零样本生成,在LRS3数据集上验证了效果,且映射具有语言无关性。

Comments 5 pages, 1 figure, 5 tables, submitted to IberSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16866 2026-06-16 cs.CV 新提交 81%

Redirecting the Flow: Image Customization through Attention Distribution Shift

重定向流:通过注意力分布偏移实现图像定制

Jie Li, Suorong Yang, Jian Zhao, Furao Shen

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) School of Computer Science, Nanjing University(南京大学计算机科学与技术学院) School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院)

专题命中 个性化与一致性 :diffusion(abstract,abstract_cn);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出基于最大熵理论的Conditional Attention Distribution Shift方法,通过双分支架构CustomShift实现高效主题驱动图像生成,在DreamBooth和Custom101基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19719 2026-08-21 cs.CV cs.AI 新提交 79%

Scale-Separated Conditioning for Style-Encoder-Free Diffusion Stylization

用于无风格编码器的扩散风格化的尺度分离条件设置

Jingtao Zhang, Haorui Gao, Youqing Liang, Zeming Liu

机构 * College of Computing, Georgia Institute of Technology(佐治亚理工学院计算学院) Courant Institute of Mathematical Sciences, New York University(纽约大学柯朗数学科学研究所) Department of Computer Science, Brown University(布朗大学计算机科学系)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出无风格编码器的扩散风格化框架SEFS,通过单张图像低分辨率裁剪形成风格令牌,在未配对单张图像上训练,提升艺术风格化的内容一致性等性能,代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25622 2026-07-29 cs.CV 新提交 79%

Beyond Facial Consistency: Personalized Person Image Generation with Holistic Identity Preservation

超越面部一致性:具有整体身份保留的个性化人物图像生成

Yuxuan Xiao, Shanshan Zhang, Jian Yang, Shengcai Liao

机构 * Black Forest Labs(黑森林实验室)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 研究个性化人物图像生成中面部保真度与外观一致性权衡问题,提出双分支基线及动态平衡缩放策略DBS,由自适应时间门控和区域感知优化组成,实验表明DBS比现有基线更好,为整体身份建模提供可控框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25390 2026-07-29 cs.CV 新提交 79%

Noise-Free One-Step LoRA for Task-Driven Image Restoration with Diffusion Priors

基于扩散先验的无噪声单步LoRA用于任务驱动的图像恢复

Jaeha Kim, Kyoung Mu Lee

机构 * Seoul National University(首尔国立大学) IPAI, Seoul National University(首尔国立大学IPAI)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对退化图像影响下游任务的问题,提出基于扩散先验的无噪声单步LoRA方法用于任务驱动的图像恢复,通过特定适配模块及新训练策略,经实验验证该方法在多任务上优于先前方法且具泛化能力。

Comments Code: https://github.com/JaehaKim97/NOLA-IR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23673 2026-07-28 cs.CV 新提交 79%

Contrastive Parameter Disentanglement for Multi-modal Remote Sensing Image Generation

用于多模态遥感图像生成的对比参数解缠

Yu Zhang, Wenda Zhao, Haojun Tang, Haipeng Wang

机构 * School of Information and Communication Engineering, Dalian University of Technology(大连理工大学信息与通信工程学院) Unit 92728 of PLA(中国人民解放军92728部队)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 针对现有遥感图像生成方法局限,提出对比参数解缠框架,通过对比参数解缠模块、解缠优化策略及查询-键结构转移机制,实现多模态遥感图像高质量生成,在相关任务中性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10538 2026-07-14 cs.HC cs.CV cs.CY 新提交 79%

Navigating the Open-Source Model Ecosystem: An Empirical Study of Creator Practices in Artistic Image Generation

探索开源模型生态系统:艺术图像生成中创作者实践的实证研究

Yiluo Wei, Yupeng He, Qiming Ye, Gareth Tyson

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 本文针对开源图像生成生态系统中创作者模型使用行为展开实证研究,构建含600万张图像及生成元数据的数据集,关联基础模型与LoRA模型使用情况,揭示其优劣势,公开数据集,为创作者和研究人员提供参考。

Comments Accepted to MM'26: The 34th ACM International Conference on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10165 2026-07-14 cs.CV cs.AI 新提交 79%

EmoStyle: Affective Conditioning of Style-Specialist Experts for Emotional Image Generation

EmoStyle:用于情感图像生成的风格专家情感调节

Dexiang Hong, Yijie Guo, Weidong Chen, Xinyan Liu, Zixuan Zou, Zhendong Mao, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 针对情感感知艺术图像生成中训练与测试时属性不一致造成的控制差距问题,提出EmoStyle框架,利用语言模型推理器预测情感线索,编码情感字段指导生成,训练专用LoRA适配器结合风格表达情感,经视觉语言模型引导排序,在挑战赛中获佳绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06389 2026-07-08 cs.CV 新提交 79%

FADRA: Frequency-Aware Diffusion with Residual Adaptation for Video Face Restoration

FADRA:用于视频人脸识别的频率感知扩散与残差自适应

Jin Jiang, Jia Wang, Panwen Hu, Weiran Zhao, Shengcai Liao

机构 * United Arab Emirates University (UAEU)(阿联酋大学) Ocean University of China (OUC)(中国海洋大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对视频人脸识别在复杂退化下难以平衡空间保真度和时间连贯性的问题,提出FADRA框架,利用预训练模型的时间一致性,通过LoRA适配器、重复残差自适应头及频率感知损失等实现,实验证明其在恢复面部结构和保持时间一致性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17619 2026-06-17 cs.CV 新提交 79%

RAVA: Retrieval-Augmented Viewpoint Alignment for Subject-Driven Image Generation

RAVA: 检索增强的视角对齐用于主题驱动图像生成

Qiwei Yan, Zhiqiang Yuan, Chongyang Li, Jiapei Zhang, Ying Deng, Jinchao Zhang, Jie Zhou

机构 * WeChat AI, Tencent Inc.(腾讯微信人工智能实验室)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 提出RAVA框架,通过检索增强提供几何证据,解决跨主体视角对齐中的视角漂移和结构不匹配问题,在保持身份的同时实现可靠视角控制。

详情

展开后加载摘要…

URL PDF HTML 收藏