arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11875
2603.22466 2026-03-25 cs.CV cs.AI cs.HC cs.MM

Color When It Counts: Grayscale-Guided Online Triggering for Always-On Streaming Video Sensing

颜色何时重要:灰度引导的在线触发用于始终开启的流视频感知

Weitong Cai, Hang Zhang, Yukai Huang, Shitong Sun, Jiankang Deng, Songcen Xu, Jifei Song, Zhensong Zhang

机构 * Queen Mary University of London(伦敦皇后玛丽大学) Independent Researcher(独立研究者) Durham University(杜伦大学) Imperial College London(伦敦帝国学院) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 本文提出灰度引导的在线触发方法,通过减少颜色捕获频率,在资源受限设备上实现高效流视频感知,实验显示其在保持性能的同时显著降低能耗。

Comments Accepted at CVPR 2026 (Main track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19609 2026-03-25 cs.CV cs.AI cs.RO

LoD-Loc v3: Generalized Aerial Localization in Dense Cities using Instance Silhouette Alignment

LoD-Loc v3:基于实例轮廓对齐的密集城市中通用航空视觉定位

Shuaibang Peng, Juelin Zhu, Xia Li, Kun Yang, Maojun Zhang, Yu Liu, Shen Yan

机构 * National University of Defense Technology(国防科技大学) Northwestern Polytechnical University(西北工业大学)

AI总结 LoD-Loc v3通过实例轮廓对齐和合成数据生成提升密集城市中的航空视觉定位性能,克服了现有方法在跨场景和密集建筑场景中的局限。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09798 2026-03-25 cs.CV

Test-time Ego-Exo-centric Adaptation for Action Anticipation via Multi-Label Prototype Growing and Dual-Clue Consistency

测试时自体-外体适应用于动作预见的多标签原型生长与双线索一致性

Zhaofeng Shi, Heqian Qiu, Lanxiao Wang, Qingbo Wu, Fanman Meng, Lili Pan, Hongliang Li

机构 * University of Electronic Science and Technology of China(电子科学与技术大学)

AI总结 本文提出TE²A任务,通过多标签原型生长模块和双线索一致性模块实现测试时自体-外体适应,提升动作预见性能,实验表明优于现有方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08809 2026-03-25 cs.CV

Where, What, Why: Toward Explainable 3D-GS Watermarking

何处、何物、为何:迈向可解释的3D-GS水印

Mingshu Cai, Jiajun Li, Osamu Yoshie, Yuya Ieiri, Yixuan Li

机构 * Waseda University(早稻田大学) Southeast University(东南大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出一种原生表示框架,通过三专家模块和安全预算感知门实现水印载体选择和质量保护,结合通道组掩码提升水印鲁棒性和可解释性,相比现有方法在PSNR和比特精度上均有提升。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07057 2026-03-25 cs.CV

SODA: Sensitivity-Oriented Dynamic Acceleration for Diffusion Transformer

SODA:面向敏感性的动态加速方法用于扩散变换器

Tong Shao, Yusen Fu, Guoying Sun, Jingde Kong, Zhuotao Tian, Jingyong Su

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 SODA通过细粒度敏感性分析动态调整缓存与剪枝策略,提升扩散变换器在可控加速比下的生成质量,实验表明其生成保真度达到最优。

Comments 23 pages, CVPR 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02098 2026-03-25 cs.IR cs.CL cs.CV

Efficient and High-Fidelity Omni Modality Retrieval

高效且高保真的多模态检索

Chuong Huynh, Manh Luong, Abhinav Shrivastava

机构 * University of Maryland, College Park, USA(美国马里兰大学 College Park 分校) Monash University(墨尔本大学)

AI总结 本文提出OmniRet模型,解决多模态检索中的计算效率与表示保真度问题,通过注意力机制和改进的池化方法提升三模态(文本、视觉、音频)检索性能,并引入新的音频中心多模态基准测试。

Comments CVPR 2026. Project page: https://hmchuong.github.io/omniret

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23029 2026-03-25 cs.CV

WISER: Wider Search, Deeper Thinking, and Adaptive Fusion for Training-Free Zero-Shot Composed Image Retrieval

WISER:更广的搜索、更深入的思考和自适应融合用于无训练零样本复合图像检索

Tianyue Wang, Leigang Qu, Tianyu Yang, Xiangzhao Hao, Yifan Xu, Haiyun Guo, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) National University of Singapore(新加坡国立大学) Wuhan AI Research(武汉人工智能研究院) Minzu University of China(民族大学)

AI总结 WISER通过'检索-验证-细化'流程统一文本到图像和图像到图像检索,显式建模意图和不确定性意识,实现更广泛的搜索和更深入的思考,提升零样本复合图像检索性能。

Comments Accept to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22625 2026-03-25 cs.GR cs.CV

DiffBMP: Differentiable Rendering with Bitmap Primitives

DiffBMP:基于位图原语的可微渲染

Seongmin Hong, Junghun James Kim, Daehyeop Kim, Insoo Chung, Se Young Chun

机构 * INMC(智能媒体中心) IPAI(图像处理与人工智能研究所) Dept. of ECE, Seoul National University(首尔国立大学电子与计算机工程系)

AI总结 DiffBMP通过高效可微渲染引擎解决传统渲染器对矢量图形的限制,支持位图图像优化,具备高并行处理能力,可在1分钟内完成千级位图原语的参数优化。

Comments Accepted to CVPR 2026, https://diffbmp.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21395 2026-03-25 cs.CV

Momentum Memory for Knowledge Distillation in Computational Pathology

动量记忆用于计算病理学中的知识蒸馏

Yongxin Guo, Hao Lu, Onur C. Koyun, Zhengjie Zhu, Muhammet Fatih Demir, Metin Nafi Gurcan

机构 * Wake Forest University School of Medicine(威克森林大学医学院)

AI总结 本文提出MoMKD框架,通过动量更新的记忆机制整合基因组和病理学信息,提升跨模态知识蒸馏性能,实验表明其在病理学任务中表现优异。

Comments Accepted by CVPR 2026. Code: https://github.com/CAIR-LAB-WFUSM/MoMKD

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18993 2026-03-25 cs.CV

SeaCache: Spectral-Evolution-Aware Cache for Accelerating Diffusion Models

SeaCache: 基于频谱演化的缓存加速扩散模型

Jiwoo Chung, Sangeek Hyun, MinKyu Lee, Byeongju Han, Geonho Cha, Dongyoon Wee, Youngjun Hong, Jae-Pil Heo

机构 * Sungkyunkwan University(顺天乡大学) NAVER Cloud(NAVER云)

AI总结 本文提出SeaCache缓存机制,通过频谱对齐表示提升扩散模型推理效率,实验证明其在延迟与质量之间取得最优平衡。

Comments Accepted to CVPR 2026. Project page:https://jiwoogit.github.io/SeaCache

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01047 2026-03-25 cs.CV cs.AI

Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidance

残差解码:通过历史感知残差引导减轻大视觉-语言模型中的幻觉

Xinrong Chen, Xu Chu, Yingmin Qiu, Hengyuan Zhang, Jing Xiong, Shiyu Tang, Shuai Liu, Shaokang Yang, Cheng Yang, Hayden Kwok-Hay So, Ngai Wong

机构 * Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Hong Kong(香港大学) ByteDance Inc.(字节跳动公司)

AI总结 本文提出残差解码方法,通过利用历史信息辅助解码,纠正大视觉-语言模型中的语言先验偏差,有效抑制幻觉并提升视觉接地能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11336 2026-03-25 cs.CV

UFVideo: Towards Unified Fine-Grained Video Cooperative Understanding with Large Language Models

UFVideo:迈向统一的细粒度视频协作理解的大型语言模型

Hewen Pan, Cong Wei, Dashuang Liang, Zepeng Huang, Pengfei Gao, Ziqi Zhou, Lulu Xue, Pengfei Yan, Xiaoming Wei, Minghui Li, Shengshan Hu

机构 * Huazhong University of Science and Technology(华中科技大学) Meituan(美团)

AI总结 UFVideo通过统一多粒度协作理解能力,实现视频理解的全面覆盖,展示了其在多粒度视频任务中的灵活性和优势。

Comments CVPR 2026 Camera Ready, Github Code: https://github.com/Heven-Pan/UFVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02982 2026-03-25 cs.CV cs.RO

U4D: Uncertainty-Aware 4D World Modeling from LiDAR Sequences

U4D:从LiDAR序列中构建不确定性感知的4D世界模型

Xiang Xu, Alan Liang, Youquan Liu, Linfeng Li, Lingdong Kong, Ziwei Liu, Qingshan Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) Nanjing University of Posts and Telecommunications(南京邮电大学) SKL-TI

AI总结 本文提出U4D框架,通过估计空间不确定性图和分阶段生成方法,提升LiDAR序列的几何精度和时间一致性,推动自动驾驶感知与模拟的可靠性。

Comments CVPR 2026; 20 pages, 7 figures, 11 tables; Code at https://github.com/worldbench/U4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02487 2026-03-25 cs.CV cs.AI

Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understanding

掩码至关重要:解锁LLMs的三维场景-语言理解的空间推理能力

Yerim Jeon, Miso Lee, WonJun Moon, Jae-Pil Heo

机构 * Sungkyunkwan University(庆尚国立大学)

AI总结 本文提出3D-SLIM掩码策略,通过适应性注意力掩码提升LLMs在三维场景-语言理解中的空间推理能力,解决传统因果掩码导致的顺序偏差和注意力受限问题。

Comments Accepted to CVPR 2026. GitHub Page: https://github.com/Jyerim/3D-SLIM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01248 2026-03-25 cs.CV

TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition

TRivia: 基于视觉-语言模型的自监督微调用于表格识别

Junyuan Zhang, Bin Wang, Qintong Zhang, Fan Wu, Zichen Wen, Jialin Lu, Junjie Shan, Ziqi Zhao, Shuya Yang, Ziling Wang, Ziyang Miao, Huaping Zhong, Yuhang Zang, Xiaoyi Dong, Ka-Ho Chow, Conghui He

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学) Sensetime

AI总结 TRivia通过自监督微调方法,使预训练视觉-语言模型直接从未标注的表格图像中学习表格识别,无需人工标注,提升了表格识别性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20996 2026-03-25 cs.CV

From Inpainting to Layer Decomposition: Repurposing Generative Inpainting Models for Image Layer Decomposition

从修复到层分解:重新利用生成修复模型进行图像层分解

Jingxi Chen, Yixiao Zhang, Xiaoye Qian, Zongxia Li, Cornelia Fermuller, Caren Chen, Yiannis Aloimonos

机构 * University of Maryland(马里兰大学) Amazon(亚马逊)

AI总结 本文提出利用生成修复模型进行图像层分解,通过轻量级微调和多模态上下文融合模块,实现更精确的物体移除和遮挡恢复,提升下游编辑和创意应用的可能性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17181 2026-03-25 cs.CV cs.LG cs.SD

Investigating self-supervised representations for audio-visual deepfake detection

探究用于音频-视觉深度伪造检测的自监督表示

Dragos-Alexandru Boldisor, Stefan Smeu, Dan Oneata, Elisabeta Oneata

机构 * Bitdefender Politehnica Bucharest(巴蒂亚努大学)

AI总结 本文系统评估了自监督表示在多模态和多领域中的检测效果、信息可解释性和跨模态互补性,发现音频引导的表示在深度伪造检测中表现最佳。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03334 2026-03-25 cs.CV

UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions

UniAVGen:基于非对称跨模态交互的统一音频视频生成

Guozhen Zhang, Zixiang Zhou, Teng Hu, Ziqiao Peng, Youliang Zhang, Yi Chen, Yuan Zhou, Qinglin Lu, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Tencent Hunyuan(腾讯文英) Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 UniAVGen通过非对称跨模态交互机制和双分支联合合成架构,实现了音频视频的统一生成,提升同步精度和语义一致性,实验表明其在较少训练样本下表现更优。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04338 2026-03-25 cs.CV cs.AI

From Editor to Dense Geometry Estimator

从编辑器到密集几何估计器

JiYuan Wang, Chunyu Lin, Lei Sun, Rongying Liu, Lang Nie, Mingxing Li, Kang Liao, Xiangxiang Chu

机构 * BJTU(北京工业大学) Alibaba Group(阿里巴巴集团) CQUPT(重庆大学) NTU(国立科技大学)

AI总结 本文分析了编辑器和生成器在密集几何估计中的微调行为,提出FE2E框架,通过改进编辑模型的训练目标和精度处理,实现了零样本单目深度和法线估计的显著提升。

Comments Accepted to CVPR 2026, 18pages, with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22564 2026-03-25 cs.CV cs.AI cs.LG

PRISM: Video Dataset Condensation with Progressive Refinement and Insertion for Sparse Motion

PRISM:基于渐进细化和插入的稀疏运动视频数据集压缩

Jaehyun Choi, Jiwan Hur, Gyojin Han, Jaemyung Yu, Junmo Kim

机构 * Korea AI Safety Institute, ETRI(韩国人工智能安全研究所,ETRI) KAIST(韩国科学技术院) NAVER AI Lab(NAVER AI实验室)

AI总结 PRISM通过将视频视为统一的时空结构,解决视频处理计算成本高和时空依赖性难题,实现高效存储与复杂运动的保留。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22271 2026-03-24 cs.CV

DUO-VSR: Dual-Stream Distillation for One-Step Video Super-Resolution

DUO-VSR:双流蒸馏用于一步视频超分辨率

Zhengyao Lv, Menghan Xia, Xintao Wang, Kwan-Yee K. Wong

机构 * The University of Hong Kong(香港大学) Huazhong University of Science and Technology(华中科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

AI总结 DUO-VSR提出双流蒸馏策略,通过轨迹保留蒸馏、双流优化和偏好引导细化,解决视频超分辨率中训练不稳定和监督不足的问题,提升视觉质量和效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22264 2026-03-24 cs.RO

UniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human Videos

UniDex:一种机器人基础套件,用于从第一人称人类视频中实现通用灵巧手控制

Gu Zhang, Qicheng Xu, Haozhe Zhang, Jianhan Ma, Long He, Yiming Bao, Zeyu Ping, Zhecheng Yuan, Chenhao Lu, Chengbo Yuan, Tianhai Liang, Xiaoyu Tian, Maanping Shao, Feihong Zhang, Mingyu Ding, Yang Gao, Hao Zhao, Hang Zhao, Huazhe Xu

机构 * Tsinghua University(清华大学) Shanghai Qizhi Institute(上海启智研究院) Sun Yat-sen University(中山大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出UniDex,通过机器人中心数据集、统一视觉-语言-动作策略和实用人类数据采集设置,实现通用灵巧手控制。UniDex-VLA在两项不同手的挑战性工具使用任务中达到81%的平均任务进度,优于现有VLA基线。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22187 2026-03-24 cs.CV cs.AI

Seeing is Improving: Visual Feedback for Iterative Text Layout Refinement

视觉反馈提升布局:用于迭代文本布局优化的视觉反馈

Junrong Guo, Shancheng Fang, Yadong Qu, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学)

AI总结 本文提出VFLM模型,通过视觉反馈迭代优化文本布局,提升生成质量,实验表明其优于现有方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22125 2026-03-24 cs.CV

DA-VAE: Plug-in Latent Compression for Diffusion via Detail Alignment

DA-VAE:通过细节对齐实现扩散模型的插件式潜在压缩

Xin Cai, Zhiyuan You, Zhoutong Zhang, Tianfan Xue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Adobe NextCam Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港下的CPII)

AI总结 本文提出DA-VAE,通过轻量级调整预训练扩散模型,实现潜在空间压缩,使1024×1024图像生成使用32×32 tokens,比原模型减少40%,并支持2048×2048生成,保持图像质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22102 2026-03-24 cs.CV cs.GR cs.RO

FreeArtGS: Articulated Gaussian Splatting Under Free-moving Scenario

FreeArtGS: 自由移动场景下的关节高斯溅射重建

Hang Dai, Hongwei Fan, Han Zhang, Duojin Wu, Jiyao Zhang, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机科学系,北京大学CFCS) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) PrimeBot

AI总结 FreeArtGS通过自由移动部分分割、关节估计和端到端优化,实现高可扩展性的自由移动关节物体重建,实验表明其在真实资产生成中具有实用性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21978 2026-03-24 cs.CV cs.GR

GeoFusion-CAD: Structure-Aware Diffusion with Geometric State Space for Parametric 3D Design

GeoFusion-CAD:基于几何状态空间的结构感知扩散模型用于参数化3D设计

Xiaolei Zhou, Chuangjie Fang, Jie Wu, Jingyi Yang, Boyi Lin, Jianwei Zheng

机构 * Zhejiang University of Technology(之江大学) Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北航)

AI总结 本文提出GeoFusion-CAD,一种端到端扩散框架,通过几何状态空间建模实现长序列参数化3D设计生成,解决了传统方法在复杂几何拓扑依赖下的扩展性问题。

Comments Accepted to CVPR 2026 (Findings). Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21957 2026-03-24 cs.CV

Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention

面向超低保留率的视频大语言模型统一时空令牌压缩

Junhao Du, Jialong Xue, Anqi Li, Jincheng Dai, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 本文提出统一的时空令牌压缩方法,通过全局令牌保留池整合注意力权重和语义相似性,实现高效令牌选择与合并,保留90.1%性能并降低计算量至2.6%。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21943 2026-03-24 cs.CV

GeoFlow: Real-Time Fine-Grained Cross-View Geolocalization via Iterative Flow Prediction

GeoFlow:通过迭代流预测实现实时细粒度跨视角地理定位

Ayesh Abu Lehyeh, Xiaohan Zhang, Ahmad Arrabi, Waqas Sultani, Chen Chen, Safwan Wshah

机构 * Vermont Artificial Intelligence Lab, Department of Computer Science, University of Vermont(佛蒙特人工智能实验室,计算机科学系,佛蒙特大学) Intelligent Machines Lab, Information Technology University(智能机器实验室,信息科技大学) Institute of Artificial Intelligence, University of Central Florida(人工智能研究所,佛罗里达中央大学)

AI总结 本文提出GeoFlow,通过迭代流预测实现实时细粒度跨视角地理定位,解决了高精度与实时性的平衡问题,实验显示其在KITTI和VIGOR数据集上达到实时29FPS且保持高精度。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21928 2026-03-24 cs.CV cs.LG

The Golden Subspace: Where Efficiency Meets Generalization in Continual Test-Time Adaptation

黄金子空间:在持续测试时适应中效率与泛化的平衡

Guannan Lai, Da-Wei Zhou, Zhenguo Li, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Hong Kong University of Science and Technology(香港科技大学) Frontier Robotics(前沿机器人)

AI总结 本文提出GOLD方法,通过轻量级适配器将特征投影到黄金子空间,并动态更新子空间以提升效率和稳定性,实验证明其在分类和分割任务中表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21786 2026-03-24 cs.CV eess.IV

The Universal Normal Embedding

通用正态嵌入

Chen Tasker, Roy Betser, Eyal Gofer, Meir Yossef Levi, Guy Gilboa

机构 * Viterbi Faculty of Electrical and Computer Engineering(电气与计算机工程学院)

AI总结 本文提出通用正态嵌入假设,通过实验验证编码器和生成模型共享的高斯潜在空间,展示其在属性预测和可控编辑中的应用。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏