arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11875
2603.20193 2026-03-23 cs.CV cs.AI cs.LG

From Masks to Pixels and Meaning: A New Taxonomy, Benchmark, and Metrics for VLM Image Tampering

从遮罩到像素与意义:一种新的分类、基准和度量标准用于VLM图像篡改

Xinyi Shang, Yi Tang, Jiacheng Cui, Ahmed Elhagry, Salwa K. Al Khatib, Sondos Mahmoud Bsharat, Jiacheng Liu, Xiaohan Zhao, Jing-Hao Xue, Hao Li, Salman Khan, Zhiqiang Shen

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University College London(伦敦大学学院)

AI总结 本文提出了一种基于像素和意义的VLM图像篡改检测新方法,引入了新的分类体系和基准,提出了基于像素的度量标准,并评估了现有模型在微编辑和非遮罩篡改上的表现。

Comments Code and data at: https://github.com/VILA-Lab/PIXAR (Accepted in CVPR 2026 Findings, but not opted in)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20185 2026-03-23 cs.CV cs.AI cs.CL

VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking

VideoSeek: 长时程视频代理与工具引导的搜索

Jingyang Lin, Jialian Wu, Jiang Liu, Ximeng Sun, Ze Wang, Xiaodong Yu, Jiebo Luo, Zicheng Liu, Emad Barsoum

机构 * AMD(AMD公司) University of Rochester(罗切斯特大学)

AI总结 VideoSeek通过视频逻辑流程主动寻找关键证据,减少帧数使用,提升视频理解能力,实验显示其在视频理解和推理任务中表现优异。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20005 2026-03-23 cs.CV

NEC-Diff: Noise-Robust Event-RAW Complementary Diffusion for Seeing Motion in Extreme Darkness

NEC-Diff: 用于极端黑暗中感知运动的噪声鲁棒事件-RAW互补扩散

Haoyue Liu, Jinghan Xu, Luxin Feng, Hanyu Zhou, Haozhi Zhao, Yi Chang, Luxin Yan

机构 * National Key Lab of Multispectral Information Intelligent Processing Technology(多谱信息智能处理技术国家级重点实验室) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

AI总结 NEC-Diff通过结合RAW图像的线性光响应和事件的亮度变化特性,提出一种新型扩散框架,以在极低光照条件下实现高保真视觉重建。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19918 2026-03-23 cs.CV cs.AI

Learning Like Humans: Analogical Concept Learning for Generalized Category Discovery

像人类一样学习:用于通用类别发现的类比概念学习

Jizhou Han, Chenhao Ding, Yuhang He, Qiang Wang, Shaokun Wang, SongLin Dong, Yihong Gong

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) School of Software Engineering, Xi’an Jiaotong University(软件工程学院,西安交通大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen University of Advanced Technology(深圳大学)

AI总结 本文提出ATCG模块,通过类比已知知识生成文本概念,结合视觉特征提升类别发现性能,在六个基准测试中均取得显著提升,尤其在细粒度数据上表现突出。

Comments Accept by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19852 2026-03-23 cs.CV cs.AI cs.LG

Failure Modes for Deep Learning-Based Online Mapping: How to Measure and Address Them

深度学习在线建图的失效模式:如何衡量和解决这些模式

Michael Hubbertz, Qi Han, Tobias Meisen

机构 * University of Wuppertal(乌珀塔尔大学) Aptiv Services Deutschland GmbH(Aptiv Services 德国分公司)

AI总结 本文提出框架识别和测量深度学习在线建图的失效模式,通过分离记忆输入特征和过拟合已知地图几何的效应,引入基于Fréchet距离的重建统计量和互补失效模式评分,分析数据集偏差并提出地图几何感知诊断方法,实验表明多样化和平衡的训练集能提升性能。

Comments Accepted to CVPR 2026, final camera ready version is published there

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19770 2026-03-23 cs.CV

FlashCap: Millisecond-Accurate Human Motion Capture via Flashing LEDs and Event-Based Vision

FlashCap:通过闪烁LED和事件视觉实现毫秒级人体动作捕捉

Zekai Wu, Shuqi Fan, Mengyin Liu, Yuhua Luo, Xincheng Lin, Ming Yan, Junhao Wu, Xiuhong Lin, Yuexin Ma, Chenglu Wen, Lan Xu, Siqi Shen, Cheng Wang

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing, Xiamen University(厦门大学城市智能感知与计算重点实验室) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, School of Informatics, Xiamen University(厦门大学多媒体可信感知与高效计算重点实验室) National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学医学数据科学国家研究院) ShanghaiTech University(上海科技大学)

AI总结 本文提出FlashCap系统,通过闪烁LED和事件视觉实现毫秒级人体动作捕捉,构建高质量数据集FlashMotion,并提出ResPose方法提升姿态估计精度和时间准确性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19766 2026-03-23 cs.CV

Adapting a Pre-trained Single-Cell Foundation Model to Spatial Gene Expression Generation from Histology Images

适应预训练的单细胞基础模型以从组织学图像生成空间基因表达

Donghai Fang, Yongheng Li, Zhen Wang, Yuansong Zeng, Wenwen Min

机构 * Sun Yat-sen University(中山大学) Yunnan University(云南大学) Chongqing University(重庆大学)

AI总结 本文提出HINGE模型,通过引入SoftAdaLN和扩散目标,将预训练的单细胞基础模型适配为条件表达生成器,提升了组织学图像生成空间基因表达的性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19762 2026-03-23 cs.CV

PCSTracker: Long-Term Scene Flow Estimation for Point Cloud Sequences

PCSTracker: 点云序列的长期场景流估计

Min Lin, Gangwei Xu, Xianqi Wang, Yuyi Peng, Xin Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Optics Valley Laboratory(光谷实验室)

AI总结 本文提出PCSTracker,通过引入IGMO和STTU模块,解决点云序列中长期场景流估计的时序一致性问题,实现实时32.5 FPS性能,优于RGB-D方法。

Comments Accepted in CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19731 2026-03-23 cs.CV

PerformRecast: Expression and Head Pose Disentanglement for Portrait Video Editing

PerformRecast:基于驱动视频的表情与头部姿态解耦的肖像视频编辑

Jiadong Liang, Bojun Xiong, Jie Tian, Hua Li, Xiao Long, Yong Zheng, Huan Fu

机构 * HUJING Digital Media & Entertainment Group(华景数字媒体与娱乐集团)

AI总结 本文提出PerformRecast,通过改进关键点变换公式和分离面部与非面部区域,实现表情与头部姿态的解耦,提升肖像视频编辑的可控性和效率。

Comments Accepted to CVPR 2026. Project Page: https://youku-aigc.github.io/PerformRecast

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19718 2026-03-23 cs.CV

BALM: A Model-Agnostic Framework for Balanced Multimodal Learning under Imbalanced Missing Rates

BALM:一种面向不平衡缺失率下平衡多模态学习的模型无关框架

Phuong-Anh Nguyen, Tien Anh Pham, Duc-Trong Le, Cam-Van Thi Nguyen

机构 * VNU University of Engineering and Technology(越南工程与技术大学)

AI总结 本文提出BALM框架,通过特征校准模块和梯度重平衡模块解决多模态学习中因不平衡缺失率导致的不平衡问题,提升模型鲁棒性和性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19678 2026-03-23 cs.CV

Vision-Language Attribute Disentanglement and Reinforcement for Lifelong Person Re-Identification

视觉-语言属性解耦与强化用于终身人物重识别

Kunlun Xu, Haotong Cheng, Jiangmeng Li, Xu Zou, Jiahuan Zhou

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(北京大学王轩计算机技术研究院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology, Wuhan, China(华中科技大学人工智能与自动化学院,武汉,中国)

AI总结 本文提出VLADR方法,通过视觉-语言属性解耦与强化提升跨域知识迁移,增强抗遗忘与泛化能力,实验表明在抗遗忘和泛化能力上优于现有方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19623 2026-03-23 cs.CV

Disentangle-then-Align: Non-Iterative Hybrid Multimodal Image Registration via Cross-Scale Feature Disentanglement

解耦后再对齐:通过跨尺度特征解耦实现非迭代混合多模态图像配准

Chunlei Zhang, Jiahao Xia, Yun Xiao, Bo Jiang, Jian Zhang

机构 * Faculty of Engineering and IT, University of Technology Sydney(新南威尔士大学工程与信息技术学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)

AI总结 本文提出HRNet网络,通过解耦表示与混合参数预测,解决多模态图像配准中共享空间不稳定和单类型变换限制的问题,实现非迭代的粗到细配准。

Comments Accepted by CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19121 2026-03-23 cs.CV cs.AI

CustomTex: High-fidelity Indoor Scene Texturing via Multi-Reference Customization

CustomTex: 通过多参考定制实现高保真的室内场景纹理

Weilin Chen, Jiahao Rao, Wenhao Wang, Xinyang Li, Xuan Cheng, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)

AI总结 CustomTex通过多参考定制方法实现高保真的室内场景纹理生成,结合语义级和像素级蒸馏技术,提升纹理的精确度和视觉质量。

Comments Accepted to CVPR 2026. This version integrates the main paper and supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17470 2026-03-23 cs.CV cs.AI

VirPro: Visual-referred Probabilistic Prompt Learning for Weakly-Supervised Monocular 3D Detection

VirPro: 基于视觉引用的概率提示学习用于弱监督单目3D检测

Chupeng Liu, Jiyong Rao, Shangquan Sun, Runkai Zhao, Weidong Cai

机构 * The University of Sydney(悉尼大学) Tongji University(同济大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出VirPro,通过生成场景条件化提示并结合多高斯提示建模,提升单目3D检测的弱监督性能,实验表明在KITTI基准上平均精度提升4.8%。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10598 2026-03-23 cs.CV

Layer Consistency Matters: Elegant Latent Transition Discrepancy for Generalizable Synthetic Image Detection

层一致性至关重要:用于通用合成图像检测的优雅潜在转换差异

Yawen Yang, Feng Li, Shuqi Kong, Yunfeng Diao, Xinjian Gao, Zenglin Shi, Meng Wang

机构 * Hefei University of Technology(合肥工业大学)

AI总结 本文提出潜在转换差异(LTD)方法,通过捕捉真实与合成图像在潜在表示中的层间一致性差异,提升合成图像检测的泛化能力和鲁棒性。

Comments Accepted by CVPR 2026 (main track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01038 2026-03-23 cs.CV cs.AI

From Intuition to Investigation: A Tool-Augmented Reasoning MLLM Framework for Generalizable Face Anti-Spoofing

从直觉到探究:一种工具增强的推理MLLM框架用于可推广的面部反伪装

Haoyuan Zhang, Keyao Wang, Guosheng Zhang, Haixiao Yue, Zhiwen Tan, Siran Peng, Tianshuo Zhang, Xiao Tan, Kunbin Chen, Wei He, Jingdong Wang, Ajian Liu, Xiangyu Zhu, Zhen Lei

机构 * SAI, UCAS(UCAS智能科学研究院) MAIS, CASIA(CASIA模式识别与智能信息处理研究院) Baidu Inc(百度公司) CAIR, HKISI, CAS(HKISI CAS计算机视觉研究院) M.U.S.T

AI总结 本文提出TAR-FAS框架,通过整合外部视觉工具提升面部反伪装的泛化能力,采用CoT-VT范式使MLLM深入分析细微伪装线索,实验表明其在跨域协议下达到SOTA性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12781 2026-03-23 cs.AI cs.CV

VIRO: Robust and Efficient Neuro-Symbolic Reasoning with Verification for Referring Expression Comprehension

VIRO:用于指代表达理解的鲁棒且高效的神经符号推理与验证

Hyejin Park, Junhyuk Kwon, Suha Kwak, Jungseul Ok

机构 * Pohang University of Science and Technology (POSTECH)(釜山科学技术大学(POSTECH))

AI总结 VIRO通过在推理步骤中嵌入轻量级操作符验证器,提升指代表达理解的鲁棒性和效率,达到61.1%的平衡准确率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15160 2026-03-23 cs.CV

EagleVision: A Dual-Stage Framework with BEV-grounding-based Chain-of-Thought for Spatial Intelligence

EagleVision:基于BEV的双阶段框架用于空间智能

Jiaxu Wan, Xu Wang, Mengwei Xie, Hang Zhang, Mu Xu, Yang Han, Hong Zhang, Ding Yuan, Yifan Yang

机构 * Atlas Lab(Atlas实验室) School of Aerospace, BUAA(北京航空航天大学航空学院) School of Software, BUAA(北京航空航天大学软件学院) State Key Laboratory of HERATT(HERATT国家重点实验室) Key Laboratory of SDODS (MOE) Project(SDODS重点实验室(教育部))

AI总结 EagleVision通过结合几何感知帧选择与主动BEV推理,提升视频空间推理能力,实现空间感知与验证的闭环循环。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00171 2026-03-23 cs.CV

CompAgent: An Agentic Framework for Visual Compliance Verification

CompAgent:一种用于视觉合规验证的代理框架

Rahul Ghosh, Baishali Chaudhury, Hari Prasanna Das, Meghana Ashok, Ryan Razkenari, Long Chen, Sungmin Hong, Chun-Hao Liu

机构 * Generative AI Innovation Center(生成式人工智能创新中心) Amazon Web Services(亚马逊网络服务)

AI总结 本文提出CompAgent,一种基于代理的视觉合规验证框架,通过集成视觉工具和规划代理,提升多模态推理能力,在公开基准测试中取得76%的F1分数,优于现有方法。

Comments Accepted to IEEE CVPR 2026 GRAIL-V Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24897 2026-03-23 cs.AI

RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmark

RealUnify: 统一模型真的能从统一中受益吗?一个全面的基准测试

Yang Shi, Yuhao Dong, Yue Ding, Yuran Wang, Xuanyu Zhu, Sheng Zhou, Wenting Liu, Haochen Tian, Rundong Wang, Huanqian Wang, Zuyan Liu, Bohan Zeng, Ruizhe Chen, Qixun Wang, Zhuoran Zhang, Xinlong Chen, Chengzhuo Tong, Bozhou Li, Qiang Liu, Haotian Wang, Wenjing Yang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang, Ziwei Liu

机构 * PKU(北京大学) Kling Team(Kling团队) NTU(国立台湾大学) CASIA(中国科学院自动化研究所) NUS(国立新加坡大学) USTC(中国科学技术大学) THU(清华大学) ZJU(浙江大学)

AI总结 RealUnify基准测试旨在评估统一模型中理解与生成能力的双向协同效应,通过10类32子任务的1000个人工标注实例,揭示现有统一模型在协同能力上的不足,强调需新的训练策略来提升统一建模潜力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09111 2026-03-23 cs.CV

Towards Open Environments and Instructions: General Vision-Language Navigation via Fast-Slow Interactive Reasoning

迈向开放环境和指令:通过快速-缓慢交互推理实现通用视觉-语言导航

Yang Li, Aming Wu, Zihao Zhang, Yahong Han

机构 * School of Artificial Intelligence, College of Intelligence and Computing, Tianjin University, China(人工智能学院,智能与计算学院,天津大学,中国) School of Computer Science and Information Engineering, Hefei University of Technology, China(计算机科学与信息工程学院,合肥工业大学,中国)

AI总结 本文提出慢4快-VLN框架,通过快速-缓慢交互推理提升视觉语言导航的泛化能力,解决传统方法在开放环境中的适应难题。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06332 2026-03-23 cs.CV

CryoHype: Reconstructing a thousand cryo-EM structures with transformer-based hypernetworks

CryoHype:基于变换器的超网络重建千个冷冻电镜结构

Jeffrey Gu, Minkyu Jeon, Ambri Ma, Serena Yeung-Levy, Ellen D. Zhong

机构 * Princeton University(普林斯顿大学) Stanford University(斯坦福大学)

AI总结 CryoHype通过变换器超网络实现高通量冷冻电镜结构重建,解决混合分子物种的组分异质性问题,实现1000个结构的高精度重建。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19232 2026-03-20 cs.CV

Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

三次离散扩散:高维表示上的离散视觉生成

Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming Han, Jiashi Feng, Yi Jiang, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Carnegie Mellon University(卡内基梅隆大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出CubiD,首个高维表示离散生成模型,通过精细掩码实现高维离散表示的生成,具备固定步数的生成能力,且在ImageNet-256上达到SOTA性能,验证离散token保留原始表示能力。

Comments Accepted by CVPR 2026 main track; Code: https://github.com/YuqingWang1029/CubiD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19224 2026-03-20 cs.CV

EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect Erasing

EffectErase: 视频对象移除与插入的联合处理以实现高质量效果擦除

Yang Fu, Yike Zheng, Ziyun Dai, Henghui Ding

机构 * Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University, China(大数据研究院,计算机科学与人工智能学院,复旦大学,中国)

AI总结 本文提出EffectErase方法,通过联合视频对象移除与插入,解决动态目标对象及其视觉效果的高质量擦除问题,利用大规模VOR数据集提升效果擦除质量。

Comments CVPR 2026, Project Page: https://henghuiding.com/EffectErase/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19176 2026-03-20 cs.SD cs.CV eess.AS

Few-shot Acoustic Synthesis with Multimodal Flow Matching

少样本声学合成与多模态流匹配

Amandine Brunetto

机构 * Center for Robotics, Mines Paris - PSL University(机器人中心,巴黎 Mines - PSL 大学)

AI总结 本文提出FLAC方法,通过流匹配生成少样本声学合成,结合空间、几何和声学线索生成新的场景房间脉冲响应,优于现有八样本基线。

Comments To appear at CVPR 2026. 23 pages, 16 figures. Project Page: https://amandinebtto.github.io/FLAC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19158 2026-03-20 cs.CV

Adaptive Auxiliary Prompt Blending for Target-Faithful Diffusion Generation

自适应辅助提示融合用于目标忠实的扩散生成

Kwanyoung Lee, SeungJu Cha, Yebin Ahn, Hyunwoo Oh, Sungho Koh, Dong-Jin Kim

机构 * Hanyang University(翰阳大学)

AI总结 本文提出自适应辅助提示融合框架,通过辅助锚点提示在低密度区域稳定扩散过程,提升目标提示的忠实性与生成质量。

Comments Accepted in CVPR 2026 (main track). 10 pages, 6 figures; supplementary material included (14 pages, 11 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19157 2026-03-20 cs.CV

ADAPT: Attention Driven Adaptive Prompt Scheduling and InTerpolating Orthogonal Complements for Rare Concepts Generation

ADAPT:基于注意力的自适应提示调度与稀有概念生成的插值正交补集

Kwanyoung Lee, Hyunwoo Oh, SeungJu Cha, Sungho Koh, Dong-Jin Kim

机构 * Hanyang University(翰阳大学)

AI总结 ADAPT框架通过确定性提示调度和语义对齐,提升稀有概念生成效果,无需额外训练,在RareBench基准上表现优异。

Comments Accepted in CVPR 2026 (findings). 10 pages, 4 figures; supplementary material included (8 pages, 10 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19076 2026-03-20 cs.CV cs.RO

DROID-SLAM in the Wild

野外中的DROID-SLAM

Moyang Li, Zihan Zhu, Marc Pollefeys, Daniel Barath

机构 * ETH Zurich(苏黎世联邦理工学院) Microsoft(微软)

AI总结 本文提出一种鲁棒的实时RGB SLAM系统,通过可微的不确定性感知捆绑调整处理动态环境,实现鲁棒的跟踪与重建。

Comments CVPR 2026, Project Page: https://moyangli00.github.io/droid-w/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19053 2026-03-20 cs.CV cs.GR

SwiftTailor: Efficient 3D Garment Generation with Geometry Image Representation

SwiftTailor: 基于几何图像表示的高效3D服装生成

Phuc Pham, Uy Dieu Tran, Binh-Son Hua, Phong Nguyen

机构 * Qualcomm AI Research(高通AI研究) Trinity College Dublin(都柏林大学)

AI总结 本文提出SwiftTailor框架,通过紧凑的几何图像表示统一缝纫图案推理与几何网格合成,提升3D服装生成的效率与精度。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19028 2026-03-20 cs.CV cs.AI cs.LG

SEM: Sparse Embedding Modulation for Post-Hoc Debiasing of Vision-Language Models

SEM:用于视觉-语言模型后验去偏的稀疏嵌入调制

Quentin Guimard, Federico Bartsch, Simone Caldarella, Rahaf Aljundi, Elisa Ricci, Massimiliano Mancini

机构 * University of Trento(特伦托大学) Toyota Motor Europe(丰田欧洲公司) Fondazione Bruno Kessler(布鲁诺·凯瑟尔基金会)

AI总结 本文提出SEM框架,通过稀疏自编码器空间调制嵌入,实现视觉-语言模型的后验去偏,提升检索和零样本分类的公平性。

Comments CVPR Findings 2026. Project website: https://sparse-embedding-modulation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏