arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11874
2603.14267 2026-04-06 cs.CV cs.AI cs.MM cs.SD

DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization

DiFlowDubber:通过跨模态对齐与同步实现的离散流匹配自动化视频配音

Ngoc-Son Nguyen, Thanh V. T. Tran, Jeongsoo Choi, Hieu-Nghia Huynh-Nguyen, Truong-Son Hy, Van Nguyen

机构 * FPT Software AI Center, Vietnam(FPT软件人工智能中心,越南) KAIST, South Korea(韩国科学技术院) University of Alabama at Birmingham, USA(阿拉巴马大学伯明翰分校)

AI总结 本文提出DiFlowDubber框架,通过离散流匹配和两阶段训练策略,解决视频配音中内容准确性、表达语气、高质量音频和精确唇同步的问题。

Comments Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12711 2026-04-06 cs.CV

Text-Phase Synergy Network with Dual Priors for Unsupervised Cross-Domain Image Retrieval

带有双先验的文本-相位协同网络用于无监督跨域图像检索

Jing Yang, Hui Xue, Shipeng Zhu, Pengfei Fang

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学))

AI总结 本文提出TPSNet,通过结合文本先验和相位先验,提升无监督跨域图像检索性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16672 2026-04-06 cs.CV

ReWeaver: Towards Simulation-Ready and Topology-Accurate Garment Reconstruction

ReWeaver:面向仿真准备和拓扑准确的服装重建

Ming Li, Hui Shan, Kai Zheng, Chentao Shen, Siyu Liu, Yanwei Fu, Zhen Chen, Xiangru Huang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Fudan University(复旦大学) Adobe Xidian University(西安电子科技大学)

AI总结 ReWeaver通过稀疏多视角图像实现拓扑准确的3D服装和缝纫图案重建,提升仿真和机器人应用的精度与一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07951 2026-04-06 cs.CV

Preserving Source Video Realism: High-Fidelity Face Swapping for Cinematic Quality

保留源视频真实性:面向电影质量的高保真面部交换

Zekai Luo, Zongze Du, Zhouhang Zhu, Hao Zhong, Muzhi Zhu, Wen Wang, Yuling Xi, Chenchen Jing, Hao Chen, Chunhua Shen

机构 * Zhejiang University, State Key Laboratory of CAD & CG(浙江大学,计算机辅助设计与图形学国家重点实验室) Zhejiang University of Technology(浙江工业大学) Ant Group(蚂蚁集团)

AI总结 本文提出LivingSwap模型,通过关键帧和视频参考引导实现高保真面部交换,提升视频真实感与时间一致性,减少生产流程中的手动工作量。

Comments Accepted to CVPR 2026. Project webpage: https://aim-uofa.github.io/LivingSwap

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00961 2026-04-06 cs.LG

Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning

通过视频扩散模型实现目标驱动的奖励用于强化学习

Qi Wang, Mian Wu, Yuyang Zhang, Mingqi Yuan, Wenyao Zhang, Haoxiang You, Yunbo Wang, Xin Jin, Xiaokang Yang, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波市空间智能与数字衍生重点实验室,东方理工高等研究院宁波数字孪生研究院,宁波) Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin(浙江省工业智能与数字孪生重点实验室) Zhongguancun Academy(中关村学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) Department of Mechanical Engineering, Yale University(耶鲁大学机械工程系)

AI总结 本文提出利用预训练的视频扩散模型为强化学习代理提供目标驱动的奖励信号,通过视频级和帧级目标提升轨迹的连贯性和目标导向性。

Comments Accepted by CVPR 2026. Project page: https://qiwang067.github.io/genreward

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23292 2026-04-06 cs.CV cs.GR

FACT-GS: Frequency-Aligned Complexity-Aware Texture Reparameterization for 2D Gaussian Splatting

FACT-GS:频率对齐的复杂度感知纹理重参数化用于2D高斯点划法

Tianhao Xie, Linlian Jiang, Xinxin Zuo, Yang Wang, Tiberiu Popa

机构 * Concordia University(康考迪亚大学) Mila–Quebec AI Institute(Mila-魁北克人工智能研究所)

AI总结 FACT-GS通过根据局部视觉频率分配纹理采样密度,提高2D高斯点划法的纹理空间利用效率,实现更清晰的高频细节表现。

Comments 11 pages, 6 figures, CVPR 2026 Findings track. Project page: https://tianhaoxie.github.io/project/FACT-GS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21331 2026-04-06 cs.CV cs.AI

The More, the Merrier: Contrastive Fusion for Higher-Order Multimodal Alignment

更多更好:用于高阶多模态对齐的对比融合

Stefanos Koutoupis, Michaela Areti Zervou, Konstantinos Kontras, Maarten De Vos, Panagiotis Tsakalides, Grigorios Tsagkatakis

机构 * Foundation for Research and Technology-Hellas(希腊研究与技术基金会) University of Crete(克里特大学) KU Leuven(鲁汶大学)

AI总结 本文提出对比融合框架,通过联合嵌入个体模态及其融合组合,捕捉高阶依赖关系,提升多模态对齐效果。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17722 2026-04-06 cs.CV

Can Vision-Language Models Count? A Synthetic Benchmark and Analysis of Attention-Based Interventions

视觉-语言模型能计数吗?一个合成基准和基于注意力的干预分析

Saurav Sengupta, Nazanin Moradinasab, Jiebei Liu, Donald E. Brown

机构 * School of Data Science, University of Virginia(弗吉尼亚大学数据科学学院)

AI总结 本文通过合成基准和注意力干预分析,探讨了视觉-语言模型在计数任务中的表现,揭示了视觉和语言复杂性对计数准确率的影响,并展示了针对性的注意力重加权对计数行为的改进。

Comments Accepted at COGVL Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04728 2026-04-06 eess.IV cs.CV physics.ins-det

Neural Field-Based 3D Surface Reconstruction of Microstructures from Multi-Detector Signals in Scanning Electron Microscopy

基于神经场的多探测器信号扫描电子显微镜微结构三维表面重建

Shuo Chen, Yijin Li, Xi Zheng, Guofeng Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Alibaba Group(阿里巴巴集团) Analysis Center of Agriculture, Life and Environment Sciences, Zhejiang University(浙江大学农业、生命与环境科学分析中心)

AI总结 本文提出NFH-SEM框架,利用神经场整合多视图几何与探测器信号光度立体线索,实现高保真三维表面重建,展示了在不同材料上的精确恢复能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02331 2026-04-03 cs.CV

EventHub: Data Factory for Generalizable Event-Based Stereo Networks without Active Sensors

EventHub:无需主动传感器的通用事件基立体网络数据工厂

Luca Bartolomei, Fabio Tosi, Matteo Poggi, Stefano Mattoccia, Guillermo Gallego

机构 * Advanced Research Center on Electronic System (ARCES)(电子系统高级研究中心 (ARCES)) TU Berlin, Robotics Institute Germany(柏林工业大学德国机器人研究所) Einstein Center Digital Future(爱因斯坦数字未来中心) SCIoI Excellence Cluster(SCIoI卓越集群)

AI总结 EventHub利用标准彩色图像生成代理标注和事件,无需主动传感器的地面真实标注,重新利用先进RGB立体模型处理事件数据,提升立体网络的泛化能力。

Comments CVPR 2026. Project Page: https://bartn8.github.io/eventhub/ Code: https://github.com/bartn8/eventhub

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02328 2026-04-03 cs.CV

Modulate-and-Map: Crossmodal Feature Mapping with Cross-View Modulation for 3D Anomaly Detection

调制与映射:用于3D异常检测的跨模态特征映射与跨视图调制

Alex Costanzino, Pierluigi Zama Ramirez, Giuseppe Lisanti, Luigi Di Stefano

机构 * CVLab, University of Bologna(博洛尼亚大学CVLab) Ca’ Foscari University of Venice(威尼斯大学)

AI总结 ModMap提出一种多视图多模态框架,通过跨模态特征映射和视图依赖关系建模,实现3D异常检测与分割,采用跨视图训练策略提升异常评分。

Comments Accepted at CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02252 2026-04-03 cs.CV

SPAR: Single-Pass Any-Resolution ViT for Open-vocabulary Segmentation

SPAR:单次通过任意分辨率ViT用于开放词汇分割

Naomi Kombol, Ivan Martinović, Siniša Šegvić, Giorgos Tolias

AI总结 SPAR通过单次通过任意分辨率ViT实现高效高分辨率推理,提升开放词汇分割的mIoU性能,无需架构改动或像素级监督。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02162 2026-04-03 cs.CV

Beyond the Fold: Quantifying Split-Level Noise and the Case for Leave-One-Dataset-Out AU Evaluation

超越折叠:量化分层噪声及留一数据集-out AU评估的案例

Saurabh Hinduja, Gurmeet Kaur, Maneesh Bilalpur, Jeffrey Cohn, Shaun Canavan

机构 * CGI Technologies and Solutions Inc(CGI技术与解决方案公司) University of Pittsburgh(匹兹堡大学) University of South Florida(南佛罗里达大学)

AI总结 本文探讨了交叉验证中分层噪声的影响,发现其引入了可测量的随机方差,并通过留一数据集-out方法验证了跨数据集鲁棒性,指出交叉折叠验证的提升可能源于协议方差。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02093 2026-04-03 cs.CV

GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding

GroundVTS:多模态大语言模型中的视频时间定位视觉标记采样

Rong Fan, Kaiyan Xiao, Minghao Zhu, Liuyi Wang, Kai Dai, Zhao Yang

机构 * Newcapec AI Research(新开普人工智能研究院) Fudan University(复旦大学) Tongji University(同济大学)

AI总结 本文提出GroundVTS,通过细粒度查询引导机制筛选视觉标记,提升视频时间定位的时空信息保留与时间连贯性,实验表明其在三个标准基准上优于现有方法。

Comments Published as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22193 2026-04-03 cs.CV

PAM: A Pose-Appearance-Motion Engine for Sim-to-Real HOI Video Generation

PAM:一种用于仿真到现实手-物体互动视频生成的姿态-外观-运动引擎

Mingju Gao, Kaisen Yang, Huan-ang Gao, Bohan Li, Ao Ding, Wenyi Li, Yangcheng Yu, Jinkun Liu, Shaocong Xu, Yike Niu, Haohan Chi, Hao Chen, Hao Tang, Yu Zhang, Li Yi, Hao Zhao

机构 * Peking University(北京大学) Tsinghua University(清华大学) BAAI(北京智源人工智能研究院) SJTU(上海交通大学) Eastern Institute of Technology(东方理工高等研究院) University of Cambridge(剑桥大学)

AI总结 本文提出PAM引擎,整合姿态、外观和运动生成可控的HOI视频,通过实验验证其在DexYCB和OAKINK2数据集上的性能优势。

Comments Accepted to CVPR 2026 Code: https://github.com/GasaiYU/PAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14870 2026-04-03 cs.CV eess.IV

HERBench: A Benchmark for Multi-Evidence Integration in Video Question Answering

HERBench:视频问答中多证据整合的基准

Dan Ben-Ami, Gabriele Serussi, Kobi Cohen, Chaim Baskin

机构 * INSIGHT Lab, Ben-Gurion University of the Negev(本-古里安大学 INSIGHT 实验室) Ben-Gurion University of the Negev(本-古里安大学)

AI总结 HERBench通过要求至少三个非重叠视频片段线索,推动视频问答中多证据整合的研究,评估13种最新视频大语言模型,发现其准确率仅31-42%,揭示检索与融合两大瓶颈。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13714 2026-04-03 eess.IV cs.AI cs.CV cs.LG

DeDelayed: Deleting Remote Inference Delay via On-Device Correction

DeDelayed:通过设备端校正删除远程推断延迟

Dan Jacobellis, Mateen Ulhaq, Fabien Racapé, Hyomin Choi, Neeraja J. Yadwadkar

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) InterDigital

AI总结 本文提出DeDelayed系统,通过设备端与远程模型协同推断,降低视频处理延迟,提升实时视频分割性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02071 2026-04-03 cs.CV cs.AI cs.LG

Mining Instance-Centric Vision-Language Contexts for Human-Object Interaction Detection

挖掘实例导向的视觉-语言上下文以实现人-物交互检测

Soo Won Seo, KyungChae Lee, Hyungchan Cho, Taein Son, Nam Ik Cho, Jun Won Choi

机构 * Seoul National University(首尔国立大学) Hanyang University(汉阳大学)

AI总结 本文提出InCoM-Net框架,通过整合VLM提取的语义知识与实例特征,提升人-物交互检测的交互推理能力,实验表明其在HICO-DET和V-COCO基准上达到最优性能。

Comments Accepted to CVPR 2026. Code: https://github.com/nowuss/InCoM-Net

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02032 2026-04-03 cs.CV cs.LG

IndoorCrowd: A Multi-Scene Dataset for Human Detection, Segmentation, and Tracking with an Automated Annotation Pipeline

IndoorCrowd: 一个用于人体检测、分割和跟踪的多场景数据集及自动化标注流水线

Sebastian-Ion Nae, Radu Moldoveanu, Alexandra Stefania Ghita, Adina Magda Florea

机构 * National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学国家科学技术大学) Expleo

AI总结 IndoorCrowd数据集通过多场景采集,提供人体检测、实例分割和多目标跟踪的基准,包含31个视频和自动化标注工具的评估结果,揭示了人群密度、尺度和遮挡对任务的影响。

Comments Accepted at Conference on Computer Vision and Pattern Recognition Workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01966 2026-04-03 cs.CV cs.AI cs.RO

Ego-Grounding for Personalized Question-Answering in Egocentric Videos

面向第一视角视频的个性化问答中的自我定位

Junbin Xiao, Shenglang Zhang, Pengxiang Zhu, Angela Yao

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出MyEgo数据集,用于评估多模态大语言模型在需要自我定位的个性化问答中的能力,发现现有模型在自我记忆和推理方面存在显著不足。

Comments To appear at CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01888 2026-04-03 cs.CV

Low-Effort Jailbreak Attacks Against Text-to-Image Safety Filters

低努力对抗攻击针对文本到图像安全过滤器

Ahmed B Mustafa, Zihan Ye, Yang Lu, Michael P Pound, Shreyank N Gowda

机构 * University of Nottingham(诺丁汉大学) Xi’an Jiaotong-Liverpool University(西交利物浦大学) Xiamen University(厦门大学)

AI总结 研究揭示文本到图像模型易受低努力对抗攻击影响,通过提示策略绕过安全过滤,展示多种视觉对抗技术,揭示表面提示过滤与深层语义理解的差距,攻击成功率高达74.47%。

Comments Text-to-Image version of the Anyone can Jailbreak paper. Accepted in CVPR-W AIMS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01791 2026-04-03 cs.CV

PTC-Depth: Pose-Refined Monocular Depth Estimation with Temporal Consistency

PTC-Depth:基于姿态优化的单目深度估计与时间一致性

Leezy Han, Seunggyu Kim, Dongseok Shim, Hyeonbeom Lee

机构 * Ajou University(亚洲大学) Sony Creative AI Lab(索尼创意AI实验室)

AI总结 本文提出PTC-Depth框架,通过轮式里程计实现稳定深度估计,结合光流三角化估计相机姿态和稀疏深度,利用递归贝叶斯估计修正尺度,提升深度预测的准确性和一致性。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01777 2026-04-03 cs.CV

GardenDesigner: Encoding Aesthetic Principles into Jiangnan Garden Construction via a Chain of Agents

GardenDesigner: 通过一系列智能体编码美学原则以指导江南园林建设

Mengtian Li, Fan Yang, Ruixue Xiong, Yiyan Fan, Zhifeng Xie, Zeyu Wang

机构 * Shanghai University(上海大学) Shanghai Engineering Research Center of Motion Picture Special Effects(上海电影特效工程技术研究中心) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出GardenDesigner框架,通过智能体链编码江南园林建设的美学原则,结合地形分布和道路生成代理,实现快速生成多样化且美观的江南园林。

Comments CVPR 2026, Project page: https://monad-cube.github.io/GardenDesigner

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01749 2026-04-03 cs.CV

Ultrasound-CLIP: Semantic-Aware Contrastive Pre-training for Ultrasound Image-Text Understanding

超声-CLIP:面向超声图像-文本理解的语义感知对比预训练

Jiayun Jin, Haolong Chai, Xueying Huang, Xiaoqing Guo, Zengwei Zheng, Zhan Zhou, Junmei Wang, Xinyu Wang, Jie Liu, Binbin Zhou

机构 * Hangzhou City University(杭州城市大学) Hong Kong Baptist University(香港浸会大学) Zhejiang University(浙江大学) The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院附属第一医院) City University of Hong Kong(香港城市大学)

AI总结 本文提出超声-CLIP,通过构建US-365K数据集和UDT知识框架,引入语义软标签和损失函数,提升超声图像与文本的语义对比学习效果,实现分类和检索的SOTA性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01666 2026-04-03 cs.CV

DynaVid: Learning to Generate Highly Dynamic Videos using Synthetic Motion Data

DynaVid: 通过合成运动数据学习生成高度动态视频

Wonjoon Jin, Jiyun Won, Janghyeok Han, Qi Dai, Chong Luo, Seung-Hwan Baek, Sunghyun Cho

机构 * POSTECH(浦项科技大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 DynaVid通过合成运动数据训练视频合成框架,解决动态视频生成中真实数据不足的问题,采用两阶段生成方法提升动态运动和摄像机运动的现实感与可控性。

Comments Accepted to CVPR 2026. Website: https://jinwonjoon.github.io/DynaVid/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01634 2026-04-03 cs.LG cs.CL

CRIT: Graph-Based Automatic Data Synthesis to Enhance Cross-Modal Multi-Hop Reasoning

CRIT: 基于图的自动数据合成以增强跨模态多跳推理

Junyoung Sung, Seungwoo Lyu, Minjun Kim, Sumin An, Arsha Nagrani, Paul Hongsuck Seo

机构 * Dept. of CSE, Korea University(高丽大学计算机科学与工程系) Google DeepMind(谷歌DeepMind)

AI总结 CRIT通过图基自动管道生成复杂跨模态推理任务,提升多跳推理能力,实验表明先进模型在该任务上表现欠佳,训练于CRIT的模型在SPIQA等基准上显著提升。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01605 2026-04-03 cs.CV cs.RO

F3DGS: Federated 3D Gaussian Splatting for Decentralized Multi-Agent World Modeling

F3DGS:联邦3D高斯点云用于去中心化多智能体世界建模

Morui Zhu, Mohammad Dehghani Tezerjani, Mátyás Szántó, Márton Vaitkus, Song Fu, Qing Yang

机构 * University of North Texas(北德克萨斯大学) Budapest University of Technology and Economics(布达佩斯技术与经济大学)

AI总结 F3DGS通过联邦学习实现去中心化多智能体3D重建,利用共享几何框架和可见性感知聚合解决部分观测问题,实现分布式优化。

Comments Accepted to the CVPR 2026 SPAR-3D Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01600 2026-04-03 cs.AI

MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correction

MM-ReCoder:通过强化学习和自我校正推进图表到代码生成

Zitian Tang, Xu Zhang, Jianbo Yuan, Yang Zou, Varad Gunjal, Songyao Jiang, Davide Modolo

机构 * Brown University(布朗大学) Amazon AGI(亚马逊AGI)

AI总结 MM-ReCoder通过强化学习和自我校正机制提升图表到代码生成能力,其两阶段多轮自我校正策略基于Group Relative Policy Optimization,提升代码准确性和可执行性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01586 2026-04-03 cs.CV cs.AI

SHOE: Semantic HOI Open-Vocabulary Evaluation Metric

SHOE:语义HOI开放词汇评估度量

Maja Noack, Qinqian Lei, Taipeng Tian, Bihan Dong, Robby T. Tan, Yixin Chen, John Young, Saijun Zhang, Bo Wang

机构 * University of Mississippi(密西西比大学) National University of Singapore(新加坡国立大学) Independent Researcher(独立研究员) ASUS Intelligent Cloud Services (AICS)(华硕智能云服务(AICS))

AI总结 本文提出SHOE评估框架,通过结合预测与真实HOI标签的语义相似性,改进开放词汇HOI检测的评估方法,实验表明其与人类判断一致率达85.73%。

Comments Accepted to GRAIL-V Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01570 2026-04-03 cs.RO

Boosting Vision-Language-Action Finetuning with Feasible Action Neighborhood Prior

通过可行动作邻域先验提升视觉-语言-动作微调

Haochen Niu, Kanyu Zhang, Shuyu Yin, Qinghai Guo, Peilin Liu, Fei Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies(华为技术有限公司)

AI总结 本文提出FAN引导正则化方法,通过调整模型输出分布以匹配FAN几何特性,提升VLA适应的样本效率和泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏