arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-03-19 至 2026-03-19 共收录 35
2603.17995 2026-03-19 cs.CV cs.GR cs.LG

LoST: Level of Semantics Tokenization for 3D Shapes

LoST:3D形状的语义层次标记化

Niladri Shekhar Dutt, Zifan Shi, Paul Guerrero, Chun-Hao Paul Huang, Duygu Ceylan, Niloy J. Mitra, Xuelin Chen

机构 * University College London(伦敦大学学院) Adobe Research(Adobe研究院)

AI总结 本文提出LoST,通过语义显著性对3D形状进行标记化,实现高效的自回归生成。实验表明LoST在几何和语义重建上优于现有方法,并提升下游任务性能。

Comments CVPR 2026; Project website-- https://lost3d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17910 2026-03-19 cs.CV

SpiderCam: Low-Power Snapshot Depth from Differential Defocus

SpiderCam: 低功耗差分模糊拍摄深度

Marcos A. Ferreira, Tianao Li, John Mamish, Josiah Hester, Yaman Sangar, Qi Guo, Emma Alexander

机构 * Northwestern University(西北大学) Georgia Institute of Technology(佐治亚理工学院) Purdue University(普渡大学)

AI总结 SpiderCam通过FPGA实现低功耗差分模糊拍摄深度,实时生成480x400稀疏深度图,功耗仅624mW,首次实现被动FPGA 3D相机亚瓦特总功耗。

Comments Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17828 2026-03-19 cs.CV

TINA: Text-Free Inversion Attack for Unlearned Text-to-Image Diffusion Models

TINA:无文本逆向攻击用于未学习的文本到图像扩散模型

Qianlong Xiang, Miao Zhang, Haoyu Zhang, Kun Wang, Junhui Hou, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学) Shenzhen Loop Area Institute(深圳河套学院) Peng Cheng Laboratory(鹏城实验室) Shandong University(山东大学)

AI总结 TINA通过无文本逆向攻击揭示未学习模型中残留的视觉知识,挑战现有去概念化方法的局限性。

Comments 16 pages, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17809 2026-03-19 cs.CV cs.AI

Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients

细粒度后训练量化用于大型视觉语言模型的量化感知集成梯度

Ziwei Xiang, Fanhu Zeng, Hongjian Fang, Rui-Qi Wang, Renxing Chen, Yanan Zhu, Yi Chen, Peipei Yang, Xu-Yao Zhang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,中国科学院自动化所) School of Artificial Intelligence, UCAS(人工智能学院,中国科学院大学) Beijing National Research Center for Information Science and Technology(北京信息科学研究中心) Institute of Artificial Intelligence, USTB(信息科学技术大学人工智能学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhongguancun Academy(中关村学院)

AI总结 本文提出细粒度后训练量化方法,通过量化感知集成梯度评估token敏感性,提升大型视觉语言模型的精度与效率。

Comments Accepted by CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17684 2026-03-19 cs.CV

Does YOLO Really Need to See Every Training Image in Every Epoch?

YOLO真的需要在每个epoch中都看到每张训练图像吗?

Xingxing Xie, Jiahua Dong, Junwei Han, Gong Cheng

机构 * School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院) School of Artificial Intelligence, Chongqing University of Posts and Telecommunications(重庆邮电大学人工智能学院)

AI总结 本文提出反遗忘采样策略(AFSS),通过动态选择训练图像以提高YOLO检测器的训练效率和准确性,在多个数据集上实现了超过1.43倍的加速。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17662 2026-03-19 cs.CV cs.AI

FINER: MLLMs Hallucinate under Fine-grained Negative Queries

FINER:MLLMs在细粒度负查询下产生幻觉

Rui Xiao, Sanghwan Kim, Yongqin Xian, Zeynep Akata, Stephan Alaniz

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Helmholtz Munich(海德堡-慕尼黑亥姆霍尔茨中心) Google(谷歌) LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院)

AI总结 本文提出FINER基准测试,分析MLLMs在细粒度不匹配与真实元素共存时的幻觉问题,并通过FINER-Tuning提升模型性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17651 2026-03-19 cs.CV cs.AI

Anchoring and Rescaling Attention for Semantically Coherent Inbetweening

锚定与重缩放注意力以实现语义一致的中间帧生成

Tae Eun Choi, Sumin Shim, Junhyeok Kim, Seong Jae Hwang

机构 * Yonsei University(延世大学)

AI总结 本文提出通过关键帧和文本锚定注意力偏差,提升生成中间帧的语义一致性和时间稳定性,同时引入重缩放时间RoPE增强帧一致性,建立首个文本条件的GI评估基准TGI-Bench。

Comments Accepted to CVPR 2026; Code is released at https://github.com/teunchoi/TGI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15026 2026-03-19 cs.CV cs.LG

Training-free Detection of Generated Videos via Spatial-Temporal Likelihoods

无需训练的生成视频检测方法:时空似然方法

Omer Ben Hayun, Roy Betser, Meir Yossef Levi, Levi Kassel, Guy Gilboa

机构 * Technion – Israel Institute of Technology(技术学院–以色列理工学院)

AI总结 本文提出STALL方法,通过时空似然建模实现无需训练的视频合成检测,优于传统图像和视频检测方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05059 2026-03-19 cs.LG cs.AI cs.CV

Learning from Oblivion: Predicting Knowledge Overflowed Weights via Retrodiction of Forgetting

从遗忘中学习:通过遗忘的逆向预测知识溢出的权重

Jinhyeok Jang, Jaehong Kim, Jung Uk Kim

机构 * ETRI UST Kyung Hee University(庆北大学)

AI总结 本文提出KNOW预测方法,通过结构化遗忘与逆向建模合成知识丰富的权重,提升下游任务性能。

Comments To appear in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17605 2026-03-19 cs.CV

ReLaGS: Relational Language Gaussian Splatting

ReLaGS:关系语言高斯点云

Yaxu Xie, Abdalla Arafa, Alireza Javanmardi, Christen Millerdurai, Jia Cheng Hu, Shaoxiang Wang, Alain Pagani, Didier Stricker

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) RPTU University Kaiserslautern-Landau(科布伦茨-兰道大学(RPTU)) University of Modena and Reggio Emilia(摩德纳和雷吉奥-艾米利亚大学)

AI总结 ReLaGS通过构建层次化的语言蒸馏高斯场景和3D语义场景图,实现无需场景特定训练的统一3D感知与推理,结合多视角语言对齐策略和图神经网络进行关系推理。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17583 2026-03-19 cs.CV cs.AI

Edit-As-Act: Goal-Regressive Planning for Open-Vocabulary 3D Indoor Scene Editing

Edit-As-Act:面向开放词汇3D室内场景编辑的目标回归规划

Seongrae Noh, SeungWon Seo, Gyeong-Moon Park, HyeongYeop Kang

机构 * Korea University(韩国大学)

AI总结 本文提出Edit-As-Act框架,通过目标回归规划实现开放词汇3D室内场景编辑,解决传统方法在生成和物理一致性上的不足,实验表明其在多个编辑任务中表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17571 2026-03-19 cs.CV

PanoVGGT: Feed-Forward 3D Reconstruction from Panoramic Imagery

PanoVGGT:从全景影像进行前馈3D重建

Yijing Guo, Mengjun Chao, Luo Wang, Tianyang Zhao, Haizhao Dai, Yingliang Zhang, Jingyi Yu, Yujiao Shi

机构 * ShanghaiTech University(上海科技大学) Sudo

AI总结 本文提出PanoVGGT模型,通过单次前向传递从单或多张全景影像联合预测相机姿态、深度图和3D点云,采用球面感知位置嵌入和全景特定三轴SO(3)旋转增强,解决全局框架模糊问题,并贡献PanoCity大规模户外全景数据集。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17554 2026-03-19 cs.CV

Prompt-Free Universal Region Proposal Network

无提示通用区域提议网络

Qihong Tang, Changhan Liu, Shaofeng Zhang, Wenbin Li, Qi Fan, Yang Gao

机构 * Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出无提示通用区域提议网络PF-RPN,通过自适应查询嵌入和级联自提示模块实现无需外部提示的对象定位,适用于多种目标检测场景。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17538 2026-03-19 cs.CV cs.AI

Learning Coordinate-based Convolutional Kernels for Continuous SE(3) Equivariant and Efficient Point Cloud Analysis

学习基于坐标的卷积核以实现连续SE(3)等价性和高效的点云分析

Jaein Kim, Hee Bin Yoo, Dong-Sig Han, Byoung-Tak Zhang

机构 * Interdisciplinary Program in Neuroscience, Seoul National University(首尔国立大学神经科学跨学科项目) Département d’Informatique, École Normale Supérieure (ENS)(规范高等学校计算机系) Department of Computing, Imperial College London(伦敦帝国学院计算系) Department of Computer Science and Engineering, Seoul National University(首尔国立大学计算机科学与工程系)

AI总结 本文提出ECKConv,通过坐标基网络设计实现SE(3)等价性和高效点云处理,在分类、姿态注册等任务中验证了其性能优势。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17355 2026-03-19 cs.CV

OnlineHMR: Video-based Online World-Grounded Human Mesh Recovery

OnlineHMR:基于视频的在线世界坐标人体网格恢复

Yiwen Zhao, Ce Zheng, Yufu Wang, Hsueh-Han Daniel Yang, Liting Wen, Laszlo A. Jeni

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出OnlineHMR,一种在线处理框架,通过因果键值缓存和滑动窗口学习策略实现在线世界坐标人体网格恢复,适用于AR/VR等交互场景。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17312 2026-03-19 cs.CV cs.AI

Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress

基于视觉语言模型的递归推理用于估计长周期具身任务进度

Yuelin Zhang, Sijie Cheng, Chen Li, Zongzhao Li, Yuxin Huang, Yang Liu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程研究中心) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

AI总结 本文提出R²VLM模型,通过递归推理框架处理局部视频片段,维护全局上下文,实现复杂时间依赖推理,提升长周期任务进度估计性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17161 2026-03-19 cs.CV

GazeOnce360: Fisheye-Based 360° Multi-Person Gaze Estimation with Global-Local Feature Fusion

GazeOnce360:基于鱼眼的360°多人凝视估计与全局-局部特征融合

Zhuojiang Cai, Zhenghui Sun, Feng Lu

机构 * State Key Laboratory of VR Technology and Systems, School of CSE, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学计算机科学与工程学院)

AI总结 本文提出GazeOnce360,一种端到端模型,用于从单个桌面安装的向上鱼眼摄像头估计多人凝视方向。通过引入MPSGaze360大规模合成数据集,融合全局低分辨率上下文与高分辨率局部眼区,解决鱼眼图像的严重失真和视角变化问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17159 2026-03-19 cs.CV cs.RO

BEV-SLD: Self-Supervised Scene Landmark Detection for Global Localization with LiDAR Bird's-Eye View Images

BEV-SLD:基于LiDAR鸟瞰图像的自监督场景地标检测用于全局定位

David Skuddis, Vincent Ress, Wei Zhang, Vincent Ofosu Nyako, Norbert Haala

机构 * Institute for Photogrammetry and Geoinformatics, University of Stuttgart, Germany(摄影测量与地理信息研究所,斯图加特大学,德国)

AI总结 本文提出BEV-SLD,通过自监督学习利用鸟瞰图像发现特定场景模式,实现鲁棒的全局定位,优于现有方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16966 2026-03-19 cs.CV cs.AI cs.MM cs.SD eess.AS

CineSRD: Leveraging Visual, Acoustic, and Linguistic Cues for Open-World Visual Media Speaker Diarization

CineSRD:利用视觉、听觉和语言线索进行开放世界视觉媒体说话人聚类

Liangbin Huang, Xiaohua Liao, Chaoqun Cui, Shijing Wang, Zhaolong Huang, Yanlong Du, Wenji Mao

机构 * Hujing Digital Media and Entertainment Group(华景数字媒体与娱乐集团) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部门) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)

AI总结 CineSRD通过整合视觉、听觉和语言线索,解决开放世界视觉媒体中说话人识别的挑战,提出统一多模态框架并构建专用基准数据集,验证其在复杂场景下的鲁棒性和泛化能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14920 2026-03-19 cs.CV

F2HDR: Two-Stage HDR Video Reconstruction via Flow Adapter and Physical Motion Modeling

F2HDR:通过流适配器和物理运动建模的两阶段HDR视频重建

Huanjing Yue, Dawei Li, Shaoxiong Tu, Jingyu Yang

机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) State Key Laboratory of Smart Power Distribution Equipment and System, Tianjin University(天津大学智能电力分配设备与系统国家重点实验室) Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 本文提出F2HDR框架,通过流适配器和物理运动建模解决HDR视频重建中的动态场景对齐和细节恢复问题,实现高质量重建。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09506 2026-03-19 cs.CV cs.RO

Context-Nav: Context-Driven Exploration and Viewpoint-Aware 3D Spatial Reasoning for Instance Navigation

Context-Nav: 基于上下文的探索与视点感知的3D空间推理用于实例导航

Won Shik Jang, Ue-Hwan Kim

机构 * Department of AI Convergence(人工智能融合系)

AI总结 Context-Nav通过上下文驱动的探索和视点感知的3D空间推理,提升实例导航任务的性能,无需特定任务训练,实现最先进的结果。

Comments Accepted to CVPR 2026. Code is available at https://github.com/AutoCompSysLab/ContextNav

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23562 2026-03-19 cs.LG cs.AI cs.CL

VL-RouterBench: A Benchmark for Vision-Language Model Routing

VL-RouterBench:一种用于视觉-语言模型路由的基准测试

Zhehao Huang, Baijiong Lin, Jingyuan Zhang, Jingying Wang, Yuhang Liu, Ning Lu, Tao Li, Xiaolin Huang

机构 * Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(1 图像处理与模式识别研究所,上海交通大学) The Hong Kong University of Science and Technology (Guangzhou)(2 香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(3 香港科学与技术大学)

AI总结 本文提出VL-RouterBench,用于系统评估视觉-语言模型路由系统的能力,通过构建质量与成本矩阵,评估10种路由方法并发现显著的路由改进空间,揭示了路由架构改进的潜力。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02341 2026-03-19 cs.CV

TALO: Pushing 3D Vision Foundation Models Towards Globally Consistent Online Reconstruction

TALO:推动3D视觉基础模型向全球一致的在线重建迈进

Fengyi Zhang, Tianjun Zhang, Kasra Khosoussi, Zheng Zhang, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出基于薄板样条的高自由度长期对齐框架,通过全局传播控制点纠正空间变化不一致,并采用点无关子图注册设计提升鲁棒性,实验表明其在多数据集和相机配置下均能获得更一致的几何和更低的轨迹误差。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16955 2026-03-19 cs.CV cs.LG eess.IV

Neighbor GRPO: Contrastive ODE Policy Optimization Aligns Flow Models

邻居GRPO:对比ODE策略优化对齐流模型

Dailan He, Guanlin Feng, Xingtong Ge, Yazhe Niu, Yi Zhang, Bingqi Ma, Guanglu Song, Yu Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) Vivix Group Limited(Vivix集团有限公司) HKUST(香港理工大学) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(创新香港下的CPII)

AI总结 本文提出Neighbor GRPO,通过扰动ODE初始噪声条件生成候选轨迹,基于softmax距离优化,避免SDE,提升效率与生成质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11005 2026-03-19 cs.CV

Draft and Refine with Visual Experts

草稿与润色:借助视觉专家

Sungheon Jeong, Ryozo Masukawa, Jihong Park, Sanggeon Yun, Wenjun Huang, Hanning Chen, Mahdi Imani, Mohsen Imani

机构 * University of California, Irvine(加州大学尔湾分校) Northeastern University(东北大学) MOLOCO

AI总结 本文提出DnR框架,通过可视化专家反馈提升模型视觉利用能力,减少幻觉并提高多模态系统可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23728 2026-03-19 cs.CV cs.AI

M3DLayout: A Multi-Source Dataset of 3D Indoor Layouts and Structured Descriptions for 3D Generation

M3DLayout:一个多源的3D室内布局及结构描述数据集用于3D生成

Yiheng Zhang, Zhuojiang Cai, Mingdao Wang, Meitong Guo, Tianxiao Li, Li Lin, Yuwang Wang

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学) Migu Beijing Research Institute(咪咕北京研究院)

AI总结 本文提出M3DLayout数据集,包含21367个布局和433k个物体实例,整合真实扫描、专业CAD设计和程序生成场景,为3D生成模型提供多样化的空间和语义学习基础。

Comments CVPR 2026; Project Page: https://graphic-kiliani.github.io/M3DLayout/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22496 2026-03-19 cs.CV

Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation

MLLMs关注什么以及依赖什么:解释自回归标记生成

Ruoyu Chen, Xiaoqing Guo, Kangwei Liu, Siyuan Liang, Shiming Liu, Qunli Zhang, Laiyuan Wang, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) College of Computing and Data Science, NTU(NTU 计算与数据科学学院) Huawei(华为) School of Flexible Electronics, SYSU(SYSU 灵活电子学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(Sun Yat-sen 大学深圳校区计算机科学与技术学院)

AI总结 本文提出EAGLE框架,通过轻量级黑盒方法解释MLLMs的自回归标记生成,量化语言先验和感知证据的影响,提升模型可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13615 2026-03-19 cs.AI cs.CL cs.HC

See, Think, Act: Teaching Multimodal Agents to Effectively Interact with GUI by Identifying Toggles

看见、思考、行动:通过识别切换器教多模态代理有效交互GUI

Zongru Wu, Rui Mao, Zhiyuan Tian, Pengzhou Cheng, Tianjie Ju, Zheng Wu, Lingzhong Dong, Haiyue Sheng, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

AI总结 本文提出State-aware Reasoning方法,通过识别当前切换状态和指令目标状态,提升多模态代理在GUI切换指令执行的准确性,实验显示准确率提升超30%。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05186 2026-03-19 cs.RO cs.CV

Learning to See and Act: Task-Aware Virtual View Exploration for Robotic Manipulation

学习感知与行动:面向机器人操作的任务感知虚拟视角探索

Yongjie Bai, Zhouxia Wang, Yang Liu, Kaijun Luo, Yifan Wen, Mingtong Dai, Weixing Chen, Ziliang Chen, Lingbo Liu, Guanbin Li, Liang Lin

机构 * Sun Yat-sen University(中山大学) Pengcheng Laboratory(鹏城实验室) Nanyang Technological University(南洋理工大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) X-Era AI Lab(X-Era AI实验室)

AI总结 本文提出TVVE框架,通过动态选择任务相关虚拟视角和重构场景表示,提升机器人操作在遮挡和跨任务迁移中的性能,实验验证其鲁棒性。

Comments 24 pages, 15 figures, Project page: https://hcplab-sysu.github.io/TAVP, Code: https://github.com/HCPLab-SYSU/TAVP.git, Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19161 2026-03-19 cs.CV

Benchmarking Endoscopic Surgical Image Restoration and Beyond

内窥手术图像修复与更广泛的评估

Jialun Pei, Diandian Guo, Donghui Yang, Zhixi Li, Yuxin Feng, Long Ma, Bo Du, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Dalian University of Technology(大连理工大学) Southern Medical University(南方医科大学) Xidian University(西安电子科技大学) Wuhan University(武汉大学)

AI总结 本文提出SurgClean数据集,用于评估内窥手术场景中的多种图像修复任务,揭示现有算法与临床需求间的差距,并从结构和语义角度分析手术与自然场景的退化差异。

Comments This work has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏