arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8673 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8673 篇

2603.22560 2026-04-07 cs.RO 57%

Allometric Scaling Laws for Bipedal Robots

双足机器人的等比定律

Naomi Oke, Aja M. Carter, Ben Gu, Steven Man, Cordelia Pride, Sarah Bergbreiter, Aaron M. Johnson

机构 * Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文研究双足机器人腿部长度与质量、速度等参数的等比关系,发现机器人质量与腿部长度平方成正比,与生物等比定律不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03766 2026-04-07 cs.RO cs.SY eess.SY 57%

A Novel Hybrid PID-LQR Controller for Sit-To-Stand Assistance Using a CAD-Integrated Simscape Multibody Lower Limb Exoskeleton

一种用于坐-立转换辅助的新型混合PID-LQR控制器:基于CAD集成的Simscape Multibody下肢外骨骼

Ranjeet Kumbhar, Rajmeet Singh, Appaso M Gadade, Ashish Singla, Irfan Hussain

机构 * Thapar Institute of Engineering and Technology(塔帕尔工程技术学院) Khalifa University Center for Autonomous Robotic Systems (KUCARS)(哈利法大学自主机器人系统中心) Khalifa University(哈利法大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出一种混合PID-LQR控制器,用于下肢外骨骼坐-立转换辅助,通过CAD集成Simscape Multibody建立高保真动态模型,并通过仿真验证其在关节轨迹跟踪中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03558 2026-04-07 cs.CV 57%

LOGER: Local--Global Ensemble for Robust Deepfake Detection in the Wild

LOGER:用于野外鲁棒深度伪造检测的局部-全局集成

Fei Wu, Dagong Lu, Mufeng Yao, Xinlei Xu, Fengjun Guo

机构 * Shanghai Jiao Tong University(上海交通大学) INTSIG Information(INTSIG信息)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 LOGER通过局部-全局集成框架提升深度伪造检测鲁棒性,利用多尺度视觉基础模型捕捉全局异常,结合多实例学习策略提取局部伪造痕迹,有效应对真实世界退化。

Comments 2nd place (out of 94 teams) in the NTIRE 2026 Robust Deepfake Detection Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03377 2026-04-07 cs.CV 57%

ViBA: Implicit Bundle Adjustment with Geometric and Temporal Consistency for Robust Visual Matching

ViBA: 基于几何和时间一致性的隐式捆绑调整用于鲁棒视觉匹配

Xiaoji Niu, Yuqing Wang, Yan Wang, Hailiang Tang, Tisheng Zhang

机构 * GNSS Research Center, Wuhan University(武汉大学卫星导航定位技术研究中心) Electronic Information School, Wuhan University(武汉大学电子信息学院) Hubei Technology Innovation Center for Spatiotemporal Information and Positioning Navigation(湖北省时空信息与定位导航技术创新中心) Hubei Luojia Laboratory(湖北珞珈实验室)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 ViBA结合几何优化与特征学习,实现连续在线训练,通过隐式可微的几何残差框架提升视觉匹配的鲁棒性和精度,实测在EuRoC和UMA数据集上显著降低位移和旋转误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03944 2026-04-07 cs.CV 57%

SCP: Spatial Causal Prediction in Video

SCP:视频中的空间因果预测

Yanguang Zhao, Jie Yang, Shengqiong Wu, Shutong Hu, Hongbo Qiu, Yu Wang, Guijia Zhang, Tan Kai Ze, Hao Fei, Chia-Wen Lin, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) Shenzhen University(深圳大学) Sichuan University(四川大学) National Tsing Hua University(国立清华大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出SCP任务,挑战模型超越观察预测空间因果结果,并构建SCP-Bench基准测试,揭示人类与模型性能差距及因果推理局限。

Comments 30 pages, 21 figures, 17 tables, CVPR findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03530 2026-04-07 cs.LG 57%

A Multi-Level Causal Intervention Framework for Mechanistic Interpretability in Variational Autoencoders

一种多级因果干预框架用于变分自编码器的机制可解释性

Dip Roy, Rajiv Misra, Sanjay Kumar Singh, Anisha Roy

机构 * Indian Institute of Technology, Patna(印度理工学院巴特那分校) Rajarshi School of Management Technology, Varanasi(拉贾尔希管理技术学院瓦拉纳西分校) Jaypee Institute of Information Technology, Noida(杰皮信息技术学院诺伊达分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本文提出多级因果干预框架,用于分析变分自编码器的机制可解释性,定义了三个新指标,并通过大规模实验揭示了VAE因果机制的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02586 2026-04-06 cs.CV cs.GR 57%

TrackerSplat: Exploiting Point Tracking for Fast and Robust Dynamic 3D Gaussians Reconstruction

TrackerSplat:利用点跟踪实现快速且鲁棒的动态3D高斯重建

Daheng Yin, Isaac Ding, Yili Jin, Jianxin Shi, Jiangchuan Liu

机构 * Simon Fraser University(西蒙弗雷泽大学) McGill University(麦吉尔大学) Nankai University(南开大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 TrackerSplat通过整合先进点跟踪方法,提升动态场景重建中3D高斯的鲁棒性和可扩展性,有效减少大位移导致的失真和时间不一致问题,实现高吞吐量与高质量重建。

Comments 11 pages, 6 figures

Journal ref SA Conference Papers '25: Proceedings of the SIGGRAPH Asia 2025 Conference Papers Article No.: 71, Pages 1 - 11

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17266 2026-04-06 cs.RO 57%

Simulation of Active Soft Nets for Capture of Space Debris

主动软网的模拟用于空间碎片的捕获

Leone Costi, Dario Izzo

机构 * European Space Agency(欧洲航天局)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出基于MuJoCo的模拟器,用于设计和控制软机器人网自主清除空间碎片。研究不同机械模型和控制策略,展示软网在捕获Envisat时的高适应性与成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02107 2026-04-03 cs.RO 57%

HyVGGT-VO: Tightly Coupled Hybrid Dense Visual Odometry with Feed-Forward Models

HyVGGT-VO:紧密耦合的混合密集视觉里程计与前馈模型

Junxiang Pan, Lipu Zhou, Baojie Chen

机构 * School of Instrument Science and Opto-electronics Engineering, Beihang University(北京航空航天大学仪器科学与光电工程学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出HyVGGT-VO框架,结合稀疏VO的高效计算与前馈模型的密集重建能力,实现高效实时姿态估计与密集重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29966 2026-04-03 cs.CV 57%

Scaling Video Pretraining for Surgical Foundation Models

为手术基础模型扩展视频预训练

Sicheng Lu, Zikai Xiao, Jianhui Wei, Danyu Sun, Qi Lu, Keli Hu, Yang Feng, Jian Wu, Zongxin Yang, Zuozhu Liu

机构 * The Johns Hopkins University(约翰霍普金斯大学) Zhejiang University(浙江大学) Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学伊利诺伊大学厄巴纳-香槟分校联合学院) Zhejiang Lab(之江实验室) Shaoxing University(绍兴大学) Angelalign(时代天使) Harvard Medical School(哈佛医学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出SurgRec,通过大规模数据和统一预训练流程提升手术视频理解能力,对比SSL基线和视觉语言模型,展示SurgRec在多个下游任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22193 2026-04-03 cs.CV 57%

PAM: A Pose-Appearance-Motion Engine for Sim-to-Real HOI Video Generation

PAM:一种用于仿真到现实手-物体互动视频生成的姿态-外观-运动引擎

Mingju Gao, Kaisen Yang, Huan-ang Gao, Bohan Li, Ao Ding, Wenyi Li, Yangcheng Yu, Jinkun Liu, Shaocong Xu, Yike Niu, Haohan Chi, Hao Chen, Hao Tang, Yu Zhang, Li Yi, Hao Zhao

机构 * Peking University(北京大学) Tsinghua University(清华大学) BAAI(北京智源人工智能研究院) SJTU(上海交通大学) Eastern Institute of Technology(东方理工高等研究院) University of Cambridge(剑桥大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出PAM引擎,整合姿态、外观和运动生成可控的HOI视频,通过实验验证其在DexYCB和OAKINK2数据集上的性能优势。

Comments Accepted to CVPR 2026 Code: https://github.com/GasaiYU/PAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29697 2026-04-01 cs.CV 57%

FED-Bench: A Cross-Granular Benchmark for Disentangled Evaluation of Facial Expression Editing

FED-Bench:一种跨粒度的面部表情编辑评估基准

Fengjian Xue, Xuecheng Wu, Heli Sun, Yunyun Shi, Shi Chen, Liangyu Fu, Jinheng Xie, Dingkang Yang, Hao Wang, Junxiao Xue, Liang He

机构 * Xi’an Jiaotong University(西安交通大学) Northwestern Polytechnical University(西北工业大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Zhejiang Lab(之江实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出FED-Bench,通过构建747个三元组基准,引入FED-Score评估协议,评估面部表情编辑的对齐、保真度和相对表达增益,揭示当前方法在高保真与准确表达操控间的困境,并提供20k+真实世界面部训练集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29666 2026-04-01 cs.CV 57%

CoRe-DA: Contrastive Regression for Unsupervised Domain Adaptation in Surgical Skill Assessment

CoRe-DA:基于对比学习的无监督领域适应在手术技能评估中的应用

Dimitrios Anastasiou, Razvan Caramalau, Jialang Xu, Runlong He, Freweini Tesfai, Matthew Boal, Nader Francis, Danail Stoyanov, Evangelos B. Mazomenos

机构 * UCL Hawkes Institute, University College London(伦敦大学学院霍克斯研究所) Dept of Computer Science, University College London(伦敦大学学院计算机科学系) The Griffin Institute(格里芬研究所)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出CoRe-DA,一种基于对比学习的无监督领域适应方法,用于手术技能评估,通过相对评分监督和目标域自训练,提升跨领域泛化能力,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29651 2026-04-01 cs.HC cs.AI cs.CL cs.IR 57%

Semantic Interaction for Narrative Map Sensemaking: An Insight-based Evaluation

语义交互用于叙事地图认知:基于洞察的评估

Brian Felipe Keith-Norambuena, Fausto German, Eric Krokos, Sarah Joseph, Chris North

机构 * Universidad Católica del Norte(智利天主教大学) Virginia Tech(弗吉尼亚理工大学) U.S. Government(美国政府)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文通过实验评估语义交互在叙事地图认知中的有效性,发现基于地图的原型比时间线基线更具洞察力,语义交互条件在统计上显著优于基本地图条件,提供了叙事认知中地图表示优于时间线的实证证据。

Comments Text2Story Workshop 2026 at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08533 2026-04-01 cs.CV 57%

SecAgent: Efficient Mobile GUI Agent with Semantic Context

SecAgent:基于语义上下文的高效移动GUI代理

Yiping Xie, Song Chen, Jingxuan Xing, Wei Jiang, Zekun Zhu, Yingyao Wang, Pi Bu, Jun Song, Yuning Jiang, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘天集团)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 SecAgent通过构建中文移动GUI数据集和语义上下文机制,提升移动GUI代理的效率与性能,实现高效任务处理与多语言支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20155 2026-04-01 cs.CV 57%

PartNeXt: A Next-Generation Dataset for Fine-Grained and Hierarchical 3D Part Understanding

PartNeXt:面向细粒度和层次化3D部件理解的下一代数据集

Penghao Wang, Yiyang He, Xin Lv, Yukai Zhou, Lan Xu, Jingyi Yu, Jiayuan Gu

机构 * ShanghaiTech University(上海科技大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 PartNeXt通过23000个高质量纹理3D模型,解决传统数据集在可扩展性和实用性上的不足,提升细粒度部件分割和3D部件问答任务的性能。

Comments NeurIPS 2025 DB Track. Project page: https://authoritywang.github.io/partnext

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28429 2026-03-31 cs.AR cs.AI 57%

AceleradorSNN: A Neuromorphic Cognitive System Integrating Spiking Neural Networks and DynamicImage Signal Processing on FPGA

AceleradorSNN:一种集成脉冲神经网络和动态图像信号处理的类脑认知系统

Daniel Gutierrez, Ruben Martinez, Leyre Arnedo, Antonio Cuesta, Soukaina El Hamry

机构 * Intigia R\&D Department Alicante, Spain

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 为实现自主系统中的高速低延迟高效目标检测,提出AceleradorSNN系统,整合脉冲神经网络与动态图像信号处理,通过FPGA实现实时流式图像处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28224 2026-03-31 cs.CV 57%

Ghost-FWL: A Large-Scale Full-Waveform LiDAR Dataset for Ghost Detection and Removal

Ghost-FWL: 一种大规模全波形激光雷达数据集用于鬼影检测与去除

Kazuma Ikeda, Ryosei Hara, Rokuto Nagata, Ozora Sako. Zihao Ding, Takahiro Kado, Ibuki Fujioka, Taro Beppu, Mariko Isogawa, Kentaro Yoshioka

机构 * Keio University(庆应义塾大学) Sony Semiconductor Solutions(索尼半导体解决方案)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出Ghost-FWL数据集,用于解决移动激光雷达中鬼影点的检测与去除问题,通过全波形激光雷达数据提升3D映射和定位精度,实验表明其在SLAM和目标检测任务中效果显著。

Comments Accepted to CVPR 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28092 2026-03-31 cs.LG 57%

InkDrop: Invisible Backdoor Attacks Against Dataset Condensation

InkDrop: 针对数据集压缩的不可见后门攻击

He Yang, Dongyi Lv, Song Ma, Wei Xi, Zhi Wang, Hanlin Gu, Yajie Wang

机构 * IEEE Publication Technology Group(IEEE出版技术组)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本文提出InkDrop,一种针对数据集压缩的隐蔽后门攻击方法,通过利用模型决策边界附近的不确定性,实现对压缩数据集的高效且隐蔽的恶意操控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24257 2026-03-31 cs.CV 57%

Memory-Augmented Vision-Language Agents for Persistent and Semantically Consistent Object Captioning

具有记忆增强的视觉-语言代理用于持久且语义一致的对象描述

Tommaso Galliena, Stefano Rosa, Tommaso Apicella, Pietro Morerio, Alessio Del Bue, Lorenzo Natale

机构 * Italian Institute of Technology, Genoa, Italy(意大利理工学院,热那亚,意大利) University of Genoa, Genoa, Italy(热那亚大学,热那亚,意大利)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV

AI总结 本文提出一种统一的记忆增强视觉-语言代理,通过单一自回归框架同时处理数据关联、对象描述和探索策略,提升持久且语义一致的对象描述能力。

Comments 24 pages, 7 figures, 7 tables (including Supplementary Materials)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15109 2026-03-31 cs.SI cs.AI cs.CY cs.HC cs.MA 57%

An Agentic Operationalization of DISARM for FIMI Investigation on Social Media

针对FIMI调查的社会媒体的代理操作化DISARM

Kevin Tseng, Juan Carlos Toledano, Bart De Clerck, Yuliia Dukach, Phil Tinn

机构 * Center of Research Acquisition National Institute of Cyber Security Taipei City, Taiwan Department of Mathematics Royal Military Academy Brussels, Belgium Research Division OpenMinds Ltd. Kyiv, Ukraine Department of Sustainable Communication Technologies SINTEF Oslo, Norway (Corresponding Author)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文提出一种基于代理的DISARM操作化框架,用于社会媒体上的FIMI调查。通过整合通用代理AI组件,实现对社交媒体数据中操纵性行为的识别和映射,提升分析效率和可解释性。

Comments This paper was originally presented at the International Conference on Military Communication and Information Systems (ICMCIS), organized by the Information Systems Technology (IST) Scientific and Technical Committee, IST-224-RSY---the ICMCIS, held in Bath, United Kingdom, 12-13 May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20770 2026-03-31 cs.CV 57%

OccuFly: A 3D Vision Benchmark for Semantic Scene Completion from the Aerial Perspective

OccuFly:一种用于从空中视角进行语义场景补全的3D视觉基准

Markus Gross, Sai B. Matha, Aya Fahmy, Rui Song, Daniel Cremers, Henri Meess

机构 * Fraunhofer Institute IVI(弗劳恩霍夫交通与基础设施系统研究所) TU Munich(慕尼黑工业大学) MCML(慕尼黑机器学习中心) UCLA(加州大学洛杉矶分校)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出OccuFly基准,通过无LiDAR相机数据生成框架,提供21类语义的20000+样本,评估视觉模型在空中场景中的局限性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27534 2026-03-31 cs.RO 57%

S3KF: Spherical State-Space Kalman Filtering for Panoramic 3D Multi-Object Tracking

S3KF:基于旋转激光雷达和四鱼眼相机的全景三维多目标跟踪框架

Zhongyuan Liu, Shaonan Yu, Jianping Li, Pengfei Wan, Xinhang Xu, Pengfei Wang, Maggie Y. Gao, Lihua Xie

机构 * CertaintyX School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) ST Engineering(新科工程) School of Civil and Environmental Engineering, Nanyang Technological University(南洋理工大学土木与环境工程学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出S3KF框架,利用旋转激光雷达和四鱼眼相机实现全景三维多目标跟踪,通过球面状态表示和扩展球面卡尔曼滤波提升跟踪精度与实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10652 2026-03-31 cs.CV cs.CR 57%

TriDF: Evaluating Perception, Detection, and Hallucination for Interpretable DeepFake Detection

TriDF:评估可解释深度伪造检测的感知、检测和幻觉

Jian-Yu Jiang-Lin, Kang-Yang Huang, Ling Zou, Ling Lo, Sheng-Ping Yang, Yu-Wen Tseng, Kun-Hsiang Lin, Chia-Ling Chen, Yu-Ting Ta, Yan-Tsung Wang, Po-Ching Chen, Hongxia Xie, Hong-Han Shuai, Wen-Huang Cheng

机构 * National Taiwan University(国立台湾大学) National Yang Ming Chiao Tung University(国立阳明交通大学) Jilin University(吉林大学) VinUniversity

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 TriDF提出一个全面的可解释深度伪造检测基准,评估模型感知、检测和幻觉能力,揭示三者间的相互作用,为构建可信系统提供基础。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26036 2026-03-30 cs.CV 57%

Face2Parts: Exploring Coarse-to-Fine Inter-Regional Facial Dependencies for Generalized Deepfake Detection

Face2Parts: 探索粗到细的区域间面部依赖关系以实现通用深度伪造检测

Kutub Uddin, Nusrat Tasnim, Byung Tae Oh

机构 * School of Electronics and Information Engineering, Korea Aerospace University(韩国航空大学电子与信息工程学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出Face2Parts方法,通过粗到细的区域间依赖关系提升深度伪造检测性能,采用层次特征表示和通道注意力机制,在多个数据集上取得高AUC成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23866 2026-03-30 cs.CR cs.LG 57%

A Channel-Triggered Backdoor Attack on Wireless Semantic Image Reconstruction

面向无线语义图像重建的通道触发后门攻击

Jialin Wan, Jinglong Shen, Nan Cheng, Zhisheng Yin, Yiliang Liu, Wenchao Xu, Xuemin, Shen

机构 * School of Telecommunications Engineering, Xidian University(西安电子科技大学通信工程学院) Department of Computing, Hong Kong Polytechnic University(香港理工大学计算学系) Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本文提出一种利用无线信道特性作为激活触发器的后门攻击框架,解决传统输入级触发器在严格输入约束下的局限性,通过信道统计参数提升隐蔽性与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25887 2026-03-30 cs.CV 57%

World Reasoning Arena

世界推理竞技场

PAN Team, Qiyue Gao, Kun Zhou, Jiannan Xiang, Zihan Liu, Dequan Yang, Junrong Chen, Arif Ahmad, Cong Zeng, Ganesh Bannur, Xinqi Huang, Zheqi Liu, Yi Gu, Yichi Yang, Guangyi Liu, Zhiting Hu, Zhengzhong Liu, Eric Xing

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 本文提出WR-Arena基准,评估世界模型在动作模拟、长期预测和推理规划三方面的能力,揭示当前模型与人类水平推理的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25867 2026-03-30 cs.CV 57%

Seeing Through Smoke: Surgical Desmoking for Improved Visual Perception

穿透烟雾:改进视觉感知的手术去烟技术

Jingpei Lu, Fengyi Jiang, Xiaorui Zhang, Lingbo Jin, Omid Mohareri

机构 * Intuitive Surgical(直觉外科)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出基于变压器的手术去烟模型,通过物理启发的去烟头联合预测无烟图像和对应的烟雾图。通过合成数据生成管道解决配对烟雾到无烟训练数据不足的问题,构建了最大的手术烟雾数据集,实验表明在图像重建上优于现有去雾和去烟方法。

Comments 8 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08055 2026-03-30 cs.CV 57%

Beyond Deepfake vs Real: Facial Deepfake Detection in the Open-Set Paradigm

超越深度伪造与真实:在开集范式下的人脸深度伪造检测

Nadarasar Bahavan, Sachith Seneviratne, Sanjay Saha, Ken Chen, Sanka Rasnayaka, Saman Halgamuge

机构 * The University of Melbourne(墨尔本大学) National University of Singapore(新加坡国立大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出基于监督对比学习的开集深度伪造分类算法,旨在提升对新兴深度伪造技术的检测能力,通过FaceForensics++数据集验证,实现领先性能。

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition - Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25689 2026-03-27 cs.CV 57%

LEMMA: Laplacian pyramids for Efficient Marine SeMAntic Segmentation

LEMMA:用于高效海洋语义分割的拉普拉斯金字塔

Ishaan Gakhar, Laven Srivastava, Sankarshanaa Sagaram, Aditya Kasliwal, Ujjwal Verma

机构 * Manipal Institute of Technology, Manipal Academy of Higher Education(马尼帕尔理工学院,马尼帕尔高等教育学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 LEMMA通过拉普拉斯金字塔提升边缘识别,降低计算成本,实现高效海洋遥感分割,展现优异性能。

Comments Accepted at the MaCVi Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏