arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8686 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8686 篇

2603.14132 2026-03-17 cs.CV cs.LG 62%

DualSwinFusionSeg: Multimodal Martian Landslide Segmentation via Dual Swin Transformer with Multi-Scale Fusion and UNet++

DualSwinFusionSeg: 多模态火星滑坡分割 via 双Swin Transformer 与多尺度融合及UNet++

Shahriar Kabir, Abdullah Muhammed Amimul Ehsan, Istiak Ahmmed Rifti, Md Kaykobad Reza

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV、cs.LG

AI总结 本文提出DualSwinFusionSeg,通过双Swin Transformer与多尺度融合及UNet++实现多模态火星滑坡分割,验证了在有限标注数据下提升分割精度的效果。

Comments 10 pages, 2 Figures, 12 Tables. Code is available at: https://github.com/amimulamim/Mars-LS-Segmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05267 2026-03-17 cs.IT cs.AI cs.LG math.IT 62%

Uncertainty Quantification and Data Efficiency in AI: An Information-Theoretic Perspective

人工智能中的不确定性量化与数据效率:信息论视角

Osvaldo Simeone, Yaniv Romano

机构 * Institute for Intelligent Networked Systems, Northeastern University London(智能网络系统研究所,诺思安普顿大学伦敦分校) Departments of Electrical and Computer Engineering and of Computer Science at the Technion–Israel Institute of Technology(技术ion-以色列理工学院电子与计算机工程系和计算机科学系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文从信息论角度探讨了人工智能中数据有限场景下的不确定性量化与数据效率问题,分析了贝叶斯学习框架、信息论泛化界限及合成数据增强等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12960 2026-03-16 cs.RO cs.AI 62%

Efficient Real-World Autonomous Racing via Attenuated Residual Policy Optimization

通过衰减残差策略优化实现高效的现实世界自主赛车

Raphael Trumpp, Denis Hoornaert, Mirco Theile, Marco Caccamo

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出α-RPO方法,通过逐步衰减基础策略生成独立神经策略,减少系统复杂度并提升驾驶性能,适用于现实世界机器人部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12930 2026-03-16 cs.CV cs.LG 62%

Rethinking VLMs for Image Forgery Detection and Localization

重新思考视觉语言模型用于图像伪造检测与定位

Shaofeng Guo, Jiequan Cui, Richang Hong

机构 * Hefei University of Technology Key Laboratory of Knowledge Engineering with Big Data, Ministry of Education(合肥工业大学大数据知识工程重点实验室,教育部)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 本文研究如何利用视觉语言模型提升图像伪造检测与定位性能,发现传统先验知识对检测效果有负面影响,提出IFDL-VLM新方法,通过位置掩码增强模型可解释性,并在多个基准上取得新最优结果。

Comments 8pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12758 2026-03-16 cs.CV cs.AI 62%

FC-Track: Overlap-Aware Post-Association Correction for Online Multi-Object Tracking

FC-Track: 重叠感知的在线多目标跟踪后关联修正

Cheng Ju, Zejing Zhao, Akio Namiki

机构 * Graduate School of Engineering, Chiba University(Chiba大学工学研究科)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 FC-Track通过重叠感知的后关联修正方法,有效减少在线多目标跟踪中的身份切换问题,无需全局优化或重识别,实现在复杂动态环境下的高可靠性跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12719 2026-03-16 cs.CV cs.AI 62%

IGASA: Integrated Geometry-Aware and Skip-Attention Modules for Enhanced Point Cloud Registration

IGASA: 集成几何感知和跳过注意力模块的增强点云配准

Dongxu Zhang, Jihua Zhu, Shiqi Li, Wenbiao Yan, Haoran Xu, Peilin Fan, Huimin Lu

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本文提出IGASA框架,通过层次金字塔架构和HCLA、IGAR模块提升点云配准的鲁棒性和精度,实验表明其在多个基准数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09320 2026-03-11 cs.CV cs.AI 62%

SpaceSense-Bench: A Large-Scale Multi-Modal Benchmark for Spacecraft Perception and Pose Estimation

SpaceSense-Bench: 一个大规模多模态基准用于航天器感知与姿态估计

Aodi Wu, Jianhong Zuo, Zeyuan Zhao, Xubo Luo, Ruisuo Wang, Xue Wan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 SpaceSense-Bench通过大规模多模态数据集提升航天器感知与姿态估计的鲁棒性与准确性。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09291 2026-03-11 cs.CV cs.AI 62%

DenoiseSplat: Feed-Forward Gaussian Splatting for Noisy 3D Scene Reconstruction

DenoiseSplat: 用于噪声3D场景重建的前馈高斯点散布

Fuzhen Jiang, Zhuoran Li, Yinlin Zhang

机构 * Hangzhou Dianzi University(杭州电子科技大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 DenoiseSplat通过前馈高斯点散布方法,在噪声多视图图像中实现更准确的3D场景重建,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14965 2026-03-11 cs.CV cs.RO 62%

You Only Pose Once: A Minimalist's Detection Transformer for Monocular RGB Category-level 9D Multi-Object Pose Estimation

你只需一次定位:一种极简主义的检测转换器用于单目RGB类别级9D多目标姿态估计

Hakjin Lee, Junghoon Seo, Jaehoon Sim

机构 * PIT IN Co.(PIT IN公司)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 YOPO提出了一种单阶段的检测转换器,通过端到端训练实现类别级9D多目标姿态估计,取得了新的状态-of-the-art成果。

Comments This paper has been accepted by IEEE ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16187 2026-03-10 cs.RO cs.AI 62%

EasyInsert: A Data-Efficient and Generalizable Insertion Policy

EasyInsert: 一种数据高效且具有通用性的插入策略

Guanghe Li, Junming Zhao, Shengjie Wang, Yang Gao

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海启智研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 EasyInsert通过delta-pose回归问题实现高效数据收集,提升机器人在杂乱环境中的插入任务泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16053 2026-03-10 cs.RO cs.AI 62%

Compose by Focus: Scene Graph-based Atomic Skills

通过聚焦:基于场景图的原子技能

Han Qi, Changhe Chen, Heng Yang

机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) Robotics Department, University of Michigan(密歇根大学机器人系)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于场景图的原子技能学习框架,结合图神经网络与扩散式模仿学习,并与视觉-语言模型结合,提升机器人在复杂任务中的稳健性和组合泛化能力。

Comments Acceptance to ICRA 2026. Website: https://computationalrobotics.seas.harvard.edu/SkillComposition/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06704 2026-03-10 cs.CV cs.LG 62%

On the Generalization Capacities of MLLMs for Spatial Intelligence

关于多模态大语言模型在空间智能中的泛化能力

Gongjie Zhang, Wenhao Li, Quanhao Qian, Jiuniu Wang, Deli Zhao, Shijian Lu, Ran Xu

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) HuPan Lab(虎朋实验室) Nanyang Technological University(南洋理工大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Camera-Aware MLLM框架,通过注入相机内参、数据增强和蒸馏几何先验,提升多模态大语言模型在空间任务中的泛化能力与鲁棒性。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02808 2026-03-10 cs.RO cs.AI cs.SY eess.SY 62%

Improving the Resilience of Quadrotors in Underground Environments by Combining Learning-based and Safety Controllers

通过结合学习型控制器和安全控制器提高地下环境中四旋翼的鲁棒性

Isaac Ronald Ward, Mark Paral, Kristopher Riordan, Mykel J. Kochenderfer

机构 * Stanford Intelligent Systems Laboratory, Department of Aeronautics and Astronautics, Stanford University(斯坦福大学航空航天系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本研究通过结合学习型和安全控制器,提高四旋翼在地下环境中的鲁棒性,实现任务完成与碰撞避免的平衡。

Comments Accepted and awarded best paper at the 11th International Conference on Control, Decision and Information Technologies (CoDIT 2025 - https://codit2025.org/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06512 2026-03-09 cs.RO cs.CV 62%

SG-DOR: Learning Scene Graphs with Direction-Conditioned Occlusion Reasoning for Pepper Plants

SG-DOR:基于方向条件遮挡推理的学习场景图用于Pepper植物

Rohit Menon, Niklas Mueller-Goldingen, Sicong Pan, Gokul Krishna Chenchani, Maren Bennewitz

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 SG-DOR通过方向条件遮挡推理,提升密集作物中果实遮挡预测与连接推断的准确性,为机器人采摘提供结构化关系信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06061 2026-03-09 cs.CV cs.RO 62%

Transforming Omnidirectional RGB-LiDAR data into 3D Gaussian Splatting

将全方位RGB-LiDAR数据转换为3D高斯散点

Semin Bae, Hansol Lim, Jongseong Brad Choi

机构 * Department of Computer Science, State University of New York(计算机科学系,纽约州立大学) Department of Mechanical Engineering, State University of New York(机械工程系,纽约州立大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种将全方位RGB-LiDAR数据转换为3D高斯散点的重用管道,解决数据处理中的非线性失真和计算开销问题,提升复杂场景的渲染保真度。

Comments This work has been submitted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10704 2026-03-09 cs.CV cs.RO 62%

(MGS)$^2$-Net: Unifying Micro-Geometric Scale and Macro-Geometric Structure for Cross-View Geo-Localization

(MGS)$^2$-Net:融合微几何尺度与宏几何结构的跨视角地理定位

Minglei Li, Mengfan He, Chunyu Li, Chao Chen, Xingyu Shao, Ziyang Meng

机构 * Department of Precision Instrument, Tsinghua University, Beijing 100084, China(精密仪器系,清华大学,北京100084,中国)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 (MGS)$^2$-Net通过融合微几何尺度与宏几何结构,解决跨视角地理定位中的几何错位问题,实现高精度和鲁棒性的定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03657 2026-03-05 cs.CV cs.AI 62%

InEdit-Bench: Benchmarking Intermediate Logical Pathways for Intelligent Image Editing Models

InEdit-Bench:智能图像编辑模型中间逻辑路径的基准测试

Zhiqiang Sheng, Xumeng Han, Zhiwei Zhang, Zenghui Xiong, Yifan Ding, Aoxiang Ping, Xiang Li, Tong Guo, Yao Mao

机构 * State Key Laboratory of Optical Field Manipulation Science and Technology, Institute of Optics and Electronics, Chinese Academy of Sciences(光学场操控科学与技术国家重点实验室,光学电子研究所,中国科学院) National Laboratory on Adaptive Optics(自适应光学国家实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 InEdit-Bench通过评估图像编辑模型在中间逻辑路径推理中的表现,揭示了现有模型在动态推理和多步骤演变建模方面的不足,推动更智能的多模态生成模型发展。

Comments CVPR findings. Project page: https://github.com/SZStrong1/InEdit-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03390 2026-03-05 cs.RO cs.AI 62%

Multi-Agent-Based Simulation of Archaeological Mobility in Uneven Landscapes

基于多智能体的考古移动性在不规则地形中的模拟

Chairi Kiourt, Vassilis Evangelidis, Dimitris Grigoropoulos

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种多智能体建模框架,用于模拟不规则地形中的考古移动性,通过强化学习实现高效动态适应,展示了地形感知追捕和运输分析的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07885 2026-03-05 cs.RO cs.AI 62%

Safety Guardrails for LLM-Enabled Robots

LLM赋能机器人中的安全护栏

Zachary Ravichandran, Alexander Robey, Vijay Kumar, George J. Pappas, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 RoboGuard通过两阶段护栏架构,利用根信任LLM和链式推理生成上下文安全规范,有效降低LLM赋能机器人在对抗攻击下的不安全计划执行率,提升系统安全性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00206 2026-03-03 cs.CV cs.AI 62%

TACIT Benchmark: A Programmatic Visual Reasoning Benchmark for Generative and Discriminative Models

TACIT基准:一个生成和判别模型的程序化视觉推理基准

Daniel Nobrega Medeiros

机构 * Independent Researcher(独立研究者)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 TACIT基准提出一个程序化视觉推理测试,包含10个任务和6个领域,通过生成和判别双轨评估模型在空间导航、抽象模式完成等任务中的推理能力。

Comments 10 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00108 2026-03-03 cs.RO cs.AI 62%

SurgFusion-Net: Diversified Adaptive Multimodal Fusion Network for Surgical Skill Assessment

SurgFusion-Net:用于外科技能评估的多样化自适应多模态融合网络

Runlong He, Freweini M. Tesfai, Matthew W. E. Boal, Nazir Sirajudeen, Dimitrios Anastasiou, Jialang Xu, Mobarak I. Hoque, Philip J. Edwards, John D. Kelly, Ashwin Sridhar, Abdolrahim Kadkhodamohammadi, Dhivya Chandrasekaran, Matthew J. Clarkson, Danail Stoyanov, Nader Francis, Evangelos B. Mazomenos

机构 * UCL Hawkes Institute and the Department of Medical Physics & Biomedical Engineering, UCL(UCL哈维斯研究所及UCL医学物理与生物医学工程系) UCL Hawkes Institute and the Department of Computer Science, UCL(UCL哈维斯研究所及UCL计算机科学系) UCL Hawkes Institute and the Division of Informatics, Imaging & Data Sciences, The University of Manchester(UCL哈维斯研究所及信息学、成像与数据科学系,曼彻斯特大学) UCL Hospitals NHS Foundation Trust(UCL医院 NHS基金会信托) Griffin Institute, Northwick Park and St Mark’s Hospital(格里芬研究所,北wick公园及圣马可医院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 SurgFusion-Net通过引入DRA策略和两个新的临床数据集,提升了多模态外科技能评估的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23761 2026-03-02 cs.LG cs.CV 62%

OPTIAGENT: A Physics-Driven Agentic Framework for Automated Optical Design

OPTIAGENT:一种基于物理的代理框架用于自动光学设计

Yuyu Geng, Lei Sun, Yao Gao, Xinxin Hu, Zhonghua Yi, Xiaolong Qian, Weijian Hu, Jian Bai, Kaiwei Wang

机构 * Zhejiang University(浙江大学) INSAIT, Sofia University(INSAIT,索菲亚大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 OPTIAGENT通过结合LLM与物理驱动的优化方法,首次实现了无需专业光学知识即可自动设计光学系统,提升了光学设计的自动化水平和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19565 2026-02-27 cs.CV cs.AI 62%

DICArt: Advancing Category-level Articulated Object Pose Estimation in Discrete State-Spaces

DICArt: 在离散状态空间中推进类别级拟合物体姿态估计

Li Zhang, Mingyu Mei, Ailing Wang, Xianhui Meng, Yan Zhong, Xinyuan Song, Liu Liu, Rujing Wang, Zaixing He, Cewu Lu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Peking University(北京大学) Emory University(埃默里大学) Hefei University of Technology(合肥工业大学) Jianghuai Advance Technology Center(江淮先进技术中心) Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 DICArt通过离散扩散过程和层次化运动学耦合策略,提升复杂环境下类别级6D姿态估计的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00288 2026-02-26 cs.CV cs.AI 62%

TimeBlind: A Spatio-Temporal Compositionality Benchmark for Video LLMs

TimeBlind: 一种用于视频大语言模型的时空组合性基准

Baiqi Li, Kangyi Zhao, Ce Zhang, Chancharik Mitra, Jean de Dieu Nyandwi, Gedas Bertasius

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 TimeBlind通过细粒度时空理解基准揭示视频大语言模型对时间动态理解的不足,展示其在实例准确率上的显著劣势,强调对静态视觉捷径的依赖。

Comments For code and data, see https://baiqi-li.github.io/timeblind_project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15427 2026-02-26 cs.RO cs.CV 62%

Lang2Lift: A Language-Guided Autonomous Forklift System for Outdoor Industrial Pallet Handling

Lang2Lift: 一种基于语言引导的户外工业叉车自主系统

Huy Hoang Nguyen, Johannes Huemer, Markus Murschitz, Tobias Glueck, Minh Nhat Vu, Andreas Kugi

机构 * AIT Austrian Institute of Technology GmbH(奥地利技术研究所) Automation & Control Institute(自动化与控制研究所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 Lang2Lift通过语言引导的视觉感知和闭环控制,实现户外环境下的自主叉车托盘拾取,提升工业自动化效率。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19983 2026-02-26 cs.RO cs.AI 62%

Contextual Safety Reasoning and Grounding for Open-World Robots

面向开放世界机器人的上下文安全推理与 grounding

Zachary Ravichandran, David Snyder, Alexander Robey, Hamed Hassani, Vijay Kumar, George J. Pappas

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 CORE框架通过视觉语言模型实现在线上下文推理与空间grounding,提供概率安全保证,在开放世界中有效执行上下文适应的安全行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20709 2026-02-25 cs.CV cs.AI 62%

Onboard-Targeted Segmentation of Straylight in Space Camera Sensors

空间相机传感器中 straylight 的 onboard 目标分割

Riccardo Gallon, Fabian Schiemenz, Alessandra Menicucci, Eberhard Gill

机构 * Department of Space Systems Engineering, Faculty of Aerospace Engineering(航天系统工程系,航空航天工程学院) Airbus Defence and Space GmbH(Airbus防务与空间有限公司)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本研究提出了一种基于 AI 的方法,用于在航天器资源受限硬件上实现空间相机中 straylight 的语义分割,并通过自定义指标评估其系统性能。

Comments Submitted to Aerospace Science and Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20636 2026-02-25 cs.CV cs.AI 62%

SurgAtt-Tracker: Online Surgical Attention Tracking via Temporal Proposal Reranking and Motion-Aware Refinement

SurgAtt-Tracker: 通过时间提案重排和运动感知细化实现在线手术注意力跟踪

Rulin Zhou, Guankun Wang, An Wang, Yujie Ma, Lixin Ouyang, Bolin Cui, Junyan Li, Chaowei Zhu, Mingyang Li, Ming Chen, Xiaopin Zhong, Peng Lu, Jiankun Wang, Xianming Liu, Hongliang Ren

机构 * Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学电子工程系) Division of Gastrointestinal Surgery, Shenzhen People's Hospital, China(深圳人民医院胃肠外科) College of Mechatronics and Control Engineering, Shenzhen University, China(深圳大学机电与控制工程学院) Department of Mechanical Engineering, The University of Hong Kong, Hong Kong SAR, China(香港大学机械工程系) Department of Electronic and Electrical Engineering, Southern University of Science and Technology(南方科技大学电子与电气工程系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 SurgAtt-Tracker通过时间提案重排和运动感知细化实现手术注意力跟踪,提供帧级视野指导以支持机器人规划和自动摄像头控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19348 2026-02-24 cs.CV cs.AI 62%

MultiDiffSense: Diffusion-Based Multi-Modal Visuo-Tactile Image Generation Conditioned on Object Shape and Contact Pose

MultiDiffSense: 基于扩散的多模态视觉-触觉图像生成,基于物体形状和接触姿态

Sirine Bhouri, Lan Wei, Jian-Qing Zheng, Dandan Zhang

机构 * Department of Bioengineering, Imperial-X Initiative, Imperial College London(生物工程系、Imperial-X计划、帝国理工学院伦敦分校) CAMS-Oxford Institute, University of Oxford(CAMS-牛津研究所、牛津大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 MultiDiffSense是一种基于扩散的多模态视觉-触觉图像生成模型,通过双条件化实现可控且物理一致的多模态生成,提升了触觉传感数据集的生成效率和跨模态学习能力。

Comments Accepted by 2026 ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16175 2026-02-24 cs.CV cs.AI 62%

Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight

Mantis:一种具有解耦视觉前瞻性能力的多功能视觉-语言-动作模型

Yi Yang, Xueqi Li, Yiyang Chen, Jin Song, Yihan Wang, Zipeng Xiao, Jiadi Su, You Qiaoben, Pengfei Liu, Zhijie Deng

机构 * SJTU(上海交通大学) SII(上海信息所) SUSTech(四川大学) NJUPT(南京工业大学) FDU(福建大学) BOSCH(博世)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 Mantis通过解耦视觉前瞻性模块提升视觉-语言-动作模型的性能,实现高成功率和快速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏