arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-09-01 至 2026-09-01 共收录 175 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 30 篇

2608.29601 2026-09-01 cs.RO cs.CV cs.LG 新提交 67%

$\mathcal{N}_0$-Foundation: Towards the Age of Tactile Intelligence

$\boldsymbol{\tau}_0$-基础模型:迈向触觉智能时代

NeoteAI Team, Fudan TEAI Team

机构 * NeoteAI(尼奥特人工智能)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本研究提出$\boldsymbol{\tau}_0$-基础模型,构建大规模视触觉数据集及视触觉表征模型,结合真实与模拟套件形成评估基准,助力触觉具身操控研究。

Comments 13 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03485 2026-09-01 cs.CV cs.AI cs.RO 版本更新 67%

Phys4D: Fine-Grained Physics-Consistent 4D Modeling from Video Diffusion

Phys4D: 从视频扩散模型实现细粒度物理一致的4D建模

Haoran Lu, Shang Wu, Songling Liu, Jianshu Zhang, Maojiang Su, Guo Ye, Chenwei Xu, Lie Lu, Pranav Maneriker, Fan Du, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Dolby Laboratories(杜比实验室)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出Phys4D流水线,通过三阶段训练(伪监督预训练、物理监督微调、强化学习校正)从视频扩散模型学习物理一致的4D世界表示,显著提升细粒度时空与物理一致性。

Comments v2:Expanded the experiment section with more baselines and add more experiments in supplementary--corrected some typographical errors, and corrected author-affiliation information that was inaccurate in the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30858 2026-09-01 cs.RO cs.CV 新提交 62%

GAFT: Geo-Anchored Fine-Tuning for Hazard Identification from Rare Failures

GAFT:用于从罕见故障中识别危险的地理锚定微调

Yanran Xu, Chuanhang Qiu, Yue Wang, Wenbo Wu, Zhaoxing Li

机构 * University of Southampton(南安普顿大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 针对越野导航罕见故障导致的危险识别难题,提出参数高效的GAFT方法,通过几何先验指导LoRA适配,在森林危险基准上显著提升了留一场景重复平均F₂

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30821 2026-09-01 cs.CV cs.AI 新提交 62%

Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling

Lucida:用于可组合真实到仿真场景建模的解析、生成与放置

Minghan Qin, Yuang Wang, Xiuyu Yang, Yushi Long, Yujian Zhang, Ruihuan Wang, Kai Ye, Yangang Zhang, Hang Li

机构 * ByteDance Seed(字节跳动Seed) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 Lucida是一种可组合真实到仿真场景建模方法,通过重新分配流程要求,在三个步骤中利用真实采集的可靠信息,结合GizmoAct策略提升了场景建模相关任务的性能。

Comments Project Page: https://lucida-r2s.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28664 2026-09-01 cs.RO cs.CV cs.MM 新提交 62%

The Potential of Haptic Foundation Models

触觉基础模型的潜力

Jianquan Wang, Haiwei Dong, Abdulmotaleb El Saddik

机构 * University of Ottawa(渥太华大学) Dayan Technologies(大眼科技)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 该研究针对具身AI中通用触觉感知的瓶颈,探索触觉基础模型(HFMs)的潜力,阐述其需从被动大模型转变的四个核心维度,并在TacBench上对多个触觉基准开展三类任务评估。

Comments accepted by IEEE Consumer Electronics Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07392 2026-09-01 cs.RO cs.CV 版本更新 62%

NGD-SLAM: Towards Real-Time Dynamic SLAM without GPU

NGD-SLAM:无需GPU的实时动态SLAM系统

Yuhao Zhang, Mihai Bujanca, Mikel Luján

机构 * University of Manchester(曼彻斯特大学) University of Cambridge(剑桥大学) Qualcomm Technologies XR Labs, Austria(Qualcomm Technologies XR 研究所,奥地利)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出仅在CPU运行的实时动态SLAM系统,通过掩码传播机制解耦跟踪与掩码生成,结合ORB特征与光流的混合跟踪策略,在笔记本CPU上实现60 FPS跟踪帧率,保持动态环境高定位精度,代码公开。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30714 2026-09-01 cs.CV 新提交 57%

SegWave: Wavelet-Driven Segmentation of Tampered Regions

SegWave:基于小波的篡改区域分割

Siddhi Pravin Lipare, Vishesh Kumar, Akshay Agarwal

机构 * IIIT-Hyderabad(印度国际信息技术研究所海得拉巴分校) IISER-Bhopal(印度科学教育与研究研究所博帕尔分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 针对图像真实性验证难题,提出SegWave混合框架,结合Transformer与DWT并引入ASA模块,经多基准数据集实验,其性能优于现有最先进的篡改检测方法。

Comments Accepted at the PFATCV Workshop, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30536 2026-09-01 cs.RO 新提交 57%

Behavior-Skill: A Fine-Grained Benchmark for Evaluating Vision-Language-Action Policies in Long-Horizon Tasks

Behavior-Skill:用于评估长 horizon 任务中视觉-语言-动作策略的细粒度基准

Chunyun Ma, Lun Luo, Xingjian Luo, Xiexing Feng, Hang Zhang, Wei Liu, Feng Qiao, Yaonan Wang, Huimin Lu, Xieyuanli Chen

机构 * XPeng Inc.(小鹏汽车) The Chinese University of Hong Kong(香港中文大学) Hunan University(湖南大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 本研究提出细粒度基准 Behavior-Skill,含 235492 个技能实例,引入轨迹与技能级指标,实验发现接触丰富操作技能是长 horizon VLA 策略瓶颈,可用于分析改进该类策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30451 2026-09-01 cs.CV 新提交 57%

SeqAlign3DVG: A Sequence-Aligned Benchmark and Voxel Reasoning Framework for 3D Visual Grounding

SeqAlign3DVG:用于3D视觉定位的序列对齐基准与体素推理框架

Yi Zhang, Yi Wang, Yueting Wu, Kaiyue Yang, Yuejiao Su, Lap-Pui Chau

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV

AI总结 针对现有3D视觉定位基准的文本-观测对齐松散、忽略时间顺序的问题,提出SeqAlign3DVG基准及含ROVM、PLVF的体素推理框架,在无深度协议下实现最优性能,提升复杂关系目标定位效果。

Comments Accepted by ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29475 2026-09-01 cs.CV 新提交 57%

Seeing Through Extreme Visual Sparsity: Surface Understanding from a Single Random Visual Patch

从极端视觉稀疏性中洞察:基于单个随机视觉斑块的表面理解

Sindhuja Penchala, Sudip Mittal, Noorbakhsh Amiri Golilarz

机构 * The University of Alabama(阿拉巴马大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 该研究提出SSUF框架,适配四种预训练架构,在仅保留10%可见区域的Touch-and-Go数据集上,实现极端视觉稀疏下的表面重建与材质分类,各模型表现不同且均达实时推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29396 2026-09-01 cs.RO 新提交 57%

Toward Trustworthy Robot-Assisted Sliding Palpation for Shallow Vessel Localisation with a Calibrated Digital Twin

面向基于校准数字孪生的浅血管定位的可信机器人辅助滑动触诊

Piotr Blaszyk, Wen Fan, Kaizhong Deng, Daniel Elson, Dandan Zhang

机构 * Imperial College London(帝国理工学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 本文提出带校准数字孪生的机器人辅助滑动触诊框架,结合时空图神经网络实现浅血管定位,在三类数据集上验证了模拟到真实的定位精度,为可信触觉触诊提供了进展。

Comments ECCV workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18734 2026-09-01 cs.CV 版本更新 57%

CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes

CL4D:用于动态场景视觉-语言推理的对比语言-4D预训练

Kumal Hewagamage, Isuranga Senavirathne, Sasika Amarasinghe, Hasitha Gallella, Dulanga Weerakoon, Vigneshwaran Subbaraju, Ranga Rodrigo

机构 * University of Moratuwa(莫拉图瓦大学) Singapore-MIT Alliance for Research & Technology (SMART) Centre(新加坡-麻省理工研究与技术联盟(SMART)中心) Agency for Science, Technology and Research (A*STAR)(新加坡科学、技术与研究局(A*STAR))

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本研究提出CL4D(首个4D视觉编码器)及基于其的4DVLM,在自建DynAction4D数据集上训练,CL4D性能较现有方法提升约16.75%,4DVLM优于Gemini、GPT-5等前沿视频VLM。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31048 2026-09-01 eess.IV 新提交 56%

OmniRAS: Standardizing Foundation Model Training and Evaluation in Robot-Assisted Surgery

OmniRAS:标准化机器人辅助手术领域的基础模型训练与评估

Leonardo Borgioli, Neil Getty, Wenli Xiu, Jessica Cassiani, Alvaro Ducas, Carlos Agustin Orda, Hira Waris, Fangfang Xia, Rick Stevens, Pier Cristoforo Giulianotti, Milos Zefran

专题命中 机器人数据与评测 :robotic(abstract);robotics(comments)

AI总结 本文针对机器人辅助手术领域基础模型稀缺的问题,提出OmniRAS系列V-JEPA-2.1编码器,发布专属数据集并完成大规模预训练与多任务评估,取得最优适配结果。

Comments 18 pages, 11 figures, 4 tables. Under review at IEEE Transactions on Robotics (T-RO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30526 2026-09-01 cs.HC 新提交 50%

User Experience in Human-Machine Interaction: Insights from Field Studies in Autonomous Mobility

人机交互中的用户体验:来自自主移动实地研究的见解

Helen Schneider, Svetlana Pavlitska, J. Marius Zöllner

专题命中 机器人数据与评测 :robotics(abstract)

AI总结 本研究针对AVs用户接受度研究的场景局限,通过144名参与者的真实交通实地研究,验证多模态传感在乘客情感推断中的实用性,提供相关研究工具,为自主系统用户中心设计奠定基础。

Comments Accepted for publication at ABAW Workshop at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19741 2026-09-01 cs.CL cs.DB 版本更新 50%

One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows

单次成功并非可靠:Thinkingbox——面向有状态业务工作流智能体的沙箱与基准测试集

Zhuochun Li, Youngmin Ko, Ali Keramati, Nicola Ferri, Susana Palmaz Lopez Pelaez, Liang-Chun Tsai, Calvin Wang, Mirco Milletari, Tuhin Kundu, Vadim Smolyakov, Kjartan Olafsson, Tommy Guy

机构 * University of Pittsburgh(匹兹堡大学) Northwestern University(西北大学) University of California Irvine(加州大学欧文分校) Microsoft(微软公司)

专题命中 机器人数据与评测 :navigation(abstract)

AI总结 研究人员推出面向有状态业务工作流智能体的沙箱Thinkingbox及基准测试集Thinkingbox-bench,发现现有智能体在该基准上可靠完成任务的表现远逊于单次成功表现,凸显了端到端任务可靠评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21457 2026-09-01 cs.CR 版本更新 50%

SoK: Systematizing Generation, Characteristics, and Defenses in LLM-Generated Phishing

SoK:揭示大语言模型生成钓鱼攻击的生成与检测差距

Fengchao Chen, Tingmin Wu, Van Nguyen, Carsten Rudolph

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本文首次全面分析大语言模型生成的钓鱼内容,揭示其逃避检测、强调人类认知操控的特点,并指出防御策略与生成方法间的不对称性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09439 2026-09-01 cs.MM 版本更新 50%

Identity-Aware Vision-Language Model for Explainable Face Forgery Detection

用于可解释人脸伪造检测的身份感知视觉语言模型

Junhao Xu, Jingjing Chen, Yang Jiao, Jiacheng Zhang, Zhiyu Tan, Hao Li, Yu-Gang Jiang

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 针对人脸伪造检测的实际局限,提出轻量身份感知VLM,动态编码身份信息并结合检测适配器,在仅10个额外令牌下实现优于传统方法和通用VLM的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11764 2026-09-01 cs.MM 版本更新 50%

Identity-Driven Multimedia Forgery Detection via Reference Assistance

基于身份驱动的参考辅助多媒体伪造检测

Junhao Xu, Jingjing Chen, Xue Song, Feng Han, Haijun Shan, Yugang Jiang

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 针对现有媒体伪造数据集的局限,提出含54位名人视频的IDForge数据集,设计参考辅助多模态伪造检测网络R-MFDN,实验验证其在多媒体伪造检测任务的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他机器人 7 篇

2608.30760 2026-09-01 cs.LG 新提交 79%

PRACTICE: From Experience to Expertise in Self-Evolving Embodied Agents

PRACTICE:从经验到自进化具身智能体的专业能力

Ziyi Bai, Siqi Li, Tinglei Huang, Börje F. Karlsson

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院(BAAI)) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 其他机器人 :embodied agent(title,abstract);分类 cs.LG

AI总结 PRACTICE通过训练技能学习者维护技能库,结合两阶段课程训练与在线编辑蒸馏,在EB-ALFRED等任务上实现优于基线的自进化具身智能体性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29237 2026-09-01 cs.CV cs.AI cs.RO cs.SY eess.SY q-bio.QM 新提交 67%

AGRICAM: A Track-Mounted Crop Pollination Monitoring Robot

AGRICAM:一种履带式作物授粉监测机器人

Malika Nisal Ratnayake, Adel N. Toosi, James Cook, Romina Rader, Alan Dorin

机构 * Monash University(莫纳什大学) The University of Melbourne(墨尔本大学) Western Sydney University(西悉尼大学) University of New England(新英格兰大学)

专题命中 其他机器人 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出AGRICAM履带式授粉监测机器人,其可自主运行并在商业蓝莓农场成功监测传粉活动,为授粉管理提供数据支撑,助力提升作物产量与粮食安全。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14252 2026-09-01 cs.RO cs.AI cs.CL 版本更新 66%

MEMORA: Embodied Action Memory from Egocentric Videos for Reasoning and Planning

MEMORA:基于自我中心视频的具身动作记忆用于推理与规划

Zihao Yu, Xiu Yuan, Chongjie Zhang

专题命中 其他机器人 :embodied agent(abstract);分类 cs.RO、cs.AI;robotics(comments)

AI总结 研究针对长期机器人规划中对具身经验记忆的需求,提出MEMORA方法,通过形成-巩固-检索生命周期及四种类型存储实现具身动作记忆,经实验评估取得良好结果,能为机器人规划提供记忆上下文。

Comments 50 pages. v1: Oral presentation at the Robotics: Science and Systems 2026 Workshop on Foundation Models for Robot Planning (FM4RoboPlan). v2: Accepted to the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30344 2026-09-01 cs.CV cs.CG cs.GR cs.RO 新提交 62%

Proximity3D: Shape from Capacitive Proximity on Sensing Manifold

Proximity3D:基于感知流形上电容邻近性的形状重建

Hao Chen, Chenming Wu, Chun Ping Lam, Xiangjia Chen, Guoxin Fang, Charlie C. L. Wang, Yeung Yam, Juncong Lin, Chengkai Dai

机构 * Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) Xiamen University(厦门大学) The Chinese University of Hong Kong(香港中文大学) The University of Manchester(曼彻斯特大学)

专题命中 其他机器人 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 Proximity3D提出将弯曲电容织物表面作为非平面感知流形,引入多视图前馈重建模型,通过聚合电容邻近场实现物体形状鲁棒重建,为机器人近场几何感知提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29562 2026-09-01 cs.LG cs.MA cs.RO cs.SY eess.SY 新提交 62%

Asynchronous Cooperative Online Learning for Multi-Robot Control under Computational Delays

计算延迟下多机器人控制的异步协同在线学习

Xiaobing Dai, Zewen Yang, Wei Ren, Sandra Hirche

机构 * Technical University of Munich(慕尼黑工业大学) University of California at Riverside(加州大学河滨分校)

专题命中 其他机器人 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 针对多机器人控制中计算延迟与查询点差异问题,提出异步协同在线学习策略与伴随MAS分布式控制律,经无人水面艇仿真验证,其学习与控制性能优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30055 2026-09-01 cs.RO cs.SY eess.SY 新提交 61%

MiBOT: A head-worn robot that modulates cardiovascular responses through human-like soft massage

MiBOT:一款通过类人轻柔按摩调节心血管反应的头戴式机器人

Alice Mylaeus, Stephanie Vogt, Berken Utku Demirel, Marcel Gort, Mirko Meboldt, Manuel Meier, Christian Holz

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 其他机器人 :robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 本文提出头戴式按摩机器人MiBOT,采用气动人工肌肉实现静音类人按摩,经对照研究证实其可降低受试者血压与心率,为头部按摩机器人研发提供了有效方案。

Comments Published at 2024 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29728 2026-09-01 cond-mat.soft cond-mat.stat-mech 新提交 50%

Active embracement enables autonomous tweezing in active star polymers

主动拥抱使活性星型聚合物实现自主镊子功能

Marco Musacchio, Davide Breoni, Iman Abdoli, Luca Tubiana, Hartmut Löwen, Lorenzo Caprini

专题命中 其他机器人 :robotic(abstract)

AI总结 该研究发现活性星型聚合物的主动拥抱非平衡现象,可作为自主镊子实现靶向捕获,为智能材料设计提供蓝图。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏