arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-01-14 至 2026-01-14 共收录 34 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 10 篇

2511.09555 2026-01-14 cs.RO cs.CV 88%

SpatialActor: Exploring Disentangled Spatial Representations for Robust Robotic Manipulation

SpatialActor: 探索解耦的空间表示以实现鲁棒的机器人操作

Hao Shi, Bin Xie, Yingfei Liu, Yang Yue, Tiancai Wang, Haoqiang Fan, Xiangyu Zhang, Gao Huang

机构 * Dexmal

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.CV

AI总结 SpatialActor通过解耦语义和几何,提升机器人操作的鲁棒性和精确性,实现高准确率和强泛化能力。

Comments AAAI 2026 Oral | Project Page: https://shihao1895.github.io/SpatialActor

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08325 2026-01-14 cs.RO 86%

ActiveVLA: Injecting Active Perception into Vision-Language-Action Models for Precise 3D Robotic Manipulation

ActiveVLA: 向视觉-语言-动作模型注入主动感知以实现精确的3D机器人操控

Zhenyang Liu, Yongchong Gu, Yikai Wang, Xiangyang Xue, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Nanyang Technological University(南洋理工大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);分类 cs.RO

AI总结 ActiveVLA通过引入主动感知能力,提升机器人在复杂环境中的高精度3D操控性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04428 2026-01-14 cs.RO 83%

DexH2R: Task-oriented Dexterous Manipulation from Human to Robots

DexH2R:从人类到机器人的任务导向灵巧操作

Shuqi Zhao, Xinghao Zhu, Yuxin Chen, Chenran Li, Lichen Xie, Xiang Zhang, Mingyu Ding, Masayoshi Tomizuka

机构 * Department of Mechanical Engineering, the University of California, Berkeley(机械工程系,加州大学伯克利分校)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 DexH2R通过结合人类手部运动重定向与任务导向的残差动作策略,提升机器人灵巧操作性能,实现高泛化能力的任务完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08342 2026-01-14 cs.CL 78%

Detecting Mental Manipulation in Speech via Synthetic Multi-Speaker Dialogue

通过合成多说话对话检测心理操控

Run Chen, Wen Liang, Ziwei Gong, Lin Ai, Julia Hirschberg

机构 * Columbia University(哥伦比亚大学) Red Hat(红帽公司)

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 本文提出首个通过合成多说话对话检测心理操控的研究,揭示语音与文本在检测准确性上的差异,强调多模态对话系统中模态意识的重要性。

Comments Accepted to IWSDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21097 2026-01-14 cond-mat.str-el 71%

Optical Detection and Manipulation of Pseudospin Orders in Wigner Crystals

二维电子Wigner晶体中赝自旋序的光学检测与操控

Yichen Dong, Eugene Demler, Zhiyuan Sun

专题命中 机器人操作 :manipulation(title)

AI总结 通过耦合轨道运动实现Wigner晶体中赝自旋序的光学检测与操控

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17185 2026-01-14 cs.CR 71%

Bribers, Bribers on The Chain, Is Resisting All in Vain? Trustless Consensus Manipulation Through Bribing Contracts

贿赂者、链上贿赂者,抵抗一切都徒劳?通过贿赂合同实现无信任共识操纵

Bence Soóki-Tóth, István András Seres, Kamilla Kara, Ábel Nagy, Balázs Pejó, Gergely Biczók

专题命中 机器人操作 :manipulation(title)

AI总结 本研究提出三种高效的贿赂合同,通过智能合约实现对以太坊共识机制的无信任操纵,分析了贿赂对验证者行为和随机性信标的影响。

Comments To appear at Financial Cryptography and Data Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13958 2026-01-14 cs.AI cs.LO 57%

Towards Constraint Temporal Answer Set Programming

朝向约束时间答案集编程

Pedro Cabalar, Martín Diéguez, François Olivier, Torsten Schaub, Igor Stéphan

机构 * University of Corunna, Spain University of Angers, France CRIL CNRS \& Artois University, France University of Potsdam, Germany

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文提出了一种结合时间逻辑和约束的ASP扩展,用于实现高精度动态系统推理。

Journal ref Theory and Practice of Logic Programming 25 (2025) 579-594

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08040 2026-01-14 cs.CV 57%

Rescind: Countering Image Misconduct in Biomedical Publications with Vision-Language and State-Space Modeling

Rescind: 通过视觉-语言和状态空间建模对抗生物医学出版物中的图像不当行为

Soumyaroop Nandi, Prem Natarajan

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 Rescind通过视觉-语言和状态空间建模方法,提出首个生物医学图像伪造生成与检测框架,实现高精度伪造定位与验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07963 2026-01-14 cs.CV 57%

3DGS-Drag: Dragging Gaussians for Intuitive Point-Based 3D Editing

3DGS-Drag:基于高斯分布的直观点基3D编辑

Jiahua Dong, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 3DGS-Drag通过结合变形引导和扩散引导,实现高效直观的点基3D场景拖动编辑,提升几何内容编辑的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17371 2026-01-14 cs.CR cs.NI 50%

Secret Sharing in 5G-MEC: Applicability for joint Security and Dependability

5G-MEC中的秘密分享:联合安全与可靠性的适用性

Thilina Pathirana, Ruxandra F. Olimid

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出在5G-MEC中使用阈值秘密分享技术,以提升数据存储的安全性和可靠性,通过分割存储敏感数据并要求至少k个节点参与重建,同时考虑MEHs的可信程度进行节点选择。

Comments 10 pages, 5 figures, Accepted to the proceedings of 22nd International Conference on Privacy, Security, and Trust (PST2025)

Journal ref 2025 22nd Annual International Conference on Privacy, Security, and Trust (PST), Fredericton, NB, Canada, 2025, pp. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 11 篇

2601.08665 2026-01-14 cs.RO cs.CV 84%

VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory

VLingNav:基于适应性推理和视觉辅助语言记忆的具身导航

Shaoan Wang, Yuanfei Luo, Xingyu Chen, Aocheng Luo, Dongyue Li, Chang Liu, Sheng Chen, Yangang Zhang, Junzhi Yu

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 VLingNav通过引入适应性推理和视觉辅助语言记忆,实现了复杂具身导航任务中的高效导航与泛化能力。

Comments Project page: https://wsakobe.github.io/VLingNav-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08161 2026-01-14 cs.RO cs.CV 81%

Robust Subpixel Localization of Diagonal Markers in Large-Scale Navigation via Multi-Layer Screening and Adaptive Matching

通过多层筛选和自适应匹配实现大尺度导航中对角标记的鲁棒子像素定位

Jing Tao, Banglei Guan, Yang Shang, Shunkun Liang, Qifeng Yu

机构 * College of Aerospace Science and Engineering(航空航天科学与工程学院) National University of Defense Technology(国防科技大学) Hunan Provincial Key Laboratory of Image Measurement and Vision Navigation(湖南省图像测量与视觉导航重点实验室)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种多层筛选与自适应匹配相结合的方法,用于大尺度导航中实现对角标记的鲁棒子像素定位。

Comments This paper has been accepted by Applied Optics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08244 2026-01-14 cs.RO 79%

A brain-inspired information fusion method for enhancing robot GPS outages navigation

一种受大脑启发的信息融合方法,用于增强机器人GPS失灵时的导航

Yaohua Liu, Hengjun Zhang, Binkai Ou

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) School of Electronic Engineering and Automation, Guilin University of Electronic Technology(桂林电子科技大学电子工程与自动化学院) Innovation and Research and Development Department, BoardWare Information System Company Ltd(BoardWare信息系统公司创新与研发部)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出了一种基于脉冲神经网络的脑启发GPS/INS融合方法,用于提升机器人在GPS失灵时的导航精度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07945 2026-01-14 cs.RO 79%

Contact-aware Path Planning for Autonomous Neuroendovascular Navigation

具有接触意识的自主神经内血管导航路径规划

Aabha Tamhankar, Ron Alterovitz, Ajit S. Puri, Giovanni Pittiglio

机构 * FuTURE Lab, Department of Robotics Engineering, Worcester Polytechnic Insitute (WPI)(沃思彻斯特理工学院未来实验室) Department of Computer Science, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校计算机科学系) UMass Memorial Medical Center(马萨诸塞州纪念医疗中心)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出了一种高效的接触意识路径规划方法,用于自主神经内血管导航,实现了快速且精确的路径计算,具有亚毫米级的跟踪精度。

Comments 8 pages, 7 figures, IROS(R-AL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15491 2026-01-14 cs.HC 78%

GazeBlend: Exploring Paired Gaze-Based Input Techniques for Navigation and Selection Tasks on Mobile Devices

GazeBlend:探索配对基于目光的输入技术用于移动设备上的导航和选择任务

Omar Namnakani, Yasmeen Abdrabou, Jonathan Grizou, Mohamed Khamis

专题命中 具身导航 :navigation(title,abstract)

AI总结 GazeBlend研究通过配对目光手势与停留时间或追踪技术,提升移动设备导航和选择任务的效率与性能。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08229 2026-01-14 cs.CR 67%

A Survey of Security Challenges and Solutions for UAS Traffic Management (UTM) and small Unmanned Aerial Systems (sUAS)

无人机交通管理(UTM)和小型无人驾驶航空系统(sUAS)的安全挑战与解决方案综述

Iman Sharifi, Mahyar Ghazanfari, Abenezer Taye, Peng Wei, Maheed H. Ahmed, Hyeong Tae Kim, Mahsa Ghasemi, Vijay Gupta, Noah Dahle, Robert Canady, Abel Diaz Gonzalez, Austin Coursey, Bryce Bjorkman, Cailani Lemieux-Mack, Bryan C. Ward, Xenofon Koutsoukos, Gautam Biswas, Heber Herencia-Zapana, Saqib Hasan, Isaac Amundson, Filippos Fotiadis, Ufuk Topcu, Junchi Lu, Qi Alfred Chen, Nischal Aryal, Amer Ibrahim, Abdul Karim Ras, Amir Shirkhodaie

专题命中 具身导航 :manipulation(abstract);navigation(abstract)

AI总结 本文综述了sUAS和UTM生态系统的网络安全漏洞与防御措施,旨在建立统一的分类法并识别未来UTM环境中的安全挑战。

Comments 26 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08185 2026-01-14 cond-mat.mtrl-sci cs.AI cs.LG cs.MA physics.comp-ph 62%

Autonomous Materials Exploration by Integrating Automated Phase Identification and AI-Assisted Human Reasoning

通过整合自动化相识别和AI辅助的人类推理实现自主材料探索

Ming-Chiang Chang, Maximilian Amsler, Duncan R. Sutherland, Sebastian Ament, Katie R. Gann, Lan Zhou, Louisa M. Smieska, Arthur R. Woll, John M. Gregoire, Carla P. Gomes, R. Bruce van Dover, Michael O. Thompson

机构 * Department of Materials Science and Engineering, Cornell University, Ithaca, NY 14853, United States(材料科学与工程系,康奈尔大学,Ithaca, NY 14853, United States) Department of Computer Science, Cornell University, Ithaca, NY 14853, United States(计算机科学系,康奈尔大学,Ithaca, NY 14853, United States) Joint Center for Artificial Photosynthesis, California Institute of Technology, Pasadena, CA 91125(人工光合作研究中心,加州理工学院,Pasadena, CA 91125) Cornell High Energy Synchrotron Source, Cornell University, Ithaca, NY 14850, United States(康奈尔高能同步辐射源,康奈尔大学,Ithaca, NY 14850, United States)

专题命中 具身导航 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 通过整合自动化相识别和AI辅助的人类推理,实现自主材料探索,提升材料合成效率和发现新材料的能力。

Comments Main manuscript: 21 pages(including references), 6 figures. Supplementary Information: 12 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08699 2026-01-14 cs.CL 50%

RAGShaper: Eliciting Sophisticated Agentic RAG Skills via Automated Data Synthesis

RAGShaper: 通过自动化数据合成激发复杂的代理RAG技能

Zhengwei Tao, Bo Li, Jialong Wu, Guochen Yan, Huanyao Zhang, Jiahao Xu, Haitao Mi, Wentao Zhang

机构 * Peking University(北京大学) Tencent AI Lab(腾讯人工智能实验室)

专题命中 具身导航 :navigation(abstract)

AI总结 RAGShaper通过自动化数据合成构建高质量RAG任务和代理轨迹,提升模型在复杂检索任务中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07741 2026-01-14 cond-mat.soft physics.bio-ph 50%

Controlling microalgae populations by phototactic memory

通过光趋向记忆控制微藻种群

Gianni Jacucci, Davide Breoni, Pierre Illien, Luca Tubiana, Jean-François Allemand, Sylvain Gigan, Raphaël Jeanneret

专题命中 具身导航 :navigation(abstract)

AI总结 本研究通过光趋向记忆机制控制微藻种群,揭示了光梯度导航与时间整合在结构化环境中的核心作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21018 2026-01-14 eess.SP 50%

LEO Constellations as a Decentralized GNSS Network: Optimizing PNT Corrections in Space

低轨道星座作为去中心化GNSS网络:优化空间中的PNT校正

Xing Liu, Xue Xian Zheng, José A. López-Salcedo, Tareq Y. Al-Naffouri, Gonzalo Seco-Granados

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出一种基于大规模LEO星座的去中心化GNSS网络,通过动态图建模和动量加速梯度追踪方法,实现高精度轨道和时间确定,减少通信负担并提高自主导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12566 2026-01-14 cs.SE 50%

Power Assumptions Matter: Evaluating End-user Laptop Energy Models for Sustainability Reporting of Browser-Based Web Services

功率假设至关重要:评估终端用户笔记本电脑能源模型以用于浏览器基础网络服务的可持续性报告

Maja H. Kirkeby, Timmie Lagermann

专题命中 具身导航 :navigation(abstract)

AI总结 本文通过实验证明,终端用户笔记本电脑的恒定功率假设在浏览器基础网络服务的可持续性报告中存在系统性偏差,提出类别特定参数结合硬件的模型能更准确地反映能耗,为报告提供更实用的改进方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 2 篇

2601.07964 2026-01-14 cs.AI 79%

Executable Ontologies in Game Development: From Algorithmic Control to Semantic World Modeling

可执行本体在游戏开发中的应用:从算法控制到语义世界建模

Alexander Boldachev

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文提出利用可执行本体实现游戏开发中的语义世界建模,通过数据流条件实现任务中断,解决传统AI架构中的语义-过程鸿沟。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08388 2026-01-14 cs.AI 57%

Creativity in AI as Emergence from Domain-Limited Generative Models

人工智能中的创造力作为领域受限生成模型的涌现

Corina Chutaux

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出从生成模型角度研究人工智能创造力,将其视为领域受限模型在受限制信息环境中的涌现属性,通过分解四个组成部分探讨创造力的生成机制。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 2 篇

2511.00549 2026-01-14 cs.LG cs.AI 62%

Robust Single-Agent Reinforcement Learning for Regional Traffic Signal Control Under Demand Fluctuations

鲁棒的单智能体强化学习用于应对需求波动的区域交通信号控制

Qiang Li, Jin Niu, Lina Yu

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种鲁棒的单智能体强化学习框架,用于应对交通需求波动的区域交通信号控制,通过集中决策和高效学习模型有效减少交通队列长度。

Comments A critical error in the methodology. The reported congestion control effects were not caused by the proposed signal timing optimization, but by an incorrect traffic volume scaling factor during evaluation. The traffic demand was not properly amplified, resulting in misleading performance gains. Due to the substantial nature of the error, completion of revisions is not feasible in the short term

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08210 2026-01-14 cs.LG 57%

Scalable Multiagent Reinforcement Learning with Collective Influence Estimation

可扩展的多智能体强化学习与集体影响估计

Zhenglong Luo, Zhiyong Chen, Aoxiang Liu, Ke Pan

机构 * School of Engineering, The University of Newcastle(工程学院) School of Automation, Central South University(自动化学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出了一种可扩展的多智能体强化学习框架,通过集体影响估计网络实现高效协作,避免网络扩展并提升鲁棒性和部署可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人数据与评测 5 篇

2411.03315 2026-01-14 cs.RO cs.LG 73%

Learning Force Distribution Estimation for the GelSight Mini Optical Tactile Sensor Based on Finite Element Analysis

基于有限元分析的GelSight Mini光学触觉传感器力分布估计学习

Erik Helmut, Luca Dziarski, Niklas Funk, Boris Belousov, Jan Peters

机构 * Department of Computational Engineering, Technical University of Darmstadt(计算工程系,德累斯顿技术大学) Department of Computer Science, Technical University of Darmstadt(计算机科学系,德累斯顿技术大学) German Research Center for AI (DFKI)(德国人工智能研究中心) Centre for Cognitive Science, Technical University of Darmstadt(认知科学中心,德累斯顿技术大学) Hessian Center for Artificial Intelligence (Hessian.AI), Darmstadt(黑森人工智能中心(Hessian.AI),德累斯顿)

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本研究提出基于U-net的机器学习方法,利用有限元分析推导出的力分布数据,实现GelSight Mini传感器的力分布估计,具有高精度和实时应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07868 2026-01-14 cs.LG cs.AI 62%

RewriteNets: End-to-End Trainable String-Rewriting for Generative Sequence Modeling

RewriteNets:生成序列建模中的端到端可训练字符串重写

Harshil Vejendla

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 RewriteNets通过显式字符串重写机制,在生成序列建模中实现端到端训练,展现优异的系统泛化能力和计算效率。

Comments 6 pages, 2 figures, AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12735 2026-01-14 cs.CV 57%

Backdoor Attacks on Open Vocabulary Object Detectors via Multi-Modal Prompt Tuning

通过多模态提示调优对开放词汇目标检测器进行后门攻击

Ankita Raj, Chetan Arora

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 TrAP通过多模态提示调优对开放词汇目标检测器实施后门攻击,利用轻量级提示标记植入恶意行为,提升攻击成功率并改进下游任务性能。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21495 2026-01-14 cs.RO 57%

CLAMP: Crowdsourcing a LArge-scale in-the-wild haptic dataset with an open-source device for Multimodal robot Perception

CLAMP:通过开源设备收集大规模真实场景触觉数据集以实现多模态机器人感知

Pranav N. Thakkar, Shubhangi Sinha, Karan Baijal, Yuhan, Bian, Leah Lackey, Ben Dodson, Heisen Kong, Jueun Kwon, Amber Li, Yifei Hu, Alexios Rekoutis, Tom Silver, Tapomayukh Bhattacharjee

机构 * Cornell University(康奈尔大学) Horace Mann School(霍拉曼学校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 CLAMP通过开源设备收集大规模真实场景触觉数据集,训练多模态触觉编码器,实现材料识别和机器人操作任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14725 2026-01-14 cs.RO cs.HC 57%

Using Mobile AR for Rapid Feasibility Analysis for Deployment of Robots: A Usability Study with Non-Expert Users

利用移动AR进行机器人部署的快速可行性分析:非专家用户的可用性研究

Krzysztof Zielinski, Slawomir Tadeja, Bruce Blumberg, Mikkel Baun Kjærgaard

机构 * Faculty of Engineering, University of Southern Denmark(南部丹麦大学工程学院) Universal Robots A/S(Universal Robots公司) Department of Engineering, University of Cambridge(剑桥大学工程学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本研究提出了一种基于移动AR的非专家用户可用性工具,用于快速评估机器人部署的可行性,通过实验表明该工具在十分钟内可完成复杂分析,且用户认知负荷低,具有高可用性。

Comments Accepted in IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏