arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-09-01 至 2026-09-01 共收录 175 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 54 篇

2606.14551 2026-09-01 cs.RO cs.AI 版本更新 62%

TRACE: Trajectory-Routed Causal Memory for Delayed-Evidence Visuomotor Imitation

TRACE: 用于延迟证据视觉运动模仿的轨迹路由因果记忆

Zihao Li, Ranpeng Qiu, Yincong Chen, Guoqiang Ren, Weiming Zhi

机构 * Zeno AI Zhejiang University(浙江大学) Zhejiang University of Technology(浙江工业大学) The University of Sydney(悉尼大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 针对视觉运动模仿中早期线索消失导致观察歧义的问题,提出TRACE记忆框架,利用路径签名存储和检索任务相关证据,在长周期任务中提升分支选择准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09076 2026-09-01 cs.MA cs.AI cs.LG 版本更新 62%

Robust Multi-Agent LLMs under Byzantine Faults

在拜占庭故障下鲁棒的多智能体大语言模型

Haejoon Lee, Vincent-Daniel Yun, Dimitra Panagou, Sai Praneeth Karimireddy

机构 * Department of Robotics, University of Michigan, Ann Arbor, USA(密歇根大学机器人系,安娜堡,美国) Thomas Lord Department of Computer Science, University of Southern California, USA(南加州大学计算机科学托马斯·劳德系,美国)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Self-Anchored Consensus算法,通过去中心化迭代过滤和优化协议提升多智能体系统在拜占庭故障下的鲁棒性,实验表明其在数学和常识推理任务中表现优异。

Comments EMNLP 2026 Main Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17805 2026-09-01 cs.LG cs.AI cs.GT 版本更新 62%

Perturbation Sensitivity of Maximum-Likelihood Pairwise Ranking in Computational Decision Systems

通过策略性成对数据扰动进行排名滥用

Junyi Yao, Zihao Zheng, Jiayu Long

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究基于最大似然估计的成对排名系统对策略性数据扰动的脆弱性,提出自适应子集选择攻击(ASSA)方法,实验表明少量扰动即可显著改变全局排名。

Comments accepted to 2026 International Conference on Data Science, Mathematics, and Informatics (ICoDMI), proceedings to IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23147 2026-09-01 cs.LG cs.AI 版本更新 62%

Securing Time Integrity in Energy IoT Against Clock Drift and Y2K38 Failures

保护能源物联网中的时间完整性:应对时钟漂移和Y2K38故障

Saeid Jamshidi, Foutse Khomh, Carol Fung, Omar Abdul Wahab, Rolando Herrero

机构 * Department of Computer and Software Engineering, Polytechnique Montréal(Polytechnique Montréal 计算机与软件工程系) SWAT Laboratory, Polytechnique Montréal(Polytechnique Montréal SWAT 实验室) College of Engineering, Northeastern University(Northeastern University 工程学院) Concordia Institute for Information Systems Engineering (CIISE), Concordia University(Concordia University 信息系统工程研究所)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 提出STGAT框架,结合漂移感知时间嵌入、时间自注意力和图注意力,检测能源物联网中的时钟漂移、同步偏移和Y2K38溢出等时间异常,准确率达95.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14056 2026-09-01 cs.CV cs.AI 版本更新 62%

POCI-Diff: 3D-Layout Guided Diffusion for Controllable Synthetic Surveillance Data Generation

POCI-Diff: 通过3D布局引导扩散实现位置对象一致性和交互

Andrea Rigo, Luca Stornaiuolo, Weijie Wang, Mauro Martino, Bruno Lepri, Nicu Sebe

机构 * DISI, University of Trento(DISI,特伦托大学) Toretei S.r.l.(Toretei公司) Visual AI Lab, MIT-IBM Watson AI Lab(视觉人工智能实验室,MIT-IBM沃森人工智能实验室) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 POCI-Diff通过3D布局引导扩散实现一致性和交互性的物体位置控制,提升文本到图像生成的布局一致性和编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14086 2026-09-01 cs.CV cs.AI cs.CL 版本更新 62%

Error-Driven Scene Editing for 3D Grounding in Large Language Models

面向大语言模型中3D grounding的错误驱动场景编辑

Yue Zhang, Zun Wang, Han Lin, Jialu Li, Jianing Yang, Yonatan Bitton, Idan Szpektor, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Michigan(密歇根大学) Google Research(谷歌研究)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 针对3D大语言模型的空间grounding偏差问题,提出错误驱动框架DEER-3D,通过结构化循环生成针对性反事实训练示例,在多基准上实现4%-6%的性能增益。

Comments Accepted by ECCV 2026. Code: https://github.com/zhangyuejoslin/Deer-3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30656 2026-09-01 cs.CV 新提交 57%

APT: Anchor-aligned Perturbations for Tamper Localization in Fully Regenerated Images

APT:用于完全再生图像篡改定位的锚点对齐扰动

Suhyeon Ha, Woo Jae Kim, Joonsung Jeon, Sooel Son, Sung-eui Yoon

机构 * KAIST(韩国科学技术院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 针对现有篡改定位方法在完全再生图像中失效的问题,提出半脆弱潜在空间扰动APT,通过锚点对齐特征实现篡改定位,在COCO数据集上FR IoU达0.92,性能优于基线,可泛化到未知篡改类型。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29997 2026-09-01 cs.CV 新提交 57%

Discrete Diffusion Bridges for Spatiotemporally Aligned Image Translation and Generation

用于时空对齐图像翻译与生成的离散扩散桥

Xing Xie, Jiawei Liu, Shijun Zhou, Huijie Fan, Zhi Han, Yandong Tang, Liangqiong Qu

机构 * Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 该研究提出离散扩散桥(DDB)框架,解决离散扩散在图像翻译与生成中的时空错位问题,通过混合吸收机制和信息引导噪声调度实现平衡,在多生成任务中表现优异且适配低采样步数场景。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29459 2026-09-01 cs.AI 新提交 57%

Toward Latent Language Model Skills Steering and Optimization: An Empirical Study

面向潜在语言模型技能的引导与优化:一项实证研究

Xunyi Jiang, Junda Wu, Yuxin Xiong, Sheldon Yu, Tong Yu, David Arbour, Ritwik Sinha, Julian McAuley, Hongyi Wen

机构 * New York University(纽约大学) Adobe Research(奥多比研究院) UC San Diego(加州大学圣迭戈分校)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本研究通过实证探究发现大型语言模型(LLM)的过程技能可表征为激活空间中的向量方向,且可通过向量操作实现技能引导与优化,为LLM过程技能的潜在空间操控提供了表征级视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29456 2026-09-01 cs.CV 新提交 57%

Text-Guided Diffusion-Based Adversarial Attacks on Chest X-Ray Images

基于文本引导扩散模型的胸部X射线图像对抗攻击

Basudha Pal, Arjun Narayanan, Neha Ajith, Vikas R Bhat, Muhammad Umair

机构 * The Johns Hopkins University(约翰斯·霍普金斯大学) Manipal Institute of Technology(马尼帕尔理工学院) Manipal Academy of Higher Education(马尼帕尔高等教育学院) The Johns Hopkins Hospital(约翰斯·霍普金斯医院) Columbia University Irving Medical Center(哥伦比亚大学欧文医学中心)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 该研究提出文本引导扩散对抗框架攻击胸部X射线分类模型,在多架构上验证其能显著降低分类性能,同时发现人机判读存在重要差异,凸显需扩展医疗AI鲁棒性评估方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29137 2026-09-01 cs.CV 新提交 57%

Chat-Edit-3D++: Interactive 3D and 4D Scene Editing via Large Language Models

Chat-Edit-3D++:基于大语言模型的交互式3D与4D场景编辑

Shuangkang Fang, Yufeng Wang, Yi-Hsuan Tsai, Wenrui Ding, Yi Yang, Shuchang Zhou, Ming-Hsuan Yang

机构 * School of Electrical and Information Engineering, Beihang University(北京航空航天大学电子信息工程学院) Institute of Unmanned System, Beihang University(北京航空航天大学无人系统研究院) Atmanity Inc.(Atmanity公司) Megvii Research(旷视研究院) University of California at Merced(加州大学默塞德分校)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 该研究针对现有3D场景编辑方案的缺陷,提出Hash-Atlas网络及基于LLM的CE3D++方法,实现2D编辑与3D重建解耦,可调度30种视觉工具,支持3D/4D场景交互式文本驱动编辑。

Comments Project Website: https://sk-fun.fun/CE3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28875 2026-09-01 cs.CL cs.AI cs.SD 新提交 57%

No Detectable Change in Side-Level WER from Prompt-Level Context: A Preregistered Ablation on a Production Oral-History Corpus

提示词层面上下文未检测到侧边级词错误率(WER)变化:对生产级口述历史语料库的预注册消融实验

Theodore O. Cochran, Stephanie Dodson, Keith Nore

机构 * AI for Altruism(利他智能)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 该预注册实验在生产级口述历史转录工具上发现,提示词层面上下文未改变侧边级WER,仅短语有小幅改善,需结合序列对齐指标评估上下文机制。

Comments 31 pages, 1 figure. Preregistered on OSF (https://osf.io/ns49b, DOI 10.17605/OSF.IO/NS49B); release materials and dated provider-documentation snapshots in the study component (https://osf.io/9nsvr)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16490 2026-09-01 cs.RO 版本更新 57%

Robots that Collaborate: Sequential Asymmetric Imitation for Learning Coupled Robot Policies

协作机器人:用于学习耦合机器人策略的序列非对称模仿

Yincong Chen, Ranpeng Qiu, Zihao Li, Yanan Zhou, Guoqiang Ren, Weiming Zhi

机构 * Zeno AI University of Sydney(悉尼大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出序列非对称模仿(SAI),通过单操作员课程学习耦合多机器人行为,无需同步双操作员演示或显式通信,在真实双机器人操作任务中提升成功率与相位同步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20994 2026-09-01 cs.CR cs.AI cs.CL 版本更新 57%

Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models

打破MCP:函数劫持攻击:函数调用和代理模型的新威胁

Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis, Seshu Tirupathi, John D. Kelleher

机构 * IBM Research Europe(IBM欧洲研究院) Trinity College Dublin(三一学院都柏林) Imperial College London(帝国理工学院伦敦) ADAPT Research Centre(ADAPT研究中心)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文提出了一种新的函数劫持攻击,通过操纵代理模型的工具选择过程,迫使调用特定攻击者选择的函数,展示了代理模型在函数调用接口上的新漏洞。

Comments Accepted to TMLR (08/26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09888 2026-09-01 cs.RO 版本更新 57%

TriPilot-FF: Coordinated Whole-Body Teleoperation with Force Feedback

TriPilot-FF:具有力反馈的协调全身遥控

Zihao Li, Yanan Zhou, Ranpeng Qiu, Hangyu Wu, Guoqiang Ren, Weiming Zhi

机构 * Zeno AI Zhejiang University(浙江大学) Zhejiang University of Technology(浙江工业大学) University of Sydney(悉尼大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 TriPilot-FF通过引入脚踏板触觉反馈和双臂跟随遥控,实现了具有力反馈的协调全身遥控,提升移动机械臂的操控精度和避障能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18552 2026-09-01 cs.CL cs.LG 版本更新 57%

Unknown Unknowns: Do Hidden Intentions in LLMs Evade Detection?

未知未知数:为何大语言模型中的隐藏意图难以被检测

Devansh Srivastav, David Pape, Lea Schönherr

机构 * CISPA Helmholtz Center for Information Security(CISPA赫尔姆霍茨信息安全中心)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 研究揭示大语言模型中隐藏意图难以检测的问题,提出分类法并分析检测方法失效原因,强调需建立稳健框架以应对潜在风险。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23129 2026-09-01 eess.IV cs.CV physics.med-ph 版本更新 57%

MRpro: open framework for model-based, learned, and quantitative MR imaging

MRpro:用于基于模型、学习型与定量磁共振成像的开源框架

Felix Frederik Zimmermann, Patrick Schuenke, Christoph S. Aigner, Bill A. Bernhardt, Mara Guastini, Johannes Hammacher, Noah Jaitner, Andreas Kofler, Leonid Lunin, Stefan Martin, Catarina Redshaw Kranich, Jakob Schattenfroh, David Schote, Yanglei Wu, Christoph Kolbitsch

机构 * Department of Radiology(放射科) Charité -- Universitätsmedizin Berlin(柏林夏里特大学医学院) Max Planck Research Group MR Physics(人类发展马克斯·普朗克研究所磁共振物理研究组) Max Planck Institute for Human Development(人类发展马克斯·普朗克研究所)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 MRpro是基于PyTorch的开源MR成像框架,含数据结构、算子库与深度学习组件,可实现多类重建与定量估计,已在多场强实测及模拟数据上验证。

Comments Submitted to NMR in Biomedicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30574 2026-09-01 eess.SY cs.SY 新提交 50%

Exposing the Invisible: Detecting Stealthy Parameter-Based Cyber-Attacks on Inverter Synchronization Loops

揭示隐形威胁:检测针对逆变器同步环路的隐蔽性基于参数的网络攻击

Zaint A. Alexakis, Michal M. Drewniak, Charalambos Konstantinou

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文针对物联网技术应用下逆变器同步环路面临的隐蔽性基于参数的网络攻击,提出一种改进型锁相环,可在保留传统性能的同时检测此类攻击,实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30204 2026-09-01 cs.CL 新提交 50%

When Models Hear What They Expect: Diagnosing Prosodic Heuristics in Multimodal Sarcasm Detection

当模型“听到”它们所期待的:诊断多模态讽刺检测中的韵律启发式算法

Yongjian Chen, Pengfei Wei, Yiqun Sun, Zhu Li, Lawrence B. Hsieh

机构 * Magellan Technology Research Institute (MTRI)(麦哲伦技术研究所(MTRI)) Center for Language and Cognition, University of Groningen(格罗宁根大学语言与认知中心)

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文以讽刺检测为切入点,评估Qwen2.5-Omni等多模态大语言模型,发现模型依赖音高升高、停顿不规则的韵律刻板印象,操控该维度可使假阳性率达60%,且该效应可跨模型复现。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28902 2026-09-01 physics.optics 新提交 50%

Defects encode high-dimensional topological information

缺陷编码高维拓扑信息

Yunqi Zhang, Fengjun Li, Runchen Zhang, Zi-Lan Deng, Liangyu Deng, Zhikai Zhou, Ruofu Liu, Zimo Zhao, Yifei Ma, Yuanzhe Xu, Zixuan Wang, Yixuan Zhao, Jize Yan, Honghui He, Xiangping Li, Chao He

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究发现斯托克斯缺陷可作为拓扑信息载体,提出斯托克斯缺陷斯格明子,利用全介质超表面实现其结构,达成纳米尺度高维光学信息编码,拓展了缺陷的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20259 2026-09-01 physics.bio-ph physics.app-ph physics.optics 版本更新 50%

Morphology-Driven optimization of Double Nanohole-based Plasmonic Optical Tweezers

基于双纳米孔结构的等离子体光学镊子的形态驱动优化

Pau Molet, Edona Karakaçi, Maria Sanz Paz, Mariano Barella, Michael Mayer

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究通过系统模拟和形态表征对双纳米孔结构的参数进行优化,以提高光学镊子的 trapping stiffness、局部电场约束和传输变化(ΔTT),同时降低所需光功率,从而提升其在单分子生物物理中的应用性能。

Comments 40 pages, 15 figures (including Supp. info)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20386 2026-09-01 cs.GR 版本更新 50%

Anisotropic Green Coordinates

各向异性绿坐标

Dong Xiao, Renjie Chen, Bailin Deng

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究提出各向异性绿坐标,用于实现灵活的形状变形,通过数学建模和优化框架,提供多样化的空间变形能力。

Comments Accepted by SIGGRAPH Asia 2026 Journal Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19807 2026-09-01 physics.acc-ph hep-ex 版本更新 50%

Beam Steering and Radiation Generation of Electrons in Bent Crystals in the Sub-GeV Domain

在亚GeV领域中,弯曲晶体中电子束偏转与辐射产生研究

R. Negrello, M. Romagnoni, A. Sytov, N. Canale, D. De Salvador, P. Fedeli, V. Guidi, V. V. Haurylavets, P. Klag, W. Lauth, L. Malagutti, A. Mazzolari, G. Paternò, F. Sgarbossa, M. Soldani, V. V. Tikhomirov, D. Valzani, L. Bandiera

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究通过实验和模拟分析,揭示了亚GeV电子束在弯曲硅晶体中通道化效应增强辐射发射,并验证了低能区高效束流操控和高能辐射产生可行性。

Comments Version published in Eur. Phys. J. C

Journal ref Eur. Phys. J. C 86, 923 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.08599 2026-09-01 eess.SY cs.SY math.OC 版本更新 50%

LMI Properties and Applications in Systems, Stability, and Control Theory

线性矩阵不等式(LMI)的性质及其在系统、稳定性与控制理论中的应用

Ryan James Caverly, James Richard Forbes

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文献整合散见于各类文献的线性矩阵不等式(LMI)相关性质、技巧及应用,以百科全书或实用手册形式呈现,附必要示例与多种等价形式,供相关领域读者使用。

Comments See appendix A.1 for a detailed list of new additions and updates from the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 39 篇

2608.28995 2026-09-01 cs.RO cs.CV 新提交 84%

Hydra: A Navigation World Action Model with Discrete Latent Planning and Continuous Flow-Matching Execution

Hydra:一种具有离散潜在规划与连续流匹配执行能力的导航世界动作模型

Mohammad Nazeri, Alexandyr Card, Samira Huber, Anuj Pokhrel, Yujun Wang, Ruben Hammele, Daeun Song, Sören Pirk, Xuesu Xiao

机构 * George Mason University(乔治梅森大学) Kiel University(基尔大学) Ludwig Maximilian University Munich(慕尼黑大学) Ewha Womans University(梨花女子大学)

专题命中 具身导航 :navigation(title);world model(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Hydra模型,通过将规划器移入模型内部消除生成模型与规划器的表示不对齐问题,结合离散潜在规划与条件流匹配,在物理机器人平台上的目标导向规划与闭环执行能力表现优异。

Comments 29 pages, 12 figures. https://robotixx.github.io/hydra

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30689 2026-09-01 cs.CV 新提交 83%

CANVAS: Consistency-Aware Navigation via Visual Adaptive Sampling for Long-Context Text-to-SVG Generation

CANVAS:面向长上下文文本到SVG生成的一致性感知视觉自适应采样导航

Yichen Wu, Haoxuan Qu, Yihang Lou, Hossein Rahmani, Jun Liu

机构 * University of Nottingham(诺丁汉大学) Lancaster University(兰卡斯特大学) Peking University(北京大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.CV

AI总结 本文提出无训练的CANVAS框架,通过视觉自适应采样提升长上下文文本到SVG生成的全局一致性,无需额外训练即可在多基准上取得良好效果。

Comments 30 pages (including supplementary material), 9 figures, 10 tables. Code: https://github.com/Louis-YW/CANVAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30935 2026-09-01 cs.RO cs.AI 新提交 81%

LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation

LightNav-0:激发视觉语言模型的空间智能以实现通用具身导航

Shaoan Wang, Aocheng Luo, Fei Huang, Jingyi Xu, Xiaoyang Wang, Yueyu Wang, Qianli Ma, Fan Yang, Ran Mei, Jia Wei, Jiangpeng Hu, Xuhao Liu, Hongming Chen, Yuanbin Shao, Yiyang Lin, Ziliang Li, Liang Pan, Xinhang Liu, Yuntao Ma, Tingxiang Fan

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 LightNav-0 是激发 VLM 空间智能的通用具身导航模型,单模型支持多导航任务,在仿真基准和真实场景中均实现最优性能,具备强泛化能力。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30396 2026-09-01 cs.AI cs.RO 新提交 81%

Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation

将基础模型搭建为物理世界智能体以推动长时程导航前沿

Zixing Lei, Gengze Zhou, Xiong-Hui Chen, Jiazhao Zhang, Yiyang Huang, Hang Yin, Haoqi Yuan, Qi Wu, Weixin Li, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Inc(阿里巴巴集团) Zhongguancun Academy(中关村学院) Adelaide University(阿德莱德大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出NavMCP框架,结合VLM推理智能体与NFM执行器实现长时程导航,在多个具身问答基准及Unitree Go2机器人上取得优于基线的性能,验证了该方法的有效性。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29114 2026-09-01 cs.RO cs.AI 新提交 81%

CGFM-Nav: Cognitive Graph-Field Memory for Semantic-Guided Lifelong Multimodal Embodied Navigation

CGFM-Nav:用于语义引导的终身多模态具身导航的认知图场记忆

Yuxiang Xiao, Xibei Chen, Xin Zhou, Jie Chen, Yifeng Zhang, Guillaume Sartoretti

机构 * National University of Singapore(新加坡国立大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 该研究针对视觉与语言导航中环境表征的不足,提出CGFM及基于其的CGFM-Nav框架,在GOAT-Bench实验中提升了导航的成功率与SPL,验证了方法的有效性。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30242 2026-09-01 cs.RO 新提交 79%

CanonNav: Disentangling Navigation Behavior from Camera Geometry in Cross-Platform Visual Navigation

CanonNav:跨平台视觉导航中解耦导航行为与相机几何

Dong-Wook Kim, Ji-Hoon Hwang, E-In Son, Mintaek Oh, Seung-Woo Seo

机构 * Seoul National University(首尔大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 CanonNav框架解耦导航行为与相机几何,引入相机几何规范化并结合规划监督,仅用RGB推理便在多场景视觉导航中优于相关基线与RGB-D方法。

详情

展开后加载摘要…

URL PDF HTML 收藏