arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 14074 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 14074 篇

2608.26669 2026-08-28 cs.RO cs.CV 新提交 62%

Beyond the Proving Ground: Independent Public-Road Testing of Assisted Lane Change Systems using LiDAR

超越试验场:基于激光雷达的辅助变道系统独立公开道路测试

Marcello Cellina, Akos Kriston, Antonio Migneco, Davide Maggi, Stefano Favelli, Fabrizio Re, Fabrizio Minarini, Andrea Nuovo, Riccardo Dona, Biagio Ciuffo

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 本研究提出公共道路独立测试辅助变道系统的方法,在法国A31高速开展测试,发现部分系统操作未达UNECE第79号法规安全距离要求,验证了LiDAR传感的适用性,可支持市场监管与法规修订。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19971 2026-08-28 cs.RO cs.CV 版本更新 62%

Unified Prediction and Planning via Conflict-Aware Disjoint Parameter Training

通过冲突感知不相交参数训练实现统一预测与规划

Taewon Seo, Seonae Jeon, Giwon Lee, Kuk-Jin Yoon, Daehee Park

机构 * DGIST(韩国科学技术院大邱庆北校区) KAIST(韩国科学技术院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 研究社交机器人在拥挤环境中统一预测与规划问题,提出基于模型合并的不相交参数训练框架DPT,通过分布式参数学习减轻技能冲突,稀疏合并提升性能,在标准基准测试中验证其在机器人导航上通用且有效。

Comments Accepted at ECCV 2026. 38 pages, 14 figures. Project page: https://dpt2026.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15987 2026-08-27 cs.LG cs.AI 版本更新 62%

AlgoTrace: Algorithmic Primitives and Compositional Geometry of Reasoning in Language Models

语言模型中推理的算法原语与组合几何

Samuel Lippl, Thomas McGee, Kimberly Lopez, Ziwen Pan, Pierce Zhang, Salma Ziadi, Oliver Eberle, Ida Momennejad

机构 * Microsoft Research NYC(微软研究院纽约分部) Center for Theoretical Neuroscience(理论神经科学中心) Department of Psychology(心理学系) University of California Los Angeles(加州大学洛杉矶分校) Institute for Pure and Applied Mathematics(纯粹与应用数学研究所) Emory University(埃默里大学) Rice University(里士满大学) Mount Holyoke College(马里兰霍克学院) Technische Universität Berlin(柏林技术大学) BIFOLD-Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 研究通过分析语言模型中的算法原语,揭示其推理过程的组合几何结构,并展示原语在跨任务和跨模型中的可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21395 2026-08-25 cs.RO cs.AI 新提交 62%

ODG-NoMaD: Overhead-Camera Direction-Guided NoMaD

ODG-NoMaD: overhead相机方向引导的NoMaD

Blossom Treesa Bastian, Keerthi S. Shetty, Manish Kolachalam, Rani Malhotra, Ashish Dutta

机构 * Applied Research Center for Autonomous Machines, Infosys Center for Emerging Technologies(Infosys新兴技术中心自主机器应用研究中心) Dept. of Mechanical Engineering, IIT Kanpur(印度理工学院坎普尔分校机械工程系)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 该研究提出ODG-NoMaD,通过overhead相机方向引导改进NoMaD,在模拟办公环境中大幅减少残余距离、优于NaviDiffusor且全程无碰撞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16070 2026-08-18 cs.LG cs.AI 新提交 62%

OceanLight: Efficient Global Ocean Forecasting via Geometry-Adaptive Unstructured Mesh Representation

OceanLight:基于几何自适应非结构化网格表示的高效全球海洋预报方法

Wei Wu, Xiang Wang, Hongze Leng, Qingye Min, Junxing Zhu, Junqiang Song

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 OceanLight框架结合几何自适应非结构化网格分词与GNN主干,在提升海洋预报精度的同时降低计算成本,为可扩展数据驱动海洋学建立了可推广范式。

Comments 35 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15995 2026-08-18 cs.RO cs.LG 新提交 62%

Learning Varying Physical Therapist-Patient Interactions for Robot-mediated Upper Limb Task-Specific Training

学习可变的治疗师-患者交互用于机器人介导的上肢任务特定训练

Jia Quan Loh, Vincent Crocher, Marlena Klaic, Denny Oetomo, Ying Tan

机构 * The University of Melbourne(墨尔本大学)

专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 该研究针对康复机器人在任务特定训练中未体现显著优势的问题,提出基于TPGMM的演示学习框架,学习个性化治疗师-患者交互,在多任务评估中其表现略优于查找表。

Comments 12 pages, 4 figures, 3 tables Submitted to:IEEE Transactions on Neural Systems and Rehabilitation Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12314 2026-08-17 cs.RO cs.CV 版本更新 62%

LatentAM: Real-Time, Large-Scale Latent Gaussian Attention Mapping via Online Dictionary Learning

LatentAM:通过在线字典学习实现实时、大规模的潜在高斯注意力映射

Junwoon Lee, Yulun Tian

机构 * Robotics Department, University of Michigan(密歇根大学机器人系)

专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 LatentAM通过在线字典学习实现实时、大规模的潜在高斯注意力映射,提升机器人感知的特征重建保真度与实时性

Comments 8 pages, 7 figures. Accepted for RA-L. Homepage: https://junwoonlee.github.io/projects/LatentAM/ Code: https://github.com/UMich-SSI-Lab/latentam

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12515 2026-08-14 cs.CV cs.RO 新提交 62%

Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?

视觉-语言模型能否从机器人的第一人称视角图像评估人际距离风险?

Vladyslava Rudas, Dmytro Kuzmenko

机构 * National University of Kyiv-Mohyla Academy(基辅莫希拉国立大学) University of Turin(都灵大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 该研究评估了InternVL、Qwen-VL、SmolVLM三种VLM在机器人第一人称视角图像人际距离危险分类中的表现,发现Qwen-VL经特定优化后高危险召回率更高,当前VLM在相关推理定位上仍有局限。

Comments Accepted at the EMR 2026 workshop at ECCV 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00237 2026-08-13 cs.CV cs.RO 版本更新 62%

Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving

隐式质心引导:用于指令对齐自动驾驶的单次无分类器引导

Meibo Hu, Jiamian Wang, Pichao Wang, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工学院) NVIDIA(英伟达公司)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 针对视觉语言自动驾驶模型的指令跟随差距,提出单次引导机制LCS,降低推理延迟约50%,在Bench2Drive和nuScenes基准上提升指令遵循与驾驶性能。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08837 2026-08-13 cs.LG cs.AI 版本更新 62%

Prompt-Driven Exploration

提示驱动的探索

Sunshine Jiang, John Marangola, David Zhang, Raghuram Kowdeed, Ruiyang Luo, Nitish Dashora, Richard Li, Pulkit Agrawal, Zhang-Wei Hong

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) Improbable AI Lab(英普罗巴布尔人工智能实验室)

专题命中 具身导航 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究针对强化学习中探索难的问题,提出提示驱动的探索策略(PDE),利用视觉-语言模型对轨迹视频推理,从弱策略轨迹中优化提示,实现后验采样,能让强化学习从零奖励起步学习成功策略并提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10023 2026-08-12 cs.RO cs.CV cs.SY eess.SY 新提交 62%

Protection Levels for Vision-Based Pose Estimation

基于视觉的位姿估计的保护水平

Olivia Beyer Bruvik, Romeo Valentin, Marc R. Schlichting, Don Walker, Mykel J. Kochenderfer

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 本研究扩展了现有视觉位姿估计框架,推导了适用于航空场景的非线性PnP问题保护水平算法,分析了相关因素对其的影响并展示了权衡关系,为视觉导航的完整性认证提供支持。

Comments 11 pages, 5 figures. Accepted for publication at the 2026 AIAA DATC/IEEE 45th Digital Avionics Systems Conference (DASC). O. Beyer Bruvik and R. Valentin contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07606 2026-08-11 cs.RO cs.AI cs.HC eess.IV 新提交 62%

Enhanced Real-Time 6-DOF Extended Reality Catheter Tracking for Evaluating Potential Improvement in Efficiency, Precision, and Depth Perception for Cardiac Interventions

用于评估心脏介入效率、精度和深度感知潜在提升的增强型实时六自由度扩展现实导管跟踪技术

Mohsen Annabestani, Sandhya Sriram, Andrew Kuzemczak, S. Chiu Wong, Alexandros Sigaras, Bobak Mosadegh

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本研究开发基于XR的实时6-DOF导管跟踪平台,经20名医学生测试,其可使心脏介入操作速度提升超5倍、导管移动距离减约5倍,还能提高精度、降低变异性,优化操作体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26046 2026-08-11 cs.RO cs.CV 版本更新 62%

RoboAtlas: Contextual Active SLAM

RoboAtlas:上下文感知主动SLAM

Alexander Schperberg, Shivam K. Panda, Abraham P. Vinod, Rokaha Bhagawan, M. K. Jawed, Stefano Di Cairano

机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 提出RoboAtlas框架,通过上下文感知的多臂赌博机平衡几何探索与语义推理,结合3D语义地图OpenRoboVox,在真实环境中实现100%任务成功率,并在GOAT-Bench上以90.6%成功率达到SOTA。

Comments Alexander Schperberg and Shivam K. Panda made equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04732 2026-08-06 eess.SY cs.AI cs.RO cs.SY 新提交 62%

Toward Integrating Adaptive Experience Replay and Online Uncertainty Estimation in Safe Actor-Critic Optimal Control

在安全Actor-Critic最优控制中融合自适应经验回放与在线不确定性估计

Mahshad Rastegarmoghaddam, Davoud Nikkhouy, Shima Samadzadeh

机构 * Politecnico di Milano(米兰理工大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 该研究在安全Actor-Critic最优控制中提出融合自适应经验回放与在线不确定性估计的集成架构,在二维机器人导航任务的测试中,该集成配置在极端压力测试下实现零接触且全部种子到达目标,性能优于仅移除不确定性估计的配置。

Comments Code, deterministic seeds, data, figures, and protocol files are archived at https://doi.org/10.5281/zenodo.21515850 and https://github.com/SDNT8810/safe-actor-critic-aer-ue-reproducibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19138 2026-08-05 cs.CR cs.AI cs.LG cs.SE 版本更新 62%

AgenticSCR: An Autonomous Agentic Secure Code Review for Immature Vulnerabilities Detection

AgenticSCR: 一种用于检测初期漏洞的自主代理安全代码审查

Wachiraphan Charoenwet, Kla Tantithamthavorn, Patanamon Thongtanunam, Hong Yi Lin, Minwoo Jeong, Ming Wu

机构 * The University of Melbourne(墨尔本大学) Monash University(莫纳什大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 AgenticSCR通过结合LLMs、自主决策和语义记忆,有效检测预提交阶段的初期漏洞,优于传统SAST工具和静态LLM基线。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE'26 Industry-Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02320 2026-08-04 cs.RO cs.CV 新提交 62%

TravKAN: Fast and Interpretable Nonlinear Traversability Analysis with Kolmogorov-Arnold Networks

TravKAN:基于Kolmogorov-Arnold网络的快速可解释非线性可通行性分析

Daniel Fusaro, Simone Mosco, Wanmeng Li, Alberto Pretto

专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出基于Kolmogorov-Arnold网络的TravKAN框架,结合LiDAR反射率手工特征,在公开数据集上性能优于传统深度模型,兼具可解释性与高效性,适用于安全关键的机器人可通行性分析。

Comments This paper has been accepted for publication at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21337 2026-08-04 cs.LG cs.AI 版本更新 62%

DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams

DataClaw0: 从原始流中智能定制多模态数据

Cong Wan, Zeyu Guo, Zijian Cai, Jiangyang Li, SongLin Dong, Lin Peng, Xiangyang Luo, Zhiheng Ma, Yihong Gong

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shenzhen University of Advanced Technology(深圳理工大学) Tsinghua University(清华大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 提出DataClaw0模型,通过两阶段流水线将生成语义合成锚定于确定性事实锚点,结合SFT与GRPO实现复杂数据精炼意图的对齐,首个数据精炼基准验证其高效性。

Comments add base model: Qwen3.5-27B

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27194 2026-07-30 cs.CV cs.RO 新提交 62%

VidMap: Exploiting Temporal Structure for Video-Based Structure-from-Motion

VidMap:利用时序结构实现基于视频的运动恢复结构

Zador Pataki, Paul-Edouard Sarlin, Marc Pollefeys

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌) Microsoft(微软)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 VidMap结合SLAM序列约束与SfM全局优化,利用宽基线匹配和深度先验,在多样挑战性数据集上,较最新SLAM和SfM更鲁棒准确,可实现任意长未标定视频的度量重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24983 2026-07-29 cs.LG cs.AI math.OC stat.ML 新提交 62%

Generative Distributionally Robust Optimization

生成式分布鲁棒优化

Ziwei Zhang, Jonathan Yu-Meng Li, Zhihao Jin

机构 * Telfer School of Management, University of Ottawa(渥太华大学泰尔弗管理学院) Department of Electrical and Computer Engineering, Western University(西安大略大学电气与计算机工程系)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 研究提出生成式分布鲁棒优化(GDRO)框架,接受可采样条件生成器为名义模型,通过采样器-辛科恩配对限制最坏情况法则,可直接有限样本近似和可微实现,相比名义决策降低了罕见上下文库存遗憾和SocialGAN导航碰撞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10571 2026-07-29 cs.LG cs.AI stat.ML 版本更新 62%

Learning from Local Walks on Dynamic Graphs with Bandit Feedback

从具有强盗反馈的动态图上的局部游走中学习

Sourav Chakraborty, Amit Kiran Rege, Claire Monteleoni, Lijun Chen

机构 * Department of Computer Science, University of Colorado, Boulder(科罗拉多大学博尔德分校计算机科学系) INRIA, Paris(法国国家信息与自动化研究所巴黎分部)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 研究动态图上随机多臂强盗问题,基于滑动窗口混合识别结构条件,分析局部探索然后提交算法,建立次线性期望遗憾,还包括奖励感知策略及相关定理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22142 2026-07-29 cs.LG cs.AI 版本更新 62%

Short-Term-to-Long-Term Memory Transfer for Knowledge Graphs under Partial Observability

知识图谱下的短期到长期记忆转移:在部分可观测性下的短期到长期记忆转移

Taewoon Kim, Vincent François-Lavet, Michael Cochez

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在部分可观测性下知识图谱中的短期到长期记忆转移问题,提出了一种基于神经符号价值决策的方法,通过在长期插入前决定保留或丢弃观察到的三元组,从而提升记忆效率,并在RoomKG基准测试中优于符号和神经基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24083 2026-07-28 cs.LG cs.RO 新提交 62%

Learning Reusable Hybrid Motion Priors for Humanoid Locomotion from Motion Imitation

从运动模仿中学习可重复使用的类人运动混合先验

Valerio Belli, Valerio Modugno, Enrico Mingo Hoffman, Fabio Amadio

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.LG

AI总结 研究提出三阶段流程,将运动模仿技能转化为可重复使用的类人运动混合先验(HMP)。先训练专家策略模仿人类运动,再提炼为冻结架构,最后训练任务级策略。经模拟评估和机器人验证,HMP可重复使用,还揭示可解释码本结构,训练码本技巧能减少下游跌倒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22166 2026-07-27 cs.RO cs.AI 新提交 62%

Learning Spatiotemporal Decision Priors for Efficient Path Planning under Partial Observability

学习时空决策先验以实现部分可观测性下的高效路径规划

Yi Liu, Hongda Zhang, Leyao Zou, Chunlei Meng, Ziqing Zhou, Yuning Chen, Zhuo Zou, Lida Xu, Zhongxue Gan, Chun Ouyang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(智能机器人与先进制造学院,复旦大学) School of Information Science and Technology, Fudan University(信息科学与技术学院,复旦大学) Department of Information Technology, Old Dominion University(信息技术系,老 Dominion 大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 研究部分可观测性下的路径规划问题,提出ImiPath框架,从示范轨迹提炼时空决策先验,经局部时空观测表示和时空注意力策略网络转换为决策先验并纳入异构规划器,提升路径质量与搜索效率,验证了框架的适应性和实际部署潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11029 2026-07-24 cs.RO cs.CV 版本更新 62%

Learning to Navigate Efficiently with Only 0.58M Trainable Parameters

仅用58万个可训练参数学习高效导航

Edward Beng Wai Tan, Siew-Kei Lam

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 研究视觉导航中单个任务族所需规模及替代结构,提出分解式导航模型,仅用少量可训练参数,在导航任务中接近最先进模型性能,还能用于无目标探索,故障模式可解析纠正。

Comments 6 pages, 4 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13830 2026-07-22 cs.RO cs.CV 版本更新 62%

Recursive ArUco Markers: A Scalable Fiducial Marker Design for Unmanned Aerial Vehicle Landing Pads

递归ArUco标记:一种用于无人机着陆垫的可扩展基准标记设计

Rafael Munoz-Salinas, Francisco Jose Romero-Ramirez, Sergio Garrido-Jurado

机构 * Universidad de Córdoba(科尔多瓦大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 研究针对无人机着陆依赖的视觉基准标记操作范围有限问题,提出递归ArUco标记设计,通过改进位采样策略实现任意深度递归、遮挡下稳健检测及多唯一标识符字典,使无人机机队可同时在指定位置着陆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18537 2026-07-22 cs.RO cs.AI 版本更新 62%

SKETCH: Semantic Key-Point Conditioning for Long-Horizon Vessel Trajectory Prediction

SKETCH: 面向长时域船舶轨迹预测的语义关键点条件建模

Linyong Gan, Zimo Li, Wenxin Xu, Xingjian Li, Jianhua Z. Huang, Enmei Tu, Shuhang Chen

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)数据科学学院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)科学与工程学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院) COSCO SHIPPING Advanced Technology Institute, Shanghai, China(中远海运技术研究院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 针对长时域轨迹预测中方向漂移问题,提出基于语义关键点(NKP)的条件轨迹建模框架,将预测分解为全局语义决策与局部运动建模,采用预训练-微调策略估计NKP先验,在真实AIS数据上显著提升长时域、方向精度和细粒度预测性能。

Comments Final Camera-Ready Version. Accepted by ICML 2026 (PMLR Vol. 306)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17994 2026-07-21 cs.CV cs.AI 新提交 62%

HAS: Highlight-guided Attention Steering for Multimodal LLM Video Summarization

HAS:用于多模态大语言模型视频摘要的高亮引导注意力转向

Rui Chu, Yingjie Lao

机构 * Tufts University(塔夫茨大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 针对视频摘要,提出HAS方法,通过全局找连续帧级高亮分布并作为注意力转向向量,让多模态大语言模型在推理时更关注高亮帧,避免丢失信息,在多种基准测试中性能出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17058 2026-07-21 cs.RO cs.CV 新提交 62%

DROID-ANCHOR: Odometry-Anchored Recurrent Metric Depth Estimation

DROID-ANCHOR:基于里程计锚定的循环度量深度估计

Yuxuan Chen, Brook Du

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 研究针对单目系统尺度问题,提出Metric-DROID架构,通过集成里程计,利用LSTM更新算子、不确定性感知度量后端及选择性残差微调策略,实现视觉SLAM与物理现实锚定,有效解决尺度模糊等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15621 2026-07-20 cs.RO cs.AI 新提交 62%

Think at 5 Hz, Act at 20 Hz: Asynchronous Fast-Slow Vision-Language-Action Inference for Closed-Loop Driving

以5Hz思考,20Hz行动:用于闭环驾驶的异步快慢视觉-语言-动作推理

Yun Li, Jiachen Gong, Simon Thompson, Ehsan Javanmardi, Qunli Zhang, Zifan Zeng, Shiming Liu, Peng Wang, Zixuan Guo, Manabu Tsukada

机构 * The University of Tokyo(东京大学) TIER IV, Inc.(TIER IV公司) Huawei(华为)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 研究针对大语言模型用于闭环驾驶时推理延迟与车辆控制速率冲突的问题,提出快慢架构,慢系统用冻结主干处理历史,快专家基于缓存和当前帧回归航路点,经训练在CARLA上提升路线完成率,降低误差且可零样本转移。

Comments 13 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14228 2026-07-17 cs.CV cs.AI 新提交 62%

SeeSE3: Emergence of 3D Space in Vision Features

SeeSE3:视觉特征中3D空间的出现

Caroline Chen, Sayna Ebrahimi, Fedor Kitashov, Ming-Hsuan Yang, Leonidas Guibas, Viorica Pătrăucean, Maks Ovsjanikov

机构 * Google DeepMind(谷歌DeepMind)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 研究视觉基础模型构建的表征与3D欧几里得空间内在属性的关系,提出从拓扑和几何角度评估的探测器,发现自监督视觉模型有相关潜在子空间,并基于此提出“潜在空间导航”技术用于视觉里程计和定位。

详情

展开后加载摘要…

URL PDF HTML 收藏