arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-09 至 2026-06-09 共收录 170 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 30 篇

2606.07813 2026-06-09 cs.RO cs.CV 新提交 81%

MinNav: Minimalist Navigation Using Optical Flow For Active Tiny Aerial Robots

MinNav:基于光流的极简导航用于主动微型飞行机器人

Aniket Patil, Mandeep Singh, Uday Girish Maradana, Nitin J. Sanket

机构 * Worcester Polytechnic Institute(伍斯特理工学院) Perception and Autonomous Robotics (PeAR) Group, Robotics Engineering Department, Worcester Polytechnic Institute(伍斯特理工学院机器人工程系感知与自主机器人(PeAR)实验室)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 提出MinNav导航栈,利用光流及其不确定性,使微型飞行机器人在无先验知识下穿越静态/动态障碍和未知形状间隙,通过主动探索提高成功率,实验成功率70%,计算量远小于深度方法。

Comments Accepted for publication at ICRA 2026. Link to Project page https://pear.wpi.edu/research/minnav.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06317 2026-06-09 cs.CV cs.AI 版本更新 81%

NavOne: One-Step Global Planning for Vision-Language Navigation on Top-Down Maps

NavOne: 一种基于顶部向下地图的视觉语言导航的一步全局规划

Dijia Zhan, Jinyi Li, Chenxi Zheng, Shaoyu Huang, Yong Li, Jie Tang, Xuemiao Xu

机构 * South China University of Technology(南方科技大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出了一种基于顶部向下地图的视觉语言导航方法,通过引入NavOne框架,实现多模态地图的单步全局路径规划,显著提升了导航效率和性能。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09399 2026-06-09 cs.AI 新提交 79%

RunAgent SuperBrowser: A Theory of Autonomous Web Navigation Grounded in Human Browsing Behaviour

RunAgent SuperBrowser: 基于人类浏览行为的自主网页导航理论

Radeen Mostafa, Sawradip Saha

机构 * RunAgent AI

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI

AI总结 提出SuperBrowser自主网页导航代理,通过模仿人类浏览的感知-认知-行动三元机制,在Mind2Web Hard基准上以89.47%成功率超越现有开源研究代理。

Comments 31 pages, 8 figures, preprint/work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08029 2026-06-09 cs.RO 新提交 79%

IntentNav: Learning Spatial-Visual Object Navigation from Human Demonstrations

IntentNav: 从人类演示中学习空间-视觉物体导航

Yuxin Cai, Zongtai Li, Maonan Wang, Muyi Bao, Haokun Zhu, Ruofei Bai, Ding Zhao, Zirui Li, Wenshan Wang, Wei-Yun Yau, Ji Zhang, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学) The Chinese University of Hong Kong(香港中文大学) A*STAR Institute for Infocomm Research (I2R)(新加坡科技研究局资讯通信研究院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 提出IntentNav框架,通过人类演示学习类人物体导航策略,利用前沿标注和意图对齐目标实现最优性能,并零样本迁移到多种机器人平台。

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01205 2026-06-09 cs.RO 版本更新 79%

ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning

ImagineUAV:通过世界-动作建模和动力学规划实现空中视觉语言导航

Xuchen Liu, Jiawei Huang, Shihao Xia, Bingxi Liu, Jinqiang Cui, Jiankun Yang

机构 * Pengcheng Laboratory(鹏城实验室) School of Computer Science and Cyber Engineering(计算机科学与网络工程学院) Guangzhou University(广州大学) Southern University of Science and Technology(南方科技大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 针对无人机视觉语言导航中几何不一致和动力学失配问题,提出基于潜视频扩散模型的世界-动作建模框架,通过生成未来观测推断6自由度运动并规划无碰撞轨迹,以1.3B参数在基准和实际飞行中超越先前方法。

Comments Video demo: https://www.youtube.com/watch?v=Ng1alP0yhc0

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09602 2026-06-09 quant-ph 新提交 78%

Zermelo's navigation problem through the lens of quantum annealing: How the Landau-Zener approximation leads to an efficient classical solution

通过量子退火视角的Zermelo导航问题:Landau-Zener近似如何导致高效的经典解法

Sølve Selstø, Tor Kristian Dahle, Sergiy Denysov, Yves-Laurent Ariel Rezus, Leiv Øyehaug

专题命中 具身导航 :navigation(title,abstract)

AI总结 将Zermelo导航问题转化为量子退火框架,利用qutrit和Landau-Zener近似,发现计算复杂度仅为二次,揭示了可高效利用的经典结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23082 2026-06-09 q-bio.NC 版本更新 78%

Spatial navigation in preclinical Alzheimer's disease: A review

阿尔茨海默病前期阶段的空间导航:综述

Syrine Salouhou, Victor Gilles, Remi Vallée, Gillian T. Coughlan, Romain Bachelet, Michael Hornberger, Hugo Spiers, Antoine Coutrot, Antoine Garnier-Crussard

专题命中 具身导航 :navigation(title,abstract)

AI总结 本文综述了阿尔茨海默病前期阶段空间导航的认知功能,探讨其与AD病理标志物如p-tau的相关性,提出空间导航任务作为早期检测高风险个体的敏感方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08253 2026-06-09 cs.RO cs.LG 新提交 73%

Mind Your Steps: A General Learning Framework for Accurate Humanoid Foothold Tracking

注意你的步伐:一种用于精确人形机器人落脚点跟踪的通用学习框架

Alessandro Montenegro, Shihao Li, Puze Liu, Alberto Maria Metelli, Jan Peters

机构 * Politecnico di Milano(米兰理工大学) TU Darmstadt(达姆施塔特工业大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Italian Institute of Technology(意大利技术研究院) University of Pisa(比萨大学)

专题命中 具身导航 :manipulation(abstract);navigation(abstract);分类 cs.RO、cs.LG

AI总结 提出一种轻量级通用3D落脚点跟踪策略学习框架,通过目标采样器动态提供步态支持,结合新目标表示克服真实世界噪声,实现与多种高层规划器无缝集成的精确自然运动。

Comments Accepted to RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09294 2026-06-09 cs.CV 新提交 70%

Virtual-point-based Solutions to Handle Generalized Absolute Pose Problem

基于虚拟点的广义绝对位姿问题求解方法

Bin Li, Banglei Guan, Shunkun Liang, Yang Shang

机构 * National University of Defense Technology(国防科技大学) Hunan Institute of Advanced Technology(湖南高级技术研究所)

专题命中 具身导航 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 针对多相机系统广义PnP问题,提出虚拟点公式化方法,将标准PnP求解器转化为广义位姿求解器,并基于Cayley、四元数和旋转矩阵参数化导出三种求解器,在精度、全局最优性和效率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19749 2026-06-09 eess.IV cs.CV 版本更新 70%

SPIRONet: Spatial-Frequency Learning and Graph-based Channel Interaction Network for Vessel Segmentation

SPIRONet:用于血管分割的空间-频率学习与基于图的通道交互网络

De-Xing Huang, Xiao-Hu Zhou, Xiao-Liang Xie, Shi-Qi Liu, Shuang-Yi Wang, Zhen-Qiu Feng, Mei-Jiang Gui, Hao Li, Tian-Yu Xiang, Bo-Xian Yao, Zeng-Guang Hou

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 具身导航 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 提出SPIRONet,通过双空间-频率编码器、交叉注意力融合和基于图的通道交互模块,解决低信噪比、细小血管和强干扰下的血管分割难题,在五个数据集上取得最优性能。

Comments Accepted by Biomedical Signal Processing and Control. 15 Pages, 9 Figures, 13 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00917 2026-06-09 cs.RO cs.CV cs.LG 版本更新 67%

A Survey on Deep Multi-Task Learning in Connected Autonomous Vehicles

联网自动驾驶车辆中深度多任务学习综述

Jiayuan Wang, Farhad Pourpanah, Q. M. Jonathan Wu, Ning Zhang

机构 * Department of Electrical and Computer Engineering, University of Windsor(温莎大学电气与计算机工程系) Department of Electrical and Computer Engineering, Queen’s University(皇后大学电气与计算机工程系)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 综述联网自动驾驶车辆中深度多任务学习,涵盖感知、预测、规划、控制及V2X通信与资源管理,分析现有方法优缺点并指出未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09569 2026-06-09 cs.RO cs.CV 新提交 62%

Efficient Minimal Solvers for Relative Pose Estimation in Autonomous Driving Applications

自动驾驶应用中相对位姿估计的高效最小求解器

Tao Li, Liang Liu, Jianli Han, Weimin Lv

机构 * College of Aerospace Science and Engineering, Naval Aviation University(海军航空大学航空航天科学与工程学院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 提出基于新平移参数化和一阶旋转近似的统一框架,设计三种最小求解器(利用IMU垂直方向、转向旋转轴方向、平面运动假设),减少点对应数量和代数复杂度,在RANSAC中加速假设生成,平衡速度与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07658 2026-06-09 cs.CV cs.LG 新提交 62%

What neurosurgeons need to see: synthetic intra-operative MRI from ultrasound for brain-shift compensation in brain tumour surgery

神经外科医生需要看到的:用于脑肿瘤手术中脑移位补偿的超声合成术中MRI

Santiago Cepeda, Olga Esteban-Sinovas, Ignacio Arrese, Rosario Sarabia

机构 * Department of Neurosurgery, Neurovascular Unit, Río Hortega University Hospital, Valladolid, Spain(西班牙巴利亚多利德里奥·奥尔特加大学医院神经外科神经血管科) Specialized Group in Biomedical Imaging and Computational Analysis (GEIBAC), Instituto de Investigación Biosanitaria de Valladolid (IBioVALL), Valladolid, Spain(西班牙巴利亚多利德生物医学研究与计算分析专业组(GEIBAC),巴利亚多利德生物健康研究所(IBioVALL))

专题命中 具身导航 :navigation(abstract);分类 cs.CV、cs.LG

AI总结 提出一种端到端流水线,通过融合术前MRI、术中超声生成的合成MRI及锚定该合成图像的可变形配准,生成术前成像空间中的全脑MRI体积,以补偿脑移位,为神经导航提供类似MRI的术中视野更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20906 2026-06-09 cs.CV cs.RO 版本更新 62%

Distant Object Localisation from Noisy Image Segmentation Sequences

基于噪声图像分割序列的远距离目标定位

Julius Pesonen, Arno Solin, Eija Honkavaara

机构 * Research Council of Finland(芬兰研究理事会) RCF Flagship Forest–Human–Machine Interplay—Building Resilience, Redefining Value Networks and Enabling Meaningful Experiences (UNITE)(RCF旗舰森林-人类-机器交互——构建韧性,重新定义价值网络和赋能有意义体验(UNITE))

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 针对远距离目标定位问题,提出多视图三角测量和粒子滤波两种方法,后者还能提供形状和不确定性估计,结合无人机图像分割与GNSS姿态估计实现可靠野火监测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08500 2026-06-09 cs.SE cs.AI 新提交 57%

Projecting the Emerging Mindset of SWE Agent by Launching a Wild Code Understanding Journey

通过发起野生的代码理解之旅来投射SWE代理新兴思维模式

Zhengyi Zhuo, Yan Liu

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 本文通过有限工具接口让SWE代理在真实代码库中探索,提出Ada框架,利用观察透镜分析代理的导航、证据选择、综合、基础化和停止行为,将轨迹数据转化为可比较的行为画像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08477 2026-06-09 cs.AI 新提交 57%

A Variability-Based Framework for Interpretable Naming in Formal and Relational Concept Analysis

基于可变性的框架:形式概念分析与关系概念分析中的可解释命名

Alain Gutierrez, Marianne Huchard, Pierre Martin, André Miralles, Violaine Prince

机构 * LIRMM, Univ. Montpellier, CNRS(法国国家科学研究中心蒙彼利埃大学计算机科学、机器人及微电子实验室) CIRAD, UPR AIDA(法国农业国际合作研究发展中心AIDA研究单元) AIDA, CIRAD, Univ. Montpellier(法国农业国际合作研究发展中心AIDA研究单元,蒙彼利埃大学) INRAE - UMR TETIS - Territoires, Environnement(法国国家农业、食品与环境研究院TETIS联合研究单元)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 针对形式概念分析和关系概念分析中概念命名缺乏可解释性的问题,提出一种基于可变性的LLM辅助命名框架,通过控制信息源生成可读名称,并在披萨店数据集上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08282 2026-06-09 cs.AI 新提交 57%

From Validator Selection to Portfolio Collection Optimization in Proof-of-Stake Blockchains

从验证者选择到权益证明区块链中的投资组合收集优化

Jonas Gehrlein, Grzegorz Miebs, Matteo Brunelli, Adam Mielniczuk, Miłosz Kadziński

机构 * Parity Technologies AG Institute of Computing Science, Poznan University of Technology(波兹南工业大学计算科学研究所) Department of Industrial Engineering, University of Trento(特伦托大学工业工程系)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 针对权益证明区块链中提名者选择验证者的多准则决策问题,提出双目标优化框架,同时最大化验证者期望效用(代表组合质量和盈利能力)和分配期望熵(代表风险分散),通过主动偏好学习和多目标进化算法求解,并引入交互式二分搜索导航确定满意折衷。

Comments 24 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08002 2026-06-09 cs.CV 新提交 57%

Aqua Boundary-Saliency Attention Module for Lightweight Underwater Salient Instance Segmentation Detection Transformer

Aqua边界显著性注意力模块:用于轻量级水下显著实例分割检测Transformer

M. Fazri Nizar, Julian Supardi, Muhammad Naufal Rachmatullah

机构 * Universitas Sriwijaya(斯里维贾亚大学)

专题命中 具身导航 :robotic(abstract);分类 cs.CV

AI总结 提出轻量级水下显著实例分割检测Transformer(LUSIS-DETR),通过Aqua边界显著性注意力模块嵌入水下先验线索,在四个数据集上达到领先性能,并在NVIDIA T4 GPU上实现4.31-6.34毫秒延迟。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07725 2026-06-09 physics.geo-ph cs.LG 新提交 57%

GNSS-FM: A Self-Supervised Foundation Model for Daily GNSS Displacement Time Series

GNSS-FM:用于日常GNSS位移时间序列的自监督基础模型

Nick Teutschmann, Laura Crocetti, Fanny Lehmann, Leonardo Trentini, Benedikt Soja

机构 * Institute of Geodesy and Photogrammetry, ETH Zurich(大地测量与摄影测量研究所,苏黎世联邦理工学院) ETH AI Center(ETH人工智能中心)

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 提出GNSS-FM自监督基础模型,通过双流输入和掩码潜在预测预训练,在位移预测和地震阶跃定位任务上优于强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22243 2026-06-09 cs.RO 版本更新 57%

SODA-CitrON: Static Object Data Association by Clustering Multi-Modal Sensor Detections Online

SODA-CitrON:通过在线聚类多模态传感器检测实现静态物体数据关联

Jan Nausner, Kilian Wohlleben, Michael Hubner

机构 * Jan Nausner, Kilian Wohlleben, Michael Hubner

专题命中 具身导航 :robotics(abstract);分类 cs.RO

AI总结 本文提出SODA-CitrON方法,通过在线聚类多模态传感器检测实现静态物体的数据关联,同时估计位置并维持持久跟踪,优于现有方法在F1分数、位置RMSE、MOTP和MOTA指标上。

Comments 8 pages, 5 figures; \c{opyright} 2026 IEEE. Accepted for the 2026 International Conference on Information Fusion (FUSION 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03606 2026-06-09 cs.LG 版本更新 57%

Observation-driven correction of numerical weather prediction for marine winds

基于观测驱动的海洋风数值天气预报修正

Matteo Peduto, Qidong Yang, Jonathan Giezendanner, Devis Tuia, Sherrie Wang

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 提出ORCA模型,利用Transformer架构融合稀疏、异质的海洋观测数据,实时修正GFS风场预报,在0-48小时预报时效内误差降低13%-45%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03957 2026-06-09 cs.HC cs.CV 57%

Vision Language Models as Values Detectors

视觉语言模型作为价值检测器

Giulio Antonio Abbo, Tony Belpaeme

机构 * IDLab-AIRO, Ghent University – imec, Belgium(IDLab-AIRO、根特大学 – imec、比利时)

专题命中 具身导航 :robotics(abstract);分类 cs.CV

AI总结 本文研究了先进LLM与人类标注者在家庭环境场景中检测相关元素的对齐情况,发现LLaVA 34B表现最佳但仍需改进,表明LLM在检测图像中价值元素方面有潜力。

Comments 13 pages, 2 figures

Journal ref Value Engineering in Artificial Intelligence (VALE 2024) (LNAI,volume 15356)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14413 2026-06-09 eess.SP 版本更新 56%

Comprehensive Review of Doppler Shift Localization Methods: Advances, Limitations, and Research Opportunities

多普勒位移定位方法综述:进展、局限与研究机会

Rafal Szczepanik

专题命中 具身导航 :navigation(abstract,comments)

AI总结 本文综述了非合作发射机在GNSS不可用或退化环境中的可靠定位方法,分析了多普勒技术的演变、测量模型和估计器,并探讨了环境特定部署和开放研究挑战。

Comments 27 pages, 1 table. TransNav: International Journal on Marine Navigation and Safety of Sea Transportation (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07719 2026-06-09 eess.SP 新提交 50%

Hessian-matching Based Weighting for Attitude Determination Using Short-Range DoA Measurements with IMU Assistance

基于Hessian匹配的短距离DoA测量与IMU辅助姿态确定加权方法

Chenxin Tu, Hengchuan Zhang, Xiaowei Cui, Gang Liu, Mingquan Lu

专题命中 具身导航 :navigation(abstract)

AI总结 针对短距离场景下方向向量误差各向异性问题,提出基于Hessian匹配的标量加权策略,通过流形高斯-牛顿法求解协方差加权正交Procrustes问题,并引入IMU重力向量提升精度与鲁棒性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02383 2026-06-09 cs.MA cs.GT cs.SY eess.SY 版本更新 50%

A Game-Theoretic Decision Framework for Optimal Selection of Coordination Detection Methods in Multi-UAV Fleet Operations

多无人机编队操作中协调检测方法最优选择的博弈论决策框架

Christian Manasseh, Savana Ammons

专题命中 具身导航 :navigation(abstract)

AI总结 提出一个博弈论决策框架,通过将方法选择建模为监控者与自然之间的零和博弈,解决多无人机编队协调检测中速度与准确性的权衡问题,并利用混合策略保证最坏情况下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11042 2026-06-09 cond-mat.soft cond-mat.stat-mech 50%

Delayed Active Swimmer in a Velocity Landscape

速度景观中的延迟主动游泳者

Viktor Holubec, Alexander Fischer, Giovanni Volpe, Frank Cichos

专题命中 具身导航 :navigation(abstract)

AI总结 研究延迟对主动粒子动力学的影响,揭示时间延迟如何控制粒子运输与自组织,为生物微游泳器和合成微机器人提供新机制。

Comments 6 pages, 4 figures

Journal ref Phys. Rev. Research 8, L022017 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 20 篇

2606.09813 2026-06-09 cs.RO cs.CV 新提交 88%

iMaC: Translating Actions into Motion and Contact Images for Embodied World Models

iMaC: 将动作转化为运动与接触图像用于具身世界模型

Zhenyu Wu, Xiuwei Xu, Yukun Zhou, Yifan Li, Qiuping Deng, Xiaofeng Wang, Zheng Zhu, Bingyao Yu, Ziwei Wang, Jiwen Lu, Haibin Yan

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) GigaAI Nanyang Technological University(南洋理工大学)

专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);manipulation(abstract);robotic(abstract)

AI总结 提出iMac框架,将原始视觉图像作为动作表示,通过图像-动作编码器和动态预测器实现高保真未来状态预测和闭环控制,在预测精度、任务成功率和跨场景泛化上优于传统向量动作控制。

Comments Project page: https://imac-wm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01799 2026-06-09 cs.CV 版本更新 87%

Embody4D: A Generalist Data Engine for Embodied 4D World Modeling

Embody4D: 面向具身4D世界建模的通用数据引擎

Peiyan Tu, Hanxin Zhu, Jingwen Sun, Shaojie Ren, Cong Wang, Yuyan Xu, Jiayi Luo, Xiaoqian Cheng, Zhibo Chen

机构 * Zhejiang University(浙江大学) Beijing Zhongguancun Academy(北京中关村学院) University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Jiao Tong University(上海交通大学) Beihang University(北京航空航天大学)

专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);manipulation(abstract);robotic(abstract)

AI总结 提出Embody4D视频到视频世界模型,通过3D感知合成管道、潜在置信度专家调制和交互注意力机制,将单目机器人视频转换为多视角视频,解决具身智能中视角稀疏问题,提升下游规划与学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07687 2026-06-09 cs.CV cs.AI 新提交 84%

What Makes Video World Model Latents Action-Relevant: Prediction over Reconstruction

什么使视频世界模型潜在空间与动作相关:预测优于重建

Jewon Yeom, Hanseul Kim, Jeongjae Park, Sungmok Jung, Jaejin Lee, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔大学数据科学研究生院)

专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 通过统一探针评估,发现动作相关结构主要由时间视频预训练驱动,而非像素重建保真度,其中视频预训练自监督编码器在视觉保真度和动作预测间取得最佳帕累托权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09032 2026-06-09 cs.CL 新提交 82%

Bridging the Agent-World Gap: Text World Models for LLM-based Agents

弥合智能体-世界鸿沟:面向基于LLM的智能体的文本世界模型

Yixia Li, Hongru Wang, Peng Lai, Zhiwen Ruan, He Zhu, Youxin Zhu, Ganlong Zhao, Minda Hu, Yun Chen, Sibei Yang, Peng Li, Jeff Z. Pan, Jia Pan, Guanhua Chen, Yang Liu, Guanbin Li

机构 * Southern University of Science and Technology(南方科技大学) University of Edinburgh(爱丁堡大学) Peking University(北京大学) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 具身推理 :world model(title,abstract);navigation(abstract)

AI总结 本文系统综述了面向基于LLM的智能体的文本世界模型,围绕形式化框架和智能体生命周期,涵盖基础定义、构建范式、应用(训练时经验合成与推理时规划、验证、适应)及评估,旨在整合该领域并明确设计空间与开放挑战。

Comments Code: https://github.com/sustech-nlp/awesome-text-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏