arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3146 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 3146 篇

2510.21746 2025-10-28 cs.RO 61%

Avi: Action from Volumetric Inference

Harris Song, Long Le

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of pennsylvania(宾夕法尼亚大学)

专题命中 具身推理 :robotic(abstract);分类 cs.RO;world model(comments)

Comments NeurIPS 2025 Workshop on Embodied World Models for Decision Making. URL: https://avi-3drobot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02353 2025-09-03 cs.RO 61%

SAVOR: Skill Affordance Learning from Visuo-Haptic Perception for Robot-Assisted Bite Acquisition

Zhanxin Wu, Bo Ai, Tom Silver, Tapomayukh Bhattacharjee

机构 * Cornell University(康奈尔大学) UC San Diego(南加州大学)

专题命中 具身推理 :manipulation(abstract);分类 cs.RO;robot learning(comments)

Comments Conference on Robot Learning, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04250 2024-10-08 cs.RO 61%

ETHcavation: A Dataset and Pipeline for Panoptic Scene Understanding and Object Tracking in Dynamic Construction Environments

Lorenzo Terenzi, Julian Nubert, Pol Eyschen, Pascal Roth, Simin Fei, Edo Jelavic, Marco Hutter

专题命中 具身推理 :navigation(abstract);分类 cs.RO;robotics(comments)

Comments 9 pages, 7 figures, 4 tables, submitted to 2024 Australasian Conference on Robotics and Automation (ACRA 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.01717 2021-06-04 cs.CV 61%

Towards urban scenes understanding through polarization cues

Marc Blanchon, Désiré Sidibé, Olivier Morel, Ralph Seulin, Fabrice Meriaudeau

专题命中 具身推理 :robotics(abstract,comments);分类 cs.CV

Comments Submitted to Autonomous Robots - Special Issue on Unconventional Sensors in Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25956 2026-08-27 cs.CV 新提交 57%

4DGS-WAM: Bridging Past and Future with an Object-Centric World Action Model based on 4D Gaussian Splatting

4DGS-WAM:基于4D高斯溅射的以对象为中心的世界动作模型,连接过去与未来

Yueen Ma, Zenglin Xu, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Academy of AI for Science(上海人工智能科学研究院) Fudan University(复旦大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本研究提出基于4D高斯溅射的以对象为中心的世界动作模型4DGS-WAM,将2D观测转为持久4D表示,复用静态内容以聚焦动态对象演化,在KITTI-MOT上完成短程预测与过去重建评估。

Comments This is a work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24044 2026-08-27 cs.LG 版本更新 57%

JEPA-x: Cross-Predictive Physics Grounding for Forecastable Latent Dynamics

XP-JEPA:用于可预测潜在动力学的交叉预测物理基础

Kehan Wen, Ziming Li, Siyuan Luo, Fan Shi

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 XP-JEPA通过将视觉与物理表征交叉预测,提升了潜在动力学的可预测性,在多任务套件上降低了展开漂移并提高了控制成功率,无需特权输入即可实现更优的基于展开的控制性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16287 2026-08-27 cs.LG 版本更新 57%

SCALE: State-Calibrated Latent Embeddings for JEPA Planning in the Right Geometry

SCALE:用于正确几何空间中JEPA规划的状态校准潜在嵌入

Jiaming Hu, Yan Zheng, Tian Wang

机构 * Boston University(波士顿大学) Unity Technologies(Unity科技公司)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 该研究提出SCALE正则化器,为LeWM表示校准几何属性,在多任务、多求解器和多计算预算下均提升规划性能,证明规划依赖信息对几何的塑造作用。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03314 2026-08-27 cs.CV 版本更新 57%

TASE: Truncation-Aware Semantic Embeddings for 3D Scene Understanding and Editing

TASE: 用于3D场景理解与编辑的截断感知语义嵌入

Tim-Felix Faasch, Jochen Kall, Lucas Nunes, Jens Behley, Cyrill Stachniss

机构 * Bosch Research(博世研究院) Rheinisch-Westfälische Technische Hochschule Aachen(亚琛工业大学) University of Bonn(波恩大学)

专题命中 具身推理 :robotics(abstract);分类 cs.CV

AI总结 提出TASE方法,通过将预训练的2D语义特征投影到截断感知嵌入空间,结合尺度和平移等变损失,实现可控的3D场景文本驱动编辑,在大几何修改任务上显著优于现有方法。

Comments Code: https://github.com/boschresearch/TASE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23790 2026-08-26 cs.CV q-bio.NC 新提交 57%

Primate vision reveals a missing principle for robust dynamic AI

灵长类视觉揭示了鲁棒动态人工智能缺失的原理

Matteo Dunnhofer, Christian Micheloni, Kohitij Kar

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 该研究对比人类与猕猴视觉及相关神经网络,发现预测世界模型兼具跨外观泛化与高神经保真度,提出将运动逐步整合到物体表征是鲁棒动态视觉的关键原理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23706 2026-08-26 cs.AI 新提交 57%

Do LLMs Understand Limit Order Book Dynamics?

大型语言模型(LLM)是否理解限价订单簿(LOB)动态?

Junxiao Chen, Paul Glasserman

机构 * Columbia Business School(哥伦比亚商学院)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本研究测试基于LOB数据训练的LLM,发现其隐式世界模型未掌握LOB状态,导致预测有偏且存在虚假可预测性,为此将相关测试扩展至LOB的随机动态环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13554 2026-08-26 cs.ET cs.IT cs.RO math.IT 版本更新 57%

Observability Engineering: From Measurement to Information Generation in Active Sensing Systems

从快照感知到持久电磁世界建模:一种面向ISAC的生成空间视角

Pin-Han Ho, Limei Peng

专题命中 具身推理 :world model(abstract);分类 cs.RO

AI总结 本文提出一种基于生成空间的毫米波感知框架,通过低维激励空间实现灵活、可扩展的持续电磁世界建模,避免了快照感知的局限性。

Comments 7 pages, 6 figures/tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23526 2026-08-25 cs.AI 新提交 57%

Correcting a learned physical invariant improves world-model rollouts

修正已学习的物理不变量可改进世界模型的滚动预测

Richard Bao

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本研究针对仅用单摆视频训练的DreamerV3,通过无标签搜索发现其学习到类能量不变量,投影隐态回初始水平集可降低保守模型滚动误差,揭示世界模型存在从像素学物理约束却在想象时违反的失效模式。

Comments 10 pages, 5 figures. Code at https://github.com/Zarand3r/world-model-invariants

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22358 2026-08-25 cs.LG physics.geo-ph 新提交 57%

Tracing the Unlabeled Storm: Cross-Variable Transfer in a Lagrangian Atmospheric JEPA Framework

追踪未标记的风暴:拉格朗日大气JEPA框架中的跨变量迁移

K M Anirudh, S Sandeep, Hariprasad Kodamana

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 该研究提出跨变量代理学习方法,基于M-JEPA在无降水监督下预训练,实现了优于ECMWF集合的季风降水预测,为大气表示迁移提供诊断框架。

Comments 8 pages, 3 figures, plus supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07399 2026-08-25 stat.ML cs.LG 版本更新 57%

Automatic, Debiased, and Invariant Counterfactual Generation under General Interventions

通用干预下的自动、去偏和不变反事实生成

Raphael C Kim, Jingsen Zhu, Ramin Zabih, Michele Santacatterina

机构 * Cornell Tech(康奈尔科技) Cornell University(康奈尔大学) Department of Biostatistics, Department of Population Health(生物统计学系、人口健康系) New York University Grossman School of Medicine(纽约大学格罗斯曼医学院)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 提出ADIGen框架,结合Riesz回归、因果不变性和正交统计学习,实现通用干预下反事实生成的自动、去偏和不变性,并提供过剩风险界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15535 2026-08-25 cs.CV 版本更新 57%

Learning Spatially Adaptive Structural Coordination for Underwater Salient Object Detection

学习动态结构专业化用于水下显著目标检测

Lin Hong, Chenhui Wang, Linan Deng, Yuning Cui, Yu Zhang, Xin Wang, Bojian Zhang, Xingchen Yang, Fumin Zhang

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) School of Robotics and Advanced Manufacture, Harbin Institute of Technology(机器人与先进制造学院,哈尔滨工业大学) School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) College of Computer Science & Visual Computing and Intelligent Perception Lab, Nankai University(计算机科学与视觉计算学院及智能感知实验室,南开大学) School of Cyber Science and Technology, Sun Yat-sen University(网络科学与技术学院,中山大学) School of Automation, Southeast University(自动化学院,东南大学)

专题命中 具身推理 :robotic(abstract);分类 cs.CV

AI总结 本文提出DSS-USOD方法,通过动态结构专业化解决水下图像退化导致的定位不准确、区域碎片化和边界预测粗的问题,提升边界精度与区域一致性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07303 2026-08-21 cs.LG 版本更新 57%

Bootstrap Theory of Representational Emergence (TBER): Explanatory Insufficiency, Transition Regimes, and the Emergence of New Representational Levels

表征涌现的自举理论:解释不充分性作为表征学习与世界模型的驱动力

Jacques Raynal, Pierre Slangen, Elsa Raynal, Jacques Margerit

机构 * Laboratory of Bioengineering and Nanosciences (LBN), University of Montpellier(生物工程与纳米科学实验室(LBN),蒙彼利埃大学) EuroMov Digital Health in Motion, University of Montpellier, IMT Mines Alès(EuroMov数字健康运动,蒙彼利埃大学,IMT矿山阿尔勒) Certified Sophrologist, Sensorimotor Practice, Montpellier, France(认证Sophrologist,运动觉实践,蒙彼利埃,法国) Emeritus Professor, University of Montpellier(荣誉教授,蒙彼利埃大学)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 提出表征涌现自举理论(TBER),将解释不充分性视为新表征涌现的积极信号,通过五阶段递归过程驱动表征创新,应用于表征学习、世界模型和科学发现。

Comments Version 4. Major theoretical revision introducing the distinction between manifestations of explanatory insufficiency and resolution regimes (local-corrective, representationally resolutive, and structurally recurrent), together with regime-sensitive diagnosis and closure assessment. Formal mathematical boundary cases have been clarified. 28 references, no figures or tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13546 2026-08-19 cs.CV 版本更新 57%

Alaya-EVOKE: From Linear-Scaling Supervision to Endless World

Alaya-EVOKE:从线性缩放监督到无尽世界

Yuanyang Yin, Gongxuan Wang, Yifan Zhan, Chuanhao Li, Kaipeng Zhang, Feng Zhao

机构 * MoE Key Lab of BIPC(BIPC教育部重点实验室) USTC(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Alaya Lab(Alaya实验室)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 Alaya-EVOKE将持久世界状态外部化并重新设计教师模型,解决交互式世界模型的冲突需求,在WBench等基准上实现最优性能,支持开放式长时序生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18005 2026-08-19 cs.CV 版本更新 57%

UrbanWorld2.0: A Multimodal Agentic Framework for Reality-Aligned 3D World Generation at City-Scale

RAISECity: 一种用于城市级现实对齐3D世界生成的多模态代理框架

Shengyuan Wang, Zhiheng Zheng, Yu Shang, Lixuan He, Yangcheng Yu, Fan Hangyu, Jie Feng, Qingmin Liao, Yong Li

机构 * College of AI, Tsinghua University(人工智能学院,清华大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,北京研究院,清华大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 RAISECity通过多模态代理框架实现城市级3D世界生成,提升现实对齐、精度和性能,适用于沉浸媒体和具身智能应用。

Comments Accepted by ACM MM 2026, the code is available at: https://github.com/tsinghua-fib-lab/UrbanWorld2.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14125 2026-08-17 cs.AI 新提交 57%

Traj-LeWM: Path-Aware World-Model Planning via Latent Trajectory Cost

Traj-LeWM:通过潜在轨迹代价实现路径感知的世界模型规划

Xiaodi Huang, Ziyi Ding, Jingtian Wan, Yuchen Liu, Yuan Zhang, Xiao-Ping Zhang, Jiayu Chen, Zhang Zhang, Tao Huang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Jiao Tong University(上海交通大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) The University of Hong Kong(香港大学) INFIFORCE University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文针对LeWM的局限提出Traj-LeWM,通过引入潜在轨迹代价结合终点距离的联合评分,在多个机器人与导航任务上实现性能提升,验证了轨迹级信息的互补作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10439 2026-08-12 cs.CV 新提交 57%

Stream Forcing: Constructing Unified Training Trajectory for Robust Streaming Video Generation

流强制:构建用于鲁棒流视频生成的统一训练轨迹

Yueting Zhu, Yuehao Song, Kaicheng Zhang, Bao Tang, Shaoyu Chen, Qian Zhang, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science & Technology(华中科技大学) Horizon Robotics(地平线机器人) Anyverse Dynamics

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 针对流视频扩散模型的训练-推理不匹配问题,提出Stream Forcing统一训练框架,通过构建训练轨迹及相关算法,在UCF-101基准测试中FVD分别提升36.6%、27.9%,提升了生成质量与长时序泛化能力。

Comments 15 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12231 2026-08-12 cs.LG 版本更新 57%

Temporal Straightening for Latent Planning

时间拉直用于隐式规划

Ying Wang, Oumayma Bounou, Gaoyue Zhou, Randall Balestriero, Tim G. J. Rudner, Yann LeCun, Mengye Ren

机构 * New York University(纽约大学) Brown University(布朗大学) University of Toronto(多伦多大学)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 受人类视觉处理中感知拉直假说启发,提出时间拉直方法,通过曲率正则化联合学习JEPA世界模型的编码器和预测器,改善隐式规划中的表示学习,使梯度规划更稳定并提高目标到达任务成功率。

Comments ICML2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08476 2026-08-11 cs.CV 新提交 57%

RayLift: Lifting Complementary Ray-Wise Evidence with 3D Geometry Priors for Semantic Scene Completion

RayLift:利用3D几何先验提升互补射线级证据以实现语义场景补全

Meng Wang, Hongxia Yu, Wenzhe He, Xingdong Song, Huilong Pi, Jiapeng Zhang, Ruihui Li

专题命中 具身推理 :robotics(abstract);分类 cs.CV

AI总结 针对现有语义场景补全方法的深度误差传播问题,提出RayLift框架,通过互补上下文编码器、深度射线证据提升模块和语义感知体素集成器,在两个基准数据集上实现优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29393 2026-08-11 cs.RO 版本更新 57%

AquaJEPA: An Action-Conditioned Multimodal JEPA Family for Underwater Robot Dynamics

AquaJEPA:面向水下机器人动力学的动作条件多模态预测表示

Alan-Barsag Gazzaev, Alexey Gavrilov, Sergey Muravyov

机构 * ITMO University(ITMO大学)

专题命中 具身推理 :world model(abstract);分类 cs.RO

AI总结 该研究提出动作条件多模态预测模型AquaJEPA,在Stonefish环境中对比多种基线,经120个带计划DVL损失的配对环境实验,其闭环性能最优,配对最终误差显著优于多数基线。

Comments Submitted to IEEE ICRA 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21109 2026-08-11 cs.RO 版本更新 57%

Anomaly-Informed Confidence Calibration for Vision-Based Safety Prediction

基于异常的置信度校准用于基于视觉的安全预测

Zhenjiang Mao, Jiawen Wu, Gabriel Wagner, Zhongzheng Zhang, Ivan Ruchkin

机构 * Trustworthy Engineered Autonomy (TEA) Lab, Department of Electrical and Computer Engineering, University of Florida(可信工程自主性实验室,电气与计算机工程系,佛罗里达大学)

专题命中 具身推理 :world model(abstract);分类 cs.RO

AI总结 本文提出了一种基于异常的在线校准方法,通过融合感知和动态异常分数来改进基于视觉的安全预测中的置信度估计,从而在面对分布偏移时减少过自信,提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14382 2026-08-11 cs.CV cs.GR cs.MM 版本更新 57%

Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation

Delta Forcing:交互式自回归视频生成中的信任区域引导

Yuheng Wu, Xiangbo Gao, Tianhao Chen, Xinghao Chen, Qing Yin, Zhengzhong Tu, Dongman Lee

机构 * Texas A\&M University(德克萨斯A&M大学) University of Washington(华盛顿大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出Delta Forcing方法,通过约束不可靠的教师监督在适应性信任区域中,以提高自回归视频生成的一致性并保持对新事件的响应性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06227 2026-08-07 cs.NI cs.AI cs.IT cs.SY eess.SY math.IT 新提交 57%

From Passive Mirrors to Active Agents: Holonic Digital Twins for Physical AI over Networks

从被动镜像到主动智能体:面向网络物理AI的 holonic 数字孪生

Christo Kurisummoottil Thomas, Omar Hashash, Walid Saad

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文针对当前AI嵌入物理系统失效、无线网络架构无法支持实时物理AI协调的问题,提出HDT-Nets框架,通过holonic数字孪生实现实时物理AI推理,为网络物理AI提供新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21124 2026-08-07 cs.SD cs.AI eess.AS 版本更新 57%

PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs

PhaseCoder: 无关麦克风几何的多模态大语言模型空间音频理解

Artem Dementyev, Wazeer Zulfikar, Sinan Hersek, Pascal Getreuer, Anurag Kumar, Vivek Kumar

机构 * Google DeepMind(谷歌DeepMind) Media Lab, MIT(媒体实验室,麻省理工学院) Google AR(谷歌AR)

专题命中 具身推理 :embodied AI(abstract);分类 cs.AI

AI总结 PhaseCoder是一种无需麦克风几何结构的Transformer空间音频编码器,能够生成空间嵌入并使LLM实现复杂空间推理和转录任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04412 2026-08-06 cs.CV 新提交 57%

muSync-GS: Physics-Synchronized Driving Video Synthesis for Weather and Geometric Road Hazards

muSync-GS:面向天气与几何道路危险场景的物理同步驾驶视频合成方法

Yang Chen, Yicheng Zhu, Tao Li, Zilin Bian

机构 * Rochester Institute of Technology(罗切斯特理工学院) City University of Hong Kong(香港城市大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 muSync-GS是一种物理同步驾驶视频合成框架,通过耦合天气、道路几何编辑与车辆动力学,在12个CarSim案例上实现了车辆状态的精准预测与场景同步。

Comments 42 pages, 14 figures; includes an appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03413 2026-08-05 cs.AI cs.ET 新提交 57%

Enactive Artificial Intelligence: A Decision-Centric Architecture for Complex Systems

能动人工智能:面向复杂系统的以决策为中心的架构

Zuojun Max Shen, Yuan Qu, Pujun Zhang, Anbang Liu, Yunhao Liang

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本研究提出能动人工智能框架,通过组织世界、站点世界等四个角色构建以决策为中心的架构,拓展AI前沿,为企业与工业复杂系统的可靠AI部署提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21644 2026-08-05 cs.LG cs.SY eess.SY 版本更新 57%

Toward Goal-Agnostic Joint-Embedding Predictive Control of Partial Differential Equations

迈向偏微分方程的目标无关联合嵌入预测控制

Jonathan Gallagher, Roberto Guglielmi

机构 * University of Waterloo(滑铁卢大学)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 该研究针对偏微分方程提出目标无关控制框架,基于联合嵌入预测架构,通过离线训练小型二维ViT编码器等,经模型预测路径积分控制器复用。在相关基准测试中,KE探测器规划提升奖励、降低误差,验证了潜在动力学与目标无关及校准可观测量用于状态控制的优势。

Comments Associated code will be open sourced alongside a later, updated submission

详情

展开后加载摘要…

URL PDF HTML 收藏