arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-12-02 至 2025-12-02 共收录 107 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 18 篇

2512.00041 2025-12-02 cs.RO cs.CV 84%

VISTAv2: World Imagination for Indoor Vision-and-Language Navigation

VISTAv2:室内视觉与语言导航的世界想象

Yanjia Huang, Xianshun Jiang, Xiangbo Gao, Mingyang Wu, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 具身导航 :navigation(title,abstract);world model(abstract);分类 cs.RO、cs.CV

AI总结 VISTAv2通过生成式世界模型实现室内视觉与语言导航的稳健规划,结合动作条件想象和在线价值图融合,提升导航效率与鲁棒性。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01009 2025-12-02 cs.RO cs.CV 81%

FOM-Nav: Frontier-Object Maps for Object Goal Navigation

FOM-Nav:用于目标导航的前沿-对象地图

Thomas Chabal, Shizhe Chen, Jean Ponce, Cordelia Schmid

机构 * Inria(法国国家信息与自动化技术研究院) Department of Computer Science, École normale supérieure (ENS-PSL, CNRS, Inria)(高等师范学院计算机科学系) Courant Institute of Mathematical Sciences and Center for Data Science, New York University(纽约大学Courant数学科学研究所和数据科学中心)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 FOM-Nav通过前沿-对象地图和视觉-语言模型提升机器人在未知环境中的目标导航效率,实现最先进的导航性能。

Comments Project page: https://www.di.ens.fr/willow/research/fom-nav/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00030 2025-12-02 cs.RO cs.AI 81%

Perturbation-mitigated USV Navigation with Distributionally Robust Reinforcement Learning

具有分布鲁棒强化学习的扰动缓解USV导航

Zhaofan Zhang, Minghao Yang, Sihong Xie, Hui Xiong

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出DRIQN,通过结合分布鲁棒优化与隐式分位数网络,提升USV在复杂环境下的导航鲁棒性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01608 2025-12-02 cs.RO cs.SY eess.SY 79%

Integrated YOLOP Perception and Lyapunov-based Control for Autonomous Mobile Robot Navigation on Track

集成YOLOP感知与Lyapunov基于的控制用于轨道上自主移动机器人导航

Mo Chen

机构 * Graduate School of Science and Technology(科学与技术研究生学院) Master’s Program in Science and Technology(科学技术硕士项目) Green Science and Engineering Division(绿色科学与工程系)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出了一种结合多任务视觉感知与Lyapunov稳定控制的自主轨道导航框架,实现非完整差分驱动机器人在动态环境中的稳定导航。

Comments This is a master's graduation thesis that has not been formally published. Uploaded with the author's copyright permission. No confidential content involved

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04542 2025-12-02 cs.HC 78%

Ego vs. Exo and Active vs. Passive: Investigating the Individual and Combined Effects of Viewpoint and Navigation on Spatial Immersion and Understanding in Immersive Storytelling

视角与导航对沉浸式叙事中空间沉浸与理解的影响研究

Tao Lu, Qian Zhu, Tiffany Ma, Wong Kam-Kwai, Anlan Xie, Alex Endert, Yalong Yang

专题命中 具身导航 :navigation(title,abstract)

AI总结 研究探讨了视角和导航对沉浸式叙事中空间沉浸和理解的影响,发现亲身体验与主动导航提升参与度,而外部视角与被动导航增强内容关注度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01445 2025-12-02 math.AP physics.class-ph 78%

Mathematical and numerical study of a model for navigation in stratified waters

分层水域中导航模型的数学与数值研究

Zeina Rammal, Matthieu Brachet, Germain Rousseaux, Morgan Pierre

专题命中 具身导航 :navigation(title,abstract)

AI总结 本文提出了一种用于分层水域中导航的线性模型,并设计了基于离散傅里叶变换和指数积分器的数值方案,分析了临界速度对两种状态的影响。

Comments Collections interdisciplinaire

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14103 2025-12-02 cs.RO cs.AI 74%

Coordinating Spinal and Limb Dynamics for Enhanced Sprawling Robot Mobility

协调脊柱与肢体动态以提升散开式机器人机动性

Merve Atasever, Ali Okhovat, Azhang Nazaripouya, John Nisbet, Omer Kurkutlu, Jyotirmoy V. Deshmukh, Yasemin Ozkan Aydin

机构 * University of Southern California(南加州大学) University of Notre Dame(圣母大学) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI;robotics(comments)

AI总结 本研究提出一种结合生物启发步态设计与深度强化学习的混合控制框架,用于提升四足机器人在复杂地形中的稳健爬行能力。

Comments Initial version of the work has been accepted for presentation at the Mechanical Intelligence in Robotics workshop at ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01889 2025-12-02 cs.CV 70%

KM-ViPE: Online Tightly Coupled Vision-Language-Geometry Fusion for Open-Vocabulary Semantic SLAM

KM-ViPE:在线紧密耦合视觉-语言-几何融合用于开放词汇语义SLAM

Zaid Nasser, Mikhail Iumanov, Tianhao Li, Maxim Popov, Jaafar Mahmoud, Malik Mohrat, Ilya Obrubov, Ekaterina Derevyanka, Ivan Sosin, Sergey Kolyubin

机构 * Biomechatronics and Energy-Efficient Robotics (BE2R) Lab(生物机电学与节能机器人实验室) ITMO University(ITMO大学) SBERRoboticsCenter(SBERRobotics中心)

专题命中 具身导航 :robotics(abstract);embodied AI(abstract);分类 cs.CV

AI总结 KM-ViPE通过在线紧密耦合视觉-语言-几何融合,实现开放词汇语义SLAM,适用于动态环境和未校准单目相机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18016 2025-12-02 cs.RO cs.AI 62%

ADA-DPM: A Neural Descriptors-based Adaptive Noise Filtering Strategy for SLAM

ADA-DPM: 基于神经描述符的自适应噪声过滤策略用于SLAM

Yongxin Shao, Aihong Tan, Binrui Wang, Yinlian Jin, Licong Guan, Peng Liao

机构 * College of Metrology Measurement and Instrument(计量测量与仪器学院) College of Mechanical and Electrical Engineering(机械与电气工程学院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 ADA-DPM通过动态分割、全局重要性评分和跨层图卷积模块,提升SLAM中动态物体干扰和噪声的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02874 2025-12-02 cs.RO 61%

Novel UWB Synthetic Aperture Radar Imaging for Mobile Robot Mapping

新颖的UWB合成孔径雷达成像用于移动机器人建图

Charith Premachandra, U-Xuan Tan

机构 * Engineering Product Development Pillar Singapore University of Technology(工程产品开发支柱新加坡科技设计大学)

专题命中 具身导航 :robotic(abstract);分类 cs.RO;navigation(comments)

AI总结 本文提出利用UWB雷达的合成孔径雷达成像技术,用于移动机器人在恶劣环境下实现高分辨率环境建图与闭环检测。

Comments Accepted and presented at the 15th International Conference on Indoor Positioning and Indoor Navigation (IPIN) 2025, see https://ipin-conference.org/2025/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11547 2025-12-02 cs.RO cs.SY eess.SY 61%

Towards Fully Onboard State Estimation and Trajectory Tracking for UAVs with Suspended Payloads

面向无人机挂载载具的完全 onboard 状态估计与轨迹跟踪

Martin Jiroušek, Tomáš Báča, Martin Saska

机构 * Department of Cybernetics, Faculty of Electrical Engineering, Czech Technical University in Prague(计算机工程系,电气工程学院,布拉格捷克技术大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO;robotics(journal_ref)

AI总结 本文提出了一种基于标准机载传感器的无人机挂载载具状态估计与轨迹跟踪框架,通过线性卡尔曼滤波和模型预测控制实现高精度位置控制,实验验证其在户外环境中的可靠性与实用性。

Comments Updated to match the published version. Added journal reference and DOI

Journal ref Proceedings of the 22nd International Conference on Informatics in Control, Automation and Robotics (ICINCO 2025), Vol. 2, SciTePress, pp. 128-138, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00971 2025-12-02 cs.RO 57%

H-Zero: Cross-Humanoid Locomotion Pretraining Enables Few-shot Novel Embodiment Transfer

H-Zero:跨人形机器人运动预训练实现少样本新躯干转移

Yunfeng Lin, Minghuan Liu, Yufei Xue, Ming Zhou, Yong Yu, Jiangmiao Pang, Weinan Zhang

机构 * ByteDance Seed(字节跳动种子)

专题命中 具身导航 :robotics(abstract);分类 cs.RO

AI总结 H-Zero通过跨人形机器人预训练实现少样本新躯干转移,提升机器人运动控制的通用性和效率。

Comments in submission, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07710 2025-12-02 cs.CV cs.MM 57%

Cross Modal Fine-Grained Alignment via Granularity-Aware and Region-Uncertain Modeling

跨模态细粒度对齐 via 粒度感知和区域不确定建模

Jiale Liu, Haoming Zhou, Yishu Liu, Bingzhi Chen, Yuncheng Jiang

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 本文提出了一种基于粒度感知和区域不确定建模的跨模态细粒度对齐方法,通过显著性感知和不确定性建模提升对齐的鲁棒性和可解释性。

Comments 10 pages, 6 figures, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07267 2025-12-02 eess.SP 50%

Real-Time High-Accuracy Digital Wireless Time, Frequency, and Phase Calibration For Coherent Distributed Antenna Arrays

实时高精度数字无线时间、频率和相位校准用于相干分布式天线阵列

Jason M. Merlo, Samuel Wagner, John Lancaster, Jeffrey A. Nanzer

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出了一种基于高精度双向时间传输的实时数字无线校准方法,实现分布式天线阵列中无电缆的高频率和相位一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00140 2025-12-02 q-bio.NC 50%

The Geometry of Certainty: Recursive Topological Condensation and the Limits of Inference

确定性的几何学:递归拓扑凝结与推理的极限

Xin Li

专题命中 具身导航 :navigation(abstract)

AI总结 该研究提出通过递归拓扑凝结机制,构建确定性的几何学,实现高效推理与表征扩展,但面临泛化与幻觉之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 13 篇

2511.19861 2025-12-02 cs.CV cs.RO 88%

GigaWorld-0: World Models as Data Engine to Empower Embodied AI

GigaWorld-0:世界模型作为数据引擎赋能具身AI

GigaWorld Team, Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Haoyun Li, Jiagang Zhu, Kerui Li, Mengyuan Xu, Qiuping Deng, Siting Wang, Wenkang Qin, Xinze Chen, Xiaofeng Wang, Yankai Wang, Yu Cao, Yifan Chang, Yuan Xu, Yun Ye, Yang Wang, Yukun Zhou, Zhengyuan Zhang, Zhehao Dong, Zheng Zhu

机构 * GigaWorld Team(GigaWorld团队)

专题命中 具身推理 :embodied AI(title,abstract);world model(title,abstract);分类 cs.RO、cs.CV

AI总结 GigaWorld-0通过整合视频生成与3D建模技术,构建统一的数据引擎,生成高质量具身交互数据,提升VLA模型在现实任务中的性能。

Comments Project Page: https://giga-world-0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01924 2025-12-02 cs.RO cs.AI cs.LG 85%

Real-World Robot Control by Deep Active Inference With a Temporally Hierarchical World Model

通过时序分层世界模型的深度主动推断实现现实世界的机器人控制

Kentaro Fujii, Shingo Murata

机构 * Graduate School of Integrated Design Engineering, Keio University(Keio大学整合设计工程研究院)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.LG;robotics(comments)

AI总结 本文提出一种结合时序分层世界模型的深度主动推断框架,用于在不确定环境中实现机器人高成功率的操作与探索性动作切换。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01119 2025-12-02 cs.LG cs.AI 81%

World Model Robustness via Surprise Recognition

通过惊喜识别提升世界模型鲁棒性

Geigh Zollicoffer, Tanush Chopra, Mingkuan Yan, Xiaoxu Ma, Kenneth Eaton, Mark Riedl

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 通过惊喜识别提升世界模型在噪声环境下的鲁棒性,增强自动驾驶模拟中智能体的稳定性与性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07338 2025-12-02 cs.RO cs.AI 81%

Delta-Triplane Transformers as Occupancy World Models

Delta-Triplane Transformers 作为占用世界模型

Haoran Xu, Peixi Peng, Guang Tan, Yiqian Chang, Yisen Zhao, Yonghong Tian

机构 * School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(南方科技大学深圳校区智能系统工程学院) Peng Cheng Laboratory(鹏城实验室) School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院) School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区计算机科学与技术学院) School of Computer Science, Peking University(北京大学计算机学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 Delta-Triplane Transformers 通过紧凑的3D表示和增量预测策略,提升自动驾驶中占用世界模型的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03342 2025-12-02 cs.RO 79%

Gemini Robotics 1.5: Pushing the Frontier of Generalist Robots with Advanced Embodied Reasoning, Thinking, and Motion Transfer

Gemini Robotics 1.5:通过先进的具身推理、思考和运动转移推动通用机器人前沿

Gemini Robotics Team, Abbas Abdolmaleki, Saminda Abeyruwan, Joshua Ainslie, Jean-Baptiste Alayrac, Montserrat Gonzalez Arenas, Ashwin Balakrishna, Nathan Batchelor, Alex Bewley, Jeff Bingham, Michael Bloesch, Konstantinos Bousmalis, Philemon Brakel, Anthony Brohan, Thomas Buschmann, Arunkumar Byravan, Serkan Cabi, Ken Caluwaerts, Federico Casarini, Christine Chan, Oscar Chang, London Chappellet-Volpini, Jose Enrique Chen, Xi Chen, Hao-Tien Lewis Chiang, Krzysztof Choromanski, Adrian Collister, David B. D'Ambrosio, Sudeep Dasari, Todor Davchev, Meet Kirankumar Dave, Coline Devin, Norman Di Palo, Tianli Ding, Carl Doersch, Adil Dostmohamed, Yilun Du, Debidatta Dwibedi, Sathish Thoppay Egambaram, Michael Elabd, Tom Erez, Xiaolin Fang, Claudio Fantacci, Cody Fong, Erik Frey, Chuyuan Fu, Ruiqi Gao, Marissa Giustina, Keerthana Gopalakrishnan, Laura Graesser, Oliver Groth, Agrim Gupta, Roland Hafner, Steven Hansen, Leonard Hasenclever, Sam Haves, Nicolas Heess, Brandon Hernaez, Alex Hofer, Jasmine Hsu, Lu Huang, Sandy H. Huang, Atil Iscen, Mithun George Jacob, Deepali Jain, Sally Jesmonth, Abhishek Jindal, Ryan Julian, Dmitry Kalashnikov, M. Emre Karagozler, Stefani Karp, Matija Kecman, J. Chase Kew, Donnie Kim, Frank Kim, Junkyung Kim, Thomas Kipf, Sean Kirmani, Ksenia Konyushkova, Li Yang Ku, Yuheng Kuang, Thomas Lampe, Antoine Laurens, Tuan Anh Le, Isabel Leal, Alex X. Lee, Tsang-Wei Edward Lee, Guy Lever, Jacky Liang, Li-Heng Lin, Fangchen Liu, Shangbang Long, Caden Lu, Sharath Maddineni, Anirudha Majumdar, Kevis-Kokitsi Maninis, Andrew Marmon, Sergio Martinez, Assaf Hurwitz Michaely, Niko Milonopoulos, Joss Moore, Robert Moreno, Michael Neunert, Francesco Nori, Joy Ortiz, Kenneth Oslund, Carolina Parada, Emilio Parisotto, Amaris Paryag, Acorn Pooley, Thomas Power, Alessio Quaglino, Haroon Qureshi, Rajkumar Vasudeva Raju, Helen Ran, Dushyant Rao, Kanishka Rao, Isaac Reid, David Rendleman, Krista Reymann, Miguel Rivas, Francesco Romano, Yulia Rubanova, Peter Pastor Sampedro, Pannag R Sanketi, Dhruv Shah, Mohit Sharma, Kathryn Shea, Mohit Shridhar, Charles Shu, Vikas Sindhwani, Sumeet Singh, Radu Soricut, Rachel Sterneck, Ian Storz, Razvan Surdulescu, Jie Tan, Jonathan Tompson, Saran Tunyasuvunakool, Jake Varley, Grace Vesom, Giulia Vezzani, Maria Bauza Villalonga, Oriol Vinyals, René Wagner, Ayzaan Wahid, Stefan Welker, Paul Wohlhart, Chengda Wu, Markus Wulfmeier, Fei Xia, Ted Xiao, Annie Xie, Jinyu Xie, Peng Xu, Sichun Xu, Ying Xu, Zhuo Xu, Jimmy Yan, Sherry Yang, Skye Yang, Yuxiang Yang, Hiu Hong Yu, Wenhao Yu, Wentao Yuan, Yuan Yuan, Jingwei Zhang, Tingnan Zhang, Zhiyuan Zhang, Allan Zhou, Guangyao Zhou, Yuxiang Zhou

专题命中 具身推理 :robotics(title,abstract);分类 cs.RO

AI总结 Gemini Robotics 1.5通过具身推理、思考和运动转移技术,提升通用机器人在复杂任务中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17808 2025-12-02 cs.LG 79%

Remote Sensing-Oriented World Model

面向遥感的世界模型

Yuxi Lu, Biao Wu, Zhidong Li, Kunqi Li, Chenya Huang, Huacan Wang, Qizhen Lan, Ronghao Chen, Ling Chen, Bin Liang

机构 * University of Technology Sydney (UTS)(悉尼技术大学) University of Chinese Academy of Sciences (UCAS)(中国科学院大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Peking University(北京大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 本文提出首个面向遥感的世界模型框架,通过RemoteBAGEL模型在RSWISE基准上实现空间推理的高效外推。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00226 2025-12-02 cs.CV cs.AI 74%

DenseScan: Advancing 3D Scene Understanding with 2D Dense Annotation

DenseScan: 通过2D密集标注提升3D场景理解

Zirui Wang, Tao Zhang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Wuhan University(武汉大学)

专题命中 具身推理 :robotics(abstract);navigation(abstract);分类 cs.AI、cs.CV;embodied AI(comments)

AI总结 DenseScan通过2D密集标注提升3D场景理解,结合多视角图像和多模态大语言模型生成丰富语义标注,拓展下游任务应用。

Comments Workshop on Space in Vision, Language, and Embodied AI at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01223 2025-12-02 cs.CV cs.AI 73%

S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance

S$^2$-MLLM:通过结构指导提升多模态大语言模型在3D视觉定位中的空间推理能力

Beining Xu, Siting Zhu, Zhao Jin, Junxian Li, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 具身推理 :robotics(abstract);embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 S$^2$-MLLM通过隐式空间推理提升多模态大语言模型在3D视觉定位中的空间推理能力,实现高效且准确的3D场景理解。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00736 2025-12-02 cs.LG cs.AI cs.CV 67%

REM: Evaluating LLM Embodied Spatial Reasoning through Multi-Frame Trajectories

REM:通过多帧轨迹评估大语言模型的具身空间推理

Jacob Thompson, Emiliano Garcia-Lopez, Yonatan Bisk

机构 * Department of Computer Science(计算机科学系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 具身推理 :navigation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 REM通过多帧轨迹评估大语言模型的空间推理能力,揭示其在复杂空间任务中的不足,推动更 robust 的空间表示研究。

Journal ref Proceedings of the Conference on Language Modeling (COLM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00019 2025-12-02 cs.RO cs.AI cs.CV 67%

A Comprehensive Survey on Surgical Digital Twin

外科数字孪生的全面综述

Afsah Sharaf Khan, Falong Fan, Doohwan DH Kim, Abdurrahman Alshareef, Dong Chen, Justin Kim, Ernest Carter, Bo Liu, Jerzy W. Rozenblit, Bernard Zeigler

机构 * IEEE

专题命中 具身推理 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文综述了外科数字孪生的技术现状与挑战,提出分类方法并识别了验证、安全性和数据治理等开放问题,旨在推动其在临床中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02016 2025-12-02 cs.CV 57%

Objects in Generated Videos Are Slower Than They Appear: Models Suffer Sub-Earth Gravity and Don't Know Galileo's Principle...for now

生成视频中的物体比看起来更慢:模型遭受次地球重力并目前还不知道伽利略原理...

Varun Varma Thozhiyoor, Shivam Tripathi, Venkatesh Babu Radhakrishnan, Anand Bhattad

机构 * Indian Institute of Science(印度科学研究院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 研究发现视频生成器在重力表示上存在偏差,通过针对性适配可提升其重力模拟精度。

Comments https://gravity-eval.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01878 2025-12-02 cs.AI 57%

Graph Distance as Surprise: Free Energy Minimization in Knowledge Graph Reasoning

图距离作为惊喜:知识图谱推理中的自由能最小化

Gaganpreet Jhajj, Fuhua Lin

机构 * School of Computing(计算学院) Information Systems(信息系统) Athabasca University(亚伯达大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出利用图距离最小化惊喜来改进知识图谱推理,通过连接自由能原理与KG系统,探索图距离在生成模型中的应用及其对语法结构的影响。

Comments Accepted to NORA Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10194 2025-12-02 cs.CV 57%

B2N3D: Progressive Learning from Binary to N-ary Relationships for 3D Object Grounding

B2N3D: 从二元关系到N元关系的3D物体接地的渐进式学习

Feng Xiao, Hongbin Xu, Hai Ci, Wenxiong Kang

机构 * School of Automation Science and Engineering, South China University of Technology(自动化科学与工程学院,华南理工大学) ByteDance Seed(字节跳动种子) Show Lab, National University of Singapore(Show Lab,新加坡国立大学)

专题命中 具身推理 :robotic(abstract);分类 cs.CV

AI总结 B2N3D通过引入N元关系学习提升3D物体接地的准确性,利用分组监督损失和混合注意力机制实现更精确的多模态关系建模。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模仿学习与强化学习 12 篇

2512.01383 2025-12-02 cs.CV 79%

PointNet4D: A Lightweight 4D Point Cloud Video Backbone for Online and Offline Perception in Robotic Applications

PointNet4D: 一种轻量级的4D点云视频主干网络,用于机器人应用中的在线和离线感知

Yunze Liu, Zifan Wang, Peiran Wu, Jiayang Ao

机构 * Tsinghua University(清华大学) University of Bristol(布里斯托大学) The University of Melbourne(墨尔本大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.CV

AI总结 PointNet4D是一种轻量级4D点云视频主干网络,通过混合Mamba-Transformer时间融合模块和4DMAP预训练策略,提升机器人应用中的在线和离线感知性能。

Comments Accepted by WACV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00427 2025-12-02 cs.RO physics.optics 79%

Hardware-Software Collaborative Computing of Photonic Spiking Reinforcement Learning for Robotic Continuous Control

光子脉冲强化学习的软硬件协同计算用于机器人连续控制

Mengting Yu, Shuiying Xiang, Changjian Xie, Yonghang Chen, Haowen Zhao, Xingxing Guo, Yahui Zhang, Yanan Han, Yue Hao

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出基于光子脉冲RL的软硬件协同计算架构,通过硅光子芯片与电子域结合,实现机器人连续控制的高效能效和低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏