Neural Groundplans: Persistent Neural Scene Representations from a Single Image
专题命中 具身推理 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG
Comments Project page: https://prafullsharma.net/neural_groundplans/
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
专题命中 具身推理 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG
Comments Project page: https://prafullsharma.net/neural_groundplans/
专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI、cs.LG
Comments 11 pages, 9 figures
专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI、cs.LG
Comments Accepted to ICRA 2023
专题命中 具身推理 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV
Comments Manuscript accepted in the International Journal of Computer Assisted Radiology and Surgery. codes available: https://github.com/lalithjets/Domain-adaptation-in-MTL
专题命中 具身推理 :robotics(abstract);分类 cs.RO、cs.CV、cs.LG
Comments For our project page, see https://makezur.github.io/FeatureRealisticFusion/
专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI、cs.LG
专题命中 具身推理 :robotics(abstract);分类 cs.RO、cs.CV、cs.LG
Comments 22 pages, 23 Figures (including supplementary material). Presented 3DV 2021. Project website: https://diffsdfsim.is.tue.mpg.de/
Journal ref 2021 International Conference on 3D Vision (3DV)
专题命中 具身推理 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV
专题命中 具身推理 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV
专题命中 具身推理 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV
专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI、cs.LG
Comments 9 pages, 12 figures
专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV、cs.LG
Comments Published as a conference paper at NeurIPS 2019 (spotlight)
专题命中 具身推理 :world model(abstract);robotic(abstract)
专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI、cs.CV
专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV、cs.LG
专题命中 具身推理 :navigation(abstract);分类 cs.AI、cs.CV、cs.LG
Comments Accepted by CVPR 2018 Workshop on Autonomous Driving
专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV、cs.LG
Comments 6 pages, 5 figures
专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI、cs.LG
专题命中 具身推理 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV
Comments 14 pages, 11 figures
网格是否抹去了事件?用于审计医疗世界模型流程的EndoClock
机构 * Diastole Medical R&D(Diastole医疗研发机构)
专题命中 具身推理 :world model(abstract,comments);分类 cs.CV、cs.LG
AI总结 本研究针对医疗世界模型同步预处理可能抹去任务相关证据的问题,提出EndoClock审计方法及四分类法,以超声心动图为例验证其有效性,为医疗AI流程审计提供可执行方案。
Comments Accepted for publication at the 1st MICCAI Workshop on Medical World Models (MWM 2026)
ICRA 2026 GOOSE 2D细粒度语义分割挑战赛技术报告:探索基于查询的分割和增加空间上下文用于户外场景理解
机构 * Rey Juan Carlos University(胡安卡洛斯国王大学)
专题命中 具身推理 :robotics(abstract,comments);分类 cs.RO、cs.CV
AI总结 本报告提出基于SegFormer和Mask2Former的细粒度语义分割方法,通过增大训练裁剪尺寸和测试时增强,在GOOSE挑战赛上达到69.6% mIoU,验证了查询式分割和空间上下文的重要性。
Comments Ranked 5th in the GOOSE 2D Fine-Grained Semantic Segmentation Challenge at the IEEE ICRA 2026 Workshop on Field Robotics
面向城市环境的条件性 affordance 学习
机构 * Chair of Robotics Science and System Intelligence, Technical University of Munich(慕尼黑技术大学机器人科学与系统智能系)
专题命中 具身推理 :navigation(abstract);分类 cs.RO、cs.LG;robot learning(comments)
AI总结 本文提出了一种直接感知方法,通过将视频输入映射到适合复杂城市环境自主导航的中间表示,结合高层方向输入,实现了比现有强化学习和条件模仿学习方法更高的目标导向导航性能,并首次通过图像级标签处理交通灯和速度标志,显著减少模拟中的交通事故。
Comments Accepted for Conference on Robot Learning (CoRL) 2018
机构 * Nagoya University, Japan(名古屋大学)
专题命中 具身推理 :robotic(abstract,comments);分类 cs.RO;robot learning(comments)
Comments To be presented at the 1st Workshop on Intelligent Cobodied Assistance and Robotic Empowerment (iCARE). 2025 Conference on Robot Learning (CoRL)
GeoWAM:面向自动驾驶的视觉几何世界动作模型
机构 * Uber AV Labs(优步自动驾驶实验室) ; Case Western Reserve University(凯斯西储大学)
专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.CV
AI总结 该研究提出 GeoWAM,一种用于自动驾驶的视觉几何世界动作模型,通过预训练预测未来场景几何来学习动力学,经评估其生成的驾驶策略比图像基方案更强,确立未来几何预测为自动驾驶有效预训练目标。
Comments Project page: https://yiren-lu.com/project_pages/geowam/
Mol-JEPA:用于分子的多模态联合嵌入预测架构
机构 * University of Tübingen(蒂宾根大学) ; Boehringer Ingelheim(勃林格殷格翰) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Brown University(布朗大学)
专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG
AI总结 针对分子基础模型的化学无效增强等局限,提出Mol-JEPA多模态框架,利用模态掩码融入生化上下文,在基准测试中展现出优异性能。
面向四旋翼无人机的基于稀疏场景流的无IMU机体坐标系状态估计
专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.CV
AI总结 该研究提出一种无IMU的四旋翼仅视觉状态估计系统,采用扩展卡尔曼滤波与4视图光束平差法,生成机体坐标系状态估计与稀疏场景流,无需GPS等世界坐标系基础设施。
Comments 56 pages, 5 figures, 2 tables. Evaluated on the VID dataset (arXiv:2103.11152)
科学中的自我修正发现系统:面向主体人工智能的范畴论框架
机构 * Laboratory for Atomistic and Molecular Mechanics(原子分子力学实验室) ; Department of Biological Engineering(生物工程系) ; Massachusetts Institute of Technology(麻省理工学院) ; Department of Civil and Environmental Engineering(土木与环境工程系) ; Department of Mechanical Engineering(机械工程系) ; Center for Computational Science and Engineering(计算科学与工程中心) ; Schwarzman College of Computing(施瓦茨曼计算学院)
专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一个基于范畴论的框架,通过左Kan扩展实现科学发现中的表征体制转换,并应用于材料科学中的蛋白质力学和纤维网络建模。
超越多模态对齐:通过响应替换与有序执行验证物理语言
机构 * New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Columbia University(哥伦比亚大学)
专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.LG
AI总结 本文提出DBOSC方法,在Cluster Haptic数据集与弹塑性系统中验证了多模态物理表示的可执行含义,明确了执行器、图表等因素对动作组合的影响,区分了多项可测试的操作能力成就。
Marionette:预测世界状态、渲染几何、绘制外观
机构 * Alaya Lab(Alaya实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV
AI总结 Marionette是面向带关节角色的交互式游戏的世界模型,通过显式建模3D世界状态、委托几何计算、合成外观,实现了可控的长时序行为,且外观生成无明显保真度损失。
Comments Project page: https://alayalab.github.io/Marionette/
语义辐射场作为真实场景空间推理的模拟器
机构 * Leipzig University(莱比锡大学) ; Systems Research Institute Polish Academy of Sciences(波兰科学院系统研究所) ; Wrocław University of Economics(弗罗茨瓦夫经济大学)
专题命中 具身推理 :embodied agent(abstract);分类 cs.RO、cs.CV
AI总结 该研究提出用语义辐射场(SRF)构建兼具几何真实性与语义可查询性的真实场景模拟器,用于训练评估具身智能体的空间推理能力,还将其应用于果园苹果采摘任务。
Comments Accepted at the IJCAI 2026 Workshop on Spatio-Temporal Reasoning and Learning (STRL), oral presentation