Vehicle Localization in GPS-Denied Scenarios Using Arc-Length-Based Map Matching
使用弧长基地图匹配的车辆定位在GPS受限场景中
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 具身导航 :navigation(abstract);分类 cs.RO
AI总结 本文提出基于弧长的地图匹配方法,用于改善GPS受限环境下车辆定位的漂移问题,提升自动驾驶系统的导航可靠性与安全性。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
使用弧长基地图匹配的车辆定位在GPS受限场景中
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 具身导航 :navigation(abstract);分类 cs.RO
AI总结 本文提出基于弧长的地图匹配方法,用于改善GPS受限环境下车辆定位的漂移问题,提升自动驾驶系统的导航可靠性与安全性。
TTCBF:一种用于高阶安全约束的截断泰勒控制屏障函数
专题命中 具身导航 :navigation(abstract)
AI总结 本文提出了一种截断泰勒控制屏障函数,用于处理高阶安全约束,仅需一个类K函数,并引入自适应变体提升适应性。
遮影与反射匹配:一种基于GNSS反射的新型框架,用于提升城市区域的定位精度
专题命中 具身导航 :navigation(abstract)
AI总结 本文提出ZSRM方法,通过结合遮影与反射匹配技术,提升城市区域GNSS定位精度,实验显示其在位置误差和界限方面均有显著改进。
Comments Submitted to IEEE T-ITS
社交媒体应该像Minecraft而不是Instagram:通过虚构探究青少年对有意义社交连接的愿景
专题命中 具身导航 :navigation(abstract)
AI总结 本文通过虚构探究方法,探讨青少年对理想社交媒体的愿景,发现当前平台在有意义社交连接上的不足,并提出基于沉浸感和自然表达的改进方向。
Sora作为世界模型?文本到视频生成的全面调查
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Kyung Hee University(韩国庆熙大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Harbin Institute of Technology Shenzhen(哈尔滨工业大学深圳学院) ; Nota Inc.(Nota公司) ; Tongji University(同济大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV
AI总结 本文全面调查了文本到视频生成技术在世界建模中的应用,指出其在空间、行动和战略智能方面的进展,但仍需解决多样性与一致性之间的权衡问题。
Comments First complete survey on Text-to-Video Generation from World Model perspective, 35 pages
即时世界建模支持人类规划与推理
机构 * MIT Department of Brain and Cognitive Sciences(麻省理工学院脑科学与认知科学系) ; UBC Departments of Computer Science and Psychology(不列颠哥伦比亚大学计算机科学与心理学系)
专题命中 具身推理 :world model(title);分类 cs.AI
AI总结 本文提出'即时'框架,通过在线构建简化表示实现高效心理模拟,支持人类规划与推理。
VJEPA:变分联合嵌入预测架构作为概率世界模型
专题命中 具身推理 :world model(title);分类 cs.LG
AI总结 VJEPA通过变分目标学习预测分布,统一表征学习与贝叶斯过滤,提供概率世界模型框架,适用于高维噪声环境中的鲁棒规划。
Comments 77 pages
CityCube:在城市环境中对视觉-语言模型的跨视角空间推理进行基准测试
机构 * College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学) ; State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) ; BNRist, Tsinghua University(清华大学北京研究院) ; Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)
专题命中 具身推理 :embodied AI(abstract);分类 cs.AI、cs.CV
AI总结 CityCube是一个用于评估视觉-语言模型在城市环境中跨视角空间推理能力的基准,通过多视角问答对揭示模型与人类表现的差距。
StableWorld: 向稳定和一致的长交互视频生成迈进
机构 * PRLab, NJU(南京大学PRLab) ; HKU(香港大学) ; UCAS(中国科学技术大学) ; WeChat, Tencent Inc.(腾讯公司) ; NTU(国立清华大学)
专题命中 具身推理 :world model(abstract);分类 cs.CV
AI总结 StableWorld通过动态帧淘汰机制提升长交互视频生成的稳定性和时间一致性,适用于多种生成框架。
Comments 17 pages, 21 figures,
一种类脑的具身智能用于流体和快速反射式机器人控制
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; AI 2 Robotics(AI 2机器人) ; Shenzhen, China(深圳中国)
专题命中 机器人基础模型 :robotics(title,abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 NeuroVLA是一种类脑具身智能框架,通过生物启发设计实现机器人快速反射和动态稳定性控制,首次在物理机器人上实现先进性能。
GraphPerf-RT: 一种基于图的性能模型用于OpenMP代码的硬件感知调度
机构 * Wayne State University(韦恩州立大学) ; Iowa State University(爱荷华州立大学) ; The University of Texas at Dallas(德克萨斯大学达拉斯分校)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG
AI总结 GraphPerf-RT通过结合任务拓扑、代码语义和运行时上下文,实现高效硬件感知调度,提升性能与能效。
Comments 49 pages, 4 figures, 19 tables
工业应用中人机协作的随机决策框架
机构 * Department of Control and Instrumentation Engineering, King Fahd University of Petroleum and Minerals (KFUPM)(控制与仪器工程系,国王法赫德石油与矿物大学) ; Interdisciplinary Research Center for Intelligent Manufacturing & Robotics, King Fahd University of Petroleum and Minerals (KFUPM)(智能制造与机器人交叉研究中心,国王法赫德石油与矿物大学)
专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.RO
AI总结 本文提出了一种随机建模方法,用于工业应用中人机协作的决策框架,以提高协作的安全性和效率。
Comments Under Review by IEEE Transactions on Human Machine Systems
GuideTouch:一种带有触觉反馈的障碍物避障装置用于视障人士
机构 * Skolkovo Institute of Science and Technology (Skoltech)(斯克尔科沃科学与技术研究所)
专题命中 人机交互与遥操作 :navigation(abstract);分类 cs.RO
AI总结 GuideTouch是一种通过触觉反馈帮助视障人士避开障碍物的设备,具有高识别准确性和良好的环境适应性。
Comments This paper has been accepted for publication at LBR of HRI 2026 conference
边缘计算上的视觉-语言模型用于实时机器人感知
机构 * School of Electronic and Electrical Engineering(电子与电气工程学院)
专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO、cs.AI
AI总结 本文研究了在边缘计算平台上部署视觉-语言模型以提高机器人感知的实时性与准确性,通过实验对比边缘与云部署的性能差异。
重新思考具身世界的视频生成模型
机构 * Peking University(北京大学)
专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出Rbench机器人视频生成基准和RoVid-X数据集,旨在解决高保真机器人视频生成中的数据短缺问题,推动具身AI发展。
Comments Github: https://github.com/DAGroup-PKU/ReVidgen/ Project website: https://dagroup-pku.github.io/ReVidgen.github.io/
基于轨迹级元学习的上下文感知学得网格模拟
专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG
AI总结 本文提出了一种基于轨迹级元学习的网格模拟方法,利用运动原语实现快速且准确的模拟,提升模拟精度并降低运行成本。
Comments 35 pages. Submitted to Transactions on Machine Learning Research (TMLR)
基于视觉的自然语言场景理解用于自动驾驶:一个扩展数据集和一个用于交通场景描述生成的新模型
机构 * Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系) ; School of Electrical and Computer Engineering, College of Engineering, University of Tehran(德黑兰大学电气与计算机工程学院)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 本文提出了一种基于视觉的自然语言场景理解模型,通过扩展数据集和混合注意力机制,提升自动驾驶中交通场景描述生成的准确性和丰富性。
Comments Under review at Computer Vision and Image Understanding (submitted July 25, 2025)
无需GNSS的地面LiDAR点云与卫星图像地理配准
机构 * Department of Computer Science and Software Engineering, The University of Western Australia(计算机科学与软件工程系,西澳大学) ; School of Engineering and Technology, University of New South Wales(工程与技术学院,新南威尔士大学)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV
AI总结 本研究提出了一种无需GNSS的LiDAR点云与卫星图像地理配准方法,通过点云分割、道路骨架提取和刚性变换实现高精度配准,显著降低地理偏移误差。
Comments Submitted to IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing. Under reviewing now
Hyperphantasia: 一个多模态大语言模型心理可视化能力评估基准
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV
AI总结 Hyperphantasia是一个评估多模态大语言模型心理可视化能力的合成基准,通过四个精心设计的谜题揭示了人类与当前模型之间的性能差距,并探索了强化学习在提升视觉模拟能力上的潜力。
耦合拉普拉斯特征映射用于局部感知的3D刚性点云匹配
机构 * Mines Paris, Université PSL(巴黎 Mines 学院,巴黎大学) ; Centre des Matériaux (MAT), UMR7633 CNRS(材料中心(MAT),CNRS UMR7633) ; Centre de Morphologie Mathématique (CMM)(数学形态学中心(CMM)) ; Centre de Mise en Forme des Matériaux (CEMEF), UMR7635 CNRS(材料成型中心(CEMEF),CNRS UMR7635)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV
AI总结 本文提出基于耦合拉普拉斯特征映射的3D点云匹配方法,通过考虑局部结构提升匹配精度,应用于物体异常检测和骨侧估计任务。
Comments This paper has been accepted at Computer Vision and Patter Recognition (CVPR) 2024
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 3447-3458
可扩展的任意时间算法用于学习线性时序逻辑的片段
专题命中 其他机器人 :robotics(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种可扩展的任意时间算法,用于高效学习线性时序逻辑的片段,解决了传统方法在规模和资源消耗上的限制。
MonoRace: 通过鲁棒的单目AI赢得冠军级别的无人机竞速
机构 * Control & Operation, Delft University of Technology(控制与操作,代尔夫特理工大学)
专题命中 其他机器人 :robotics(abstract);分类 cs.RO
AI总结 MonoRace通过单目AI和鲁棒状态估计,在无外部跟踪系统下实现冠军级无人机竞速,以500Hz运行神经网络,超越所有AI和人类冠军。