arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

共收录 6072 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 6072 篇

2607.01370 2026-07-03 cs.CV 新提交 57%

MapDreamer: Aerial Imagery Conditioned Latent Diffusion for Lane-Level Map Generation

MapDreamer: 基于航空影像条件潜扩散的车道级地图生成

Julian Brandes, Philipp Crocoll, Wolfram Burgard

机构 * Department CSAI at University of Technology Nuremberg(纽伦堡工业大学CSAI系) Robert Bosch GmbH(罗伯特·博世有限公司)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出MapDreamer,一种从单张航空影像直接生成带显式拓扑的车道级矢量地图的生成扩散模型,通过变分自编码器学习车道中心线及其拓扑的紧凑潜表示,并利用基于Transformer的潜扩散模型预测图结构,在几何和拓扑保真度上优于非生成基线。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04277 2026-07-03 cs.CV 版本更新 57%

Event-based vision sensing and its application to pedestrian detection for intelligent transportation and surveillance

基于事件的视觉感知及其在智能交通与监控中行人检测的应用

Han Wang, Juntao Wu, Jingyuan Bao, Min Liu, Yaoxiong Wang, Saiao Zhou, Yuman Nie, Yun Li

机构 * Han Wang, Juntao Wu, Jingyuan Bao, Min Liu, Yaoxiong Wang, Saiao Zhou, Yuman Nie, Yun Li(未知)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 综述事件视觉感知原理及其在行人检测中的应用,比较事件驱动与传统帧方法的优劣,分析现有方法并讨论开放挑战与未来方向。

Comments Published in Advanced Engineering Informatics, Vol. 76, Part B, 104989 (2026). Received 31 December 2025; Revised 3 June 2026; Accepted 18 June 2026; Available online 23 June 2026. DOI: 10.1016/j.aei.2026.104989

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06887 2026-07-01 cs.RO 版本更新 57%

VertiAdaptor: Online Kinodynamics Adaptation for Vertically Challenging Terrain

VertiAdaptor: 针对垂直挑战地形的在线运动学动力学自适应

Tong Xu, Chenhui Pan, Aniket Datar, Xuesu Xiao

机构 * George Mason University(乔治梅森大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO

AI总结 提出VertiAdaptor在线自适应框架,通过函数编码器融合高程与语义嵌入,实现地形感知的运动学动力学建模与规划,在仿真和实物平台上预测精度提升23.9%,自适应速度提高5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05663 2026-06-30 cs.CV 57%

LeAD-M3D: Leveraging Asymmetric Distillation for Real-Time Monocular 3D Detection

LeAD-M3D:利用不对称蒸馏实现实时单目3D检测

Johannes Meier, Jonathan Michel, Oussema Dhaouadi, Yung-Hsu Yang, Christoph Reich, Zuria Bauer, Stefan Roth, Marc Pollefeys, Jacques Kaiser, Daniel Cremers

机构 * DeepScenario ETH Zurich(苏黎世联邦理工学院) TU Munich(慕尼黑工业大学) MCML(慕尼黑机器学习中心) TU Darmstadt(达姆施塔特工业大学) ELIZA Microsoft(微软)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出LeAD-M3D,通过不对称蒸馏提升单目3D检测精度与效率,无需额外模态,在KITTI和Waymo数据集上达到SOTA性能,速度提升达3.6倍。

Comments ECCV 2026. Project page: https://deepscenario.github.io/LeAD-M3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04860 2026-06-30 cs.CV 57%

DivAS: Interactive 3D Segmentation by Depth-Weighted Voxel Aggregation

DivAS:通过深度加权体素聚合实现交互式3D分割

Ayush Pande, Mayank Vatsa

机构 * Indian Institute of Technology Kanpur(印度理工学院坎普尔分校) Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校)

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 DivAS通过深度加权体素聚合实现交互式3D分割,无需优化循环,基于GAussian Splatting和NeRF框架,实现高效且高质量的3D分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19119 2026-06-30 cs.CV 57%

MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images

MonoSR: 从单目图像进行开放词汇空间推理

Qirui Wang, Jingyi He, Yining Pan, Si Yong Yeo, Xulei Yang, Shijie Li

机构 * Technical University of Munich(慕尼黑工业大学) A*STAR Institute of Advanced Intelligence and Computing(新加坡科技研究局高级智能与计算研究所) Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出MonoSR大规模单目空间推理数据集,涵盖多种场景并支持多种问题类型,评估先进视觉-语言模型并分析辅助信息对单目空间推理的重要性,为开放世界中的单目空间推理提供基础。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02393 2026-06-30 cs.CV cs.GR 57%

PLOT: Pseudo-Labeling via Object Tracking for Monocular 3D Object Detection

PLOT:通过物体跟踪进行伪标签的单目3D目标检测

Seokyeong Lee, Sithu Aung, Junyong Choi, Seungryong Kim, Ig-Jae Kim, Junghyun Cho

机构 * Korea Institute of Science and Technology (KIST)(韩国科学技术研究院) KAIST AI(韩国科学技术院人工智能系) VRG, FEE, Czech Technical University in Prague(布拉格捷克理工大学电气工程学院视觉识别组) Samsung Research(三星研究院) AI-Robotics, KIST School, University of Science and Technology (UST)(科学技术联合大学院KIST学院人工智能机器人系) Yonsei-KIST Convergence Research Institute, Yonsei University(延世大学延世-KIST融合研究院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 PLOT通过物体跟踪生成单目视频中的3D标注,无需辅助传感器或模型重训练,实现了在自动驾驶、机器人和监控等领域的可靠3D目标检测。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28060 2026-06-29 cs.CV 新提交 57%

ReScene: Structured Indoor Scene Reconstruction from Multi-View Captures

ReScene: 基于多视角图像的结构化室内场景重建

Haoran Xu, Lechao Zhang, Daoguo Dong, Yan Gao, Xin Tan

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究院)

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 提出ReScene框架,通过层级视图选择和关系感知组装,解决多视角场景重建中跨视角关系融合与物理一致性难题,在ScanNet上实现几何、渲染和感知质量的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27554 2026-06-29 cs.CV 新提交 57%

Understanding Cross-Rig Generalization in Automotive Perception: a Multi-Rig Benchmark and Rig Variation Metrics

理解自动驾驶感知中的跨传感器配置泛化:多配置基准与配置变化度量

Tim Alexander Bader, Tim Dieter Eberhardt, Maximilian Dillitzer, Wilhelm Stork

机构 * Dept. of Highly Automated and Assisted Driving, Dr. Ing. h.c. F. Porsche AG(保时捷股份公司高度自动化与辅助驾驶部门) Institute for Information Processing Technologies, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院信息处理技术研究所) Faculty of Mobility and Technology, Esslingen University of Applied Sciences(埃斯林根应用科学大学移动性与技术学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 针对自动驾驶感知中传感器配置变化导致的领域差距,构建了包含14种系统化相机配置的基准,提出两种基于标定的配置描述符(配置方差和配置对比距离),实验证明几何配置差异与性能变化强相关。

Comments Accepted at ECCV 2026; Project Page: https://badertim.github.io/plentiful-carla-camera-rigs

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26321 2026-06-26 cs.RO 新提交 57%

KRVF: A Source-Aware Semantic Voxel World Representation for Edge Mobile Manipulation

KRVF:面向边缘移动操作的源感知语义体素世界表示

Runfeng Ling

机构 * The University of Manchester(曼彻斯特大学)

专题命中 感知 :occupancy(abstract);分类 cs.RO

AI总结 提出KRVF,一种源感知语义体素表示,用于边缘移动操作,通过任务导向体素编码占用、语义、时间新鲜度和证据源,实现深度故障感知推理和映射-感知闭环。

Comments Technical report, 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26047 2026-06-25 cs.RO 新提交 57%

Learning Robot Visual Navigation in Crowds via Intention-Aware Scene Representations

通过意图感知场景表示学习机器人在人群中的视觉导航

Han Bao, Bingyi Xia, Hanjing Ye, Yu Zhan, Hao Cheng, Baozhi Jia, Wenjun Xu, Jiankun Wang

机构 * Shenzhen Key Laboratory of Robotics Perception and Intelligence, Department of Electronic and Electrical Engineering, SUSTech(南方科技大学电子与电气工程系深圳市机器人感知与智能重点实验室) Jiaxing Research Institute, SUSTech(南方科技大学嘉兴研究院) Research Institute of MA&EI, Peng Cheng Laboratory(鹏城实验室机器人与人工智能研究所)

专题命中 感知 :occupancy(abstract);分类 cs.RO

AI总结 提出iCrowdNav方法,利用时空编码器和Intent-Interact Former从视觉观测中提取场景占用特征和人体姿态意图,通过深度强化学习实现高效人群导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25829 2026-06-25 cs.RO 新提交 57%

Beyond a Shadow of a Doubt: Close Proximity Geometry Reconstruction Using FMCW Radar Shadow Effects

不容置疑:利用FMCW雷达阴影效应进行近距离几何重建

Felix de Trogoff du Boisguezennec, Benjamin Ramtoula, Daniele De Martini

机构 * Oxford Robotics Institute, University of Oxford, UK(牛津大学机器人研究所,英国) ETH Zurich, Switzerland(瑞士苏黎世联邦理工学院)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 针对恶劣环境下感知退化问题,提出利用车辆底盘遮挡形成的雷达阴影恢复近处细长垂直物体的三维倾斜角度,通过解析闭式映射实现,仿真和实验验证了可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23866 2026-06-25 cs.LG cs.AI 版本更新 57%

Towards Understanding The Calibration Benefits of Sharpness-Aware Minimization

理解锐度感知最小化的校准优势

Chengli Tan, Yubo Zhou, Haishan Ye, Guang Dai, Junmin Liu, Zengjie Song, Jiangshe Zhang, Zixiang Zhao, Yunda Hao, Yong Xu

机构 * Northwestern Polytechnical University(西北工业大学) SGIT AI Lab, State Grid Corporation of China(国网SGIT人工智能实验室) Xi’an Jiaotong University(西安交通大学) ETH Zürich(苏黎世联邦理工学院) Chinese University of Hong Kong(香港中文大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.AI

AI总结 本文通过理论分析揭示锐度感知最小化(SAM)通过隐式最大化预测分布熵来改善模型校准,并提出变体CSAM进一步降低校准误差。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24796 2026-06-24 cs.CV 新提交 57%

Pocket-SLAM: Rendering-Area-Aware Pruning for Memory-Efficient 3DGS-SLAM

Pocket-SLAM:面向内存高效的3DGS-SLAM的渲染区域感知剪枝

Leshu Li, Jie Peng, Yang Zhao

机构 * University of Minnesota, Twin Cities(明尼苏达大学双城分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出一种渲染区域感知的剪枝策略,根据高斯点对有效渲染区域的贡献进行选择性移除,在EuRoC和KITTI数据集上实现超过60%的内存减少和2倍以上的FPS提升,同时保持定位与建图精度。

Comments 2026 IEEE International Conference on Robotics and Automation(ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21270 2026-06-23 physics.optics cs.CV 新提交 57%

Non-line-of-sight imaging with arbitrary relay surface geometries via 3D Gaussian Transient Rendering

基于3D高斯瞬态渲染的任意中继曲面几何非视距成像

Yi Wang, Ziyu Zhan, Yuran Wang, Hao Wang, Qiang Liu, Zuoqiang Shi, Lingyun Qiu, Xing Fu

机构 * Department of Precise Instrument, Tsinghua University(清华大学精密仪器系) Department of Electrical Engineering, City University of Hong Kong(香港城市大学电子工程系) Yau Mathematical Science Center, Tsinghua University(清华大学姚期智科学中心)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 针对非视距成像中中继曲面形状任意且采样稀疏的问题,提出一种无几何假设的LOS引导NLOS成像方法,利用3D高斯原语和可微分瞬态渲染实现端到端优化,在真实数据上达到最先进的重建保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19555 2026-06-19 cs.RO 新提交 57%

SCAN-Planner: Spatial Collision-Aware Local Planning for Route-Guided Long-Range Quadruped Navigation

SCAN-Planner:用于路线引导的远程四足导航的空间碰撞感知局部规划

Han Zheng, Zhe Chen, Yiwen Fu, Ming Yang, Tong Qin

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 感知 :occupancy(abstract);分类 cs.RO

AI总结 提出SCAN-Planner框架,通过偏航感知双圆柱足迹和投影A*搜索实现空间碰撞感知的局部规划,在密集杂乱、3D非结构化环境和远程导航中生成安全平滑轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21583 2026-06-18 cs.CV 版本更新 57%

HACMatch Semi-Supervised Rotation Regression with Hardness-Aware Curriculum Pseudo Labeling

HACMatch: 基于难度感知课程伪标签的半监督旋转回归

Mei Li, Huayi Zhou, Suizhi Huang, Yuxiang Lu, Yue Ding, Hongtao Lu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出一种难度感知课程学习框架,通过动态选择伪标签样本和结构化数据增强,在少量标注数据下提升半监督旋转回归性能。

Comments This is an accepted manuscript of an article published in Computer Vision and Image Understanding

Journal ref Computer Vision and Image Understanding (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18242 2026-06-17 cs.CV 新提交 57%

EventDrive: Event Cameras for Vision-Language Driving Intelligence

EventDrive: 用于视觉-语言驾驶智能的事件相机

Dongyue Lu, Rong Li, Ao Liang, Lingdong Kong, Wei Yin, Lai Xing Ng, Benoit R. Cottereau, Camille Simon Chane, Wei Tsang Ooi

机构 * NUS(新加坡国立大学) HKUST(GZ)(香港科技大学(广州)) Horizon Robotics(地平线机器人) A*STAR, I2R(新加坡科技研究局,资讯通信研究院) IPAL, CNRS IRL 2955, Singapore(IPAL,法国国家科学研究中心国际联合实验室2955,新加坡) University Toulouse, CNRS, CerCo, Toulouse, France(图卢兹大学,法国国家科学研究中心,CerCo,法国图卢兹) ETIS UMR 8051, CY Cergy Paris University, ENSEA, CNRS, France(ETIS UMR 8051,CY塞尔吉-巴黎大学,ENSEA,法国国家科学研究中心,法国)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出EventDrive基准和模型套件,通过多时域事件金字塔和时域混合专家模块融合事件流与RGB帧,在感知、理解、预测和规划四维度提升驾驶推理性能。

Comments CVPR2026, 34 pages, 15 figures, 15 tables, project page: https://dylanorange.github.io/projects/eventdrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17982 2026-06-17 cs.RO 新提交 57%

LAGO Policy: Latency-Aware Asynchronous Diffusion Policies with Goal-Directed Collision-Free Planning for Smooth Manipulation

LAGO策略:面向平滑操作的延迟感知异步扩散策略与目标导向无碰撞规划

Guowei Shi, Xupeng Xie, Yiming Luo, Jian Guo, Jun Ma, Boyu Zhou

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) International Digital Economy Academy(国际数字经济学院) The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 感知 :trajectory planning(abstract);分类 cs.RO

AI总结 提出LAGO策略,通过延迟感知条件引导和时空轨迹优化,解决异步扩散策略的间断和碰撞问题,实现平滑安全的操作。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17630 2026-06-17 cs.RO 新提交 57%

FLAP: FOV-Constrained Active Perception Planning for Prior-Map-Free 3D Navigation

FLAP: 面向无先验地图3D导航的视场约束主动感知规划

Mengke Zhang, Sitong Li, Tiancheng Lai, Ruitian Pang, Mingxuan Zhang, Qingcheng Chen, Fei Gao, Chao Xu, Yanjun Cao

机构 * The State Key Laboratory of Industrial Control Technology, College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院工业控制技术国家重点实验室) Huzhou Institute, Zhejiang University(浙江大学湖州研究院) Huzhou Key Laboratory of Autonomous System(湖州市自动驾驶系统重点实验室) Shanghai Institute of Special Equipment Inspection and Technical Research Co., Ltd(上海市特种设备监督检验技术研究院有限公司)

专题命中 感知 :trajectory planning(abstract);分类 cs.RO

AI总结 提出一种将主动感知直接融入轨迹优化的规划框架,通过传感器坐标系下的视场几何约束和速度触发机制,在保证安全的同时提升效率,并支持任意3D机动。

Comments 18 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04513 2026-06-17 cs.AI 版本更新 57%

MapAgent: An Industrial-Grade Agentic Framework for City-scale Lane-level Map Generation

MapAgent: 一个工业级的城市规模车道级地图生成智能框架

Deguo Xia, Zihan Li, Haochen Zhao, Dong Xie, Yuyao Kong, Xiyan Liu, Jizhou Huang, Mengmeng Yang, Diange Yang

机构 * Tsinghua University(清华大学) Baidu(百度) University of Macau(澳门大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 感知 :autonomous driving(abstract);分类 cs.AI

AI总结 提出MapAgent框架,通过结合视觉语言模型和约束感知推理,在验证驱动的Judge-Planner-Worker循环中修正车道地图生成中的规范违规问题,实现城市规模的高自动化生产。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17049 2026-06-16 cs.CV 新提交 57%

BRDFusion: Physics Meets Generation for Urban Scene Inverse Rendering

BRDFusion:物理与生成结合的城市场景逆渲染

Yi-Ruei Liu, Jie-Ying Lee, Zheng-Hui Huang, Yu-Lun Liu, Chih-Hao Lin

机构 * National Yang Ming Chiao Tung University University of Illinois Urbana-Champaign National Taiwan University

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出BRDFusion框架,结合物理建模与生成先验,实现城市场景逆渲染,在保持物理一致性的同时修复伪影,支持新视角重光照、夜间模拟和动态物体编辑。

Comments Project page: https://shigon255.github.io/brdfusion-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15287 2026-06-16 cs.CV 新提交 57%

G2IA: Geometry-Guided Instance-Aware Retrieval and Refinement for Cross-Modal Place Recognition

G2IA: 几何引导的实例感知跨模态地点识别检索与精炼

Xianyun Jiao, Jingyi Xu, Zhongmiao Yan, Xieyuanli Chen, Ling Pei

机构 * Shanghai Jiao Tong University(上海交通大学) National University of Defense Technology(国防科技大学)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 提出G2IA框架,通过几何引导的实例感知检索和跨模态局部形状与空间布局验证,解决图像到点云地点识别中的模态差异和感知混淆问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15154 2026-06-16 cs.RO 新提交 57%

Task-Aware Environment Augmentation for Reliable Navigation via Shielded Conditional Diffusion

任务感知的环境增强:通过屏蔽条件扩散实现可靠导航

Bharawee Phoompho, Gokul Puthumanaillam, Yan Miao, Ruben Hernandez, Tim Bretl, Sayan Mitra, Melkior Ornik

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 感知 :trajectory planning(abstract);分类 cs.RO

AI总结 针对部分可观测环境下的轨迹规划可靠性问题,提出任务感知的环境增强方法SCoDA,利用条件扩散模型学习最优视觉标记布局,通过屏蔽采样引导标记放置,提升轨迹执行可靠性和完成时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10523 2026-06-16 cs.CV 版本更新 57%

Reasoning in Computer Vision: Taxonomy, Models, Tasks, and Methodologies

计算机视觉中的推理:分类、模型、任务与方法论

Ayushman Sarkar, Zhenyu Yu, Mohd Yamani Idna Idris

机构 * Department of Computer Science and Engineering, Birbhum Institute of Engineering and Technology(计算机科学与工程系,比罗尔理工学院) College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) Faculty of Computer Science and Information Technology, Universiti Malaya(计算机科学与信息技术学院,马来亚大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文对计算机视觉中的推理进行系统分类,涵盖关系、符号、时间、因果和常识推理,并综述了从图模型到多模态大语言模型的实现方法及评估协议,指出开放挑战并设定未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13049 2026-06-12 cs.RO 新提交 57%

Y-BotFrame: An Extensible Embodied Agent Framework for Quadruped Robot Assistants

Y-BotFrame:一种用于四足机器人助手的可扩展具身智能体框架

Luyao Zhang, Ke Li, Yuan Ding, Xulong Zhao, Guo Yu, Chengwei Yan, Fuyu Dong, Jiawei Hu, Di Wang, Nan Luo, Gang Liu, Quan Wang

机构 * Xidian University(西安电子科技大学)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 提出Y-BotFrame框架,集成多模态感知与大语言模型认知核心,将自然语言指令映射为可执行任务单元,实现无遥控器的人机协作,支持模块化扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12579 2026-06-12 cs.RO 新提交 57%

G-MAPP: GPU-accelerated Multi-Agent Planning and Perception for Reactive Motion Generation

G-MAPP: 基于GPU加速的多智能体规划与感知用于反应式运动生成

Tanmay Bishnoi, Riddhiman Laha, Tobias Löw, Jose Alex Chandy, Luis F. C. Figueredo, Sami Haddadin

机构 * Department of Electrical, Computer, and Biomedical Engineering, Toronto Metropolitan University(多伦多都会大学电气、计算机与生物医学工程系) Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑工业大学慕尼黑机器人与机器智能研究所) Institute for Experiential Robotics, Northeastern University(东北大学体验式机器人研究所) Idiap Research Institute(Idiap 研究所) EPFL(瑞士联邦理工学院洛桑) CHART Group at the School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院 CHART 小组) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 感知 :trajectory planning(abstract);分类 cs.RO

AI总结 提出GPU加速的框架,通过并行状态探索和紧密耦合感知-动作循环,实现非结构化环境中的实时反应式运动生成,在7自由度机器人上达到5倍加速并成功避障。

Comments The implementation is available at: https://github.com/chart-research/g-mapp

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 6, pp. 7516-7523, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.10552 2026-06-12 cs.RO 57%

Making Parameterization and Constrains of Object Landmark Globally Consistent via SPD(3) Manifold and Improved Cost Functions

通过SPD(3)流形和改进的成本函数使物体地标参数化和约束实现全局一致

Yutong Hu, Wei Wang

专题命中 感知 :autonomous driving(abstract);分类 cs.RO

AI总结 本文通过SPD(3)流形和改进成本函数解决物体级SLAM后端的奇异性问题,提升收敛速度和鲁棒性,实验显示映射精度平均提高22%。

Comments 8 pages, 8 figures, submitted to IROS 2022 & RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12066 2026-06-11 cs.CV 新提交 57%

Performance Analysis of YOLOv11 and YOLOv8 for Mixed Traffic Object Detection under Adverse Weather Conditions in Developing Countries

YOLOv11与YOLOv8在发展中国家恶劣天气下混合交通目标检测的性能分析

Quoc Thuan Nguyen, Ha Anh Vu, Ngo Dang Thanh Ngan, Minh Phuc Hoang Ngoc

机构 * FPT University(FPT大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 针对发展中国家恶劣天气下的混合交通场景,评估YOLOv11n与YOLOv8n在融合数据集上的性能,YOLOv11n在精度提升3.2%的同时计算量减少22%,实现精度与效率的优化平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11419 2026-06-11 cs.RO 新提交 57%

A Modular Dual-Camera Pipeline for Micro-Inspection Using Aerial Robots

一种用于空中机器人微检测的模块化双相机流水线

S. H. Mirtajadini, N. Rublein, R. M. Ramakrishnan, G. ter Maat, M. Aldibaja, A. Y. Mersha

机构 * Netherlands Organization for Scientific Research (NWO)(荷兰科学研究组织) Saxion University of Applied Sciences(萨克逊应用科学大学)

专题命中 感知 :trajectory planning(abstract);分类 cs.RO

AI总结 提出一种模块化双相机空中微检测流水线,通过变焦云台相机和广角立体导航相机协同工作,结合视觉反馈回路,实现对树木和温室粘虫板等非结构目标的鲁棒微检测。

详情

展开后加载摘要…

URL PDF HTML 收藏