arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-01-22 至 2026-01-22 共收录 52 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 14 篇

2410.12208 2026-01-22 cs.RO cs.SY eess.SY 57%

Vehicle Localization in GPS-Denied Scenarios Using Arc-Length-Based Map Matching

使用弧长基地图匹配的车辆定位在GPS受限场景中

Nur Uddin Javed, Yuvraj Singh, Qadeer Ahmed

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出基于弧长的地图匹配方法,用于改善GPS受限环境下车辆定位的漂移问题,提升自动驾驶系统的导航可靠性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15196 2026-01-22 eess.SY cs.SY 50%

TTCBF: A Truncated Taylor Control Barrier Function for High-Order Safety Constraints

TTCBF:一种用于高阶安全约束的截断泰勒控制屏障函数

Jianye Xu, Bassam Alrifaee

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出了一种截断泰勒控制屏障函数,用于处理高阶安全约束,仅需一个类K函数,并引入自适应变体提升适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10727 2026-01-22 eess.SP 50%

Zonotope Shadow and Reflection Matching: A Novel GNSS Reflection-Based Framework for Enhanced Positioning Accuracy in Urban Areas

遮影与反射匹配:一种基于GNSS反射的新型框架,用于提升城市区域的定位精度

Sanghyun Kim, Jiwon Seo

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出ZSRM方法,通过结合遮影与反射匹配技术,提升城市区域GNSS定位精度,实验显示其在位置误差和界限方面均有显著改进。

Comments Submitted to IEEE T-ITS

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06696 2026-01-22 cs.HC 50%

Social Media Should Feel Like Minecraft, Not Instagram: Youth Visions for Meaningful Social Connections through Fictional Inquiry

社交媒体应该像Minecraft而不是Instagram:通过虚构探究青少年对有意义社交连接的愿景

JaeWon Kim, Hyunsung Cho, Fannie Liu, Alexis Hiniker

专题命中 具身导航 :navigation(abstract)

AI总结 本文通过虚构探究方法,探讨青少年对理想社交媒体的愿景,发现当前平台在有意义社交连接上的不足,并提出基于沉浸感和自然表达的改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 5 篇

2403.05131 2026-01-22 cs.AI cs.CV 82%

Sora as a World Model? A Complete Survey on Text-to-Video Generation

Sora作为世界模型?文本到视频生成的全面调查

Fachrina Dewi Puspitasari, Chaoning Zhang, Joseph Cho, Adnan Haider, Noor Ul Eman, Omer Amin, Alexis Mankowski, Muhammad Umair, Jingyao Zheng, Sheng Zheng, Lik-Hang Lee, Caiyan Qin, Tae-Ho Kim, Choong Seon Hong, Yang Yang, Heng Tao Shen

机构 * University of Electronic Science and Technology of China(电子科技大学) Kyung Hee University(韩国庆熙大学) The Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology Shenzhen(哈尔滨工业大学深圳学院) Nota Inc.(Nota公司) Tongji University(同济大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 本文全面调查了文本到视频生成技术在世界建模中的应用,指出其在空间、行动和战略智能方面的进展,但仍需解决多样性与一致性之间的权衡问题。

Comments First complete survey on Text-to-Video Generation from World Model perspective, 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14514 2026-01-22 cs.AI q-bio.NC 74%

"Just in Time" World Modeling Supports Human Planning and Reasoning

即时世界建模支持人类规划与推理

Tony Chen, Sam Cheyette, Kelsey Allen, Joshua Tenenbaum, Kevin Smith

机构 * MIT Department of Brain and Cognitive Sciences(麻省理工学院脑科学与认知科学系) UBC Departments of Computer Science and Psychology(不列颠哥伦比亚大学计算机科学与心理学系)

专题命中 具身推理 :world model(title);分类 cs.AI

AI总结 本文提出'即时'框架,通过在线构建简化表示实现高效心理模拟,支持人类规划与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14354 2026-01-22 cs.LG 74%

VJEPA: Variational Joint Embedding Predictive Architectures as Probabilistic World Models

VJEPA:变分联合嵌入预测架构作为概率世界模型

Yongchao Huang

专题命中 具身推理 :world model(title);分类 cs.LG

AI总结 VJEPA通过变分目标学习预测分布,统一表征学习与贝叶斯过滤,提供概率世界模型框架,适用于高维噪声环境中的鲁棒规划。

Comments 77 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14339 2026-01-22 cs.CV cs.AI 62%

CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments

CityCube:在城市环境中对视觉-语言模型的跨视角空间推理进行基准测试

Haotian Xu, Yue Hu, Zhengqiu Zhu, Chen Gao, Ziyou Wang, Junreng Rao, Wenhao Lu, Weishi Li, Quanjun Yin, Yong Li

机构 * College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学) State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) BNRist, Tsinghua University(清华大学北京研究院) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

专题命中 具身推理 :embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 CityCube是一个用于评估视觉-语言模型在城市环境中跨视角空间推理能力的基准,通过多视角问答对揭示模型与人类表现的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15281 2026-01-22 cs.CV 57%

StableWorld: Towards Stable and Consistent Long Interactive Video Generation

StableWorld: 向稳定和一致的长交互视频生成迈进

Ying Yang, Zhengyao Lv, Tianlin Pan, Haofan Wang, Binxin Yang, Hubery Yin, Chen Li, Ziwei Liu, Chenyang Si

机构 * PRLab, NJU(南京大学PRLab) HKU(香港大学) UCAS(中国科学技术大学) WeChat, Tencent Inc.(腾讯公司) NTU(国立清华大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 StableWorld通过动态帧淘汰机制提升长交互视频生成的稳定性和时间一致性,适用于多种生成框架。

Comments 17 pages, 21 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 1 篇

2601.14628 2026-01-22 cs.RO cs.AI 84%

A Brain-inspired Embodied Intelligence for Fluid and Fast Reflexive Robotics Control

一种类脑的具身智能用于流体和快速反射式机器人控制

Weiyu Guo, He Zhang, Pengteng Li, Tiefu Cai, Ziyang Chen, Yandong Guo, Xiao He, Yongkui Yang, Ying Sun, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) AI 2 Robotics(AI 2机器人) Shenzhen, China(深圳中国)

专题命中 机器人基础模型 :robotics(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 NeuroVLA是一种类脑具身智能框架,通过生物启发设计实现机器人快速反射和动态稳定性控制,首次在物理机器人上实现先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 1 篇

2512.12091 2026-01-22 cs.LG 57%

GraphPerf-RT: A Graph-Driven Performance Model for Hardware-Aware Scheduling of OpenMP Codes

GraphPerf-RT: 一种基于图的性能模型用于OpenMP代码的硬件感知调度

Mohammad Pivezhandi, Mahdi Banisharif, Saeed Bakhshan, Abusayeed Saifullah, Ali Jannesari

机构 * Wayne State University(韦恩州立大学) Iowa State University(爱荷华州立大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 GraphPerf-RT通过结合任务拓扑、代码语义和运行时上下文,实现高效硬件感知调度,提升性能与能效。

Comments 49 pages, 4 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 人机交互与遥操作 2 篇

2601.14809 2026-01-22 cs.RO 57%

Stochastic Decision-Making Framework for Human-Robot Collaboration in Industrial Applications

工业应用中人机协作的随机决策框架

Muhammad Adel Yusuf, Ali Nasir, Zeeshan Hameed Khan

机构 * Department of Control and Instrumentation Engineering, King Fahd University of Petroleum and Minerals (KFUPM)(控制与仪器工程系,国王法赫德石油与矿物大学) Interdisciplinary Research Center for Intelligent Manufacturing & Robotics, King Fahd University of Petroleum and Minerals (KFUPM)(智能制造与机器人交叉研究中心,国王法赫德石油与矿物大学)

专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.RO

AI总结 本文提出了一种随机建模方法,用于工业应用中人机协作的决策框架,以提高协作的安全性和效率。

Comments Under Review by IEEE Transactions on Human Machine Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13813 2026-01-22 cs.RO cs.HC 57%

GuideTouch: An Obstacle Avoidance Device with Tactile Feedback for Visually Impaired

GuideTouch:一种带有触觉反馈的障碍物避障装置用于视障人士

Timofei Kozlov, Artem Trandofilov, Georgii Gazaryan, Issatay Tokmurziyev, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology (Skoltech)(斯克尔科沃科学与技术研究所)

专题命中 人机交互与遥操作 :navigation(abstract);分类 cs.RO

AI总结 GuideTouch是一种通过触觉反馈帮助视障人士避开障碍物的设备,具有高识别准确性和良好的环境适应性。

Comments This paper has been accepted for publication at LBR of HRI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 7 篇

2601.14921 2026-01-22 cs.RO cs.AI 81%

Vision-Language Models on the Edge for Real-Time Robotic Perception

边缘计算上的视觉-语言模型用于实时机器人感知

Sarat Ahmad, Maryam Hafeez, Syed Ali Raza Zaidi

机构 * School of Electronic and Electrical Engineering(电子与电气工程学院)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 本文研究了在边缘计算平台上部署视觉-语言模型以提高机器人感知的实时性与准确性,通过实验对比边缘与云部署的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15282 2026-01-22 cs.CV cs.AI cs.RO 80%

Rethinking Video Generation Model for the Embodied World

重新思考具身世界的视频生成模型

Yufan Deng, Zilin Pan, Hongyu Zhang, Xiaojie Li, Ruoqing Hu, Yufei Ding, Yiming Zou, Yan Zeng, Daquan Zhou

机构 * Peking University(北京大学)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出Rbench机器人视频生成基准和RoVid-X数据集,旨在解决高保真机器人视频生成中的数据短缺问题,推动具身AI发展。

Comments Github: https://github.com/DAGroup-PKU/ReVidgen/ Project website: https://dagroup-pku.github.io/ReVidgen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05234 2026-01-22 cs.RO cs.LG 79%

Context-aware Learned Mesh-based Simulation via Trajectory-Level Meta-Learning

基于轨迹级元学习的上下文感知学得网格模拟

Philipp Dahlinger, Niklas Freymuth, Tai Hoang, Tobias Würth, Michael Volpp, Luise Kärger, Gerhard Neumann

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出了一种基于轨迹级元学习的网格模拟方法,利用运动原语实现快速且准确的模拟,提升模拟精度并降低运行成本。

Comments 35 pages. Submitted to Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14438 2026-01-22 cs.CV cs.AI cs.CL cs.LG 67%

Vision-Based Natural Language Scene Understanding for Autonomous Driving: An Extended Dataset and a New Model for Traffic Scene Description Generation

基于视觉的自然语言场景理解用于自动驾驶:一个扩展数据集和一个用于交通场景描述生成的新模型

Danial Sadrian Zadeh, Otman A. Basir, Behzad Moshiri

机构 * Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系) School of Electrical and Computer Engineering, College of Engineering, University of Tehran(德黑兰大学电气与计算机工程学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出了一种基于视觉的自然语言场景理解模型,通过扩展数据集和混合注意力机制,提升自动驾驶中交通场景描述生成的准确性和丰富性。

Comments Under review at Computer Vision and Image Understanding (submitted July 25, 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05999 2026-01-22 cs.CV cs.AI 62%

Geo-Registration of Terrestrial LiDAR Point Clouds with Satellite Images without GNSS

无需GNSS的地面LiDAR点云与卫星图像地理配准

Xinyu Wang, Muhammad Ibrahim, Haitian Wang, Atif Mansoor, Xiuping Jia, Ajmal Mian

机构 * Department of Computer Science and Software Engineering, The University of Western Australia(计算机科学与软件工程系,西澳大学) School of Engineering and Technology, University of New South Wales(工程与技术学院,新南威尔士大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本研究提出了一种无需GNSS的LiDAR点云与卫星图像地理配准方法,通过点云分割、道路骨架提取和刚性变换实现高精度配准,显著降低地理偏移误差。

Comments Submitted to IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing. Under reviewing now

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11932 2026-01-22 cs.CV 57%

Hyperphantasia: A Benchmark for Evaluating the Mental Visualization Capabilities of Multimodal LLMs

Hyperphantasia: 一个多模态大语言模型心理可视化能力评估基准

Mohammad Shahab Sepehri, Berk Tinaz, Zalan Fabian, Mahdi Soltanolkotabi

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 Hyperphantasia是一个评估多模态大语言模型心理可视化能力的合成基准,通过四个精心设计的谜题揭示了人类与当前模型之间的性能差距,并探索了强化学习在提升视觉模拟能力上的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17372 2026-01-22 cs.CV 57%

Coupled Laplacian Eigenmaps for Locally-Aware 3D Rigid Point Cloud Matching

耦合拉普拉斯特征映射用于局部感知的3D刚性点云匹配

Matteo Bastico, Etienne Decencière, Laurent Corté, Yannick Tillier, David Ryckelynck

机构 * Mines Paris, Université PSL(巴黎 Mines 学院,巴黎大学) Centre des Matériaux (MAT), UMR7633 CNRS(材料中心(MAT),CNRS UMR7633) Centre de Morphologie Mathématique (CMM)(数学形态学中心(CMM)) Centre de Mise en Forme des Matériaux (CEMEF), UMR7635 CNRS(材料成型中心(CEMEF),CNRS UMR7635)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出基于耦合拉普拉斯特征映射的3D点云匹配方法,通过考虑局部结构提升匹配精度,应用于物体异常检测和骨侧估计任务。

Comments This paper has been accepted at Computer Vision and Patter Recognition (CVPR) 2024

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 3447-3458

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他机器人 2 篇

2110.06726 2026-01-22 cs.AI cs.FL cs.LG 62%

Scalable Anytime Algorithms for Learning Fragments of Linear Temporal Logic

可扩展的任意时间算法用于学习线性时序逻辑的片段

Ritam Raha, Rajarshi Roy, Nathanaël Fijalkow, Daniel Neider

专题命中 其他机器人 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种可扩展的任意时间算法,用于高效学习线性时序逻辑的片段,解决了传统方法在规模和资源消耗上的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15222 2026-01-22 cs.RO 57%

MonoRace: Winning Champion-Level Drone Racing with Robust Monocular AI

MonoRace: 通过鲁棒的单目AI赢得冠军级别的无人机竞速

Stavrow A. Bahnam, Robin Ferede, Till M. Blaha, Anton E. Lang, Erin Lucassen, Quentin Missinne, Aderik E. C. Verraest, Christophe De Wagter, Guido C. H. E. de Croon

机构 * Control & Operation, Delft University of Technology(控制与操作,代尔夫特理工大学)

专题命中 其他机器人 :robotics(abstract);分类 cs.RO

AI总结 MonoRace通过单目AI和鲁棒状态估计,在无外部跟踪系统下实现冠军级无人机竞速,以500Hz运行神经网络,超越所有AI和人类冠军。

详情

展开后加载摘要…

URL PDF HTML 收藏