arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-02-03 至 2026-02-03 共收录 114 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 14 篇

2602.00475 2026-02-03 cs.LG cs.RO 81%

Parallel Stochastic Gradient-Based Planning for World Models

并行随机梯度规划用于世界模型

Michael Psenka, Michael Rabbat, Aditi Krishnapriyan, Yann LeCun, Amir Bar

机构 * University of California, Berkeley(加州大学伯克利分校) Meta FAIR New York University(纽约大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.LG

AI总结 GRASP是一种基于世界模型的并行随机梯度规划方法,通过引入随机性和软约束,有效解决长时间跨度的控制任务,优于现有规划算法。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00096 2026-02-03 cs.CV cs.AI 81%

Mirage2Matter: A Physically Grounded Gaussian World Model from Video

Mirage2Matter: 从视频构建一个物理基础的高斯世界模型

Zhengqing Gao, Ziwen Li, Xin Wang, Jiaxin Huang, Zhenyang Ren, Mingkai Shao, Hanlue Zhang, Tianyu Huang, Yongkang Cheng, Yandong Guo, Runqi Lin, Yuanyuan Wang, Tongliang Liu, Kun Zhang, Mingming Gong

机构 * MBZUAI AI$^2$Robotics(AI²Robotics) The University of Sydney(悉尼大学) Carnegie Mellon University(卡内基梅隆大学) The University of Melbourne(墨尔本大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 Mirage2Matter通过视频重建物理基础的世界模型,利用3D高斯点云和生成模型实现高保真具身训练数据生成,提升具身智能的可扩展性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02002 2026-02-03 cs.CV 79%

UniDriveDreamer: A Single-Stage Multimodal World Model for Autonomous Driving

UniDriveDreamer: 一种用于自动驾驶的单阶段多模态世界模型

Guosheng Zhao, Yaozeng Wang, Xiaofeng Wang, Zheng Zhu, Tingdong Yu, Guan Huang, Yongchen Zai, Ji Jiao, Changliang Xue, Xiaole Wang, Zhen Yang, Futang Zhu, Xingang Wang

机构 * GigaAI CASIA BYD

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 UniDriveDreamer是一种用于自动驾驶的单阶段多模态世界模型,通过统一的多模态生成方法提升视频和激光雷达数据合成的性能。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01630 2026-02-03 cs.CV 79%

Research on World Models Is Not Merely Injecting World Knowledge into Specific Tasks

世界模型的研究并非仅仅是将世界知识注入特定任务

Bohan Zeng, Kaixin Zhu, Daili Hua, Bozhou Li, Chengzhuo Tong, Yuran Wang, Xinyi Huang, Yifan Dai, Zixiang Zhang, Yifan Yang, Zhou Liu, Hao Liang, Xiaochen Ma, Ruichuan An, Tianyi Bai, Hongcheng Gao, Junbo Niu, Yang Shi, Xinlong Chen, Yue Ding, Minglei Shi, Kai Zeng, Yiwen Tang, Yuanxing Zhang, Pengfei Wan, Xintao Wang, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出统一的世界模型设计规范,强调其应整合交互、感知、符号推理和空间表示,以实现更通用和稳健的世界模型。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01270 2026-02-03 cs.LG 79%

Mixture-of-World Models: Scaling Multi-Task Reinforcement Learning with Modular Latent Dynamics

混合世界模型:通过模块化潜在动态扩展多任务强化学习

Boxuan Zhang, Weipu Zhang, Zhaohan Feng, Wei Xiao, Jian Sun, Jie Chen, Gang Wang

机构 * School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学) Jiangxing Intelligence Inc.(江行智能有限公司)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 混合世界模型通过模块化架构和任务聚类策略,在多任务强化学习中实现了高效的参数利用和样本效率,展示了在Atari和Meta-World基准上的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10498 2026-02-03 cs.CV 79%

The Role of World Models in Shaping Autonomous Driving: A Comprehensive Survey

世界模型在塑造自动驾驶中的作用:全面综述

Sifan Tu, Xin Zhou, Dingkang Liang, Xingyu Jiang, Yumeng Zhang, Xiaofan Li, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Baidu Inc(百度公司)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文综述了驾驶世界模型在自动驾驶中的作用,分析了其生态系统、分类方法及性能表现,探讨了当前研究的局限性与未来发展方向。

Comments For continuous updates, please follow the repository: https://github.com/LMD0311/Awesome-World-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00558 2026-02-03 cs.NI 78%

NetWorld: Communication-Based Diffusion World Model for Multi-Agent Reinforcement Learning in Wireless Networks

NetWorld: 基于通信的扩散世界模型用于无线网络中的多智能体强化学习

Kechen Meng, Rongpeng Li, Yansha Deng, Zhifeng Zhao, Honggang Zhang

专题命中 具身推理 :world model(title,abstract)

AI总结 NetWorld通过通信增强的扩散世界模型,实现无线网络中多智能体强化学习的少样本泛化和高效轨迹规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00608 2026-02-03 cs.AI cs.GR cs.LG 62%

Scalable Generative Game Engine: Breaking the Resolution Wall via Hardware-Algorithm Co-Design

可扩展的生成游戏引擎:通过硬件-算法协同设计突破分辨率限制

Wei Zeng, Xuchen Li, Ruili Feng, Zhen Liu, Fengwei An, Jian Zhao

机构 * School of Microelectronics, Southern University of Science and Technology (SUSTech)(南方科技大学电子学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) University of Waterloo(滑铁卢大学) School of Marxism, Tsinghua University(清华大学马克思主义学院) Zhongguancun Academy(中关村学院)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出硬件-算法协同设计框架,通过优化资源分配和减少内存带宽使用,实现高分辨率实时生成游戏,提升像素吞吐量50倍,达到26.4 FPS和48.3 FPS的流畅性能。

Comments Preprint, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人基础模型 3 篇

2602.01158 2026-02-03 cs.CV cs.RO 73%

Improving Robustness of Vision-Language-Action Models by Restoring Corrupted Visual Inputs

通过恢复损坏的视觉输入来提高视觉-语言-动作模型的鲁棒性

Daniel Yezid Guarnizo Orjuela, Leonardo Scappatura, Veronica Di Gennaro, Riccardo Andrea Izzo, Gianluca Bardaro, Matteo Matteucci

机构 * Department of Electronics, Information, and Bioengineering(电子信息与生物工程系)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本研究提出CRT模块,通过对抗训练恢复损坏的视觉输入,提升VLA模型在现实环境中的鲁棒性与性能稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01811 2026-02-03 cs.RO 70%

From Knowing to Doing Precisely: A General Self-Correction and Termination Framework for VLA models

从认知到精准执行:一种通用的自我校正与终止框架用于VLA模型

Wentao Zhang, Aolan Sun, Wentao Mo, Xiaoyang Qu, Yuxin Zheng, Jianzong Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) Ping An Technology (Shenzhen) Co., Ltd., Shenzhen, China(平安科技(深圳)有限公司,深圳,中国)

专题命中 机器人基础模型 :embodied agent(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出VLA-SCT框架,通过自我校正和终止机制提升VLA模型在抓取任务中的精度和鲁棒性,提高复杂环境下的执行可靠性。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24795 2026-02-03 cs.CV cs.AI cs.LG cs.RO 70%

A Survey on Efficient Vision-Language-Action Models

高效视觉-语言-动作模型的综述

Zhaoshu Yu, Bo Wang, Pengpeng Zeng, Haonan Zhang, Ji Zhang, Zheng Wang, Lianli Gao, Jingkuan Song, Nicu Sebe, Heng Tao Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机科学与人工智能学院) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文综述了高效视觉-语言-动作模型,系统分类了模型设计、训练和数据收集三个核心领域,总结了最新方法并提出了未来研究方向。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模仿学习与强化学习 14 篇

2602.02454 2026-02-03 cs.RO cs.AI 86%

World-Gymnast: Training Robots with Reinforcement Learning in a World Model

World-Gymnast: 在世界模型中用强化学习训练机器人

Ansh Kumar Sharma, Yixiang Sun, Ninghao Lu, Yunzhe Zhang, Jiarao Liu, Sherry Yang

机构 * New York University(纽约大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :world model(title,abstract);robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 World-Gymnast通过在世界模型中进行强化学习微调,有效提升真实机器人性能,比监督学习和软件模拟更具优势。

Comments https://world-gymnast.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01266 2026-02-03 cs.RO 80%

Reinforcement Learning for Active Perception in Autonomous Navigation

自主导航中的主动感知强化学习

Grzegorz Malczyk, Mihir Kulkarni, Kostas Alexis

机构 * Department of Engineering Cybernetics, Norwegian University of Science and Technology (NTNU)(工程 cybernetics 系,挪威科学技术大学)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO;robotics(comments)

AI总结 本文提出一种端到端强化学习框架,使无人机在复杂环境中通过主动控制相机实现安全导航与探索。

Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02396 2026-02-03 cs.RO cs.LG 73%

PRISM: Performer RS-IMLE for Single-pass Multisensory Imitation Learning

PRISM:基于单次传递的RS-IMLE单次传递多感官模仿学习

Amisha Bhaskar, Pratap Tokekar, Stefano Di Cairano, Alexander Schperberg

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 PRISM通过单次传递的RS-IMLE方法,实现高效的多感官模仿学习,优于扩散策略,提升成功率并减少轨迹 jerk。

Comments 10 pages main text and 4 figures, and 11 pages appendix and 10 figures, total 21 pages and 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00743 2026-02-03 cs.RO cs.AI 73%

SA-VLA: Spatially-Aware Flow-Matching for Vision-Language-Action Reinforcement Learning

SA-VLA:面向视觉-语言-动作强化学习的空间感知流匹配

Xu Pan, Zhenglin Wan, Xingrui Yu, Xianwei Zheng, Youkai Ke, Ming Sun, Rui Wang, Ziwei Wang, Ivor Tsang

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 SA-VLA通过空间感知的RL适应框架,在强化学习微调中保持空间定位,提升视觉-语言-动作任务的鲁棒性和泛化能力。

Comments Version 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07593 2026-02-03 cs.RO cs.AI cs.CV cs.SY eess.IV eess.SY 67%

Vision-Proprioception Fusion with Mamba2 in End-to-End Reinforcement Learning for Motion Control

基于Mamba2的视觉-本体感知融合在端到端强化学习中的运动控制

Xiaowen Tao, Yinuo Wang, Jinzhao Zhou

机构 * School of Computer Science and Statistics, Trinity College Dublin(都柏林三一学院计算机科学与统计学系) Faculty of Engineering and Information Technology, University of Technology Sydney(新南威尔士大学理工学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出基于SSD-Mamba2的视觉-本体感知融合框架,通过端到端强化学习提升运动控制的效率和安全性。

Comments 6 figures and 8 tables. This paper has been accepted by Advanced Engineering Informatics

Journal ref Advanced Engineering Informatics, vol. 71, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02473 2026-02-03 cs.RO cs.LG 62%

HumanX: Toward Agile and Generalizable Humanoid Interaction Skills from Human Videos

HumanX: 向通过人类视频实现敏捷且可推广的人形交互技能迈进

Yinhuai Wang, Qihan Zhao, Yuen Fui Lau, Runyi Yu, Hok Wai Tsui, Qifeng Chen, Jingbo Wang, Jiangmiao Pang, Ping Tan

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 HumanX通过人类视频实现敏捷且可推广的人形交互技能,无需任务特定奖励,展示出高泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01915 2026-02-03 cs.LG cs.AI 62%

VLM-Guided Experience Replay

基于VLM的经验回放

Elad Sharony, Tom Jurgenson, Orr Krupnik, Dotan Di Castro, Shie Mannor

机构 * Nvidia Research(英伟达研究)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用VLMs指导经验回放,提升强化学习中样本效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02649 2026-02-03 cs.RO cs.AI 62%

Effective Online 3D Bin Packing with Lookahead Parcels Using Monte Carlo Tree Search

有效在线三维装箱使用蒙特卡洛树搜索和前瞻性包裹

Jiangyi Fang, Bowen Zhou, Haotian Wang, Xin Zhu, Leye Wang

机构 * Key Lab of High Confidence Software Technologies (Peking University), Ministry of Education China(高可信软件技术重点实验室(北京大学)) Faculty of Computing, Harbin Institute of Technology, Harbin, China(计算机学院,哈尔滨工业大学,哈尔滨,中国) JD Logistic, Beijing, China(京东物流,北京,中国) School of Computer Science, Peking University, Beijing, China(计算机科学学院,北京大学,北京,中国)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于蒙特卡洛树搜索和前瞻性包裹的在线三维装箱方法,通过动态探索先验平衡强化学习策略与稳健随机策略,有效应对物流中的短期分布变化,实现显著的装箱效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14858 2026-02-03 cs.LG cs.AI 62%

1000 Layer Networks for Self-Supervised RL: Scaling Depth Can Enable New Goal-Reaching Capabilities

1000层网络用于自监督强化学习:增加深度可以启用新的目标到达能力

Kevin Wang, Ishaan Javali, Michał Bortkiewicz, Tomasz Trzciński, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学) Warsaw University of Technology(华沙理工大学) Tooploox IDEAS Research Institute(IDEAS研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过增加网络深度至1024层,显著提升自监督强化学习的目标到达能力,实验显示性能提升达2-50倍。

Comments Link to project website: https://wang-kevin3290.github.io/scaling-crl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00401 2026-02-03 cs.RO cs.AI 62%

ZEST: Zero-shot Embodied Skill Transfer for Athletic Robot Control

ZEST:零样本具身技能迁移用于竞技机器人控制

Jean Pierre Sleiman, He Li, Alphonsus Adu-Bredu, Robin Deits, Arun Kumar, Kevin Bergamin, Mohak Bhardwaj, Scott Biddlestone, Nicola Burger, Matthew A. Estrada, Francesco Iacobelli, Twan Koolen, Alexander Lambert, Erica Lin, M. Eva Mungai, Zach Nobles, Shane Rozen-Levy, Yuyao Shi, Jiashun Wang, Jakob Welner, Fangzhou Yu, Mike Zhang, Alfred Rizzi, Jessica Hodgins, Sylvain Bertrand, Yeuhi Abe, Scott Kuindersma, Farbod Farshidian

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 ZEST通过强化学习从多种数据源训练策略,实现零样本具身技能迁移,使机器人能执行复杂动态行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02283 2026-02-03 cs.LG stat.ML 57%

Choice-Model-Assisted Q-learning for Delayed-Feedback Revenue Management

基于选择模型的Q学习用于延迟反馈收益管理

Owen Shen, Patrick Jaillet

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文提出基于选择模型的Q学习方法,用于解决延迟反馈下的收益管理问题,通过部分世界模型提升决策鲁棒性并减少偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01040 2026-02-03 cs.RO 57%

Learning Adaptive Cross-Embodiment Visuomotor Policy with Contrastive Prompt Orchestration

学习适应性跨主体视觉运动策略与对比提示协调

Yuhang Zhang, Chao Yan, Jiaxi Yu, Jiaping Xiao, Mir Feroskhan

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) College of Automation Engineering, Nanjing University of Aeronautics and Astronautics(南京航空航天大学自动化工程学院)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.RO

AI总结 CAPO通过对比提示学习和自适应提示协调,提升跨主体视觉运动策略的适应性和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00452 2026-02-03 cs.LG 57%

Imitation from Observations with Trajectory-Level Generative Embeddings

通过轨迹级生成嵌入进行观察模仿学习

Yongtao Qu, Shangzhe Li, Weitong Zhang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 TGE通过轨迹级生成嵌入解决离线模仿学习中专家数据稀缺的问题,利用时序扩散模型构建平滑奖励,提升离线数据与专家行为间的学习信号。

Comments 25 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10007 2026-02-03 cs.LG math.OC stat.ML 57%

Sample Complexity of Distributionally Robust Average-Reward Reinforcement Learning

分布鲁棒平均奖励强化学习的样本复杂度

Zijun Chen, Shengbo Wang, Nian Si

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出两种算法,实现了分布鲁棒平均奖励强化学习的近最优样本复杂度,通过锚定状态稳定转移核并保证收敛性。

Comments Accepted at NeurIPS 2025. Updated with minor corrections and additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 人机交互与遥操作 4 篇

2602.00494 2026-02-03 cs.HC 82%

SRL Proxemics: Spatial Guidelines for Supernumerary Robotic Limbs in Near-Body Interactions

SRL 亲疏距离:近身交互中冗余机械肢体的空间指南

Hongyu Zhou, Chia-An fan, Yihao Dong, Shuto Takashita, Masahiko Inami, Zhanna Sarsenbayeva, Anusha Withana

专题命中 人机交互与遥操作 :robotic(title,abstract);embodied AI(abstract)

AI总结 本文提出SRL Proxemics框架,通过近身交互实验揭示自主性与空间行为校准对安全性和信任的影响。

Comments Accepted to CHI 2026. Version of Record: DOI 10.1145/3772318.3790532

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08664 2026-02-03 cs.RO cs.AI 73%

A Social Robot with Inner Speech for Dietary Guidance

具有内部言语的社交机器人用于饮食指导

Valerio Belcamino, Alessandro Carfì, Valeria Seidita, Fulvio Mastrogiovanni, Antonio Chella

机构 * TheEngineRoom, Department of Informatics Bioengineering, Robotics and System Engineering, University of Genoa, Genoa, Italy(TheEngineRoom,信息生物工程与机器人系统工程系,热那亚大学,热那亚,意大利) Department of Engineering, University of Palermo, Palermo, Italy(工程系,巴勒莫大学,巴勒莫,意大利)

专题命中 人机交互与遥操作 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一款具备内部言语功能的社交机器人,通过增强透明度和信任度来提供饮食指导,结合大语言模型和知识图谱提升交互效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00493 2026-02-03 cs.HC 67%

One Body, Two Minds: Alternating VR Perspective During Remote Teleoperation of Supernumerary Limbs

一具躯体,两个心智:远程操控超冗余肢体时的交替虚拟现实视角

Hongyu Zhou, Xincheng Huang, Winston Wijaya, Yi Fei Cheng, David Lindlbauer, Eduardo Velloso, Andrea Bianchi, Zhanna Sarsenbayeva, Anusha Withana

专题命中 人机交互与遥操作 :navigation(abstract);robotic(abstract)

AI总结 本文提出两种虚拟现实视角切换方法,通过实验发现嵌入锚定视角支持具身性,离体视角提升导航效率,为远程操控超冗余肢体提供优化方案。

Comments Accepted to CHI 2026. Version of Record: DOI {10.1145/3772318.3791433

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01594 2026-02-03 cs.CV 57%

UV-M3TL: A Unified and Versatile Multimodal Multi-Task Learning Framework for Assistive Driving Perception

UV-M3TL: 一种统一且多功能的多模态多任务学习框架用于辅助驾驶感知

Wenzhuo Liu, Qiannan Guo, Zhen Wang, Wenshuo Wang, Lei Yang, Yicheng Qiao, Lening Wang, Zhiwei Li, Chen Lv, Shanghang Zhang, Junqiang Xi, Huaping Liu

机构 * Energy and Transportation Domain, Beijing Institute of Technology(能源与交通领域,北京理工大学) State Key Laboratory of Intelligent Technology and Systems and Department of Computer Science and Technology, Tsinghua University(智能技术与系统国家重点实验室和清华大学计算机科学与技术系) School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学) School of Transportation Science and Engineering and the State Key Lab of Intelligent Transportation System, Beihang University(交通运输科学与工程学院和智能交通系统国家重点实验室,北京航空航天大学) Beijing University of Chemical Technology(北京化工大学)

专题命中 人机交互与遥操作 :navigation(abstract);分类 cs.CV

AI总结 UV-M3TL通过双分支结构和自适应损失机制,实现多模态多任务学习,提升辅助驾驶感知的性能与多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人数据与评测 21 篇

2506.04842 2026-02-03 cs.RO cs.CV 84%

MineInsight: A Multi-sensor Dataset for Humanitarian Demining Robotics in Off-Road Environments

MineInsight: 一种多传感器数据集用于野外环境的人道主义排雷机器人

Mario Malizia, Charles Hamesse, Ken Hasselmann, Geert De Cubber, Nikolaos Tsiogkas, Eric Demeester, Rob Haelterman

机构 * Royal Military Academy(皇家军事学院) KU Leuven(库尔勒大学) ACRO Research Group(ACRO研究组)

专题命中 机器人数据与评测 :robotics(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 MineInsight数据集通过多传感器和多光谱数据为野外环境的人道主义排雷机器人提供基准测试,包含35种目标和多种视角扫描以提升检测性能。

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 2, pp. 1650-1657, Feb. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏