ROSClaw: A Hierarchical Semantic-Physical Framework for Heterogeneous Multi-Agent Collaboration
ROSClaw:一种用于异构多智能体协作的分层语义-物理框架
Rongfeng Zhao, Xuanhao Zhang, Zhaochen Guo, Xiang Shao, Zhongpan Zhu, Bin He, Jie Chen
机构
*
Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院)
;
National Key Laboratory of Autonomous Intelligent Unmanned Systems (Tongji University)(自主智能无人系统全国重点实验室(同济大学))
;
Frontiers Science Center for Intelligent Autonomous Systems(智能自主系统前沿科学中心)
;
Tongji University(同济大学)
;
College of Electronics and Information Engineering, Tongji University(同济大学电子与信息工程学院)
RANGER: A Monocular Zero-Shot Semantic Navigation Framework through Visual Contextual Adaptation
RANGER:通过视觉上下文适应的单目零样本语义导航框架
Ming-Ming Yu, Yi Chen, Börje F. Karlsson, Wenjun Wu
机构
*
Beihang University(北京航空航天大学)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)
AERR-Nav: Adaptive Exploration-Recovery-Reminiscing Strategy for Zero-Shot Object Navigation
AERR-Nav:面向零样本物体导航的自适应探索-恢复-回忆策略
Jingzhi Huang, Junkai Huang, Haoyang Yang, Haoang Li, Yi Wang
机构
*
Hong Kong Polytechnic University(香港理工大学)
;
Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中
GUI与屏幕智能体
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
R2F: Repurposing Ray Frontiers for LLM-free Object Navigation
R2F:利用射线前沿进行无需大语言模型的对象导航
Francesco Argenziano, John Mark Alexis Marcelo, Michele Brienza, Abdel Hakim Drid, Emanuele Musumeci, Daniele Nardi, Domenico D. Bloisi, Vincenzo Suriani
机构
*
Department of Computer, Automation and Management Engineering, Sapienza University of Rome(罗马萨皮恩扎大学计算机、自动化与管理工程系)
;
Department of Electronics and Automation, Mohamed Khider University of Biskra(比斯克拉Mohamed Khider大学电子与自动化系)
;
International University of Rome UNINT, Rome(罗马国际大学UNINT)
机构
*
Dept. of Electrical and Computer Engineering, University of Maryland, College Park, MD, USA(电气与计算机工程系,马里兰大学,College Park, MD, USA)
;
Dept. of Computer Science, University of Maryland, College Park, MD, USA(计算机科学系,马里兰大学,College Park, MD, USA)
;
James Clark School of Engineering, University of Maryland, College Park, MD, USA(James Clark工程学院,马里兰大学,College Park, MD, USA)
Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation
通过执行反馈强化学习训练高阶调度器以实现长周期GUI自动化
Zehao Deng, Tianjie Ju, Zheng Wu, Zhuosheng Zhang, Gongshen Liu
机构
*
School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)
;
School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)
Enhancing Vision-Language Navigation with Multimodal Event Knowledge from Real-World Indoor Tour Videos
通过真实世界室内游览视频的多模态事件知识增强视觉语言导航
Haoxuan Xu, Tianfu Li, Wenbo Chen, Yi Liu, Xingxing Zuo, Yaoxian Song, Haoang Li
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Tsinghua University(清华大学)
;
Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(马尔代夫 bin Zayed 大学人工智能学院)
;
Hangzhou City University(杭州城市学院)
专题命中
GUI与屏幕智能体
:LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV
From Perception to Action: An Interactive Benchmark for Vision Reasoning
从感知到行动:一个交互式基准测试用于视觉推理
Yuhao Wu, Maojia Song, Yihuai Lan, Lei Wang, Zhiqiang Hu, Yao Xiao, Heng Zhou, Weihua Zheng, Dylan Raharja, Soujanya Poria, Roy Ka-Wei Lee
机构
*
Singapore University of Technology(新加坡科技设计大学)
;
Singapore Management University (SMU), Singapore(新加坡管理学院)
;
Nanyang Technological University (NTU), Singapore(南洋理工大学)
;
University of Science(科学大学)
Foundation Models in Autonomous Driving: A Survey on Scenario Generation and Scenario Analysis
自动驾驶中的基础模型:场景生成与场景分析的综述
Yuan Gao, Mattia Piccinini, Yuchen Zhang, Dingrui Wang, Korbinian Moller, Roberto Brusnicki, Baha Zarrouki, Alessio Gambi, Jan Frederik Totz, Kai Storms, Steven Peters, Andrea Stocco, Bassam Alrifaee, Marco Pavone, Johannes Betz
专题命中
GUI与屏幕智能体
:vision-language model(abstract);multimodal large language model(abstract);分类 cs.AI
AI总结
本文综述了基础模型在自动驾驶场景生成与分析中的应用,探讨了相关模型、方法及挑战。
CommentsIEEE Open Journal of Intelligent Transportation Systems
Journal refIEEE Open Journal of Intelligent Transportation Systems, 03 February 2026
A Pragmatist Robot: Learning to Plan Tasks by Experiencing the Real World
务实型机器人:通过体验现实世界学习任务规划
Kaixian Qu, Guowei Lan, René Zurbrügg, Changan Chen, Christopher E. Mower, Haitham Bou-Ammar, Marco Hutter
机构
*
Robotic Systems Lab, ETH Zürich(瑞士联邦理工学院机器人系统实验室)
;
ETH AI Center, ETH Zürich(瑞士联邦理工学院人工智能中心)
;
Huawei Noah’s Ark Lab, London, UK(华为诺亚实验室,伦敦,英国)
;
UCL Centre for AI, London, UK(伦敦大学学院人工智能中心)
What Matters in Building Vision-Language-Action Models for Generalist Robots
在通用机器人中构建视觉-语言-动作模型所关注的关键因素
Xinghang Li, Peiyan Li, Long Qian, Minghuan Liu, Dong Wang, Jirong Liu, Bingyi Kang, Xiao Ma, Xinlong Wang, Di Guo, Tao Kong, Hanbo Zhang, Huaping Liu
机构
*
Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)
;
ByteDance Research(字节跳动研究院)
;
CASIA MAIS-NLPR
;
Shanghai Jiao Tong University(上海交通大学)
;
National University of Singapore(新加坡国立大学)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中
GUI与屏幕智能体
:vision language model(abstract);VLM(abstract);分类 cs.CV