RLMM-Flow: A Flow-based Mobile Manipulation Framework with Latent-Space Reinforcement Learning
RLMM-Flow:一种基于流的隐空间强化学习移动操作框架
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 该研究提出RLMM-Flow框架,结合流策略预训练与隐空间强化学习,在移动操作基准上提升任务成功率等指标,同时保留流的快速推理能力。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
RLMM-Flow:一种基于流的隐空间强化学习移动操作框架
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 该研究提出RLMM-Flow框架,结合流策略预训练与隐空间强化学习,在移动操作基准上提升任务成功率等指标,同时保留流的快速推理能力。
行为-环境信息回路驱动感官导航
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 该研究提出基于传递熵的信息论框架,量化感官与行为的双向信息流,可预测生物与人工系统的导航效率,揭示了驱动导航的通用行为-环境反馈回路。
Comments 14 pages, 6 figures; supplementary information included
Umulsai:一种用于朝鲜正谱记谱法的纯文本格式和浏览器内排版系统
专题命中 GUI与网页智能体 :workflow(abstract)
AI总结 研究针对朝鲜正谱记谱法与西方排版系统不兼容且缺乏实用数字工具的问题,提出了Umulsai编辑器,其核心包含特定纯文本格式、排版引擎和无依赖实现,经专家主导的AI辅助工作流程开发并验证,可实现高质量输出与多种功能。
迈向视觉语言导航的双脑最小充分表示
机构 * Hangzhou Dianzi University(杭州电子科技大学) ; University of Zurich(苏黎世大学) ; University of Exeter(埃克塞特大学)
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 针对视觉语言导航中存在的问题,提出BrainNav框架,包含逻辑锚定模型等三个组件,通过将语义意图与空间感知对齐,提升智能体在复杂任务中的表现,在实验中相比之前最优方法有改进,为鲁棒的视觉语言导航提供有效基础。
ZONDA:多楼层环境中具有动态避障功能的零样本目标导航
机构 * Southern University of Science and Technology(南方科技大学) ; Guangdong Direct Drive Technology Limited(广东直驱技术有限公司) ; South China University of Technology(华南理工大学) ; Great Bay University(大湾区大学)
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 研究针对目标导航任务中现有方法局限,提出ZONDA框架,集成启发式多楼层规划、多视图目标验证、动态行人避障三个核心组件,通过真实机器人及模拟测试取得显著改进结果,在动态基准测试中表现优于现有基线。
Sidekick:与计算机使用代理进行有效多任务通信的设计
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 研究针对计算机使用代理文本反馈问题,开发Sidekick原型系统,在不同交互阶段用多模态反馈传达其状态,经30人参与的研究验证其能显著提升多任务性能,有效支持进度感知等,还展示了应用前景及对人机协作的意义。
G2-Nav:用于机器人社交导航的基于视觉语言的地面与防护代价地图
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 研究针对机器人社交导航问题,提出G2-Nav框架,将VLM语义推理转化为视觉语言代价地图,经开放集感知评估区域和代理,结合语义验证与高频安全检查,实现非结构化环境下安全、高效且符合社会规范的自主导航。
Comments submitted
用于动态视觉语言导航的从慢速推理器到快速规划器的逐令牌潜在流
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; National University of Singapore(新加坡国立大学) ; Zhejiang University(浙江大学)
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 针对动态视觉语言导航中语言推理慢与规划需即时的矛盾,提出SPARK-VLN双系统框架,通过三个模块将慢速VLM推理器知识流到快速规划器,引入新基准套件,提高了导航成功率、社会合规性及推理效率。
在有限标注和导航预算下用于目标检测的具身主动学习
机构 * LAAS-CNRS, Universite de Toulouse, CNRS(法国国家科学研究中心图卢兹分部LAAS、图卢兹大学、法国国家科学研究中心) ; Department of Electrical Engineering and Automation at Aalto University(阿尔托大学电气工程与自动化系)
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 研究在机器人导航和标注预算有限时,如何让目标检测器适应未知环境。核心方法是利用空间一致性选择样本重训检测器,实验表明该方法能在无外部监督下选图,相同预算下适应结束时检测精度最高。
Comments Accepted at 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)
SoftNav:将3D场景令牌注入视觉语言模型以进行具身导航
机构 * Zhejiang University(浙江大学) ; Shandong University(山东大学)
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 研究针对具身导航中3D场景理解与导航推理协同问题,提出SoftNav方法,通过轻量级投影仪将3D连续表示作为软令牌注入VLM隐藏空间,在HM3D-OVON上超越先前方法,且能零样本转移到其他场景,弥合表征差距实现可转移导航。
Comments 8 pages, 6 figures. Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026
xChk:自带身份——基于验证者确定充分性的异构认证
专题命中 GUI与网页智能体 :AI agent(abstract)
AI总结 xChk作为自带身份的参考身份提供商,让用户通过异构证明注册并在OIDC令牌中披露声明,依赖方应用自身策略,支持人工参与高风险操作认证,生产部署实现双边RP评估及特定依赖方登录。
Comments 19 pages, 4 figures. Reference implementation at https://in.xchk.io; one documented RP (crabbyed.com, Appendix B)
AutoPath:学习可转移的目标条件随机路径先验以实现无人类示范的安全导航
机构 * Zhejiang University(浙江大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Ant Group(蚂蚁集团) ; Shanghai Jiao Tong University(上海交通大学) ; Shenzhen University(深圳大学)
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 研究在复杂环境下的安全导航问题,提出学习可转移目标条件随机路径先验的方法,引入规范状态表示和结构化先验学习框架,实验证明该方法成功率高、效率有竞争力且可跨平台转移。
Comments Accepted by IEEE Robotics and Automation Letters (RA-L). 8 pages, 4 figures
在人群中导航:用于人类感知机器人导航的具有社会力动力学的非线性模型预测控制
机构 * Department of Electronics and Telecommunications, Politecnico di Torino(电子与电信系,都灵理工大学) ; School of Engineering, Pablo de Olavide University(工程学院,巴勃罗·德奥拉维德大学)
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 研究针对自主机器人在人群中安全合规导航的挑战,提出基于社会力模型的非线性模型预测控制框架SFM-NMPC,将人类运动预测嵌入优化循环,能联合预测人机轨迹,经测试在社会合规性上优于基线,有效用于现实社会导航。
Comments 9 pages, 7 figures, accepted at IROS 2026
PIER-Flow:用于实时移动机器人导航的物理信息高效整流流
机构 * School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 研究针对移动机器人在复杂环境下导航问题,提出PIER-Flow策略。通过将MPC专家知识融入常微分方程,利用并行潜在采样等实现单步动作生成,经物理信息训练目标及异步架构提升性能,在模拟和实际部署中均取得良好效果,显著加速规划并降低延迟。
基于人工智能的血管内导航的血管几何特征表征
机构 * National Taiwan University Hospital(台湾大学附属医院) ; Chelsea & Westminster Hospital(切尔西和威斯敏斯特医院)
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 研究旨在识别与血管内导航难度相关的血管指标并开发自动化流程,通过分割血管树测量指标,用RL算法导航并分析结果,发现血管几何形状影响导航难度,所提流程为相关评估奠定基础。
Comments Int J CARS (2026)
海报:注意差距——刻画谷歌安全浏览(GSB)与域名系统(DNS)解析之间的时间盲点
专题命中 GUI与网页智能体 :workflow(abstract)
AI总结 研究刻画谷歌安全浏览与DNS解析间时间差距,通过数据包捕获分析发现约79%测量有正时间差距,DNS响应滞后,复杂解析中或有安全隐患,为研究浏览器安全机制中基于时间的风险及缓解措施奠定基础。
Comments To appear in the proceedings of the 23rd Conference on Detection of Intrusions and Malware & Vulnerability Assessment (DIMVA '26)
从视觉语言导航中的区域到达到实例级定位
机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) ; Ruyi Dynamics(如意动力) ; Fudan University(复旦大学) ; Swiss Federal Institute of Technology Lausanne (EPFL)(瑞士洛桑联邦理工学院)
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 研究视觉语言导航中当前评估协议局限,提出‘最后3米定位差距’及指标,构建REALM模块和REVERIE - AIM数据集,可减少过早终止,提升定位精度和视觉定位成功率。
Social-Annotate: 用于标注和收集社交媒体数据的自愈浏览器扩展
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 提出Social-Annotate浏览器扩展,通过注入可定制表单实现在线平台直接数据收集,并集成大语言模型驱动的自愈代理以应对界面变化,支持12个平台,降低数据收集和维护成本。
Comments 13 pages, 3 figures, 1 SI-table, 2 SI-figures
SE(2)导航网格
机构 * Robotic Systems Lab, ETH Zurich(苏黎世联邦理工学院机器人系统实验室)
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 提出SE(2)导航网格,通过编码偏航依赖的可通行性,支持非圆形机器人在复杂多层环境中的高效路径规划,并开发了A*-拉绳-A*分层路径搜索策略。
Comments Project page: https://se2-navmesh.github.io/
基于克里金稀疏测量与障碍推断的智慧港口移动基站定位
专题命中 GUI与网页智能体 :workflow(abstract)
AI总结 提出DOCKING框架,利用普通克里金法重建无线环境图并推断障碍物模型,实现移动集成接入与回传部署优化,在稀疏测量下达到高精度与容量增益。
Comments 15 pages, 14 figures. Submitted to IEEE Open Journal of the Communications Society
LocalNav: 蒸馏前沿视觉语言模型与具身强化学习用于设备端物体目标导航
机构 * Center for Project-Based Learning(项目学习中心) ; Integrated Systems Laboratory(集成系统实验室)
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 提出蒸馏策略将大型VLM的空间语义推理迁移至轻量级本地VLM,结合E-RLVR与令牌生成正则化,在嵌入式设备上实现低延迟物体目标导航。
SurveilNav: 机器人与监控系统协同的目标导航
机构 * Beihang University(北京航空航天大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beijing Jiaotong University(北京交通大学) ; ATeam ; University of Chinese Academy of Sciences(中国科学院大学) ; Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 提出SurveilNav框架,通过主动摄像头调度、联合2D/3D建图、基于VLM的价值估计和协同目标验证,融合机器人动态局部感知与监控全局视图,在HM3D数据集上实现领先的探索效率和导航成功率。
Comments Accepted by ICRA 2026
VisCritic: 视觉状态比较作为GUI智能体的过程奖励
机构 * City University of Hong Kong(香港城市大学)
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 提出VisCritic框架,通过比较操作前后截图在视觉特征空间中的变化来验证GUI智能体动作,结合孪生视觉Transformer和动作感知评判头,无需额外人工标注即可提升多基准测试性能。
Comments 17 pages, 4 figures; ECCV 2026 submission; supplementary material uploaded as ancillary file
来自预训练ViT的每补丁标量实现现实世界快速移动导航
机构 * NaverLabs Europe(NaverLabs欧洲)
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 通过大规模真实世界导航实验,研究预训练视觉编码器在机器人导航中的关键组件,提出异构多教师蒸馏和瓶颈策略,发现可解释特征与可供性关联,并证明仅用RGB训练非最优。
Comments European Conference on Computer Vision -- ECCV 2026
Journal ref European Conference on Computer Vision -- ECCV 2026
UNSEEN: 未知环境中基于稀疏估计的不确定性感知导航
机构 * University of Trento(特伦托大学)
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 提出UNSEEN框架,仅用前视相机通过稀疏地图与位姿不确定性估计,联合优化任务进度与估计精度,在未知环境中实现鲁棒导航,相比现有方法定位误差降低9.8%,估计精度提升45%。
迷失在聚合中:LLM空间导航的多尺度诊断基准
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 提出多尺度诊断基准,将迷宫导航分解为局部、节点和全局三个认知层次,评估LLM在空间推理中的失败位置,发现跨尺度聚合是主要瓶颈。
PolyMerge: 用多面体覆盖压缩3D高斯泼溅以实现可证明安全的资源受限导航
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 提出PolyMerge,将大规模3D高斯泼溅模型转换为凸多面体覆盖,保证覆盖原模型所有障碍物,结合控制障碍函数实现实时安全路径规划,在Crazyflie无人机上验证。
Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 7, pp. 8512-8519, July 2026
缺失的层次:为什么教育科技需要设计时的生成式用户界面,而非仅运行时个性化
专题命中 GUI与网页智能体 :workflow(abstract)
AI总结 针对教育科技中运行时生成式UI导致可访问性不足的问题,提出在创作层采用基于卡片的语义单元编码,由生成式AI在教学设计时生成多种界面表示,经教师验证后交付,实现公平可扩展的适应性教育。
Comments Accepted at the NextGen Learning Interfaces Workshop in AIED 2026
Metis: 一种用于自动驾驶和城市导航的通用高效世界-动作模型
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; The University of Hong Kong(香港大学) ; Tongji University(同济大学) ; Li Auto Inc.(理想汽车) ; Huazhong University of Science and Technology(华中科技大学) ; Imperial College London(伦敦帝国理工学院) ; University of Surrey(萨里大学)
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 提出Metis框架,通过解耦视频生成与动作预测,采用混合专家架构和不对称注意力掩码,实现高效推理与泛化,在多个导航基准上取得最优性能。
通过浏览器可访问的LLM交互得到度/直径问题的新下界
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 通过与ChatGPT交互发现图构造,改进了度/直径问题的下界:N(12,5)≥34,992和N(16,5)≥147,456。