EndoWAM: A Grounded World-Action Model for Generalizable Endoscopic Navigation
EndoWAM:用于通用内窥镜导航的基于接地的世界-动作模型
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 EndoWAM是首个用于通用机器人内窥镜导航的世界-动作模型,通过未来接地机制结合轻量型扩散Transformer与离散动作专家,在EndoMotion数据集上优于基线,具强零样本泛化能力。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
EndoWAM:用于通用内窥镜导航的基于接地的世界-动作模型
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 EndoWAM是首个用于通用机器人内窥镜导航的世界-动作模型,通过未来接地机制结合轻量型扩散Transformer与离散动作专家,在EndoMotion数据集上优于基线,具强零样本泛化能力。
SelfWAM:一种用于快速机器人控制的自 grounded 统一世界动作模型
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 SelfWAM是一种基于MoT架构的统一自 grounded WAM,通过联合预测动作等改进机器人控制,在RoboTwin 2.0等实验中提升了策略性能与推理速度。
Vision-TL-Action:基于视觉观测和时序逻辑的神经符号轨迹生成
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 本文提出Vision-TL-Action模型,通过融合视觉与TL节点标记生成动作轨迹,在Panda、AntMaze任务中优于或接近基线,实现无需物体几何信息的视觉到TL目标的轨迹生成。
Comments 17 pages, 15 figures
ZONDA:多楼层环境中具有动态避障功能的零样本目标导航
机构 * Southern University of Science and Technology(南方科技大学) ; Guangdong Direct Drive Technology Limited(广东直驱技术有限公司) ; South China University of Technology(华南理工大学) ; Great Bay University(大湾区大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 研究针对目标导航任务中现有方法局限,提出ZONDA框架,集成启发式多楼层规划、多视图目标验证、动态行人避障三个核心组件,通过真实机器人及模拟测试取得显著改进结果,在动态基准测试中表现优于现有基线。
HyperDCM:用于跨场景连续机器人导航的双曲空间动态集群记忆回放
机构 * Software Engineering Institute, East China Normal University(华东师范大学软件工程学院) ; School of Geospatial Information, Information Engineering University(信息工程大学地理空间信息学院) ; University of Shanghai for Science and Technology(上海理工大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 针对视觉导航持续学习难题,提出HyperDCM,通过场景图建模和记忆回放增强导航。利用视觉语言模型提取三元组,经R-GCN编码投影到双曲空间,采用动态聚类等策略。实验证明其在保留导航能力和泛化性上优于基线。
AC-VLA:通过组合学习实现稳健的分布外动作执行
机构 * Shenzhen Technology University(深圳技术大学) ; Shenzhen University of Advanced Technology(深圳先进技术大学) ; Tongji University(同济大学) ; Great Bay University(大湾区大学)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 研究VLA模型在分布外泛化的问题,提出AC-VLA框架,含组合学习模块和状态条件不对称掩码策略,无需修改架构可集成到VLA主干,在LIBERO和LIBERO-OOD基准测试中,该框架在组合OOD任务上有显著改进,分布内性能良好。
CosFly-VLA:一种用于无人机跟踪的空间感知视觉-语言-动作模型
机构 * Autel Robotics(大疆创新科技有限公司) ; Northeast Normal University(东北师范大学) ; Southern University of Science and Technology(南方科技大学) ; Peking University(北京大学) ; University of Hong Kong(香港大学)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 针对复杂城市环境中无人机动态目标跟踪问题,提出CosFly-VLA模型,通过结构化预测接口联合定位目标、估计可见性并生成飞行动作。经多阶段训练,该模型在开环误差和闭环成功率上有显著提升,实现从可见帧模仿到空间基础动作闭环控制的进展。
盲人与视力正常者语义记忆导航中的熵:视觉经验的影响
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 研究通过属性列举任务及语义熵指标,对比盲人与视力正常者语义记忆导航差异,发现视力正常者抽象概念熵高于具体概念,盲人在视觉突出具体概念上熵更高,强调视觉经验对语义记忆组织和导航的作用。
Comments Cogsci paper 2026
Journal ref Proceedings of the Annual Meeting of the Cognitive Science Society, 48(0), 2026
EDAR:学习用于机器人操作的环境相关动作表示
机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ; Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院智能信息处理上海市重点实验室) ; TeleAI, China Telecom(中国电信天翼人工智能公司)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 研究针对机器人操作中动作表示难的问题,提出EDAR方法,将动作令牌与可执行控制结构和预期视觉后果关联,通过实验证明该方法能改善下游策略学习,突出环境相关动作表示的重要性。
使用具有迭代重新规划的基础模型进行零售商店中的移动操作任务规划
机构 * TCS Research, Tata Consultancy Services Ltd.(塔塔咨询服务公司TCS研究院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 研究零售场景补货问题,利用大语言模型和视觉语言模型,结合定制移动操作平台、用户驱动提示及反馈迭代重新规划方法纠错,在模拟环境验证端到端系统,为零售自动化提供了新的任务规划方案。
直接动作头注入接地3D点实现空间与任务泛化
机构 * National Tsing Hua University(国立清华大学) ; National Yang Ming Chiao Tung University(国立阳明交通大学)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 提出轻量级模块,将3D点表示的接地信号通过自适应层归一化直接注入VLA模型的动作头,在LIBERO-PRO上显著提升空间和任务泛化性能。
PhysReflect-VLA:面向可靠视觉-语言-动作策略的物理可行性与自反思调节
机构 * Xiamen University(厦门大学) ; Aberystwyth University(阿伯里斯特威斯大学)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 提出PhysReflect-VLA框架,通过物理可行性评估和结构化自反思增强VLA策略,在闭环控制中实现稳定多阶段操作,平均成功率提升5.4%。
PAMAE: 面向可靠流匹配视觉-语言-动作策略的相位感知MoE动作专家
机构 * Department of Artificial Intelligence, School of Informatics, Xiamen University(厦门大学信息学院人工智能系) ; Department of Computer Science, Aberystwyth University(阿伯里斯特威斯大学计算机科学系)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 针对多阶段机器人操作中VLA模型动作生成不可靠的问题,提出即插即用的相位感知混合专家动作模块PAMAE,通过稀疏专家混合和相位感知路由提升阶段一致性,在模拟任务中成功率提升9.2%。
有目的的流动:潜在动作引导的流匹配策略用于机器人操作
机构 * École Centrale de Lyon(里昂中央理工学院) ; LIRIS, UMR5205(LIRIS实验室,UMR5205)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 提出潜在动作引导流匹配(LAFM)框架,通过自适应先验分布库替代固定高斯分布,利用潜在动作模型选择结构对齐的初始化,解决流匹配策略中向量场纠缠问题,在真实机器人部署中成功率提升23.4%。
一对二执行:一种面向单臂智能体动作扩展至双臂的新框架
机构 * Chongqing University(重庆大学) ; Xi’an Jiaotong-Liverpool University(西交利物浦大学) ; Lumos Robotics
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)
AI总结 提出ExS2D层次化动作扩展框架,利用单臂监督实现双臂操作,通过时间优先关系提取、子任务引导动作映射和碰撞避免协调规划,在仿真中减少54.4%执行步骤并保持成功率。
Comments 6 pages, 5 figures, 3 tables
基于蒸馏视觉语言可靠性的引导扩散用于空中导航
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 提出一种可靠性感知的扩散规划器,通过蒸馏视觉语言模型生成场景级可靠性热图,引导去噪过程处理不可靠区域,显著降低无人机导航中的障碍物违反率并提高区域可靠性。
通过流反转引导改进机器人通用策略
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 提出流反转引导(FRS)方法,通过逆向流策略找到次优动作的潜在噪声并映射到通用策略的动作模式,提升零样本控制、行为克隆和强化学习效果。
World Pilot: 用世界动作先验引导视觉-语言-动作模型
机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) ; Nanjing University(南京大学) ; Beihang University(北京航空航天大学)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 提出World Pilot框架,通过世界动作模型(WAM)的潜在引导和动作引导两条路径,为VLA模型提供场景演化先验和轨迹级运动提示,在LIBERO-Plus零样本OOD基准上达到84.7%的总成功率,并在多个真实机器人操作任务中取得最高成功率。
Comments Project Website: https://world-pilot.github.io/
弥合智能体-世界鸿沟:面向基于LLM的智能体的文本世界模型
机构 * Southern University of Science and Technology(南方科技大学) ; University of Edinburgh(爱丁堡大学) ; Peking University(北京大学) ; Sun Yat-sen University(中山大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai University of Finance and Economics(上海财经大学) ; Tsinghua University(清华大学) ; The University of Hong Kong(香港大学)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 本文系统综述了面向基于LLM的智能体的文本世界模型,围绕形式化框架和智能体生命周期,涵盖基础定义、构建范式、应用(训练时经验合成与推理时规划、验证、适应)及评估,旨在整合该领域并明确设计空间与开放挑战。
Comments Code: https://github.com/sustech-nlp/awesome-text-world-models