arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Imperial College London(帝国理工学院)

2026-08-26 至 2026-08-26 共收录 3
2608.24479 2026-08-26 cs.LG 新提交

WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation

WarpSAC:通过重新思考探索与利用,迈向可拓展离线强化学习的顶峰

Zihao Wu, Hongyao Tang, Yi Ma, Huizhong Song, Pengyi Li, Yifu Yuan, Fei Ni, Jinyi Liu, Wei Wei, Jianrong Wang, Yan Zheng, Jianye Hao

机构 * Tianjin University(天津大学) Shanxi University(山西大学) Imperial College London(伦敦帝国学院)

AI总结 该研究针对大规模并行模拟下离线RL的数据 regime 变化问题,提出具 regime 感知的WarpSAC算法家族,适配不同数据规模场景,在多基准任务及现实部署上较FlashSAC实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22008 2026-08-26 cs.RO 版本更新

Stakeholder Insights for Designing In-Home Social Robots for Dementia Disorientation Detection and Caregiver-Aware Intervention

面向痴呆定向障碍检测与护理者感知干预的家庭社交机器人设计的利益相关者见解

Emmanuel Akinrintoyo, Nicole Salomons

机构 * Imperial College London(帝国理工学院)

AI总结 该研究通过对14名痴呆护理相关人员访谈,明确了居家社交机器人设计需融入日常作息、提供情境化定向支持等关键方向,以辅助痴呆患者定向障碍检测与干预。

Comments 6

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02605 2026-08-26 cs.AI 版本更新

Adaptive GR(1) Specification Repair for Liveness-Preserving Shielding in Reinforcement Learning

自适应GR(1)规范修复用于强化学习中的存活保持防护

Tiberiu-Andrei Georgescu, Alexander W. Goodall, Dalal Alrajeh, Francesco Belardinelli, Sebastian Uchitel

机构 * Imperial College London(伦敦帝国理工学院) Universidad de Buenos Aires(布宜诺斯艾利斯大学)

AI总结 本文提出基于GR(1)规范的自适应防护框架,通过在线修复规范实现环境假设违反时的安全与存活保持。

Comments Accepted at NeSy 2026

详情

展开后加载摘要…

URL PDF HTML 收藏