arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Cambridge(剑桥大学)

2026-08-25 至 2026-08-25 共收录 3
2606.22027 2026-08-25 cs.RO cs.AI 版本更新

RARM: Confidence-Gated Progress Reward Modeling for RL in Manipulation

RARM:基于置信度门控的进展奖励建模用于操作中的强化学习

Pengzhi Yang, Xinyu Wang, Pengyu Jing, Kehan Wen, Yiduo Qu, Zhenhao Huang, Minghao Fu, Xin Liu, Yaheng Shen, Fan Shi

机构 * NUS Human-Centered Robotic Lab(新加坡国立大学人机共融机器人实验室) University of Cambridge(剑桥大学) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

AI总结 提出参考锚定奖励模型(RARM),通过对比时间目标从通用视频中学习,将单个成功演示转化为密集进展奖励,并在部署时通过置信度门控抑制虚假正奖励,在长时域操作任务中显著提升强化学习成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20197 2026-08-25 cs.RO 版本更新

Stable Transformer-Actor-Critic Model Predictive Control: A Contraction Analysis Approach

稳定的Transformer-Actor-Critic模型预测控制:一种收缩分析方法

Antonio Marino (CAM), Valerio Modugno (UCL), Marco Cognetti (LAAS)

机构 * University of Cambridge(剑桥大学) University College London(伦敦大学学院) LAAS-CNRS(Laas--cnrs)

AI总结 提出一种Transformer-Actor-Critic MPC架构,通过证明Transformer满足增量输入-状态稳定性并利用黎曼收缩理论分析互联动力学,将理论界作为训练正则化项,实现可证明鲁棒的控制策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01841 2026-08-25 cs.AI 版本更新

Retrieval-aligned Tabular Foundation Models Enable Robust Clinical Risk Prediction in Electronic Health Records Under Real-world Constraints

检索对齐的表格基础模型实现电子健康记录中在现实约束下的稳健临床风险预测

Minh-Khoi Pham, Thang-Long Nguyen Ho, Thao Thi Phuong Dao, Tai Tan Mai, Minh-Triet Tran, Marie E. Ward, Una Geary, Rob Brennan, Nick McDonald, Martin Crane, Marija Bezbradica

机构 * University of Cambridge(剑桥大学)

AI总结 针对电子健康记录中高维、异质、类别不平衡和分布偏移等挑战,提出任务对齐检索框架AWARE,通过监督嵌入学习和轻量适配器提升表格上下文学习性能,在极端不平衡下AUPRC提升高达12.2%。

Comments Not peer-reviewed. Under revision

详情

展开后加载摘要…

URL PDF HTML 收藏