Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration
为大语言模型高效强化学习引入内在探索
机构 * National University of Singapore(新加坡国立大学) ; Ant Group(蚂蚁集团)
AI总结 PREPO通过利用内在数据属性提升大语言模型强化学习的数据效率,减少回放需求同时保持性能。
高校专区
为大语言模型高效强化学习引入内在探索
机构 * National University of Singapore(新加坡国立大学) ; Ant Group(蚂蚁集团)
AI总结 PREPO通过利用内在数据属性提升大语言模型强化学习的数据效率,减少回放需求同时保持性能。
BadCLIP++: 多模态对比学习中隐蔽且持久的后门
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) ; School of Computing, National University of Singapore(新加坡国立大学计算机学院)
AI总结 BadCLIP++通过语义融合触发器和参数稳定技术,实现了多模态对比学习中隐蔽且持久的后门攻击,实验显示其在低污染率下具有高攻击成功率。
Comments 25 pages, 10 figures
通过增强现实的刚-柔机器人协同实现人机交互抓取
机构 * Advanced Robotics Centre (ARC), National University of Singapore (NUS)(先进机器人中心(ARC),新加坡国立大学) ; Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR)(高性能计算研究所(IHPC),科技研究局(A*STAR)) ; Chair of Cognitive Systems, Technical University of Munich (TUM)(认知系统教授职位,慕尼黑技术大学) ; Singapore-MIT Alliance for Research and Technology (SMART) Centre(新加坡-麻省理工联合研究技术中心) ; Computer Science and Artificial Intelligence Lab (CSAIL), Massachusetts Institute of Technology(计算机科学与人工智能实验室(CSAIL),麻省理工学院)
AI总结 本文提出了一种基于增强现实的物理人机交互框架,通过虚拟与现实的协同实现混合刚柔机器人的远程操作与抓取任务。
Comments Camera-ready version for RoboSoft 2026. 8 pages, 6 figures
数据与模型配置的协同优化:大语言模型的鸡与蛋困境
机构 * National University of Singapore(新加坡国立大学) ; Agency for Science, Technology and Research (A*STAR)(科技研究局)
AI总结 JoBS通过联合优化数据和模型配置,利用性能预测器提升大语言模型训练效率,有效降低优化成本。