Staggered Environment Resets Improve Massively Parallel On-Policy Reinforcement Learning
staggered 环境重置提升大规模并行 on-policy 强化学习
机构 * Harvard University(哈佛大学) ; UC San Diego(圣迭戈大学)
AI总结 staggered 环境重置通过增加时间多样性减少非平稳性,提升大规模并行 on-policy 强化学习的样本效率和收敛速度
高校专区
staggered 环境重置提升大规模并行 on-policy 强化学习
机构 * Harvard University(哈佛大学) ; UC San Diego(圣迭戈大学)
AI总结 staggered 环境重置通过增加时间多样性减少非平稳性,提升大规模并行 on-policy 强化学习的样本效率和收敛速度
ACE-F: 一种具有力反馈的跨体折叠系统用于灵巧远程操作
机构 * UC San Diego(加州大学圣地亚哥分校)
AI总结 ACE-F是一种具有力反馈的跨体折叠远程操作系统,通过逆运动学和软控制器流水线实现跨体泛化和精确控制,提升机器人灵巧操作的直观性和效率。
从分数匹配到局部内在维度的一种联系
机构 * PNNL(太平洋西北国家实验室) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; UC San Diego(圣地亚哥大学)
AI总结 本文提出利用去噪分数匹配损失作为局部内在维度估计器,通过理论分析和实验验证其在高维数据中的有效性与可扩展性。
Comments Accepted to the 3rd SPIGM Workshop at NeurIPS 2025
没有被遗漏的请求:通过Medha解决长上下文LLM推理中的异质性
机构 * Microsoft(微软公司) ; Georgia Institute of Technology(佐治亚理工学院) ; UC San Diego(圣地亚哥大学)
AI总结 Medha 通过引入细粒度抢占式调度和新型并行策略,有效解决长上下文LLM推理中的异质性问题,显著提升系统吞吐量和响应效率。