SpeedAug: Policy Acceleration via Tempo-Enriched Policy and RL Fine-Tuning
SpeedAug: 通过节奏增强策略和强化学习微调实现策略加速
机构 * KAIST(韩国科学技术院) ; UNIST(全南大学) ; DeepAuto.ai
AI总结 提出SpeedAug框架,通过节奏增强先验策略和强化学习微调,使机器人策略学习任务最优执行节奏,在保持高成功率的同时显著提升执行速度和样本效率。
高校专区
SpeedAug: 通过节奏增强策略和强化学习微调实现策略加速
机构 * KAIST(韩国科学技术院) ; UNIST(全南大学) ; DeepAuto.ai
AI总结 提出SpeedAug框架,通过节奏增强先验策略和强化学习微调,使机器人策略学习任务最优执行节奏,在保持高成功率的同时显著提升执行速度和样本效率。
T1:小语言模型测试时计算扩展的工具集成验证
机构 * KAIST(韩国科学技术院) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; KRAFTON
AI总结 针对小语言模型在测试时扩展中验证能力不足的问题,提出T1框架,通过外部工具过滤候选输出后由小语言模型进行最终验证,显著提升验证准确率和测试时扩展性能。
Comments ICLR 2026