RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training
RTPO:用于稳定智能体强化学习训练的反向回合策略优化
Yugu Li, Jimmy Cao, Jianglin Qiao, Siyi Hu
机构
*
Adelaide University(阿德莱德大学)
;
The University of Sydney(悉尼大学)
;
Curtin University(科廷大学)
;
School of CSIT(计算机科学与信息技术学院)
;
ACFR(澳大利亚空间研究中心)
;
School of EECMS(电子工程、计算机与数学科学学院)
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Shanghai Jiao Tong University(上海交通大学)
;
Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)
;
The University of Hong Kong(香港大学)
;
INFIFORCE
;
University of Science and Technology of China(中国科学技术大学)
;
Peking University(北京大学)
MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning
MedClaw:用于长程手术视频推理的启发式智能体框架
Yingying Fan, Penghui Du, Leyan Zhu, Runze He, Zimeng Wu, Yuxuan Zhang, Liang Chen, Jiahao Xie, Jiangtang Wang, Shuai Shao, Anchao Yang, Yutong Bai, Yan Wang
机构
*
School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院)
;
University of Maryland(马里兰大学)
;
Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院)
;
University of British Columbia(不列颠哥伦比亚大学)
;
Beijing Tiantan Hospital, Capital Medical University(首都医科大学附属北京天坛医院)