SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning
SRPO:用于长程推理的自反思策略优化
Jialong Liu, Yuling Shi, Ning Yang, Xiaodong Gu, Zuchao Li
机构
*
School of artificial intelligence, Wuhan University(武汉大学人工智能学院)
;
School of computer science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)
;
Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI
CommentsExtended version of the paper accepted at DAC 2026. Extends the conference version with evaluations on AIME 2024 and GPQA-Diamond and a prediction-oracle upper-bound analysis
机构
*
Knight Foundation School of Computing and Information Sciences, Florida International University(佛罗里达国际大学奈特基金会计算与信息科学学院)
;
SRI International(SRI国际公司)
;
University of Florida(佛罗里达大学)
;
Oak Ridge National Laboratory(橡树岭国家实验室)
;
Army Cyber Institute, United States Military Academy(美国军事学院陆军网络研究所)
;
Oakland University(奥克兰大学)
An Automated Framework for Extracting Reachable Attack Chains from Cyber Threat Intelligence Reports
一种从网络威胁情报报告中提取可达攻击链的自动化框架
Wenbo Hou, Ning Hu, Xueping Wang, Jiahao Gu, Wenjian Luo
机构
*
Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies(广东新型安全情报技术重点实验室)
;
School of Computer Science and Technology(计算机科学与技术学院)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
New Network Research Department(新网络研究部)
;
Peng Cheng Laboratory(鹏城实验室)
;
Great Bay University(大湾区大学)
专题命中
推理与问题求解
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI