Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
Yiran Guo, Lijie Xu, Jie Liu, Dan Ye, Shuang Qiu
机构
*
Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
City University of Hong Kong(香港城市大学)
TextAtari: 100K Frames Game Playing with Language Agents
Wenhao Li, Wenwu Li, Chuyun Shen, Junjie Sheng, Zixiao Huang, Di Wu, Yun Hua, Wei Yin, Xiangfeng Wang, Hongyuan Zha, Bo Jin
机构
*
Tongji University(同济大学)
;
East China Normal University(华东师范大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Bank of Communications(中国银行)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
Direct Behavior Optimization: Unlocking the Potential of Lightweight LLMs
Hongming Yang, Shi Lin, Jun Shao, Changting Lin, Donghai Zhu, Meng Han, Qinglei Kong
机构
*
Zhejiang Gongshang University(浙江工商大学)
;
Zhejiang University(浙江大学)
;
Binjiang Institute of Zhejiang University(浙江大学滨江研究院)
;
Harbin Institute of Technology(哈尔滨工业大学)
Multi-Turn Reasoning LLMs for Task Offloading in Mobile Edge Computing
面向移动边缘计算的任务卸载的多轮推理LLM
Ning Yang, Chuangxin Cheng, Haijun Zhang
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Machano-Electronic Engineering, Xidian University(西安电子科技大学机电工程学院)
;
School of Computer and Communication Engineering, University of Science and Technology Beijing(北京科技大学计算机与通信工程学院)
OPDSearch+: On-Policy Distillation with RL Refinement for Search-Augmented Reasoning
OPDSearch+:用于搜索增强推理的带RL优化的在线策略蒸馏
Qinglin Ye, Zhiyuan Gu, Jingjie Xia, Yiheng Zhang, Kaiyan Zhao, Shunchao Zheng, Yuhang Mu, Wenchao Du, Yiming Wang
机构
*
University of Chinese Academy of Sciences(中国科学院大学)
;
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
University of Macau(澳门大学)
;
Wuhan University(武汉大学)
;
Georgia Institute of Technology(佐治亚理工学院)
;
Northwestern Polytechnical University(西北工业大学)
;
University of Hong Kong(香港大学)
机构
*
Knight Foundation School of Computing and Information Sciences, Florida International University(佛罗里达国际大学奈特基金会计算与信息科学学院)
;
SRI International(SRI国际公司)
;
University of Florida(佛罗里达大学)
;
Oak Ridge National Laboratory(橡树岭国家实验室)
;
Army Cyber Institute, United States Military Academy(美国军事学院陆军网络研究所)
;
Oakland University(奥克兰大学)
Reinforcing Multi-Turn Reasoning in LLM Agents via Fine-Grained Reward Structure and Credit Assignment
通过细粒度奖励结构与信用分配增强大语言模型智能体的多轮推理能力
Quan Wei, Siliang Zeng, Chenliang Li, Zhongruo Wang, William Brown, Oana Frunza, Wei Deng, Anderson Schneider, Yuriy Nevmyvaka, Yang Katie Zhao, Alfredo Garcia, Mingyi Hong
机构
*
University of Minnesota(明尼苏达大学)
;
Texas A&M University(德克萨斯A&M大学)
;
Prime Intellect
;
Morgan Stanley(摩根大通)