When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents
当较低权限足够时:探究LLM代理中的过度权限工具选择
Kaiyue Yang, Yuyan Bu, Jingwei Yi, Yuchi Wang, Biyu Zhou, Juntao Dai, Songlin Hu, Yaodong Yang
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
The Chinese University of Hong Kong(香港中文大学)
;
Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO
理解用于大语言模型推理的进化策略:比GRPO更广泛的推理覆盖范围
Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong, Mingxuan Yuan, Zhichao Lu, Xuyang Wu, Zhenkun Wang
机构
*
Southern University of Science and Technology(南方科技大学)
;
National University of Singapore(新加坡国立大学)
;
Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海))
;
Huawei Noah’s Ark Lab(华为诺亚方舟实验室)
;
City University of Hong Kong(香港城市大学)
专题命中
后训练与偏好优化
:LLM(title,summary_cn);large language model(abstract_cn);language model(abstract_cn);post-training(abstract)
RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning
RolloutPipe: 分离式在线策略LLM强化学习中的流水线化Rollout与训练重叠
Rongjian Chen, Jianmin Hu, Kejiang Ye, Minxian Xu
机构
*
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Southern University of Science and Technology(南方科技大学)
专题命中
后训练与偏好优化
:LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
Learning at the Right Pace: Adaptive Data Scheduling Improves LLM Reinforcement Learning
以合适的速度学习:自适应数据调度改进大语言模型强化学习
Zicheng Xu, Ruixuan Zhang, Yu-Neng Chuang, Xiuyi Lou, Hoang Anh Duy Le, Oren Gal, Alexander S. Szalay, Zhaozhuo Xu, Guanchu Wang, Vladimir Braverman
机构
*
Johns Hopkins University(约翰霍普金斯大学)
;
Rice University(莱斯大学)
;
University of Haifa(海法大学)
;
Workato
;
University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)
专题命中
后训练与偏好优化
:LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)
BayLing-Duplex: Native Full-Duplex Speech Dialogue with a Single Autoregressive LLM
BayLing-Duplex: 单一自回归LLM的原生全双工语音对话
Qingkai Fang, Shoutao Guo, Yang Feng
机构
*
Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(中国科学院计算技术研究所智能信息处理重点实验室)
;
Key Laboratory of AI Safety, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室)
;
University of Chinese Academy of Sciences(中国科学院大学)
Distilled Reinforcement Learning for LLM Post-training
用于大语言模型训练后处理的蒸馏强化学习
Chen Wang, Zhaochun Li, Jionghao Bai, Yining Zhang, Hexuan Deng, Ge Lan, Yue Wang
机构
*
College of Elite Engineers, Nankai University(南开大学精英工程师学院)
;
Zhongguancun Academy(中关村学院)
;
Beijing Institute of Technology(北京理工大学)
;
Zhejiang University(浙江大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
College of Software, Nankai University(南开大学软件学院)
专题命中
后训练与偏好优化
:LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)
机构
*
University of Chicago(芝加哥大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Stanford University(斯坦福大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Meituan(美团)
机构
*
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)
;
School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)
;
School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院)
;
School of Mathematical Sciences, Peking University(北京大学数学科学学院)
专题命中
后训练与偏好优化
:large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);post-training(abstract)
机构
*
National Engineering Research Center of Software Engineering, Peking University(北京大学软件工程国家工程研究中心)
;
School of Computer Science, Peking University(北京大学计算机学院)
;
Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室)
;
Peking University Information Technology Institute, Tianjin Binhai(北京大学滨海信息技术研究院)
;
Research Institute, GRGBanking Equipment Co., Ltd.(广电运通金融电子股份有限公司研究院)