ReCUT: Balancing Reasoning Length and Accuracy in LLMs via Stepwise Trails and Preference Optimization
Zhensheng Jin, Xinze Li, Yifan Ji, Chunyi Peng, Zhenghao Liu, Qi Shi, Yukun Yan, Shuo Wang, Furong Peng, Ge Yu
机构
*
School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院)
;
Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学计算机科学与技术系)
;
Beijing National Research Center for Information Science and Technology, China(北京信息科学与技术国家研究中心)
;
Institute of Big Data Science and Industry/School of Computer and Information Technology, Shanxi University, China(山西大学大数据科学与产业研究院/计算机与信息学院)
专题命中
推理与问题求解
:preference optimization(title);large language model(abstract);language model(abstract);prompting(abstract)
Shapley-Coop: Credit Assignment for Emergent Cooperation in Self-Interested LLM Agents
Yun Hua, Haosheng Chen, Shiqin Wang, Wenhao Li, Xiangfeng Wang, Jun Luo
机构
*
Antai College of Economics and Management, Shanghai Jiao Tong University, Shanghai, China(上海交通大学安泰经济管理学院)
;
School of Computer Science and Technology, East China Normal University, Shanghai, China(华东师范大学计算机科学与技术学院)
;
School of Computer Science and Technology, Tongji University, Shanghai, China(同济大学计算机科学与技术学院)
专题命中
推理与问题求解
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
BEYOND DIALOGUE: A Profile-Dialogue Alignment Framework Towards General Role-Playing Language Model
Yeyong Yu, Runsheng Yu, Haojie Wei, Zhanqiu Zhang, Quan Qian
机构
*
School of Computer Engineering & Science, Shanghai University(上海大学计算机工程与科学学院)
;
LIGHTSPEED
;
The Hong Kong University of Science and Technology(香港科技大学)
专题命中
推理与问题求解
:language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL
R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning
Qingfei Zhao, Ruobing Wang, Dingling Xu, Daren Zha, Limin Liu
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
;
Beijing Normal University(北京师范大学)
专题命中
推理与问题求解
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
机构
*
Joint NTU-UBC Research Centre of Excellence in Active Living for the Elderly (LILY), NTU(联合NTU-UBC老龄化积极生活卓越研究中心(LILY),NTU)
;
College of Computing and Data Science, Nanyang Technological University (NTU), Singapore(计算与数据科学学院,南洋理工大学(NTU),新加坡)
;
Tan Tock Seng Hospital, Singapore(坦 tok sing 医院,新加坡)
;
Woodlands Health, Singapore(伍德兰兹健康,新加坡)
专题命中
推理与问题求解
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
LAMARL: LLM-Aided Multi-Agent Reinforcement Learning for Cooperative Policy Generation
Guobin Zhu, Rui Zhou, Wenkang Ji, Shiyu Zhao
机构
*
School of Automation Science and Electrical Engineering, Beihang University(自动化科学与电气工程学院,北京航空航天大学)
;
WINDY Lab, Department of Artificial Intelligence, Westlake University(WINDY实验室,人工智能学院,西湖大学)
专题命中
推理与问题求解
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
CommentsAccepted by IEEE Robotics and Automation Letters
机构
*
Om AI Research(Om AI研究机构)
;
Binjiang Institute of Zhejiang University(浙江大学滨江学院)
;
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中
推理与问题求解
:language agent(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
GuardAgent: Safeguard LLM Agents by a Guard Agent via Knowledge-Enabled Reasoning
Zhen Xiang, Linzhi Zheng, Yanjie Li, Junyuan Hong, Qinbin Li, Han Xie, Jiawei Zhang, Zidi Xiong, Chulin Xie, Carl Yang, Dawn Song, Bo Li
机构
*
University of Georgia(佐治亚大学)
;
University of Chicago(芝加哥大学)
;
UIUC(伊利诺伊大学香槟分校)
;
University of Texas at Austin(德克萨斯大学奥斯汀分校)
;
University of California, Berkeley(加州大学伯克利分校)
;
Emory University(埃默里大学)
;
Virtue AI
专题命中
推理与问题求解
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG