Learning at the Right Pace: Adaptive Data Scheduling Improves LLM Reinforcement Learning
以合适的速度学习:自适应数据调度改进大语言模型强化学习
Zicheng Xu, Ruixuan Zhang, Yu-Neng Chuang, Xiuyi Lou, Hoang Anh Duy Le, Oren Gal, Alexander S. Szalay, Zhaozhuo Xu, Guanchu Wang, Vladimir Braverman
机构
*
Johns Hopkins University(约翰霍普金斯大学)
;
Rice University(莱斯大学)
;
University of Haifa(海法大学)
;
Workato
;
University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)
SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs
SPOT-E:基于视觉聚光灯的冻结VLM测试时熵整形
Bo Yin, Xiaobin Hu, Chengming Xu, Ruolin Shen, Mo Yang, Jiangning Zhang, Peng-Tao Jiang, Cheng Tan, Shuicheng Yan
机构
*
National University of Singapore(新加坡国立大学)
;
Fudan University(复旦大学)
;
Technical University of Munich(慕尼黑工业大学)
;
Sagenic Tech
;
Zhejiang University(浙江大学)
;
vivo
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
SkillRevise: Improving LLM-Authored Agent Skills via Trace-Conditioned Skill Revision
SkillRevise: 通过轨迹条件技能修订改进LLM撰写的智能体技能
Yuxuan Liu, Zhaochen Su, Lingyun Xie, Yuhao Zhang, Qing Zong, Jiahe Guo, Zhongwei Xie, Yiyan Ji, Yauwai Yim, Hongyu Luo, Xiyu Ren, Ruan Chenyu, Haoran Li, Yangqiu Song
机构
*
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
Nanjing University(南京大学)
;
The University of Hong Kong(香港大学)
机构
*
Florida International University(佛罗里达国际大学)
;
Boston University(波士顿大学)
;
Department of Computer Science and Engineering, Indian Institute of Technology Patna(印度帕纳吉印度理工学院计算机科学与工程系)
Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence Calibration and Risk-Controlled Refusal
大型语言模型中的可信不确定性:置信度校准与风险控制拒绝的统一框架
Markus Oehri, Giulia Conti, Kaviraj Pather, Alexandre Rossi, Laia Serra, Adrian Parody, Rogvi Johannesen, Aviaja Petersen, Arben Krasniqi
机构
*
University of Liechtenstein(列支敦士登大学)
;
University of the Republic of San Marino(圣马尔科共和国大学)
;
University of Mauritius(毛里求斯大学)
;
International University of Monaco(摩纳哥国际大学)
;
University of Andorra(安道尔大学)
;
University of Gibraltar(直布罗陀大学)
;
University of the Faroe Islands(法罗群岛大学)
;
Ilisimatusarfik (University of Greenland)(格陵兰岛研究所(格陵兰大学))
;
University of Prizren(普里兹伦大学)
机构
*
School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算与信息系统学院)
;
SensiLab, Monash University, Australia(蒙纳士大学SensiLab)
Pushing the Limits of LLM Tool Calling via Experiential Knowledge Integration and Activation
通过经验知识集成与激活推动LLM工具调用极限
Yupu Hao, Zhuoran Jin, Huanxuan Liao, Kang Liu, Jun Zhao
机构
*
The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)