arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

2026-08-31 至 2026-08-31 共收录 5
2608.27351 2026-08-31 cs.LG 版本更新

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO

理解用于大语言模型推理的进化策略:比GRPO更广泛的推理覆盖范围

Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong, Mingxuan Yuan, Zhichao Lu, Xuyang Wu, Zhenkun Wang

机构 * Southern University of Science and Technology(南方科技大学) National University of Singapore(新加坡国立大学) Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) City University of Hong Kong(香港城市大学)

AI总结 本文研究用于LLM推理的进化策略(ES),发现ES比GRPO有更广泛的推理覆盖范围,开发了结合两者优势的GRPO-ES策略,还揭示了ES的功能稀疏性等特性,确立其为独特的推理后训练范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07248 2026-08-31 math.OC cs.LG 版本更新

Establishing Boundary KKT Convergence of Mirror Descent through Reparameterization

通过重参数化建立镜像下降法的边界KKT收敛性

Kuangyu Ding, Kim-Chuan Toh

机构 * School of Industrial Engineering, Purdue University(普渡大学工业工程学院) National University of Singapore(新加坡国立大学)

AI总结 本文通过度量扁平化重参数化S,证明镜像下降法在非凸问题中可收敛到KKT点,还将该框架应用于Shannon熵等示例,为后续扩展Bregman型方法奠定基础。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26423 2026-08-31 cs.HC cs.RO 版本更新

FleetScape: A Mixed Reality Sandtable for Spatial Supervision and Control of Scalable Drone Fleets

FleetScape:用于可扩展无人机机群空间监督与控制的混合现实沙盘

Peisen Xu, Jérémie Garcia, Peter Cleveland, Wei Tsang Ooi, Christophe Jouffrais

机构 * University of Toulouse, Fédération ENAC ISAE-SUPAERO ONERA(图卢兹大学、法国航空航天学校联合会、高等航空航天学院、法国航空航天研究院) CNRS, IPAL(法国国家科学研究中心、IPAL机构) National University of Singapore(新加坡国立大学) National University of Singapore, Augmented Human Lab(新加坡国立大学增强人类实验室) National University of Singapore, School of Computing(新加坡国立大学计算机学院)

AI总结 该研究提出混合现实沙盘系统FleetScape,通过空间交互优化无人机机群监督,经用户研究验证其对态势感知和控制切换的作用,同时得出相关设计启示。

Comments UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05122 2026-08-31 cs.CL 版本更新

Self-Evaluation Is Already There: Eliciting Latent Judge Calibration in Base LLMs with Minimal Data

自我评估已然存在:用最少数据激发基础LLM中的潜在评判校准

XiuYu Zhang, Yi Shan, Junfeng Fang, Zhenkai Liang

机构 * National University of Singapore(新加坡国立大学) Beijing University of Technology(北京理工大学)

AI总结 本文提出自我评估激发(SEE)方法,通过少量数据(160个示例)结合校准耦合强化学习和掩码蒸馏,激发基础LLM中已有的预测外部评判者评分能力,在保持答案质量的同时显著提升校准性能。

Comments Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12340 2026-08-31 stat.ML cs.LG 版本更新

Online Learning-to-Defer with Varying Experts

在线学习延迟决策与变化专家

Dang Hoang Duy, Yannis Montreuil, Maxime Meyer, Axel Carlier, Lai Xing Ng, Wei Tsang Ooi

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Fédération ENAC ISAE-SUPAERO ONERA, Université de Toulouse, France(法国图卢兹大学ENAC ISAE-SUPAERO ONERA联合体) Institute for Infocomm Research, A*STAR , Singapore(新加坡A*STAR信息通信研究所) IPAL, IRL 2955, Singapore(新加坡IPAL实验室) Department of Mathematics, National University of Singapore(新加坡国立大学数学系)

AI总结 针对动态专家池和流式数据,提出首个在线学习延迟决策算法,利用H-一致性界和在线凸优化实现遗憾界保证。

详情

展开后加载摘要…

URL PDF HTML 收藏