Best Practice Critic Optimization
如何稳定且高效地训练评价模型
机构 * National University of Singapore(新加坡国立大学) ; Tencent Hunyuan(腾讯混元)
AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。
高校专区
如何稳定且高效地训练评价模型
机构 * National University of Singapore(新加坡国立大学) ; Tencent Hunyuan(腾讯混元)
AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。
超越稳定性-探索困境:面向大语言模型策略优化的环境正则化方法
机构 * Alibaba Group(阿里巴巴集团) ; Beijing Normal University(北京师范大学) ; National University of Singapore(新加坡国立大学)
AI总结 该研究针对大语言模型策略优化的稳定性-探索困境,提出ERPO方法,通过查询KL散度正则化输入侧分布,接入现有策略优化流水线,在数学推理基准上实现了更强准确率与更稳定行为。
Comments Accepted to EMNLP 2026 main conference
分子大语言模型智能体:从架构设计到科学自主性
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Shanghai AI Lab(上海人工智能实验室) ; National University of Singapore(新加坡国立大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 该研究提出分子LLM智能体的概念框架,从架构设计和科学自主性阶梯两方面展开,为分子领域LLM智能体的比较、设计评估及部署提供指导。
Comments 25pages
PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试
机构 * National University of Singapore(新加坡国立大学) ; PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) ; Peking Union Medical College Hospital(北京协和医院)
AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。
合作博弈的非线性公理归因
机构 * National University of Singapore(新加坡国立大学) ; University of Waterloo(滑铁卢大学) ; Vector Institute(向量研究所)
AI总结 研究合作博弈中归因问题,受最小核心启发引入一类非线性公理归因方法,该方法产生的贡献向量是特定最小化问题的唯一最优解,实验表明其在包含AUC指标上比仅放宽效率公理的夏普利值变体更有效。
RARM:基于置信度门控的进展奖励建模用于操作中的强化学习
机构 * NUS Human-Centered Robotic Lab(新加坡国立大学人机共融机器人实验室) ; University of Cambridge(剑桥大学) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)
AI总结 提出参考锚定奖励模型(RARM),通过对比时间目标从通用视频中学习,将单个成功演示转化为密集进展奖励,并在部署时通过置信度门控抑制虚假正奖励,在长时域操作任务中显著提升强化学习成功率。
随机异质噪声下特征空间扰动的几何偏差
机构 * Department of Mathematics, Hong Kong University of Science and Technology(香港科技大学数学系) ; Department of Statistics and Data Science, National University of Singapore(新加坡国立大学统计与数据科学系)
AI总结 针对稀疏、异质方差噪声下的信号加噪声矩阵,研究发现经验特征向量存在经典扰动界无法捕捉的系统性几何偏差,并通过二次向量方程和精细各向同性局部律推导了最优非渐近扰动界。
Comments 132 pages, 2 figures. Restructured the paper and added new applications of the main perturbation results
自进化科学智能体发现可泛化的物理推理流体控制
机构 * National University of Singapore(新加坡国立大学)
AI总结 提出一种由大语言模型驱动的自进化科学智能体工作流,通过迭代代码生成和物理仿真诊断,自动构建可解释的控制器,并在欠驱动双关节狗鲨游泳器目标到达任务中实现零样本泛化。
视觉-语言-动作安全性:威胁、挑战、评估与机制
机构 * National University of Singapore(新加坡国立大学) ; Monash University(墨尔本大学) ; Peking University(北京大学)
AI总结 本文探讨了视觉-语言-动作模型的安全性问题,分析了其在训练和推理阶段的威胁与防御机制,总结了评估方法及六个部署领域的安全挑战。
机构 * Tencent Quantum Laboratory(腾讯量子实验室) ; HUN-REN Alfréd Rényi Institute of Mathematics(匈牙利冯·诺依曼数学研究所) ; HUN-REN Institute for Computer Science and Control(匈牙利计算机科学与控制研究所) ; Centre for Quantum Technologies(量子技术中心) ; National University of Singapore(新加坡国立大学) ; CNRS, IRIF, Université Paris Cité(法国国家科学研究中心、IRIF、巴黎Cité大学)
Comments 48 pages, 1 figure. v2: slightly improved results, some proofs and sections rewritten, references added and fixed; v3: a few sections completely rewritten, better stabiliser testing bounds, several typos and inconsistencies fixed
基于景观与搜索行为分析的粒子群优化可解释信息处理
机构 * Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) ; Department of Computer Science, Universidad de Jaén(西班牙Jaén大学计算机科学系) ; School of Computer and Mathematical Sciences, University of Adelaide(阿德莱德大学计算机与数学科学学院) ; Leiden Institute of Advanced Computer Science, University Leiden(莱顿大学先进计算机科学研究所) ; Department of Mathematics and Computing, Dr. B. R. Ambedkar National Institute of Technology(德拉·B·R·阿姆贝卡尔国立理工学院数学与计算系)
AI总结 本研究针对粒子群优化(PSO),提出结合探索性景观分析与搜索轨迹网络的多维度可解释性框架,经24个基准函数实验确立拓扑与参数配置指南,提升了PSO的透明度与可解释性。
Comments 45 pages, 21 figures