arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

2026-08-26 至 2026-08-26 共收录 11
2608.23566 2026-08-26 cs.LG cs.AI cs.CL 版本更新

Best Practice Critic Optimization

如何稳定且高效地训练评价模型

Penghui Qi, Xiangxin Zhou, Wee Sun Lee

机构 * National University of Singapore(新加坡国立大学) Tencent Hunyuan(腾讯混元)

AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23311 2026-08-26 cs.CL 版本更新

Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization

超越稳定性-探索困境:面向大语言模型策略优化的环境正则化方法

Xianlei Zhou, Xiangdi Meng, Yu He, Tianyu Qi, Shuyan Guan, Xianli Zhang, Jian Zhang, Xin Li, Qika Lin, Jun Liu

机构 * Alibaba Group(阿里巴巴集团) Beijing Normal University(北京师范大学) National University of Singapore(新加坡国立大学)

AI总结 该研究针对大语言模型策略优化的稳定性-探索困境,提出ERPO方法,通过查询KL散度正则化输入侧分布,接入现有策略优化流水线,在数学推理基准上实现了更强准确率与更稳定行为。

Comments Accepted to EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23104 2026-08-26 cs.CL cs.AI 版本更新

Molecular LLM Agents: From Architectural Design to Scientific Autonomy

分子大语言模型智能体:从架构设计到科学自主性

Jiatong Li, Wengyu Zhang, Weida Wang, Yuxuan Ren, Wei Liu, Chenyang Mao, Yuqiang Li, Yatao Bian, Changmeng Zheng, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究提出分子LLM智能体的概念框架,从架构设计和科学自主性阶梯两方面展开,为分子领域LLM智能体的比较、设计评估及部署提供指导。

Comments 25pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19261 2026-08-26 cs.CV cs.AI 版本更新

EviPathBench: Benchmarking Evidence Acquisition and Reasoning in Vision-Language Models for Whole-Slide Pathology

PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试

Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peking Union Medical College Hospital(北京协和医院)

AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09869 2026-08-26 cs.LG 版本更新

Nonlinear Axiomatic Attribution for Cooperative Games

合作博弈的非线性公理归因

Weida Li, Zhuanghua Liu, Yaoliang Yu, Bryan Kian Hsiang Low

机构 * National University of Singapore(新加坡国立大学) University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

AI总结 研究合作博弈中归因问题,受最小核心启发引入一类非线性公理归因方法,该方法产生的贡献向量是特定最小化问题的唯一最优解,实验表明其在包含AUC指标上比仅放宽效率公理的夏普利值变体更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22027 2026-08-26 cs.RO cs.AI 版本更新

RARM: Confidence-Gated Progress Reward Modeling for RL in Manipulation

RARM:基于置信度门控的进展奖励建模用于操作中的强化学习

Pengzhi Yang, Xinyu Wang, Pengyu Jing, Kehan Wen, Yiduo Qu, Zhenhao Huang, Minghao Fu, Xin Liu, Yaheng Shen, Fan Shi

机构 * NUS Human-Centered Robotic Lab(新加坡国立大学人机共融机器人实验室) University of Cambridge(剑桥大学) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

AI总结 提出参考锚定奖励模型(RARM),通过对比时间目标从通用视频中学习,将单个成功演示转化为密集进展奖励,并在部署时通过置信度门控抑制虚假正奖励,在长时域操作任务中显著提升强化学习成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11263 2026-08-26 math.ST cs.LG math.NA math.PR 版本更新

Geometric bias in eigenspace perturbation under random heterogeneous noise

随机异质噪声下特征空间扰动的几何偏差

Fengkai Liu, Ke Wang, Wanjie Wang

机构 * Department of Mathematics, Hong Kong University of Science and Technology(香港科技大学数学系) Department of Statistics and Data Science, National University of Singapore(新加坡国立大学统计与数据科学系)

AI总结 针对稀疏、异质方差噪声下的信号加噪声矩阵,研究发现经验特征向量存在经典扰动界无法捕捉的系统性几何偏差,并通过二次向量方程和精细各向同性局部律推导了最优非渐近扰动界。

Comments 132 pages, 2 figures. Restructured the paper and added new applications of the main perturbation results

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08405 2026-08-26 cs.AI physics.flu-dyn 版本更新

Self-Evolving Scientific Agent Designs Physically-Reasoned Whitebox Fluid Control

自进化科学智能体发现可泛化的物理推理流体控制

Boai Sun, Wenjin Guo, Zongmin Yu, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

AI总结 提出一种由大语言模型驱动的自进化科学智能体工作流,通过迭代代码生成和物理仿真诊断,自动构建可解释的控制器,并在欠驱动双关节狗鲨游泳器目标到达任务中实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23775 2026-08-26 cs.RO 版本更新

Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms

视觉-语言-动作安全性:威胁、挑战、评估与机制

Qi Li, Bo Yin, Weiqi Huang, Ruhao Liu, Bojun Zou, Runpeng Yu, Jingwen Ye, Weihao Yu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Monash University(墨尔本大学) Peking University(北京大学)

AI总结 本文探讨了视觉-语言-动作模型的安全性问题,分析了其在训练和推理阶段的威胁与防御机制,总结了评估方法及六个部署领域的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06848 2026-08-26 quant-ph cs.CC cs.DS cs.LG 版本更新

Reconquering Bell sampling on qudits: stabilizer learning and testing, quantum pseudorandomness bounds, and more

Jonathan Allcock, Joao F. Doriguello, Gábor Ivanyos, Miklos Santha

机构 * Tencent Quantum Laboratory(腾讯量子实验室) HUN-REN Alfréd Rényi Institute of Mathematics(匈牙利冯·诺依曼数学研究所) HUN-REN Institute for Computer Science and Control(匈牙利计算机科学与控制研究所) Centre for Quantum Technologies(量子技术中心) National University of Singapore(新加坡国立大学) CNRS, IRIF, Université Paris Cité(法国国家科学研究中心、IRIF、巴黎Cité大学)

Comments 48 pages, 1 figure. v2: slightly improved results, some proofs and sections rewritten, references added and fixed; v3: a few sections completely rewritten, better stabiliser testing bounds, several typos and inconsistencies fixed

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15741 2026-08-26 cs.NE cs.CL cs.MA 版本更新

Explainable Information Processing in Particle Swarm Optimization through Landscape and Search Behavior Analysis

基于景观与搜索行为分析的粒子群优化可解释信息处理

Nitin Gupta, Bapi Dutta, Anupam Yadav

机构 * Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) Department of Computer Science, Universidad de Jaén(西班牙Jaén大学计算机科学系) School of Computer and Mathematical Sciences, University of Adelaide(阿德莱德大学计算机与数学科学学院) Leiden Institute of Advanced Computer Science, University Leiden(莱顿大学先进计算机科学研究所) Department of Mathematics and Computing, Dr. B. R. Ambedkar National Institute of Technology(德拉·B·R·阿姆贝卡尔国立理工学院数学与计算系)

AI总结 本研究针对粒子群优化(PSO),提出结合探索性景观分析与搜索轨迹网络的多维度可解释性框架,经24个基准函数实验确立拓扑与参数配置指南,提升了PSO的透明度与可解释性。

Comments 45 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏