arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

2026-08-25 至 2026-08-25 共收录 17
2608.23566 2026-08-25 cs.LG cs.AI cs.CL 新提交

How to Train a Critic Stably and Efficiently

如何稳定且高效地训练评价模型

Penghui Qi, Xiangxin Zhou, Wee Sun Lee

机构 * National University of Singapore(新加坡国立大学) Tencent Hunyuan(腾讯混元)

AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23525 2026-08-25 cs.AI 新提交

EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards

EarthVerse:面向动态地球系统与自然灾害的科学智能体基准测试

Zhiqing Cui, Xinxiang Yin, Yihong Tang, Xinglang Zhang, Yuanzhe Hu, Siru Zhong, Weidong Tang, Yuxuan Liang, Weijia Li, Ming Jin, Shirui Pan, Yuhao Kang, Dingyi Zhuang, Jinhua Zhao

机构 * NUIST(南京信息工程大学) HKU(香港大学) McGill(麦吉尔大学) HKUST(GZ)(香港科技大学(广州)) Georgia Tech(佐治亚理工学院) NUS(新加坡国立大学) Tsinghua(清华大学) Griffith(格里菲斯大学) UT Austin(德克萨斯大学奥斯汀分校) MIT(麻省理工学院)

AI总结 EarthVerse是面向动态地球系统与自然灾害的科学智能体基准,含405项任务,评估25个智能体系统,发现其存在跨环节一致性不足问题,为科学可靠性测量提供可复现基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23311 2026-08-25 cs.CL 新提交

Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization

超越稳定性-探索困境:面向大语言模型策略优化的环境正则化方法

Xianlei Zhou, Xiangdi Meng, Yu He, Tianyu Qi, Shuyan Guan, Xianli Zhang, Jian Zhang, Xin Li, Qika Lin, Jun Liu

机构 * Alibaba Group(阿里巴巴集团) Beijing Normal University(北京师范大学) National University of Singapore(新加坡国立大学)

AI总结 该研究针对大语言模型策略优化的稳定性-探索困境,提出ERPO方法,通过查询KL散度正则化输入侧分布,接入现有策略优化流水线,在数学推理基准上实现了更强准确率与更稳定行为。

Comments Accepted to EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23167 2026-08-25 cs.CL 新提交

Accelerating Diffusion Language Models via Structured Suffix Modeling

通过结构化后缀建模加速扩散语言模型

Zifeng Cheng, Keda Li, Zhiwei Jiang, Cong Wang, Fei Shen, Qing Gu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) National University of Singapore(新加坡国立大学)

AI总结 该研究针对扩散语言模型(DLM)并行解码的高计算开销问题,提出结构化后缀建模方法,将后缀分区域处理并融入前一步解码信息,无需训练且可与其他加速技术结合,能进一步加速DLM推理并提升性能,长序列场景下最高可实现72.81倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23104 2026-08-25 cs.CL cs.AI 新提交

Molecular LLM Agents: From Architectural Design to Scientific Autonomy

分子大语言模型智能体:从架构设计到科学自主性

Jiatong Li, Wengyu Zhang, Weida Wang, Yuxuan Ren, Wei Liu, Chenyang Mao, Yuqiang Li, Yatao Bian, Changmeng Zheng, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究提出分子LLM智能体的概念框架,从架构设计和科学自主性阶梯两方面展开,为分子领域LLM智能体的比较、设计评估及部署提供指导。

Comments 25pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22971 2026-08-25 cs.AI cs.CV 新提交

ParallelWorld: Test-Time Scaling for Embodied Reasoning

ParallelWorld:具身推理的测试时缩放方法

Min Chen, Shengjun Zhang, Yuxin Li, Zhang Zhang, Xin Fei, Chong Xia, Yueqi Duan

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

AI总结 本文针对具身推理现有方法缺乏长程规划的局限,提出ParallelWorld多步测试时缩放框架,通过验证器引导的树搜索实现并行多步轨迹模拟,在ESI-Bench上显著提升了主动感知与推理性能。

Comments Project Page: this https URL (https://chen-min-22.github.io/ParallelWorld-page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22788 2026-08-25 cs.AI cs.LG 新提交

TailSieve: Partial-Rollout-Guided Tail Routing for LLM Rollouts

TailSieve:面向大语言模型(LLM)rollout的部分rollout引导式长尾路由

Tianqi Xu, Lu Lv, Haoyang Huang, Wenjie Huang, Zhanming Shen, Yuhao Shen, Baolin Zhang, Xinyi Hu, Shuang Ge, Jun Dai, Tianyu Liu, Suorong Yang, Zhikai Li, Ye Bai, Jun Zhang, Lei Chen, Yue Li, Mingchen Wan

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 TailSieve是面向LLM rollout的部分rollout引导式框架,通过联合控制长尾路由与副本分配,仅路由即可实现最高1.67倍加速,结合专用推测解码可达2.59倍加速,同时保留策略内生成并避免长度偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22770 2026-08-25 cs.CL 新提交

DelistBench: Evaluating Search-Enabled LLMs for Auditable Corporate-Event Database Completion

DelistBench:评估支持搜索的大型语言模型用于可审计的公司事件数据库补全

Xuan Yao, Li Shuping, Dai Yang, Zhou Yi, Ke-Wei Huang

机构 * Asian Institute of Digital Finance, National University of Singapore(新加坡国立大学亚洲数字金融研究院)

AI总结 该研究提出Search-to-Record任务与DelistBench基准,评估支持搜索的LLM在公司事件数据库补全中的表现,发现网络检索可显著提升准确率,低成本系统也能接近最优效果,并给出部署指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22701 2026-08-25 cs.RO 新提交

Physics Filtering Favors the Generalization of Robot Learning

物理滤波有利于机器人学习的泛化

Jindou Jia, Shixuan Han, Meng Wang, Gen Li, Zihan Yang, Sicheng Zhou, Kexin Guo, Jianfei Yang, Xiang Yu, Wei Wang, Lei Guo

机构 * Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学) National University of Singapore(新加坡国立大学) Beijing Aerospace Control Instrument Research Institute(北京航天测控仪器研究所)

AI总结 该研究提出轻量、模型无关的 PhyFilter 反馈机制,无需海量训练数据,即可提升机器人在动态不确定性下的泛化能力,在四类机器人系统上验证了其有效性。

Comments Accepted by npj Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22421 2026-08-25 cs.AI 新提交

Where World Models Break: Natural-Input Failure Discovery

世界模型何时失效:自然输入的故障发现

Zhanpeng Shi, Zi Liang, Rong Feng, Shiqin Tang, Xuyang Chen, Hongzong Li

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) The Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) Generative AI Research and Development Center, The Hong Kong University of Science and Technology(香港科技大学生成式人工智能研发中心)

AI总结 本文针对现有世界模型评估忽略灾难性故障风险的问题,提出 BasinLens 方法,可在有限查询预算下发现自然输入引发的可复现、局部持续的世界模型故障,暴露常规基准未覆盖的漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22266 2026-08-25 cs.AI cs.CL 新提交

Clarify User Expertise: Towards Proactive Conversational Agents Tailoring Responses to User Proficiency

明确用户专业能力:面向可根据用户熟练度调整响应的主动式对话智能体

Zhihong Cao, Chen Huang

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) College of Computer Science, Sichuan University(四川大学计算机学院)

AI总结 本研究针对现有对话智能体无法仅通过查询判断用户专业能力的缺陷,提出PASSING方法,通过LLM自博弈生成的询问策略主动明确用户专业能力,以调整响应提升用户理解,实验显示该方法具有优越性。

Comments Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21928 2026-08-25 cs.AI cs.CL cs.RO 新提交

GuardianBench: A Same-Scene Instruction-Contrastive Benchmark for Latent Contextual Risk in Embodied AI

GuardianBench:面向具身智能中潜在上下文风险的同场景指令对比基准

Zhesheng Zhang, Jiahao Lu, Wei Liu, Cong Pan, Jianhua Yang, Yixiang Chen, Hongyuan Yu, Mengqi Zhang, Kailin Lyu, Zhumin Chen, Keji He

机构 * Shandong University(山东大学) National University of Singapore(新加坡国立大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Xiaomi Corporation(小米公司)

AI总结 该研究提出基于国际安全标准的同场景指令对比基准GuardianBench,发现VLMs对指令不敏感,用轻量级目标VLOS可提升其安全推理性能。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21867 2026-08-25 cs.AI cs.CL 新提交

MemGuard: Persisting Verifier Signals for LLM-Agent Memory Governance

MemGuard:为大语言模型智能体记忆治理保留验证器信号

Haoyu Wang, Guangyuan Dong, He Liang, Zijing Zhang, Jiachen Luo, Chuang Liu, Chao Xue, Hao Tang

机构 * Nankai University(南开大学) National University of Singapore(新加坡国立大学) Shanghai Institute of Optics and Fine Mechanics, Chinese Academy of Sciences(中国科学院上海光学精密机械研究所) Peking University(北京大学) Technical University of Munich(慕尼黑工业大学) Queen Mary University of London(伦敦大学玛丽女王学院) Wuhan University(武汉大学) University of New South Wales(新南威尔士大学)

AI总结 针对LLM智能体记忆的不可靠准入与漂移问题,提出MemGuard方法,通过保留验证器的生命周期元数据提升多任务基准的成功指标与效率,效果优于现有基线。

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21646 2026-08-25 cs.LG cs.AI 新提交

Power-Performance Characterization of TinyML Systems

TinyML系统的功耗与性能表征

Yujie Zhang, Dhananjaya Wijerathne, Zhaoying Li, Tulika Mitra

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

AI总结 本文针对微控制器上的TinyML系统开展性能与功耗表征,提出估算抽象层成本的模型,其结果可辅助边缘设备的NAS与CNN推理优化。

Comments 7 pages, 9 figures. Published in Proceedings of the IEEE International Conference on Computer Design (ICCD), 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21614 2026-08-25 cs.AI cs.DC 新提交

SAEM: Stage-Aware Expert Management for Memory-Efficient MoE Inference in Chain-of-Thought Reasoning

SAEM:面向思维链推理的内存高效混合专家模型推理的阶段感知型专家管理

Yujie Zhang, Bin Gao, Tulika Mitra

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

AI总结 针对思维链推理中MoE模型的内存与延迟问题,提出SAEM阶段感知型专家管理运行时,通过阶段感知缓存等技术提升吞吐量,在受限GPU内存下平均实现1.33倍的性能提升。

Comments Extended version of the paper accepted at DAC 2026. Extends the conference version with evaluations on AIME 2024 and GPQA-Diamond and a prediction-oracle upper-bound analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22453 2026-08-25 cs.LG math.DG 新提交

Geometric Structures on Graphs: a Holonomy-Based Discretization of Curvature

图上的几何结构:基于和乐的曲率离散化方法

Hao Li, Yuhan Peng, Junwen Dong

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Nankai University(南开大学)

AI总结 该研究提出基于和乐的图曲率离散化框架,引入两种聚合机制实现曲率相关响应的规范等变更新,经单位球校准验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22277 2026-08-25 cs.LG physics.comp-ph 新提交

DAW: Dynamics-Aware Weighting for Deep Learning Forecasts of Chaotic Systems

DAW:面向混沌系统深度学习预测的动力学感知加权方法

Zhou Fang, Gianmarco Mengaldo

机构 * National University of Singapore(新加坡国立大学)

AI总结 针对混沌系统深度学习预测的长期误差累积问题,提出DAW框架,利用动力系统局部维度重塑损失,在KS方程上显著降低了长期自回归误差。

详情

展开后加载摘要…

URL PDF HTML 收藏