How to Train a Critic Stably and Efficiently
如何稳定且高效地训练评价模型
机构 * National University of Singapore(新加坡国立大学) ; Tencent Hunyuan(腾讯混元)
AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。
高校专区
如何稳定且高效地训练评价模型
机构 * National University of Singapore(新加坡国立大学) ; Tencent Hunyuan(腾讯混元)
AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。
EarthVerse:面向动态地球系统与自然灾害的科学智能体基准测试
机构 * NUIST(南京信息工程大学) ; HKU(香港大学) ; McGill(麦吉尔大学) ; HKUST(GZ)(香港科技大学(广州)) ; Georgia Tech(佐治亚理工学院) ; NUS(新加坡国立大学) ; Tsinghua(清华大学) ; Griffith(格里菲斯大学) ; UT Austin(德克萨斯大学奥斯汀分校) ; MIT(麻省理工学院)
AI总结 EarthVerse是面向动态地球系统与自然灾害的科学智能体基准,含405项任务,评估25个智能体系统,发现其存在跨环节一致性不足问题,为科学可靠性测量提供可复现基础。
超越稳定性-探索困境:面向大语言模型策略优化的环境正则化方法
机构 * Alibaba Group(阿里巴巴集团) ; Beijing Normal University(北京师范大学) ; National University of Singapore(新加坡国立大学)
AI总结 该研究针对大语言模型策略优化的稳定性-探索困境,提出ERPO方法,通过查询KL散度正则化输入侧分布,接入现有策略优化流水线,在数学推理基准上实现了更强准确率与更稳定行为。
Comments Accepted to EMNLP 2026 main conference
通过结构化后缀建模加速扩散语言模型
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; National University of Singapore(新加坡国立大学)
AI总结 该研究针对扩散语言模型(DLM)并行解码的高计算开销问题,提出结构化后缀建模方法,将后缀分区域处理并融入前一步解码信息,无需训练且可与其他加速技术结合,能进一步加速DLM推理并提升性能,长序列场景下最高可实现72.81倍加速。
分子大语言模型智能体:从架构设计到科学自主性
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Shanghai AI Lab(上海人工智能实验室) ; National University of Singapore(新加坡国立大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 该研究提出分子LLM智能体的概念框架,从架构设计和科学自主性阶梯两方面展开,为分子领域LLM智能体的比较、设计评估及部署提供指导。
Comments 25pages
ParallelWorld:具身推理的测试时缩放方法
机构 * Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学)
AI总结 本文针对具身推理现有方法缺乏长程规划的局限,提出ParallelWorld多步测试时缩放框架,通过验证器引导的树搜索实现并行多步轨迹模拟,在ESI-Bench上显著提升了主动感知与推理性能。
Comments Project Page: this https URL (https://chen-min-22.github.io/ParallelWorld-page/)
TailSieve:面向大语言模型(LLM)rollout的部分rollout引导式长尾路由
机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) ; Carnegie Mellon University(卡内基梅隆大学) ; Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
AI总结 TailSieve是面向LLM rollout的部分rollout引导式框架,通过联合控制长尾路由与副本分配,仅路由即可实现最高1.67倍加速,结合专用推测解码可达2.59倍加速,同时保留策略内生成并避免长度偏差。
DelistBench:评估支持搜索的大型语言模型用于可审计的公司事件数据库补全
机构 * Asian Institute of Digital Finance, National University of Singapore(新加坡国立大学亚洲数字金融研究院)
AI总结 该研究提出Search-to-Record任务与DelistBench基准,评估支持搜索的LLM在公司事件数据库补全中的表现,发现网络检索可显著提升准确率,低成本系统也能接近最优效果,并给出部署指导。
物理滤波有利于机器人学习的泛化
机构 * Nanyang Technological University(南洋理工大学) ; Beihang University(北京航空航天大学) ; National University of Singapore(新加坡国立大学) ; Beijing Aerospace Control Instrument Research Institute(北京航天测控仪器研究所)
AI总结 该研究提出轻量、模型无关的 PhyFilter 反馈机制,无需海量训练数据,即可提升机器人在动态不确定性下的泛化能力,在四类机器人系统上验证了其有效性。
Comments Accepted by npj Robotics
世界模型何时失效:自然输入的故障发现
机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) ; The Hong Kong Polytechnic University(香港理工大学) ; City University of Hong Kong(香港城市大学) ; Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) ; Generative AI Research and Development Center, The Hong Kong University of Science and Technology(香港科技大学生成式人工智能研发中心)
AI总结 本文针对现有世界模型评估忽略灾难性故障风险的问题,提出 BasinLens 方法,可在有限查询预算下发现自然输入引发的可复现、局部持续的世界模型故障,暴露常规基准未覆盖的漏洞。
明确用户专业能力:面向可根据用户熟练度调整响应的主动式对话智能体
机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) ; Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) ; College of Computer Science, Sichuan University(四川大学计算机学院)
AI总结 本研究针对现有对话智能体无法仅通过查询判断用户专业能力的缺陷,提出PASSING方法,通过LLM自博弈生成的询问策略主动明确用户专业能力,以调整响应提升用户理解,实验显示该方法具有优越性。
Comments Findings of EMNLP 2026
GuardianBench:面向具身智能中潜在上下文风险的同场景指令对比基准
机构 * Shandong University(山东大学) ; National University of Singapore(新加坡国立大学) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Xiaomi Corporation(小米公司)
AI总结 该研究提出基于国际安全标准的同场景指令对比基准GuardianBench,发现VLMs对指令不敏感,用轻量级目标VLOS可提升其安全推理性能。
Comments 21 pages, 4 figures
MemGuard:为大语言模型智能体记忆治理保留验证器信号
机构 * Nankai University(南开大学) ; National University of Singapore(新加坡国立大学) ; Shanghai Institute of Optics and Fine Mechanics, Chinese Academy of Sciences(中国科学院上海光学精密机械研究所) ; Peking University(北京大学) ; Technical University of Munich(慕尼黑工业大学) ; Queen Mary University of London(伦敦大学玛丽女王学院) ; Wuhan University(武汉大学) ; University of New South Wales(新南威尔士大学)
AI总结 针对LLM智能体记忆的不可靠准入与漂移问题,提出MemGuard方法,通过保留验证器的生命周期元数据提升多任务基准的成功指标与效率,效果优于现有基线。
Comments 30 pages, 7 figures
TinyML系统的功耗与性能表征
机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)
AI总结 本文针对微控制器上的TinyML系统开展性能与功耗表征,提出估算抽象层成本的模型,其结果可辅助边缘设备的NAS与CNN推理优化。
Comments 7 pages, 9 figures. Published in Proceedings of the IEEE International Conference on Computer Design (ICCD), 2022
SAEM:面向思维链推理的内存高效混合专家模型推理的阶段感知型专家管理
机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)
AI总结 针对思维链推理中MoE模型的内存与延迟问题,提出SAEM阶段感知型专家管理运行时,通过阶段感知缓存等技术提升吞吐量,在受限GPU内存下平均实现1.33倍的性能提升。
Comments Extended version of the paper accepted at DAC 2026. Extends the conference version with evaluations on AIME 2024 and GPQA-Diamond and a prediction-oracle upper-bound analysis
图上的几何结构:基于和乐的曲率离散化方法
机构 * National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Nankai University(南开大学)
AI总结 该研究提出基于和乐的图曲率离散化框架,引入两种聚合机制实现曲率相关响应的规范等变更新,经单位球校准验证了方法的有效性。
DAW:面向混沌系统深度学习预测的动力学感知加权方法
机构 * National University of Singapore(新加坡国立大学)
AI总结 针对混沌系统深度学习预测的长期误差累积问题,提出DAW框架,利用动力系统局部维度重塑损失,在KS方程上显著降低了长期自回归误差。