How to Train a Critic Stably and Efficiently
如何稳定且高效地训练评价模型
机构 * National University of Singapore(新加坡国立大学) ; Tencent Hunyuan(腾讯混元)
AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。
高校专区
如何稳定且高效地训练评价模型
机构 * National University of Singapore(新加坡国立大学) ; Tencent Hunyuan(腾讯混元)
AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。
EarthVerse:面向动态地球系统与自然灾害的科学智能体基准测试
机构 * NUIST(南京信息工程大学) ; HKU(香港大学) ; McGill(麦吉尔大学) ; HKUST(GZ)(香港科技大学(广州)) ; Georgia Tech(佐治亚理工学院) ; NUS(新加坡国立大学) ; Tsinghua(清华大学) ; Griffith(格里菲斯大学) ; UT Austin(德克萨斯大学奥斯汀分校) ; MIT(麻省理工学院)
AI总结 EarthVerse是面向动态地球系统与自然灾害的科学智能体基准,含405项任务,评估25个智能体系统,发现其存在跨环节一致性不足问题,为科学可靠性测量提供可复现基础。
超越稳定性-探索困境:面向大语言模型策略优化的环境正则化方法
机构 * Alibaba Group(阿里巴巴集团) ; Beijing Normal University(北京师范大学) ; National University of Singapore(新加坡国立大学)
AI总结 该研究针对大语言模型策略优化的稳定性-探索困境,提出ERPO方法,通过查询KL散度正则化输入侧分布,接入现有策略优化流水线,在数学推理基准上实现了更强准确率与更稳定行为。
Comments Accepted to EMNLP 2026 main conference
通过结构化后缀建模加速扩散语言模型
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; National University of Singapore(新加坡国立大学)
AI总结 该研究针对扩散语言模型(DLM)并行解码的高计算开销问题,提出结构化后缀建模方法,将后缀分区域处理并融入前一步解码信息,无需训练且可与其他加速技术结合,能进一步加速DLM推理并提升性能,长序列场景下最高可实现72.81倍加速。
分子大语言模型智能体:从架构设计到科学自主性
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Shanghai AI Lab(上海人工智能实验室) ; National University of Singapore(新加坡国立大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 该研究提出分子LLM智能体的概念框架,从架构设计和科学自主性阶梯两方面展开,为分子领域LLM智能体的比较、设计评估及部署提供指导。
Comments 25pages
ParallelWorld:具身推理的测试时缩放方法
机构 * Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学)
AI总结 本文针对具身推理现有方法缺乏长程规划的局限,提出ParallelWorld多步测试时缩放框架,通过验证器引导的树搜索实现并行多步轨迹模拟,在ESI-Bench上显著提升了主动感知与推理性能。
Comments Project Page: this https URL (https://chen-min-22.github.io/ParallelWorld-page/)
TailSieve:面向大语言模型(LLM)rollout的部分rollout引导式长尾路由
机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) ; Carnegie Mellon University(卡内基梅隆大学) ; Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
AI总结 TailSieve是面向LLM rollout的部分rollout引导式框架,通过联合控制长尾路由与副本分配,仅路由即可实现最高1.67倍加速,结合专用推测解码可达2.59倍加速,同时保留策略内生成并避免长度偏差。
DelistBench:评估支持搜索的大型语言模型用于可审计的公司事件数据库补全
机构 * Asian Institute of Digital Finance, National University of Singapore(新加坡国立大学亚洲数字金融研究院)
AI总结 该研究提出Search-to-Record任务与DelistBench基准,评估支持搜索的LLM在公司事件数据库补全中的表现,发现网络检索可显著提升准确率,低成本系统也能接近最优效果,并给出部署指导。
物理滤波有利于机器人学习的泛化
机构 * Nanyang Technological University(南洋理工大学) ; Beihang University(北京航空航天大学) ; National University of Singapore(新加坡国立大学) ; Beijing Aerospace Control Instrument Research Institute(北京航天测控仪器研究所)
AI总结 该研究提出轻量、模型无关的 PhyFilter 反馈机制,无需海量训练数据,即可提升机器人在动态不确定性下的泛化能力,在四类机器人系统上验证了其有效性。
Comments Accepted by npj Robotics
世界模型何时失效:自然输入的故障发现
机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) ; The Hong Kong Polytechnic University(香港理工大学) ; City University of Hong Kong(香港城市大学) ; Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) ; Generative AI Research and Development Center, The Hong Kong University of Science and Technology(香港科技大学生成式人工智能研发中心)
AI总结 本文针对现有世界模型评估忽略灾难性故障风险的问题,提出 BasinLens 方法,可在有限查询预算下发现自然输入引发的可复现、局部持续的世界模型故障,暴露常规基准未覆盖的漏洞。
明确用户专业能力:面向可根据用户熟练度调整响应的主动式对话智能体
机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) ; Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) ; College of Computer Science, Sichuan University(四川大学计算机学院)
AI总结 本研究针对现有对话智能体无法仅通过查询判断用户专业能力的缺陷,提出PASSING方法,通过LLM自博弈生成的询问策略主动明确用户专业能力,以调整响应提升用户理解,实验显示该方法具有优越性。
Comments Findings of EMNLP 2026
GuardianBench:面向具身智能中潜在上下文风险的同场景指令对比基准
机构 * Shandong University(山东大学) ; National University of Singapore(新加坡国立大学) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Xiaomi Corporation(小米公司)
AI总结 该研究提出基于国际安全标准的同场景指令对比基准GuardianBench,发现VLMs对指令不敏感,用轻量级目标VLOS可提升其安全推理性能。
Comments 21 pages, 4 figures
MemGuard:为大语言模型智能体记忆治理保留验证器信号
机构 * Nankai University(南开大学) ; National University of Singapore(新加坡国立大学) ; Shanghai Institute of Optics and Fine Mechanics, Chinese Academy of Sciences(中国科学院上海光学精密机械研究所) ; Peking University(北京大学) ; Technical University of Munich(慕尼黑工业大学) ; Queen Mary University of London(伦敦大学玛丽女王学院) ; Wuhan University(武汉大学) ; University of New South Wales(新南威尔士大学)
AI总结 针对LLM智能体记忆的不可靠准入与漂移问题,提出MemGuard方法,通过保留验证器的生命周期元数据提升多任务基准的成功指标与效率,效果优于现有基线。
Comments 30 pages, 7 figures
TinyML系统的功耗与性能表征
机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)
AI总结 本文针对微控制器上的TinyML系统开展性能与功耗表征,提出估算抽象层成本的模型,其结果可辅助边缘设备的NAS与CNN推理优化。
Comments 7 pages, 9 figures. Published in Proceedings of the IEEE International Conference on Computer Design (ICCD), 2022
SAEM:面向思维链推理的内存高效混合专家模型推理的阶段感知型专家管理
机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)
AI总结 针对思维链推理中MoE模型的内存与延迟问题,提出SAEM阶段感知型专家管理运行时,通过阶段感知缓存等技术提升吞吐量,在受限GPU内存下平均实现1.33倍的性能提升。
Comments Extended version of the paper accepted at DAC 2026. Extends the conference version with evaluations on AIME 2024 and GPQA-Diamond and a prediction-oracle upper-bound analysis
图上的几何结构:基于和乐的曲率离散化方法
机构 * National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Nankai University(南开大学)
AI总结 该研究提出基于和乐的图曲率离散化框架,引入两种聚合机制实现曲率相关响应的规范等变更新,经单位球校准验证了方法的有效性。
DAW:面向混沌系统深度学习预测的动力学感知加权方法
机构 * National University of Singapore(新加坡国立大学)
AI总结 针对混沌系统深度学习预测的长期误差累积问题,提出DAW框架,利用动力系统局部维度重塑损失,在KS方程上显著降低了长期自回归误差。
ForeDreamer:用于未来事件预测的自进化双智能体记忆架构
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; National University of Singapore(新加坡国立大学) ; Zhejiang University of Technology(浙江工业大学)
AI总结 针对开放网络未来事件预测的不足,提出自进化双智能体框架ForeDreamer,分离事实与经验记忆,经Prophet Arena、FutureX实验验证其有效性
Comments accepted to EMNLP 2026 Findings
学习制胜:表型引导的隐式流与区域运动先验用于双心室运动合成
机构 * National University of Singapore(新加坡国立大学) ; Southeast University(东南大学) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学)
AI总结 本研究针对从单一舒张末期网格合成全周期双心室运动的挑战,提出表型自适应的区域功能分区与条件隐式流框架,在多数据集上实现精度与保真度提升,性能优于对比方法。
Comments 14pages, 10 figures
SPADE:自适应合成可执行环境中的自博弈
机构 * University of Washington(华盛顿大学) ; Stanford University(斯坦福大学) ; Northeastern University(东北大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Massachusetts Institute of Technology(麻省理工学院) ; National University of Singapore(新加坡国立大学) ; Seoul National University(首尔大学) ; Stevens Institute of Technology(史蒂文斯理工学院) ; University of Chicago(芝加哥大学)
AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。
Comments Work in progress. Project page: this https URL (https://spade-rl.github.io); Code: this https URL (https://github.com/spade-rl/spade)
PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试
机构 * National University of Singapore(新加坡国立大学) ; PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) ; Peking Union Medical College Hospital(北京协和医院)
AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。
RARM:基于置信度门控的进展奖励建模用于操作中的强化学习
机构 * NUS Human-Centered Robotic Lab(新加坡国立大学人机共融机器人实验室) ; University of Cambridge(剑桥大学) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)
AI总结 提出参考锚定奖励模型(RARM),通过对比时间目标从通用视频中学习,将单个成功演示转化为密集进展奖励,并在部署时通过置信度门控抑制虚假正奖励,在长时域操作任务中显著提升强化学习成功率。
最后但同样重要:用于多模态KV缓存压缩的边界注意力校准
机构 * KAIST(韩国科学技术院) ; Zhejiang Laboratory(之江实验室) ; The Chinese University of Hong Kong(香港中文大学) ; National University of Singapore(新加坡国立大学)
AI总结 针对多模态大语言模型长视觉上下文中KV缓存压缩导致关键证据丢失的问题,提出BACON方法,通过校准观察窗口注意力与最后查询注意力,并利用层内一致性和层间持久性抑制噪声,在激进压缩下平均提升7.5%性能。
Comments EMNLP 2026 Main Conference
利用算子链实现上下文算子学习
机构 * Department of Mathematics, Shanghai Normal University(上海师范大学数学系) ; Department of Mathematics, National University of Singapore(新加坡国立大学数学系)
AI总结 提出Chain of Operators (CHOP)框架,通过构造显式初等变换与冻结ICON的算子链,无需微调即可提升上下文算子网络在分布外算子任务上的泛化能力,在标量守恒律和平均场控制问题中降低推理误差。
自进化科学智能体发现可泛化的物理推理流体控制
机构 * National University of Singapore(新加坡国立大学)
AI总结 提出一种由大语言模型驱动的自进化科学智能体工作流,通过迭代代码生成和物理仿真诊断,自动构建可解释的控制器,并在欠驱动双关节狗鲨游泳器目标到达任务中实现零样本泛化。
MOSAIC:结构化智能体智能与组合的模块化编排
机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) ; University College London(伦敦大学学院) ; University of Edinburgh(爱丁堡大学) ; Data & Analytics, Digital X(Digital X 数据与分析部) ; Alan Turing Institute(艾伦·图灵研究所)
AI总结 提出MOSAIC框架,通过结构化智能体编排、记忆驱动的模型选择和蓝图构建,将自动化数据科学转化为可验证、可复用的模型选择问题,在金融时间序列任务中优于AutoML和智能体基线。
从运动学至路由视觉控制:用于动作条件化外科视频生成
机构 * SJTU(上海交通大学) ; NUS(国立新加坡大学) ; THU(清华大学) ; EIT(欧洲研究所) ; WHU(武汉大学) ; Harvard(哈佛大学) ; NVIDIA(NVIDIA公司) ; CUHK(香港大学)
AI总结 本文提出一种运动学至视觉提升范式,通过五种图像对齐的控制模态生成动作条件化外科视频,采用分层路由框架提升控制精度与效率,构建新基准并验证方法有效性。
SkillNet: 创建、评估和连接AI技能
机构 * Zhejiang University(浙江大学) ; Tongji University(同济大学) ; Southeast University(东南大学) ; Alibaba Group(阿里巴巴集团) ; Tencent(腾讯) ; Fudan University(复旦大学) ; The University of Edinburgh(爱丁堡大学) ; Monash University(墨尔本大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Huzhou University(湖州大学) ; Hornor Device Co., Ltd(Hornor设备有限公司) ; Hangzhou Institute for Advanced Study, UCAS(杭州先进研究所,UCAS)
AI总结 SkillNet通过统一的本体和多维评估机制,大规模创建、评估和连接AI技能,提升代理性能并促进技能的持久掌握。
Comments this http URL (http://skillnet.openkg.cn/;) add SkillNet-Gym, a benchmark for evaluating skill retrieval, utilization, composition, and SkillNet-Fabric for task-specific skill routing through lightweight Wikis
前瞻性验证:用于扩散大语言模型在无上下文自由文法下的可靠约束解码
机构 * College of AI, Tsinghua University(清华大学人工智能学院) ; School of Computer Science, Peking University(北京大学计算机学院) ; School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) ; School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) ; School of Computing, National University of Singapore(新加坡国立大学计算机学院)
AI总结 LAVE通过并行预测标记分布实现可靠的约束解码,提升扩散大语言模型在上下文无关文法下的生成准确性。
遗忘的遗忘:注意力汇作为大语言模型遗忘后门的网关
机构 * Michigan State University(密歇根州立大学) ; National University of Singapore(新加坡国立大学) ; IBM Research(IBM研究院)
AI总结 该研究针对LLM遗忘过程,提出利用注意力汇作为网关的后门攻击方法,可使模型在无触发器时正常遗忘,有触发器时恢复被遗忘知识,经实验验证有效。
Comments Accepted at COLM 2026