arXivDaily arXiv每日学术速递 周一至周五更新

作者

Zhi-Hua Zhou

Machine Learning

共收录 152 篇
2602.08372 2026-09-30 cs.LG math.OC 版本更新

Dynamic Regret via Discounted-to-Dynamic Reduction with Applications to Curved Losses and Adam Optimizer

通过折扣到动态的还原实现动态后悔,应用于曲面损失和Adam优化器

Yan-Feng Xie, Yu-Jie Zhang, Peng Zhao, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家实验室) ; School of Artificial Intelligence(人工智能学院) ; University of Washington(华盛顿大学)

AI总结 本文通过折扣到动态的还原方法,改进了FTRL相关问题的动态后悔界,并应用于曲面损失和Adam优化器,获得了非凸非光滑设置下的最优收敛速率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.34423 2026-09-29 cs.LG math.OC stat.ML 新提交

On the Relation Between Interval Regret and Dynamic Regret

关于区间遗憾与动态遗憾之间关系的探讨

Yi-Han Wang, Peng Zhao, Zhi-Hua Zhou

机构 * Nanjing University(南京大学)

AI总结 本文研究区间遗憾与动态遗憾的关系,证明最优区间遗憾不蕴含最优动态遗憾,并提出通过扩大可行域与域转换损失实现最优动态遗憾,首次为指数凹函数给出高效算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19223 2026-09-29 cs.LG cs.CL 版本更新

AdaFlash: Adaptive Speculative Decoding via On-Policy Distilled Diffusion Drafters

AdaFlash:通过策略蒸馏扩散草稿器实现自适应推测解码

Yu-Yang Qian, Hao-Cong Wu, Chen Chen, Jiacheng Sun, Zhenhua Dong, Peng Zhao, Zhi-Hua Zhou

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; Huawei Foundation Model Dept(华为基础模型部)

AI总结 研究针对扩散草稿器在推测解码中存在的问题,提出AdaFlash框架,包含基于策略蒸馏算法和自适应长度头,有效降低方差,实验证明该框架能提高推理速度,尤其在高并发场景中吞吐量显著提升。

Comments COLM'26 Workshop (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11656 2026-09-11 cs.LG 新提交

Learnware and AI Model Management System

Learnware 与 AI 模型管理系统

Zhi-Hua Zhou

机构 * Nanjing University(南京大学)

AI总结 本文提出将管理单元从模型升级为Learnware(模型+规范),构建AI模型管理系统,在不访问训练数据的前提下实现模型识别、重用与协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17760 2026-08-19 cs.IT cs.AI eess.SP math.IT 新提交

Learnware for CSI Feedback: Scene-specific Small Models Can Do Big

用于CSI反馈的学习件:特定场景的小型模型可发挥大作用

Xiangyi Li, Jiajia Guo, Chao-Kai Wen, Xin Geng, Shi Jin, Zhi-Hua Zhou

机构 * Southeast University(东南大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; National Sun Yat-sen University(国立中山大学) ; Nanjing University(南京大学)

AI总结 针对6G CSI反馈的模型泛化与场景性能权衡问题,提出基于学习件的模型仓库框架,可高效检索匹配的预训练模型,在LOS/NLOS场景下性能优于通用模型,减少训练开销并增强隐私。

Comments This work has been accepted by IEEE Transactions on Wireless Communications. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23190 2026-07-28 cs.LG math.OC stat.ML 版本更新

A Simple, Optimal and Efficient Algorithm for Online Exp-Concave Optimization

一个简单、最优且高效的在线指数凹优化算法

Yi-Han Wang, Peng Zhao, Zhi-Hua Zhou

AI总结 本文提出LightONS算法,通过优化计算步骤,将在线指数凹优化的运行时间从O~(d^ω T)降至O(d²T + d^ω√(T log T)),并保持最优遗憾,解决了随机指数凹优化中的开放问题。

Comments COLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07304 2026-07-21 cs.LG 版本更新

Nonlinear Bandit

非线性带式赌博机

Tianshuo Zheng, Ting Wu, Zhi-Hua Zhou, Keqin Liu

机构 * School of Mathematics, Nanjing University(南京大学数学系) ; School of Artificial Intelligence, Nanjing University, National Key Laboratory for Novel Software Technology(南京大学人工智能学院,计算机软件新技术国家重点实验室) ; School of Mathematics and Physics, Xi’an Jiaotong-Liverpool University(西交利物浦大学数理学院)

AI总结 研究重尾噪声下广义线性带式赌博机问题,基于在线镜像下降方法提出算法EHM,实现几乎最优遗憾值且无需常用参数,还研究了上下文特征分段常数时的情况及非线性带式赌博机特殊情况,给出相应算法并证明遗憾上界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10355 2026-06-29 cs.LG 版本更新

TreeLoRA: Efficient Continual Learning via Layer-Wise LoRAs Guided by a Hierarchical Gradient-Similarity Tree

TreeLoRA:通过层级梯度相似性树引导的逐层LoRA实现高效持续学习

Yu-Yang Qian, Yuan-Ze Xu, Zhen-Yu Zhang, Peng Zhao, Zhi-Hua Zhou

AI总结 提出TreeLoRA方法,利用层级梯度相似性构建逐层适配器,结合bandit技术高效探索任务结构,并通过稀疏梯度更新优化参数,实现大预训练模型的高效持续学习。

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21929 2026-06-23 cs.LG 新提交

Selective Ensemble Based on Preference-Directed Multi-Objective Bandits

基于偏好导向的多目标赌博机的选择性集成

Lanjihong Ma, Zhen-Yu Zhang, Masashi Sugiyama, Zhi-Hua Zhou

机构 * Department of Computer Science, Zhejiang Gongshang University(浙江工商大学计算机科学与技术学院) ; Center for Advanced Intelligence Project, RIKEN(日本理化学研究所先进智能研究中心) ; Graduate School of Frontier Sciences, The University of Tokyo(东京大学新领域创成科学研究科) ; National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

AI总结 针对有限评估预算下部分偏好指定的选择性集成问题,形式化为偏好导向多目标赌博机,提出PrefUCB算法,实现对数遗憾界,在预训练模型集成和资产分配中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03831 2026-06-03 cs.LG stat.ML

Online Learning with Gradient-Variation Interval Regret

基于梯度变化的区间遗憾在线学习

Yan-Feng Xie, Shuche Wang, Peng Zhao, Zhi-Hua Zhou

机构 * State Key Laboratory for Novel Software Technology and the School of Artificial Intelligence, Nanjing University(新型软件技术国家重点实验室和人工智能学院,南京大学) ; Institute of Operations Research and Analytics, National University of Singapore(运筹与分析研究所,新加坡国立大学)

AI总结 本文提出首个基于梯度变化量实现区间遗憾界的在线学习算法,采用两层在线集成结构,自适应多种问题相关量并达到极小化最优率,同时引入Lipschitz和平滑性无关的变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
1111.2262 2026-06-03 cs.LG cs.NA math.NA

Improved Bound for the Nystrom's Method and its Application to Kernel Classification

Nyström方法的改进界及其在核分类中的应用

Rong Jin, Tianbao Yang, Mehrdad Mahdavi, Yu-Feng Li, Zhi-Hua Zhou

AI总结 本文通过积分算子集中不等式和压缩感知理论改进了Nyström方法的谱范数逼近误差界,并应用于核分类,证明在特征值服从p次幂律时可将支持向量数量减少至N^{2p/(p^2-1)}。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25191 2026-06-02 cs.AR cs.AI cs.LG

How Can Reinforcement Learning Achieve Expert-level Placement?

强化学习如何实现专家级布局?

Ruo-Tong Chen, Ke Xue, Chengrui Gao, Yunqi Shi, Tian Xu, Peng Xie, Siyuan Xu, Mingxuan Yuan, Chao Qian, Zhi-Hua Zhou

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) ; School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) ; Huawei Noah’s Ark Lab, China(华为诺亚实验室)

AI总结 针对强化学习在芯片布局中因奖励设计不当而难以达到专家质量的问题,提出从专家布局直接学习奖励模型的方法,通过推断专家轨迹并训练隐式奖励模型,实现从单个设计高效学习并泛化到未见案例。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21198 2026-05-25 cs.DC cs.AI cs.LG

ZipMoE: Efficient On-Device MoE Serving via Lossless Compression and Cache-Affinity Scheduling

ZipMoE:通过无损压缩和缓存亲和调度实现高效的设备端MoE服务

Yuchen Yang, Yaru Zhao, Pu Yang, Shaowei Wang, Zhi-Hua Zhou

机构 * School of Electronic Science and Engineering, Nanjing University, China.(南京大学电子科学与工程学院) ; National Key Laboratory for Novel Software Technology, Nanjing University, China.(南京大学新型软件技术国家重点实验室)

AI总结 提出ZipMoE系统,通过缓存-调度协同设计利用边缘设备硬件特性和MoE参数统计冗余,实现无损且高效的设备端MoE推理,显著降低延迟并提升吞吐量。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04062 2026-05-22 cs.LG cs.AI

EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation

EdgeRazor: 一种通过混合精度量化感知蒸馏实现大语言模型轻量化的框架

Shu-Hao Zhang, Le-Tong Huang, Xiang-Sheng Deng, Xin-Yi Zou, Chen Wu, Nan Li, Shao-Qun Zhang, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ; School of Intelligent Science and Technology, Nanjing University(南京大学智能科学与技术学院) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; Microsoft AI(微软AI)

AI总结 本文提出EdgeRazor框架,通过混合精度量化感知蒸馏方法,在资源受限设备上部署大语言模型,实现了更高的压缩比和更高效的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08999 2026-05-12 cs.LG

Non-Parametric Rehearsal Learning via Conditional Mean Embeddings

非参数化重现学习 via 条件均值嵌入

Wen-Bo Du, Tian-Zuo Wang, Han-Jia Ye, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) ; School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院)

AI总结 本文提出一种非参数化重现学习方法,通过条件均值嵌入处理动作诱导的分布变化,解决避免不良未来问题,无需假设数据生成过程的具体形式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07931 2026-04-10 cs.LG

Robust Length Prediction: A Perspective from Heavy-Tailed Prompt-Conditioned Distributions

鲁棒长度预测:从重尾提示条件分布的角度

Jing Wang, Yu-Yang Qian, Ke Xue, Chao Qian, Peng Zhao, Zhi-Hua Zhou

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

AI总结 本文提出通过重尾提示条件分布进行鲁棒长度预测,改进传统单次采样方法,提升预测稳定性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12946 2026-04-07 cs.AR cs.AI

Open3DBench: Open-Source Benchmark for 3D-IC Backend Implementation and PPA Evaluation

Open3DBench:开源的3D-IC后端实现与PPA评估基准

Yunqi Shi, Chengrui Gao, Wanqi Ren, Peng Xie, Siyuan Xu, Ke Xue, Mingxuan Yuan, Chao Qian, Zhi-Hua Zhou

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

AI总结 本文提出Open3DBench,基于OpenROAD流程框架,提供3D-IC后端实现与PPA评估的开源基准,展示了改进的面积、线长、时序和功耗性能,强调了PPA驱动方法的重要性。

Comments This version 2.0 is under review of TCAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07970 2026-03-10 cs.AI

Advancing Automated Algorithm Design via Evolutionary Stagewise Design with LLMs

通过基于大语言模型的进化分阶段设计推进自动化算法设计

Chen Lu, Ke Xue, Chengrui Gao, Yunqi Shi, Siyuan Xu, Mingxuan Yuan, Chao Qian, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) ; School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) ; Huawei Noah’s Ark Lab, China(华为诺亚实验室)

AI总结 本文提出EvoStage方法,通过分阶段进化设计提升自动化算法设计效率,实现超越人类专家和现有LLM方法的性能。

Comments 28 pages, 19 figures and 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12825 2026-01-28 cs.LG stat.ML

Theoretical Investigation on Inductive Bias of Isolation Forest

对隔离森林归纳偏置的理论研究

Qin-Cheng Zheng, Shao-Qun Zhang, Shen-Huan Lyu, Yuan Jiang, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家实验室,南京大学) ; School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学) ; School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学) ; College of Computer and Information, Hohai University, China(计算机与信息学院,河海大学) ; Key Laboratory of Water Resources Big Data Technology of Ministry of Water Resources, Hohai University, China(水利部水资源大数据技术重点实验室,河海大学)

AI总结 本文通过理论分析揭示了隔离森林在异常检测中的归纳偏置,指出其对中心异常的低敏感性和较高的参数适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02019 2026-01-12 cs.DB

AeroSketch: Near-Optimal Time Matrix Sketch Framework for Persistent, Sliding Window, and Distributed Streams

AeroSketch:一种近最优的时间矩阵草图框架,适用于持久、滑动窗口和分布式流

Hanyan Yin, Dongxie Wen, Jiajun Li, Zhewei Wei, Xiao Zhang, Peng Zhao, Zhi-Hua Zhou

AI总结 AeroSketch是一种新型矩阵草图框架,通过RandNLA技术在持久、滑动窗口和分布式流场景中实现近最优的更新时间复杂度和空间通信成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01069 2026-01-06 cs.LG stat.ML

Revisiting Weighted Strategy for Non-stationary Parametric Bandits and MDPs

重新审视非平稳参数老虎机和MDP中的加权策略

Jing Wang, Peng Zhao, Zhi-Hua Zhou

AI总结 本文提出了一种简化分析框架,改进了非平稳参数老虎机和MDP的加权策略,提升了算法效率和遗憾界。

Comments accepted by IEEE Transactions on Information Theory. arXiv admin note: substantial text overlap with arXiv:2303.02691

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19937 2025-11-26 cs.LG math.OC stat.ML

Adaptivity and Universality: Problem-dependent Universal Regret for Online Convex Optimization

适应性与普遍性:面向在线凸优化的问题依赖性通用遗憾

Peng Zhao, Yu-Hu Yan, Hang Yu, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(国家新型软件技术重点实验室,南京大学,中国) ; School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国)

AI总结 本文提出UniGrad方法,实现在线凸优化的通用性和问题依赖性,通过两种实现方式达到不同函数类的最优遗憾界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08054 2025-11-12 cs.AR cs.CV cs.SY eess.SY

Re$^{\text{2}}$MaP: Macro Placement by Recursively Prototyping and Packing Tree-based Relocating

Re²MaP:基于递归原型生成与树状重定位打包的宏单元布局

Yunqi Shi, Xi Lin, Zhiang Wang, Siyuan Xu, Shixiong Kai, Yao Lai, Chengrui Gao, Ke Xue, Mingxuan Yuan, Chao Qian, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology and the School of Artificial Intelligence, Nanjing University(国家新型软件技术重点实验室和南京大学人工智能学院) ; College of Integrated Circuits and Nano-Micro Electronics, Fudan University(集成电路与纳米微电子学院,复旦大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; School of Computing and Data Science, the University of Hong Kong(计算与数据科学学院,香港大学)

AI总结 提出Re²MaP宏单元布局方法,通过多级分组聚类、原型生成、角度优化及树状重定位,生成专家级布局,相比Hier-RTLMP在WNS和TNS上有显著提升,优于ReMaP且代码开源。

Comments IEEE Transactions on Comupter-Aided Design under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06597 2025-11-11 cs.LG math.OC

Optimistic Online-to-Batch Conversions for Accelerated Convergence and Universality

用于加速收敛与普适性的乐观在线到批量转换

Yu-Hu Yan, Peng Zhao, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家实验室,南京大学,中国) ; School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国)

AI总结 本文提出新颖的乐观在线到批量转换方法,将乐观性纳入理论分析,在简化在线算法设计的同时,实现光滑与强凸目标的最优加速收敛,并具备对光滑性的普适性且每次迭代仅需一次梯度查询。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12275 2025-10-31 cs.LG cs.AI

Curriculum Abductive Learning

课程溯因学习

Wen-Chao Hu, Qi-Jie Li, Lin-Han Jia, Cunjing Ge, Yu-Feng Li, Yuan Jiang, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) ; School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院)

AI总结 针对溯因学习(ABL)中因知识库庞大复杂导致溯因空间大、训练不稳定的问题,提出课程溯因学习(C-ABL)方法,通过逐步引入划分的子知识库以缩小溯因空间,显著提升训练稳定性、收敛速度与最终准确率。

Comments Accepted by NeurIPS 2025, 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07193 2025-10-28 cs.LG stat.ML

Provably Efficient Online RLHF with One-Pass Reward Modeling

可证明高效的单次奖励建模在线RLHF

Long-Fei Li, Yu-Yang Qian, Peng Zhao, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(国家新型软件技术实验室,南京大学) ; School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学)

AI总结 针对在线RLHF中历史数据存储与重训练成本高的问题,提出单次奖励建模方法,实现常数时间更新,并在多种设置下提升统计与计算效率,实验验证有效。

Comments NeurIPS 2025; The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
1112.1768 2025-09-16 cs.LG math.PR math.ST stat.TH

Extended UCB Policies for Multi-armed Bandit Problems

多臂老虎机问题的扩展 UCB 策略

Keqin Liu, Tianshuo Zheng, Zhi-Hua Zhou

机构 * School of Mathematics and Physics(数学与物理学院) ; Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) ; School of Mathematics(数学学院) ; Nanjing University(南京大学) ; National Key Laboratory for Novel Software Technology(新型软件技术国家实验室) ; School of Artificial Intelligence(人工智能学院)

AI总结 本文研究了重尾奖励分布下的多臂老虎机问题,提出了扩展稳健UCB策略,将已有矩条件推广至任意 $p>q>1$ 并保持最优遗憾阶 $O(log T)$,同时在仅知 $p$ 阶矩存在时实现近最优遗憾。

Comments 32 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08911 2025-09-10 cs.LG stat.ML

Efficient Methods for Non-stationary Online Learning

非平稳在线学习的高效方法

Peng Zhao, Yan-Feng Xie, Lijun Zhang, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(国家新型软件技术重点实验室,南京大学) ; School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学)

AI总结 本文针对非平稳在线学习中的动态遗憾和自适应遗憾,提出将每轮投影次数从O(log T)降至1的高效方法,并扩展至区间动态遗憾,适用于在线随机控制和主成分分析。

Comments V3 changes: accepted by JMLR 2025 and improve the writing; V2/V1 changes: investigate interval dynamic regret and add two applications (online non-stochastic control and online PCA) and improve the presentation; preliminary version published at NeurIPS'22

Journal ref Journal of Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00392 2025-08-04 cs.LG

Dual Adaptivity: Universal Algorithms for Minimizing the Adaptive Regret of Convex Functions

双重自适应性:最小化凸函数自适应遗憾的通用算法

Lijun Zhang, Wenhao Yang, Guanghui Wang, Wei Jiang, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(南京大学新型软件技术国家重点实验室) ; School of Artificial Intelligence, Nanjing University, Nanjing, China(南京大学人工智能学院) ; College of Computing, Georgia Institute of Technology, Atlanta, USA(佐治亚理工学院计算机学院)

AI总结 针对现有在线凸优化自适应遗憾最小化算法通用性不足的问题,本文提出具备双重自适应性的元专家框架,结合休眠专家技术与两种专家构建策略,可适配多类凸函数与变化环境,并拓展至在线复合优化场景。

Comments arXiv admin note: text overlap with arXiv:1906.10851

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23235 2025-07-01 cs.CL

Generalist Reward Models: Found Inside Large Language Models

通用奖励模型:在大型语言模型内部发现

Yi-Chen Li, Tian Xu, Yang Yu, Xuqin Zhang, Xiong-Hui Chen, Zhongxiang Ling, Ningjing Chao, Lei Yuan, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(国家新型软件技术重点实验室,南京大学,中国) ; School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国)

AI总结 本文发现通过标准下一词预测训练的LLM内部已潜在存在通用奖励模型,理论上等价于离线逆强化学习学到的奖励函数,无需额外训练即可引出高质量奖励信号,实验证明该方法优于现有方法并首次提供了RL对LLM有效性的理论证明。

详情

展开后加载摘要…

URL PDF HTML 收藏
↑