arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-21 至 2026-01-21 共收录 543 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 40 篇

2512.20339 2026-01-21 cs.SD 71%

MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model

MMEDIT: 一种基于音频语言模型的多类型音频编辑统一框架

Ye Tao, Wen Wu, Chao Zhang, Mengyue Wu, Shuai Wang, Xuenan Xu

机构 * MoE Key Lab of Artificial Intelligence, X-LANCE Lab, Shanghai Jiao Tong University(人工智能莫埃实验室、X-LANCE实验室、上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学)

专题命中 指令微调 :language model(title)

AI总结 MMEdit提出一种基于音频语言模型的统一框架,通过扩展任务定义和设计数据合成管道,实现多类型音频编辑的高精度与高保真度。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13572 2026-01-21 cs.LG 70%

Behavior Knowledge Merge in Reinforced Agentic Models

强化学习代理模型中的行为知识融合

Xiangchi Yuan, Dachuan Shi, Chunhui Zhang, Zheyuan Liu, Shenglong Yao, Soroush Vosoughi, Wenke Lee

机构 * Georgia Institute of Technology(佐治亚理工学院) Dartmouth College(达特茅斯学院) University of Notre Dame(诺丁汉大学)

专题命中 指令微调 :post-training(abstract);SFT(abstract);分类 cs.LG

AI总结 本文提出RAM框架,通过分离共享和任务特定参数更新,提升RL训练代理模型的融合效果,实现性能超越专门化代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12775 2026-01-21 cs.CL 70%

Persistent Personas? Role-Playing, Instruction Following, and Safety in Extended Interactions

持久的人格?角色扮演、指令遵循与在扩展互动中的安全性

Pedro Henrique Luz de Araujo, Michael A. Hedderich, Ali Modarressi, Hinrich Schuetze, Benjamin Roth

机构 * University of Vienna, Faculty of Computer Science(维也纳大学计算机科学系) Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学博士学院) Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Vienna, Faculty of Philological and Cultural Studies(维也纳大学文学与文化研究系)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了在长对话中人格保持的稳定性,发现随着对话延长,人格保真度下降,且非人格基线模型在初期表现更优。

Comments 31 pages, 35 figures, accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13105 2026-01-21 cs.CL 70%

Leveraging Lora Fine-Tuning and Knowledge Bases for Construction Identification

利用LoRA微调和知识库进行 constructions 识别

Liu Kaipeng, Wu Ling

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过LoRA微调和知识库结合,提升大型语言模型对英语双宾结构的识别能力,实验显示微调模型在性能上优于原生模型和理论驱动的RAG系统。

Comments 19pages, 1figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18056 2026-01-21 cs.CL 70%

MathEDU: Feedback Generation on Problem-Solving Processes for Mathematical Learning Support

MathEDU: 为数学学习支持生成问题解决过程的反馈

Wei-Ling Hsu, Yu-Chien Tang, An-Zi Yen

机构 * Department of Computer Science, National Yang Ming Chiao Tung University, Taiwan(计算机科学系,National Yang Ming Chiao Tung大学,台湾)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MathEDU研究通过构建数学问题解决过程反馈数据集,评估不同模型在正确性分类、错误识别和反馈生成任务中的可靠性,发现生成反馈存在显著差距,需提升教学意识的AI反馈。

Comments Accepted by EACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11954 2026-01-21 cs.LG 70%

Data-centric Prompt Tuning for Dynamic Graphs

面向动态图的数据导向提示微调

Yufei Peng, Cheng Yang, Zhengjie Fan, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 指令微调 :pretraining(abstract);prompting(abstract);分类 cs.LG

AI总结 DDGPrompt通过数据导向的提示框架优化动态图节点嵌入,提升在少样本和冷启动场景下的适应性与性能。

Comments CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11683 2026-01-21 cs.CR cs.AI cs.SE 70%

Attesting Model Lineage by Consisted Knowledge Evolution with Fine-Tuning Trajectory

通过细调轨迹与持续知识演化认证模型谱系

Zhuoyi Shang, Jiasen Li, Pengzhen Chen, Yanwei Liu, Xiaoyan Gu, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过细调轨迹与持续知识演化认证模型谱系,利用模型编辑和知识向量化机制实现稳健的谱系验证。

Comments Accepted to the 35th USENIX Security Symposium (USENIX Security 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14259 2026-01-21 cs.CV 67%

ManipShield: A Unified Framework for Image Manipulation Detection, Localization and Explanation

ManipShield: 一种用于图像篡改检测、定位和解释的统一框架

Zitong Xu, Huiyu Duan, Xiaoyu Wang, Zhaolin Cai, Kaiwei Zhang, Qiang Hu, Jing Liu, Xiongkuo Min, Guangtao Zhai

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) University of Electronic and Science Technology of China(电子科技大学) Tianjin University(天津大学)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 ManipShield基于多模态大语言模型,通过对比学习LoRA微调和任务特定解码器,实现图像篡改的统一检测、定位和解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07413 2026-01-21 cs.CV 67%

REF-VLM: Triplet-Based Referring Paradigm for Unified Visual Decoding

基于三元组的引用范式用于统一视觉解码

Yan Tai, Luhao Zhu, Yunan Ding, Yiying Dong, Guangtao Zhai, Xiaohong Liu, Guodong Guo

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, 200240, China(上海交通大学计算机科学学院) Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo, China(宁波数字孪生研究院) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University, Shanghai, 200240, China(上海交通大学信息科学与电子工程学院)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 REF-VLM通过引入基于三元组的引用范式,提升多任务视觉解码的性能和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12745 2026-01-21 cs.LG cs.AI 62%

A Graph Prompt Fine-Tuning Method for WSN Spatio-Temporal Correlation Anomaly Detection

一种用于WSN空间时间相关性异常检测的图提示微调方法

Miao Ye, Jing Cui, Yuan huang, Qian He, Yong Wang, Jiwen Zhang

专题命中 指令微调 :prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于图神经网络的WSN空间时间相关性异常检测方法,通过预训练-图提示-微调策略提升检测性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12600 2026-01-21 cs.SD cs.CL cs.LG eess.AS 62%

SSVD-O: Parameter-Efficient Fine-Tuning with Structured SVD for Speech Recognition

SSVD-O:基于结构SVD的参数高效微调用于语音识别

Pu Wang, Shinji Watanabe, Hugo Van hamme

机构 * KU Leuven(卢森堡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.CL、cs.LG

AI总结 SSVD-O通过结合输入和输出特征空间的结构SVD引导微调,实现高效语音识别模型的参数高效微调,提升泛化能力和减少灾难性遗忘。

Comments Accepted by IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09012 2026-01-21 cs.CL cs.AI 62%

TranslateGemma Technical Report

TranslateGemma 技术报告

Mara Finkelstein, Isaac Caswell, Tobias Domhan, Jan-Thorsten Peter, Juraj Juraska, Parker Riley, Daniel Deutsch, Geza Kovacs, Cole Dilanni, Colin Cherry, Eleftheria Briakou, Elizabeth Nielsen, Jiaming Luo, Kat Black, Ryan Mullins, Sweta Agrawal, Wenda Xu, Erin Kats, Stephane Jaskiewicz, Markus Freitag, David Vilar

专题命中 指令微调 :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 TranslateGemma基于Gemma 3开发,通过两阶段微调提升多语言翻译性能,实现高效且高质量的翻译模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12996 2026-01-21 cs.MA cs.LG 57%

OFA-MAS: One-for-All Multi-Agent System Topology Design based on Mixture-of-Experts Graph Generative Models

OFA-MAS:基于混合专家图生成模型的通用多智能体系统拓扑设计

Shiyuan Li, Yixin Liu, Yu Zheng, Mei Li, Quoc Viet Hung Nguyen, Shirui Pan

机构 * Griffith University(格里菲斯大学) Northwest A\&F University(西北农林科技大学)

专题命中 指令微调 :LLM(abstract);分类 cs.LG

AI总结 OFA-MAS提出一种基于混合专家图生成模型的通用多智能体系统拓扑设计框架,通过单个模型生成适应性协作图,提升跨领域任务的性能。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12147 2026-01-21 cs.CV cs.AI 57%

Segment and Matte Anything in a Unified Model

统一模型中的分割与遮罩任何事物

Zezhong Fan, Xiaohan Li, Topojoy Biswas, Kaushiki Nag, Kannan Achan

专题命中 指令微调 :prompting(abstract);分类 cs.AI

AI总结 本文提出SAMA,一种基于SAM的轻量级模型,实现高质量的交互式图像分割与遮罩,通过多视图定位编码器和定位适配器提升精度,展现广泛的应用能力。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00024 2026-01-21 physics.comp-ph cs.LG 57%

Generalization vs. Memorization in Autoregressive Deep Learning: Or, Examining Temporal Decay of Gradient Coherence

自回归深度学习中的泛化与记忆:或者,检验梯度一致性的时间衰减

James Amarel, Nicolas Hengartner, Robyn Miller, Kamaljeet Singh, Siddharth Mansingh, Arvind Mohan, Benjamin Migliori, Emily Casleton, Alexei Skurikhin, Earl Lawrence, Gerd J. Kunde

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) The University of Arizona(亚利桑那大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 本文研究自回归深度学习中泛化与记忆的区别,通过影响函数形式主义分析PDE代理的信息吸收与传播,揭示模型限制并提供改进设计的见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13797 2026-01-21 cs.CV 50%

PREGEN: Uncovering Latent Thoughts in Composed Video Retrieval

PREGEN:在合成视频检索中揭示潜在思想

Gabriele Serussi, David Vainshtein, Jonathan Kouchly, Dotan Di Castro, Chaim Baskin

机构 * Bosch Center for AI(博世人工智能中心) INSIGHT Lab(洞察实验室) Ben-Gurion University of the Negev(巴伊兰大学内盖夫分校)

专题命中 指令微调 :language model(abstract)

AI总结 PREGEN通过结合预训练VLM和轻量级编码模型,高效解决合成视频检索问题,显著提升检索性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 15 篇

2509.04419 2026-01-21 cs.LG cs.AI cs.CL 92%

Towards a Unified View of Large Language Model Post-Training

迈向大规模语言模型后训练的统一视角

Xingtai Lv, Yuxin Zuo, Youbang Sun, Hongyi Liu, Yuntian Wei, Zhekai Chen, Xuekai Zhu, Kaiyan Zhang, Bingning Wang, Ning Ding, Bowen Zhou

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) WeChat AI Code(微信AI代码)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);large language model(title);SFT(abstract)

AI总结 本文提出混合后训练算法,通过统一的优化过程整合在线与离线数据,实现稳定探索与有效利用演示,提升大规模语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13806 2026-01-21 cs.CL cs.LG 91%

Knowledge Graph-Assisted LLM Post-Training for Enhanced Legal Reasoning

基于知识图谱的LLM后训练以增强法律推理

Dezhao Song, Guglielmo Bonifazi, Frank Schilder, Jonathan Richard Schwarz

机构 * Thomson Reuters Foundational Research(汤姆森·路透基础研究) Imperial College London(帝国理工学院伦敦分校)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);SFT(abstract);preference optimization(abstract)

AI总结 本文提出基于知识图谱的LLM后训练方法,通过构建法律知识图谱提升法律推理能力,在多个基准测试中优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06147 2026-01-21 cs.AI cs.CL 91%

DeAL: Decoding-time Alignment for Large Language Models

DeAL:大型语言模型的解码时间对齐

James Y. Huang, Sailik Sengupta, Daniele Bonadiman, Yi-An Lai, Arshit Gupta, Nikolaos Pappas, Saab Mansour, Katrin Kirchhoff, Dan Roth

机构 * University of Southern California(南加州大学) Ω WS AI Labs(Ω WS AI实验室)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);prompting(abstract)

AI总结 DeAL通过允许用户自定义奖励函数和实现解码时间对齐,改进了大型语言模型对齐目标的实现。

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11574 2026-01-21 cs.LG cs.AI 88%

GRADE: Replacing Policy Gradients with Backpropagation for LLM Alignment

GRADE: 用反向传播替代策略梯度以实现大语言模型对齐

Lukas Abrie Nel

机构 * Lotus Health AI(Lotus健康AI)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 GRADE通过可微松弛的离散令牌采样过程替代策略梯度,实现大语言模型对齐的更稳定和高效方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06092 2026-01-21 cs.LG cs.CL 88%

Learning from Failures: Understanding LLM Alignment through Failure-Aware Inverse RL

从失败中学习:通过失败意识反向强化学习理解LLM对齐

Nyal Patel, Matthieu Bou, Arjun Jagota, Satyapriya Krishna, Sonali Parbhoo

机构 * Imperial College London(帝国理工学院伦敦分校) Amazon AGI(亚马逊人工智能实验室)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出一种失败意识反向强化学习算法,通过聚焦于误分类或困难的例子来提取更准确的奖励函数,从而提升LLM对齐的可解释性和安全性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04700 2026-01-21 cs.CL 85%

PRISM: A Unified Framework for Post-Training LLMs Without Verifiable Rewards

PRISM: 一种无需可验证奖励的统一后训练LLM框架

Mukesh Ghimire, Aosong Feng, Liwen You, Youzhi Luo, Fang Liu, Xuan Zhu

机构 * Arizona State University(亚利桑那州立大学) Amazon Web Services(亚马逊网络服务)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PRISM通过结合过程奖励模型与自我确定性,实现无需真实标签的稳定训练和提升LLM测试性能。

Comments Added open-sourced github url

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09212 2026-01-21 cs.CL 85%

Targeting Misalignment: A Conflict-Aware Framework for Reward-Model-based LLM Alignment

针对对齐偏差:一种基于冲突意识的奖励模型驱动LLM对齐框架

Zixuan Liu, Siavash H. Khajavi, Guangkai Jiang, Xinru Liu

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种基于冲突意识的框架,通过识别和缓解代理模型与策略间的冲突来提升大语言模型的对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12748 2026-01-21 cs.CL 77%

Towards Robust Process Reward Modeling via Noise-aware Learning

通过噪声感知学习实现鲁棒的过程奖励建模

Bin Xie, Bingbing Xu, Xueyun Tian, Yilin Chen, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出噪声感知迭代训练框架,通过两阶段方法缓解噪声监督问题,提升过程奖励模型的步骤正确性判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16899 2026-01-21 cs.CL cs.CV 77%

Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image

多模态奖励基准2:评估多模态奖励模型用于交错文本和图像

Yushi Hu, Reyhane Askari-Hemmat, Melissa Hall, Emily Dinan, Luke Zettlemoyer, Marjan Ghazvininejad

机构 * FAIR at Meta Superintelligence Labs(Meta超智能实验室的FAIR)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 多模态奖励基准2评估多模态奖励模型在交错文本和图像任务中的性能,通过专家标注数据和先进模型对比,揭示了不同模型在多模态理解与生成任务中的准确率差异。

Comments Code and data available at https://github.com/facebookresearch/MMRB2

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12294 2026-01-21 cs.AI cs.SE 77%

ToolPRMBench: Evaluating and Advancing Process Reward Models for Tool-using Agents

ToolPRMBench: 评估和推进用于工具使用智能体的过程奖励模型

Dawei Li, Yuguang Yao, Zhen Tan, Huan Liu, Ruocheng Guo

机构 * Arizona State University(亚利桑那州立大学) Intuit AI Research(Intuit人工智能研究)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ToolPRMBench通过构建大规模基准评估工具使用智能体的过程奖励模型,揭示PRM有效性差异并展示专用PRMs的潜力。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12758 2026-01-21 cs.CL cs.AI cs.LG 75%

VISPA: Pluralistic Alignment via Automatic Value Selection and Activation

VISPA:通过自动价值选择和激活实现多元对齐

Shenyan Zheng, Jiayou Zhong, Anudeex Shetty, Heng Ji, Preslav Nakov, Usman Naseem

机构 * University of Waterloo(滑铁卢大学) University of Melbourne(墨尔本大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) MBZUAI(马克斯·普朗克智能系统研究所) Macquarie University(麦考瑞大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 VISPA通过自动价值选择和激活实现多元对齐,适用于多种模型和场景,提供了一种可扩展的语言模型对齐方法。

Comments WIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09929 2026-01-21 eess.AS cs.AI cs.LG 73%

Aligning Generative Speech Enhancement with Perceptual Feedback

将生成式语音增强与感知反馈对齐

Haoyang Li, Nana Hou, Yuchen Hu, Jixun Yao, Sabato Marco Siniscalchi, Xuyi Zhuang, Deheng Ye, Wei Yang, Eng Siong Chng

机构 * Nanyang Technological University, Singapore(南洋理工大学) Independent Researcher(独立研究者) Northwestern Polytechnical University, China(西北工业大学) University of Palermo, Italy(巴勒莫大学) Tencent(腾讯)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于语言模型的语音增强方法,通过引入感知反馈和直接偏好优化,提升语音质量并建立新的感知对齐增强范式。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12730 2026-01-21 cs.LG 70%

Distribution-Centric Policy Optimization Dominates Exploration-Exploitation Trade-off

以分布为中心的策略优化主导探索-利用权衡

Zhaochun Li, Chen Wang, Jionghao Bai, Shisheng Cui, Ge Lan, Zhou Zhao, Yue Wang

机构 * College of Software, Nankai University(南开大学软件学院) Zhongguancun Academy(中关村学院) School of Automation , Beijing Institute of Technology(北京理工大学自动化学院) College of Computer Science(计算机科学学院) Technology, Zhejiang University(浙江大学技术学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出DCPO,通过分布层面的正则化实现可控探索,改进了探索-利用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05197 2026-01-21 cs.CL cs.LG 62%

Pre-Trained Policy Discriminators are General Reward Models

预训练策略判别器是通用奖励模型

Shihan Dou, Shichun Liu, Yuming Yang, Yicheng Zou, Yunhua Zhou, Shuhao Xing, Chenhao Huang, Qiming Ge, Demin Song, Haijun Lv, Songyang Gao, Chengqi Lv, Enyu Zhou, Honglin Guo, Zhiheng Xi, Wenwei Zhang, Qipeng Guo, Qi Zhang, Xipeng Qiu, Xuanjing Huang, Tao Gui, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.CL、cs.LG

AI总结 POLAR通过策略判别器方法构建通用奖励模型,显著提升奖励建模性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏