arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-02 至 2026-03-02 共收录 180 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 6 篇

2511.05408 2026-03-02 cs.CL cs.LG 86%

Steering Language Models with Weight Arithmetic

通过权重算术引导语言模型

Constanza Fierro, Fabien Roger

机构 * Department of Computer Science University of Copenhagen(计算机科学系 拉丁大学) Anthropic

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 通过权重算术引导方法提升语言模型在分布外行为控制中的性能,同时减少趋炎附势和偏差。

Comments ICLR 2026 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23784 2026-03-02 cs.LG cs.AI q-fin.CP q-fin.TR 81%

TradeFM: A Generative Foundation Model for Trade-flow and Market Microstructure

TradeFM: 一种用于交易流和市场微观结构的生成基础模型

Maxime Kawawa-Beaudan, Srijan Sood, Kassiani Papasotiriou, Daniel Borrajo, Manuela Veloso

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 TradeFM是一种基于生成Transformer的市场微观结构基础模型,通过学习大规模交易数据实现跨资产泛化,有效捕捉市场特征并提升合成数据生成与交易策略研究能力。

Comments 29 pages, 17 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23804 2026-03-02 cs.LG 79%

Actor-Critic Pretraining for Proximal Policy Optimization

行为克隆预训练用于近端策略优化

Andreas Kernbach, Amr Elsheikh, Nicolas Grupp, René Nagel, Marco F. Huber

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于行为克隆的actor-critic预训练方法,用于近端策略优化,通过初始化actor和critic网络提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09513 2026-03-02 q-bio.NC cs.CV 78%

Animal behavioral analysis and neural encoding with transformer-based self-supervised pretraining

基于变换器的自监督预训练的动物行为分析与神经编码

Yanchen Wang, Han Yu, Ari Blau, Yizi Zhang, The International Brain Laboratory, Liam Paninski, Cole Hurwitz, Matt Whiteway

机构 * Columbia University(哥伦比亚大学) International Brain Laboratory(国际脑实验室)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 BEAST通过自监督预训练的变换器框架,提升动物行为分析和神经编码的性能,适用于多种神经行为任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24109 2026-03-02 cs.CL cs.AI 73%

ARGUS: Seeing the Influence of Narrative Features on Persuasion in Argumentative Texts

ARGUS:叙事特征对说服力影响的观察

Sara Nabhani, Federico Pianzola, Khalid Al-Khatib, Malvina Nissim

机构 * University of Groningen(格罗宁根大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ARGUS通过分析叙事特征对说服力的影响,探索在线论证中叙事作用的机制

Comments 22 pages, 8 figures, submitted to ACM Transactions on Intelligent Systems and Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24222 2026-03-02 cs.CV cs.LG 57%

MuViT: Multi-Resolution Vision Transformers for Learning Across Scales in Microscopy

MuViT:多分辨率视觉变换器用于跨尺度学习的显微镜分析

Albert Dominguez Mantes, Gioele La Manno, Martin Weigert

机构 * Swiss Federal Institute of Technology Lausanne(瑞士联邦理工学院洛桑分校) Center for Scalable Data Analytics and Artificial Intelligence (ScaDS.AI)(可扩展数据与人工智能中心(ScaDS.AI)) Technische Universität Dresden(德累斯顿技术大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 MuViT 通过多分辨率视觉变换器在显微镜分析中实现跨尺度学习,提升多分辨率信息利用能力。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 15 篇

2510.22747 2026-03-02 cs.CL cs.AI 90%

Low-Resource Dialect Adaptation of Large Language Models: A French Dialect Case-Study

低资源方言大语言模型适应:法语方言案例研究

Eeham Khan, Firas Saidani, Owen Van Esbroeck, Richard Khoury, Leila Kosseim

机构 * 1\,Computational Linguistics at Concordia (CLaC) Laboratory Department of Computer Science

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了通过持续预训练和参数高效微调方法,将大语言模型适应到低资源方言,以魁北克法语为例,展示了在有限数据和计算资源下提升方言识别性能的方法与成果。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05629 2026-03-02 cs.LG 87%

On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification

在SFT的泛化上:从强化学习视角的奖励校正

Yongliang Wu, Yizhou Zhou, Zhou Ziheng, Yingzhe Peng, Xinyu Ye, Xinting Hu, Wenbo Zhu, Lu Qi, Ming-Hsuan Yang, Xu Yang

机构 * Southeast University(东南大学) University of California, Los Angeles(加州大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) Wuhan University(武汉大学) University of California, Merced(加州大学默塞德分校)

专题命中 指令微调 :SFT(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出动态微调方法,通过奖励校正提升SFT的泛化能力,在多个任务中表现优于传统SFT。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01780 2026-03-02 cs.SE cs.AI 86%

LIA: Supervised Fine-Tuning of Large Language Models for Automatic Issue Assignment

LIA:大型语言模型的监督微调用于自动问题分配

Arsham Khosravani, Alireza Hoseinpour, Arshia Akhavan, Mehdi Keshani, Abbas Heydarnoori

机构 * California State University Northridge(加州州立大学北岭分校) Bowling Green State University(鲍灵格林州立大学)

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 LIA通过监督微调大型语言模型,实现高效准确的问题分配,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23834 2026-03-02 cs.CR cs.AI cs.LG 86%

Enhancing Continual Learning for Software Vulnerability Prediction: Addressing Catastrophic Forgetting via Hybrid-Confidence-Aware Selective Replay for Temporal LLM Fine-Tuning

增强软件漏洞预测的持续学习:通过混合-置信度感知选择性重放应对灾难性遗忘

Xuhui Dou, Hayretdin Bahsi, Alejandro Guerra-Manzanares

机构 * School of Computer Science, University of Nottingham, Nottingham, United Kingdom(诺丁汉大学计算机科学学院) School of Informatics and Computing, Northern Arizona University, Flagstaff, United States of America(北亚利桑那大学信息学院) School of Computer Science, University of Nottingham, Ningbo, China(诺丁汉大学宁波校区)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Hybrid-CASR方法,通过置信度感知和类平衡的选性重放,提升LLM在时间漂移下的漏洞检测准确率和效率。

Comments Accepted for publication in the Proceedings of the 2026 International Conference on Information Systems Security and Privacy (ICISSP)

Journal ref Proceedings of the 12th International Conference on Information Systems Security and Privacy - Volume 1, ISBN 978-989-758-800-6, ISSN 2184-4356, pages 474-485, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00477 2026-03-02 cs.CL 85%

Intention-Adaptive LLM Fine-Tuning for Text Revision Generation

意图自适应的LLM微调用于文本修订生成

Zhexiong Liu, Diane Litman

机构 * Department of Computer Science, Learning Research & Development Center University of Pittsburgh(计算机科学系、学习研究与开发中心宾夕法尼亚大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Intention-Tuning框架,通过意图自适应的逐层微调提升文本修订生成效果。

Comments In the Conference of the European Chapter of the Association for Computational Linguistics (EACL), March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23701 2026-03-02 cs.AI cs.SE 83%

From Flat Logs to Causal Graphs: Hierarchical Failure Attribution for LLM-based Multi-Agent Systems

从平面日志到因果图:面向基于大语言模型的多智能体系统的分层故障归因

Yawen Wang, Wenjie Wu, Junjie Wang, Qing Wang

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Science & Technology on Integrated Information System Laboratory(信息系统集成技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Wuhan University of Technology(武汉理工大学)

专题命中 指令微调 :LLM(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出CHIEF框架,通过分层因果图和反事实归因方法,提升基于大语言模型的多智能体系统故障归因的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03816 2026-03-02 cs.LG cs.CR 79%

Log Probability Tracking of LLM APIs

LLM API 的对数概率跟踪

Timothée Chauvin, Erwan Le Merrer, François Taïani, Gilles Tredan

机构 * Université de Rennes(里昂大学) Inria(法国国家信息与自动化技术研究所) CNRS/IRISA(国家科学研究中心/里昂信息与自动化研究所) LAAS(国家科学研究中心拉瓦尔研究所) CNRS(国家科学研究中心)

专题命中 指令微调 :LLM(title,abstract);分类 cs.LG

AI总结 通过LLM API的对数概率进行低成本持续监控,能检测微调变化并提升审计效率

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23533 2026-03-02 eess.IV cs.CV cs.LG 79%

Few-Shot Continual Learning for 3D Brain MRI with Frozen Foundation Models

小样本持续学习用于3D脑部MRI

Chi-Sheng Chen, Xinyu Zhang, Guan-Ying Chen, Qiuzhe Xie, Fan Zhang, En-Jui Kuo

机构 * Independent Researcher, USA(美国独立研究者) Indiana University at Bloomington, United States(印第安纳大学布卢明顿分校) Independent Researcher, Taiwan(台湾独立研究者) National Taiwan University, Taiwan(台湾国立大学) Boise State University, United States(博伊西州立大学) National Yang Ming Chiao Tung University, Taiwan(台湾阳明交通大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出基于冻结基础模型与任务特定LoRA模块的小样本持续学习方法,有效解决3D脑部MRI肿瘤分割与脑年龄估计任务中的灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05394 2026-03-02 cs.CV cs.LG 79%

pFedMMA: Personalized Federated Fine-Tuning with Multi-Modal Adapter for Vision-Language Models

pFedMMA: 为视觉-语言模型设计的个性化联邦微调多模态适配器

Sajjad Ghiasvand, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 指令微调 :language model(title,abstract);分类 cs.LG

AI总结 pFedMMA通过多模态适配器实现视觉-语言模型的个性化联邦微调,平衡个性化与泛化能力,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24283 2026-03-02 cs.LG cs.AI cs.CL 75%

Taming Momentum: Rethinking Optimizer States Through Low-Rank Approximation

驯服动量:通过低秩近似重新思考优化器状态

Zhengbo Wang, Jian Liang, Ran He, Zilei Wang, Tieniu Tan

机构 * University of Science and Technology of China(中国科学技术大学) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LoRA-Pre通过低秩近似优化器状态,提升预训练和微调效率,实现内存节省与性能提升

Comments Camera-ready version. Accepted as Oral at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13328 2026-03-02 cs.LG cs.AI 73%

Thompson Sampling via Fine-Tuning of LLMs

通过微调大语言模型进行汤普森采样

Nicolas Menet, Aleksandar Terzić, Michael Hersche, Andreas Krause, Abbas Rahimi

机构 * IBM Research – Zurich(IBM瑞士研究院) Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过微调大语言模型实现高效汤普森采样,提升贝叶斯优化的样本和计算效率。

Comments accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23061 2026-03-02 cs.CV 67%

Empowering Small VLMs to Think with Dynamic Memorization and Exploration

赋能小型视觉语言模型进行动态记忆与探索

Jiazhen Liu, Yuchuan Deng, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 指令微调 :language model(abstract);SFT(abstract)

AI总结 DyME通过动态选择记忆与探索策略,提升小型视觉语言模型的推理能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05362 2026-03-02 cs.CV 50%

Imagine a City: CityGenAgent for Procedural 3D City Generation

想象一座城市:CityGenAgent用于程序化3D城市生成

Zishan Liu, Zecong Tang, RuoCheng Wu, Xinzhe Zheng, Jingyu Hu, Ka-Hei Hui, Haoran Xie, Bo Dai, Zhengzhe Liu

机构 * Lingnan University, Hong Kong SAR, China(岭南大学) Zhejiang University, Hangzhou, China(浙江大学) The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) Autodesk AI Lab, Canada(Autodesk AI实验室) The University of Hong Kong, Hong Kong SAR, China(香港大学)

专题命中 指令微调 :SFT(abstract)

AI总结 CityGenAgent通过自然语言驱动的分层程序化生成方法,实现了高质量3D城市生成,提升了语义对齐、视觉质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24038 2026-03-02 cs.CV cs.MA 50%

Enhancing CLIP Robustness via Cross-Modality Alignment

通过跨模态对齐增强CLIP鲁棒性

Xingyu Zhu, Beier Zhu, Shuo Wang, Kesen Zhao, Hanwang Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :language model(abstract)

AI总结 COLA通过跨模态对齐提升CLIP对抗鲁棒性,有效缓解对抗扰动导致的特征不一致问题,提升零样本分类性能。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23393 2026-03-02 cs.SD cs.CV 50%

Leveraging large multimodal models for audio-video deepfake detection: a pilot study

利用大型多模态模型进行音频视频深度伪造检测:一项试点研究

Songjun Cao, Yuqi Li, Yunpeng Luo, Jianjun Yin, Long Ma

机构 * Tencent Youtu Lab(腾讯优图实验室) Fudan University(复旦大学)

专题命中 指令微调 :SFT(abstract)

AI总结 本文提出AV-LMMDetect,利用大型多模态模型进行音频视频深度伪造检测,通过监督微调和分阶段训练,在多个数据集上达到新的性能水平。

Comments 5pages,ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 10 篇

2602.24082 2026-03-02 cs.CL cs.AI 92%

Preference Packing: Efficient Preference Optimization for Large Language Models

偏好打包:大型语言模型高效偏好优化

Jaekyung Cho

机构 * AWS GenAI Innovation Center(AWS生成人工智能创新中心)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);分类 cs.CL、cs.AI

AI总结 偏好打包通过减少重复输入提示的注意力操作和KV缓存内存使用,提升大型语言模型的训练效率,实验显示训练时间减少37%并实现3.22倍速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23371 2026-03-02 cs.CL cs.AI cs.LG 87%

Alignment through Meta-Weighted Online Sampling: Bridging the Gap between Data Generation and Preference Optimization

通过元权重在线采样对齐:弥合数据生成与偏好优化之间的差距

Junming Yang, Ning Xu, Biao Liu, Shiqi Qiao, Xin Geng

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用国家重点实验室)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MetaAPO通过动态结合数据生成与模型训练,有效解决偏好优化中的分布不匹配问题,提升对齐效果并降低标注成本。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26578 2026-03-02 cs.LG 85%

Linking Process to Outcome: Conditional Reward Modeling for LLM Reasoning

将过程与结果联系起来:用于大语言模型推理的条件奖励建模

Zheng Zhang, Ziwei Shan, Kaitao Song, Yexin Li, Kan Ren

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出条件奖励建模(CRM),通过将LLM推理视为时间过程,解决奖励分配模糊性和奖励黑客问题,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24159 2026-03-02 cs.AI 85%

RE-PO: Robust Enhanced Policy Optimization as a General Framework for LLM Alignment

RE-PO:一种用于大语言模型对齐的鲁棒增强策略优化通用框架

Xiaoyang Cao, Zelai Xu, Mo Guang, Kaiwen Long, Michiel A. Bakker, Yu Wang, Chao Yu

机构 * IDSS, Massachusetts Institute of Technology(IDSS,麻省理工学院) EE, Tsinghua University(电子工程系,清华大学) Li Auto Inc.(力汽车公司) SIGS, Tsinghua University(系统工程系,清华大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 RE-PO是一种用于大语言模型对齐的鲁棒增强策略优化通用框架,通过期望最大化程序推断标签正确性并自适应加权数据点以减轻噪声,提升对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23840 2026-03-02 cs.CL 85%

Measuring Sycophancy of Language Models in Multi-turn Dialogues

在多轮对话中衡量语言模型的趋炎附势性

Jiseung Hong, Grace Byun, Seungone Kim, Kai Shu, Jinho D. Choi

机构 * Carnegie Mellon University(卡内基梅隆大学) Emory University(埃默里大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本研究提出SYCON基准,评估多轮对话中语言模型的趋炎附势性,发现对齐调优会放大该行为,而模型规模和推理优化能增强抗压能力,采用第三人称视角可显著减少趋炎附势性。

Comments Accepted to Findings of EMNLP 2025

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 2239-2259

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24040 2026-03-02 cs.LG cs.AI cs.CL 83%

RewardUQ: A Unified Framework for Uncertainty-Aware Reward Models

RewardUQ:一种用于不确定性感知奖励模型的统一框架

Daniel Yang, Samuel Stante, Florian Redhardt, Lena Libon, Parnian Kassraie, Ido Hakimi, Barna Pásztor, Andreas Krause

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 RewardUQ提出了一种统一框架,用于系统评估奖励模型的不确定性量化,通过比较常用方法和提出新排序策略,揭示模型大小和初始化对性能的影响,并开源框架促进新方法的发展和应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15477 2026-03-02 cs.LG cs.AI cs.CL stat.ML 75%

What Makes a Reward Model a Good Teacher? An Optimization Perspective

什么使奖励模型成为好的老师?从优化角度出发

Noam Razin, Zixuan Wang, Hubert Strauss, Stanley Wei, Jason D. Lee, Sanjeev Arora

机构 * Some Institute(某些研究所)

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 从优化角度研究奖励模型的有效性,发现奖励方差对优化效率至关重要,准确性不足以保证模型效果。

Comments Accepted to NeurIPS 2025; Code available at https://github.com/princeton-pli/what-makes-good-rm

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19919 2026-03-02 cs.CL cs.LG 73%

Janus-Q: End-to-End Event-Driven Trading via Hierarchical-Gated Reward Modeling

Janus-Q:通过分层门控奖励建模实现端到端的事件驱动交易

Xiang Li, Zikai Wei, Yiyan Qi, Wanyun Zhou, Xiang Liu, Penglei Sun, Jian Guo, Yongqi Zhang, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) International Digital Economy Academy(国际数字经济学院)

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 Janus-Q通过分层门控奖励模型实现端到端事件驱动交易,提升金融新闻事件作为主要决策单元,提高交易决策的稳定性和盈利能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14069 2026-03-02 cs.CL 57%

Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric

开放评分系统:通过成对自适应评分表扩展强化学习

Ruipeng Jia, Yunyi Yang, Yuxin Wu, Yongbo Gai, Siyuan Tao, Mengyu Zhou, Jianhe Lin, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴文勤大模型应用团队) Beijing University Of Posts and Telecommunications(北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL

AI总结 开放评分系统通过成对自适应评分表和可验证评分表实现强化学习的稳健对齐,提升开放性任务的辨别力和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏