arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11692 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11692 篇

2607.27083 2026-07-30 cs.LG cs.AI 新提交 88%

Scores Are Not Decisions: Cost-Aware Stopping for Tool Acquisition in LLM Agents

分数并非决策:大语言模型智能体工具获取的成本感知停止策略

Yicheng Feng, Yan Zhang, Yan Cheng, Wei Qi

专题命中 指令微调 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 针对LLM智能体工具获取的异构成本问题,提出CAM-DF及其轻量变体,通过训练停止决策的离线差距实现成本感知停止,在1343个任务上验证其优于基线,减少工具接触量的同时保持任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23171 2026-07-30 cs.CR cs.AI cs.CY cs.LG 版本更新 88%

Adaptively Robust LLM Monitoring via Activation Watermarking

通过激活水印实现语言模型的鲁棒安全监控

Toluwani Aremu, Daniil Ognev, Samuele Poppi, Nils Lukas

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过激活水印技术提升语言模型的安全监控能力,针对适应性攻击者设计改进防御策略,有效提升检测准确率。

Comments 17 pages, 17 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01436 2026-07-03 cs.AI cs.LG 新提交 88%

Discrete Diffusion Language Models for Interactive Radiology Report Drafting

离散扩散语言模型用于交互式放射报告草稿生成

Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert

机构 * Stanford University School of Medicine(斯坦福大学医学院) Ghent University(根特大学) Stanford University(斯坦福大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出将离散扩散语言模型用于放射报告草稿生成,利用其任意顺序填充能力实现交互式编辑,在医学VQA任务上达到或超越自回归模型,解码速度快3.5-4.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01239 2026-07-03 cs.CL cs.AI 新提交 88%

Breaking Safety at the Token Boundary: How BPE Tokenization Creates Exploitable Gaps in LLM Alignment

在Token边界打破安全:BPE分词如何在LLM对齐中制造可利用的漏洞

Tung-Ling Li, Hongliang Liu, Yuhao Wu

机构 * Palo Alto Networks

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究发现BPE分词将安全关键词拆分为子词,导致对齐数据集缺乏此类碎片化输入,通过优化碎片化可绕过80-100%的安全拒绝,并定位到模型最后约30%层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21589 2026-07-02 cs.CL cs.AI 88%

Middo: Model-Informed Dynamic Data Optimization for Enhanced LLM Fine-Tuning via Closed-Loop Learning

Middo: 通过闭环学习提升LLM微调的模型感知动态数据优化

Zinan Tang, Xin Gao, Qizhi Pei, Zhuoshi Pan, Mengzhang Cai, Jiang Wu, Conghui He, Lijun Wu

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出Middo框架,通过闭环学习动态优化数据,提升LLM微调效果,实验显示在多个基准上平均提升7.15%的准确率。

Comments Accepted by EMNLP 2025 (Main)

Journal ref EMNLP Main (2025) 6871-6891

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07954 2026-06-23 cs.LG cs.AI 新提交 88%

Minibatch Selection for Language Models via Partition Matroid Constrained Gradient Matching

基于划分拟阵约束梯度匹配的小批量选择

Prayas Agrawal, Prateek Chanda, Ishita Khatri, Ganesh Ramakrishnan, Bamdev Mishra, Pratik Jawanpuria

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔) Department of Computer Science and Engineering(计算机科学与工程系) Centre for Machine Intelligence and Data Science(机器智能与数据科学中心) Microsoft Research India(微软印度研究院) Microsoft India(微软印度)

专题命中 指令微调 :language model(title,abstract);LLM(summary_cn);large language model(abstract);分类 cs.AI、cs.LG

AI总结 提出PartitionSel方法,通过划分拟阵约束下的梯度匹配效用最大化,实现跨域小批量选择,减少冗余并提升训练兼容性,在LLM微调中取得鲁棒性提升。

Comments 28 pages, 12 figures, ICML 2026

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea, PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09866 2026-06-10 cs.LG cs.AI 新提交 88%

Two to Tango: Coupled Task-Reference Selection for Safe LLM Fine-tuning

双人探戈:面向安全LLM微调的耦合任务-参考选择

Xinrui Chen, Jianhao Zhang, Ou Wu, Di Gao

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出DualSelect框架,通过耦合任务与安全参考选择,在微调时保持安全对齐,提升安全评分至少5.10点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00160 2026-06-02 cs.CR cs.AI cs.CL 88%

DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning

DataShield: 针对大语言模型良性指令微调的安全降级数据过滤

Junbo Zhang, Qianli Zhou, Xinyang Deng, Wen Jiang, Jie Pan, Jinbiao Zhu

机构 * nwpu.edu.cn(西北工业大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出DataShield方法,通过量化每个样本对模型合规行为的贡献作为安全降级分数,高效识别良性数据集中的安全降级样本,并在多个模型和数据集上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14993 2026-05-27 cs.CV cs.AI cs.LG 88%

Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation

Kandinsky 5.0:图像与视频生成的基础模型系列

Vladimir Arkhipkin, Vladimir Korviakov, Nikolai Gerasimenko, Denis Parkhomenko, Viacheslav Vasilev, Alexey Letunovskiy, Nikolai Vaulin, Maria Kovaleva, Ivan Kirillov, Lev Novitskiy, Denis Koposov, Nikita Kiselev, Alexander Varlamov, Dmitrii Mikhailov, Vladimir Polovnikov, Andrey Shutkin, Julia Agafonova, Ilya Vasiliev, Anastasiia Kargapoltseva, Anna Dmitrienko, Anastasia Maltseva, Anna Averchenkova, Olga Kim, Tatiana Nikulina, Denis Dimitrov

机构 * Kandinsky Lab(Kandinsky 实验室)

专题命中 指令微调 :foundation model(title,abstract);SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文介绍Kandinsky 5.0系列模型,通过多阶段训练、自监督微调和强化学习后训练,实现高分辨率图像和10秒视频的高质量生成。

Comments Website: https://kandinskylab.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02605 2026-05-26 cs.NE cs.AI cs.CL q-bio.NC 88%

Fine-Tuning Language Models to Know What They Know

微调语言模型使其了解自身所知

Sangjun Park, Elliot Meyerson, Xin Qiu, Risto Miikkulainen

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cognizant AI Lab(认知人工智能实验室)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种框架,通过进化策略对齐方法(ESMA)在控制偏差的同时提升大语言模型的元认知能力,并在未见数据集、语言和新知识上展现出鲁棒泛化性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20555 2026-05-21 cs.LG cs.AI 88%

Complementing reinforcement learning with SFT through logit averaging in the post training of LLMs

通过logit平均在LLMs后训练中补充强化学习

Xingwei Gan, Ying Zhu

机构 * UC San Diego(加州大学圣迭戈分校)

专题命中 指令微调 :SFT(title,summary_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种在LLMs后训练中通过logit平均补充强化学习的方法,将该方法整合到Group Relative Policy Optimization (GRPO)中,无需使用KL正则化或critic,通过logit平均结构将可训练策略与参考策略耦合,以利用可训练策略的推理能力并保持SFT的格式优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19147 2026-05-20 cs.CR cs.AI cs.LG 88%

Be Kind, Rewrite: Benign Projections via Rewriting Defend Against LLM Data Poisoning Attacks

仁者重写:通过重写实现良性投影以防御大语言模型数据中毒攻击

John T. Halloran, Noopur S. Bhatt

机构 * Leidos University of Pennsylvania(宾夕法尼亚大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于重写的良性投影方法(OBBR),通过利用开放书本的良性样本来提高大语言模型对数据中毒攻击的防御能力,实验表明OBBR在多种已知攻击模式中表现出更高的安全性能,并且在计算效率和模型性能方面具有优势。

Comments 15 pages, 2 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18822 2026-05-20 cs.LG cs.AI 88%

Hybrid-LoRA: Bridging Full Fine-Tuning and Low-Rank Adaptation for Post-Training

Hybrid-LoRA: 桥接全微调与低秩适应以实现训练后优化

Chengqian Zhang, Wei Zhu, Kyumin Lee

机构 * Worcester Polytechnic Institute(沃斯特理工学院) University of Hong Kong(香港大学)

专题命中 指令微调 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Hybrid-LoRA框架,通过选择性地对部分模块进行全微调,其余模块使用LoRA进行适应,从而在训练后优化中实现高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18253 2026-05-19 cs.CL cs.AI 88%

Machine Unlearning for Masked Diffusion Language Models

针对掩码扩散语言模型的机器去学习

Georu Lee, Seungwon Jeong, Hoki Kim, Jinseong Park, Woojin Lee

机构 * Dongguk University-Seoul(东国大学-首尔) Chung-Ang University(Chung-Ang 大学) Korea Institute for Advanced Study(韩国高级研究院)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种针对掩码扩散语言模型的去学习框架MDU,通过重新审视扩散过程中的知识学习,实现了高效的去学习性能。

Comments 20 pages, 8 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15394 2026-05-18 cs.LG cs.AI stat.ML 88%

Representation Without Reward: A JEPA Audit for LLM Fine-Tuning

无奖励的表示:用于LLM微调的JEPA审计

Biswa Sengupta

机构 * LLM Suite group of JP Morgan Chase and its affiliates(JP摩根士丹利 LLC 集团及其附属机构)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文探讨了在无奖励设定下,通过JEPA架构学习更有效的表示方法,测试了多种辅助项在自然语言到正则表达式生成任务中的表现,发现某些辅助项在特定统计检验下显著,但整体效果不显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10720 2026-05-14 cs.AI cs.CL cs.CY 88%

Teaching Language Models How to Code Like Learners: Conversational Serialization for Student Simulation

教语言模型如何像学习者一样编程:用于学生模拟的对话序列化

Charles Koutcheme, Juho Leinonen, Arto Hellas

专题命中 指令微调 :language model(title,abstract);large language model(abstract);preference optimization(abstract);prompting(abstract)

AI总结 本文提出通过对话序列化技术,直接从真实学生编程过程数据训练开放权重的人工编程学习者,提升模型在调试行为模拟中的能力。

Comments 8 pages, 2 figures, 2 tables. Accepted to Educational Data Mining 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11235 2026-05-13 cs.LG cs.AI 88%

Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning

将课程判断内部化以优化大语言模型强化微调

Han Zheng, Yining Ma, Karthick Gunasekaran, Bharathan Balaji, Zheng Du, Shiv Vitaladevuni, Cathy Wu

机构 * MIT(麻省理工学院) Amazon AGI(亚马逊人工智能实验室)

专题命中 指令微调 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 本文提出METIS框架,通过内部化课程判断提升LLM强化微调效率与性能,利用训练结果动态分配训练资源,实现闭环优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09015 2026-05-12 cs.CL cs.LG 88%

LLiMba: Sardinian on a Single GPU -- Adapting a 3B Language Model to a Vanishing Romance Language

LLiMba:单块GPU上的萨丁语——将一个3B语言模型适应到一种消失的罗曼语

Luca Ballore

机构 * Qwen2.5-3B-Instruct

专题命中 指令微调 :language model(title,abstract);SFT(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文提出LLiMba,通过持续预训练和监督微调,在单块24GB显卡上将Qwen2.5-3B-Instruct模型适应到萨丁语,实现低资源罗曼语的高效生成,展示了rsLoRA r256在翻译性能上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21571 2026-04-24 cs.AI cs.LG 88%

Separable Expert Architecture: Toward Privacy-Preserving LLM Personalization via Composable Adapters and Deletable User Proxies

可分离专家架构:通过可组合的适配器和可删除的用户代理实现隐私保护的LLM个性化

Chris Schneider, Philipp Schoenegger, Ben Bariach

机构 * Microsoft AI(微软人工智能)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种三层架构,通过静态基础模型、可组合的领域专家LoRA适配器和可删除的用户代理,实现将个人数据与共享权重解耦,从而在不重新训练的情况下实现隐私保护的个性化LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16583 2026-04-21 cs.LG cs.AI 88%

POLAR: Online Learning for LoRA Adapter Caching and Routing in Edge LLM Serving

POLAR:边缘大语言模型服务中的LoRA适配器缓存与路由在线学习

Shaoang Li, Jian Li

机构 * Stony Brook University(石英溪大学)

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出POLAR算法,通过在线学习解决边缘LLM服务中LoRA适配器的缓存与路由问题,结合缓存控制与路由策略,实现子线性 regrets 的理论保证和实验验证。

Comments 15pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13993 2026-04-16 cs.AI cs.CL cs.CV 88%

Reward Design for Physical Reasoning in Vision-Language Models

用于视觉语言模型中物理推理的奖励设计

Derek Lilienthal, Manisha Mukherjee, Sameera Horawalavithana

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 指令微调 :language model(title,abstract);SFT(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了奖励设计对视觉语言模型物理推理的影响,通过对比不同奖励信号发现,基于准确性的奖励在多数领域表现最佳,而基于注意力权重的奖励提升了空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10135 2026-04-16 cs.CL cs.AI 88%

Think in Sentences: Explicit Sentence Boundaries Enhance Language Model's Capabilities

按句子思考:显式句子边界增强语言模型的能力

Zhichen Liu, Yongyuan Li, Yang Xu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过在语言模型输入中插入句子边界分隔符,提升其处理能力,实验显示在GSM8k和DROP任务上分别提升7.7%和12.5%。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01152 2026-04-02 cs.CL cs.AI 88%

Brainstacks: Cross-Domain Cognitive Capabilities via Frozen MoE-LoRA Stacks for Continual LLM Learning

Brainstacks:通过冻结MoE-LoRA堆栈实现跨领域认知能力的持续LLM学习

Mohammad R. Abu Ayyash

机构 * Brains Build Research

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 Brainstacks通过冻结MoE-LoRA堆栈实现持续多领域微调,利用残差增强突破单堆栈限制,实现跨领域组合。

Comments 26 pages, 13 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27006 2026-04-01 cs.CL cs.AI cs.CY 88%

The Last Fingerprint: How Markdown Training Shapes LLM Prose

最后的指纹:Markdown训练如何塑造LLM的散文

E. M. Freeburg

机构 * Independent Researcher(独立研究员)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究发现LLM中连字符的使用受训练数据影响,通过实验揭示连字符频率作为微调方法的诊断指标,而非风格缺陷。

Comments 14 pages, 3 tables. Code and data: https://github.com/emfreeburg/the-last-fingerprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09195 2026-03-26 cs.CL cs.AI 88%

ProFit: Leveraging High-Value Signals in SFT via Probability-Guided Token Selection

ProFit:通过概率引导的标记选择利用SFT中的高价值信号

Tao Liu, Taiqiang Wu, Runming Yang, Shaoning Sun, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 指令微调 :SFT(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 ProFit通过概率引导的标记选择策略,有效缓解SFT中单参考答案导致的过拟合问题,提升模型在通用推理和数学任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18272 2026-03-20 cs.AI cs.CL 88%

Retrieval-Augmented LLM Agents: Learning to Learn from Experience

基于检索的LLM代理:学习从经验中学习

Thomas Palmeira Ferraz, Romain Deffayet, Vassilina Nikoulina, Hervé Déjean, Stéphane Clinchant

机构 * NAVER LABS Europe(NAVER实验室欧洲)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出结合微调与经验检索的方法,通过LoRA优化SFT流程,分析经验检索关键设计,提出整合经验检索的训练流程,提升代理对新任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20492 2026-02-25 cs.LG cs.AI 88%

Wireless Federated Multi-Task LLM Fine-Tuning via Sparse-and-Orthogonal LoRA

通过稀疏和正交LoRA实现无线联邦多任务大语言模型微调

Nuocheng Yang, Sihua Wang, Ouwen Huan, Mingzhe Chen, Tony Q. S. Quek, Changchuan Yin

机构 * Beijing Laboratory of Advanced Information Network(北京先进信息网络实验室) Beijing Key Laboratory of Network System Architecture and Convergence(北京网络系统架构与融合重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Department of Electrical and Computer Engineering and Institute for Data Science and Computing(电气与计算机工程系和数据科学与计算研究所) University of Miami(迈阿密大学) Information Systems Technology and Design Pillar(信息系统技术与设计支柱)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出稀疏和正交LoRA方法,通过去中心化联邦学习解决多任务大语言模型微调中的知识遗忘、通信效率和推理干扰问题,实验显示通信消耗降低73%,性能提升5%。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20006 2026-01-29 cs.CL cs.AI 88%

On the Effectiveness of LLM-Specific Fine-Tuning for Detecting AI-Generated Text

针对检测AI生成文本的LLM特定微调效果研究

Michał Gromadzki, Anna Wróblewska, Agnieszka Kaliska

机构 * Faculty of Mathematics and Information Science, Warsaw University of Technology(华沙技术大学数学与信息科学学院) Faculty of Modern Languages and Literatures, Adam Mickiewicz University(亚当·密茨凯维奇大学现代语言与文学学院)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过大规模语料库和新颖训练策略,提出Per LLM和Per LLM family微调方法,开发出在词级准确率上达99.6%的AI生成文本检测模型。

Comments 34 pages, 6 figures. Under review at Information Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06534 2026-01-19 cs.AI cs.LG 88%

Beneficial Reasoning Behaviors in Agentic Search and Effective Post-training to Obtain Them

代理搜索中的有益推理行为及有效训练以获得这些行为

Jiahe Jin, Abhijay Paladugu, Chenyan Xiong

专题命中 指令微调 :post-training(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出行为引导方法,通过预训练使代理搜索模型具备信息验证、权威评估等有益推理行为,从而在强化学习前提升任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07389 2026-01-13 cs.LG cs.AI cs.IT math.IT 88%

On the Non-decoupling of Supervised Fine-tuning and Reinforcement Learning in Post-training

在训练后阶段,监督微调与强化学习无法解耦

Xueyan Niu, Bo Bai, Wei Han, Weixi Zhang

机构 * Theory Laboratory Central Research Institute, 2012 Laboratories(理论实验室中央研究院,2012实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 指令微调 :post-training(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 研究证明在训练后阶段,监督微调与强化学习无法解耦,且在交替训练顺序下会导致性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏