arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11667 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11667 篇

2604.06171 2026-04-29 cs.CL cs.AI 86%

LLM-Augmented Knowledge Base Construction For Root Cause Analysis

基于大语言模型的知识库构建用于根本原因分析

Nguyen Phuc Tran, Brigitte Jaumard, Oscar Delgado, Tristan Glatard, Karthikeyan Premkumar, Kun Ni

机构 * Department of Computer Science and Software Engineering, Concordia University(计算机科学与软件工程系,康科迪亚大学) École de Technologie Supérieure(高级技术学院) GAIA-Ericsson Montréal, Canada(蒙特利尔加拿大GAIA-爱立信)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了三种大语言模型方法,用于从支持票中构建根本原因分析知识库,通过词法和语义相似性指标比较其性能,实验表明生成的知识库能有效加速RCA任务并提升网络韧性。

Comments This work has been accepted for publication in IEEE Access. The final published version will be available via IEEE Xplore

Journal ref 2026 IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04448 2026-04-21 cs.CL cs.AI 86%

Merging Triggers, Breaking Backdoors: Defensive Poisoning for Instruction-Tuned Language Models

融合触发器,打破后门:面向指令微调语言模型的防御性中毒

San Kim, Gary Geunbae Lee

机构 * Graduate School of Artificial Intelligence, POSTECH, Republic of Korea(POSTECH人工智能研究生院,韩国) Department of Computer Science and Engineering, POSTECH, Republic of Korea(POSTECH计算机科学与工程系,韩国)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MB-Defense框架,通过防御性中毒和后门中和两个阶段,提升指令微调语言模型对后门攻击的鲁棒性,实验表明其有效降低攻击成功率并保持指令遵循能力。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07892 2026-04-21 cs.CL cs.AI 86%

Data Selection for Multi-turn Dialogue Instruction Tuning

多轮对话指令微调的数据选择

Bo Li, Shikun Zhang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) School of Computer Science, Peking University(北京大学计算机学院) PKU-CMCC(Hubei) Joint Research Lab for LLM Industrial Applications(北京大学-湖北CMCC大模型工业应用联合实验室)

专题命中 指令微调 :instruction tuning(title);LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MDS框架,通过全局覆盖和局部结构阶段选择多轮对话数据,提升指令微调效果,优于现有方法并在多个基准测试中表现最佳。

Comments Github: https://github.com/WisdomShell/MDS Project: https://wisdomshell.github.io/MDS/

Journal ref Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14016 2026-04-16 cs.LG cs.AI 86%

MAny: Merge Anything for Multimodal Continual Instruction Tuning

MAny:为多模态连续指令微调合并任何内容

Zijian Gao, Wangwang Jia, Xingxing Zhang, Pengfei Qian, Tao Sun, Bo Ding, Yong Dou, Huaimin Wang, Kele Xu

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) National Key Laboratory of Parallel and Distributed Computing, National University of Defense Technology(国防科技大学并行与分布式计算国家重点实验室) State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) School of Computer Science, Tsinghua University(清华大学计算机科学与技术系)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对多模态连续指令微调中感知漂移和推理崩溃问题,提出MAny框架,通过跨模态投影合并和低秩参数合并实现任务知识融合,提升模型鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03402 2026-04-14 cs.AI cs.LG 86%

Risk Awareness Injection: Calibrating Vision-Language Models for Safety without Compromising Utility

风险感知注入:为安全校准视觉-语言模型而不牺牲实用性

Mengxuan Wang, Yuxin Chen, Gang Xu, Tao He, Hongjie Jiang, Ming Li

机构 * Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(华南理工大学吴贤铭智能工程学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) University of Electronic Science and Technology of China(电子科技大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RAI框架,通过增强不安全信号恢复视觉-语言模型的安全识别能力,同时保持语义完整性,实验显示有效降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18978 2026-04-09 cs.CL cs.AI 86%

Low-Confidence Gold: Refining Low-Confidence Samples for Efficient Instruction Tuning

低置信度黄金:用于高效指令微调的低置信度样本精炼

Hongyi Cai, Jie Li, Mohammad Mahdinur Rahman, Wenzhen Dong

机构 * Universiti Malaya(马来亚大学) University of Science and Technology Beijing(北京科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LCG框架,通过聚类和置信度引导选择精炼低置信度样本,提升指令微调效率与性能,实验显示在MT-bench等指标上表现更优。

Comments Accepted to EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07274 2026-04-06 cs.CL cs.CY cs.LG 86%

LLM Analysis of 150+ years of German Parliamentary Debates on Migration Reveals Shift from Post-War Solidarity to Anti-Solidarity in the Last Decade

基于150余年德国议会辩论的LLM分析揭示了从战后团结到反团结的转变

Aida Kostikova, Ole Pütz, Steffen Eger, Olga Sabelfeld, Benjamin Paassen

机构 * Bielefeld University(比勒费尔德大学) University of Technology Nuremberg(纽伦堡工业大学)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文利用LLM分析德国议会辩论中的迁移议题,发现战后时期团结程度较高,而2015年后反团结显著上升,提出需通过验证和统计修正来提升LLM在社会科学研究中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00304 2026-04-02 cs.CL cs.AI 86%

Asymmetric Actor-Critic for Multi-turn LLM Agents

多轮LLM代理的非对称Actor-Critic

Shuli Jiang, Zhaoyang Zhang, Yi Zhang, Shuo Yang, Wei Xia, Stefano Soatto

机构 * AWS Agentic AI

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出非对称Actor-Critic框架,利用专有LLM作为Actor,开源模型作为Critic,提升多轮对话可靠性。实验显示该方法在τ-bench和UserBench上优于单Agent基线,且轻量级Critic表现优异。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22287 2026-03-25 cs.CV cs.AI cs.CL 86%

Founder effects shape the evolutionary dynamics of multimodality in open LLM families

奠基效应塑造了开放大语言模型家族中多模态的进化动态

Manuel Cebrian

机构 * Center for Automation and Robotics, Spanish National Research Council, Madrid, Spain(自动化与机器人中心,西班牙国家研究委员会,西班牙马德里)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过分析模型谱系数据,发现多模态能力在开放大语言模型家族中通过罕见的奠基事件进入,并在后代谱系中快速扩展,导致多模态能力的采用动态呈现突变特征。

Comments 7 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16127 2026-03-18 cs.CL cs.LG 86%

Pre-training LLM without Learning Rate Decay Enhances Supervised Fine-Tuning

在不使用学习率衰减的情况下预训练LLM增强了监督微调

Kazuki Yano, Shun Kiyono, Sosuke Kobayashi, Sho Takase, Jun Suzuki

机构 * Tohoku University(东大大学)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文研究了学习率调度在大语言模型预训练中的作用,发现不使用衰减的学习率调度在监督微调后表现更优,且损失景观分析显示其保持更平坦的最小值以支持适应性。

Comments 25 pages, accepted by ICLR 2026 as a conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13790 2026-03-17 cs.LG cs.CL 86%

Greedy Information Projection for LLM Data Selection

贪心信息投影用于大语言模型数据选择

Victor Ye Dong, Kuan-Yun Lee, Jiamei Shuai, Shengfei Liu, Yi Liu, Jian Jiao

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出贪心信息投影框架,通过最大化子集与任务查询信号的互信息,平衡质量与多样性,高效选择数据集进行微调。

Comments Published as a paper at 3rd DATA-FM workshop @ ICLR 2026, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20900 2026-03-13 cs.SD cs.CL cs.LG eess.AS 86%

Text-only adaptation in LLM-based ASR through text denoising

基于文本去噪的LLM语音识别领域适应

Andrés Carofilis, Sergio Burdisso, Esaú Villatoro-Tello, Shashi Kumar, Kadri Hacioglu, Srikanth Madikeri, Pradeep Rangappa, Manjunath K E, Petr Motlicek, Shankar Venkatesan, Andreas Stolcke

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过文本去噪方法实现LLM语音识别领域适应,有效保持跨模态对齐并提升性能,实测在两个数据集上达到22.1%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01968 2026-03-12 cs.CL cs.AI 86%

Token Cleaning: Fine-Grained Data Selection for LLM Supervised Fine-Tuning

令牌清理:面向LLM监督微调的细粒度数据选择

Jinlong Pang, Na Di, Zhaowei Zhu, Jiaheng Wei, Hao Cheng, Chen Qian, Yang Liu

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出了一种令牌清洗方法,通过评估令牌质量并过滤无信息令牌,提升LLM监督微调的下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08754 2026-03-11 cs.LG cs.AI 86%

Hindsight Credit Assignment for Long-Horizon LLM Agents

长远时间LLM智能体的回顾信用分配

Hui-Ze Tan, Xiao-Wen Yang, Hao Chen, Jie-Jing Shao, Yi Wen, Yuteng Shen, Weihong Luo, Xiku Du, Lan-Zhe Guo, Yu-Feng Li

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HCAPO通过整合回顾信用分配提升LLM智能体在长期任务中的探索效率和决策简洁性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06604 2026-03-10 cs.LG cs.CL 86%

Know When You're Wrong: Aligning Confidence with Correctness for LLM Error Detection

知何时错误:将置信度与正确性对齐以用于LLM错误检测

Xie Xiaohu, Liu Xiaohu, Yao Benjamin

机构 * Alexa AI, Amazon, Seattle, WA, USA(Alexa AI,亚马逊,西雅图,华盛顿州)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出归一化置信度分数和自我评估框架,通过SFT提升LLM置信度可靠性,减少校准误差,提升错误检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03095 2026-03-04 cs.CL cs.AI 86%

Compact Prompting in Instruction-tuned LLMs for Joint Argumentative Component Detection

在指令调优的LLM中使用紧凑提示进行联合论证组件检测

Sofiane Elguendouze, Erwan Hain, Elena Cabrio, Serena Villata

机构 * Université Côte d’Azur, I3S, CNRS, Inria(法国埃克塞特大学、I3S研究所、国家科学研究中心、法国国家信息与自动化研究所)

专题命中 指令微调 :prompting(title);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出利用指令调优的LLM和紧凑提示,将论证组件检测重新建模为生成任务,提升从文本中直接识别论证组件的性能。

Comments Under Review (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01185 2026-03-03 cs.CL cs.AI cs.CR 86%

Token-level Data Selection for Safe LLM Fine-tuning

令牌级数据选择用于安全大语言模型微调

Yanping Li, Zhening Liu, Zijian Li, Zehong Lin, Jun Zhang

机构 * The Hong Kong University of Science(香港科学与技术大学) School of Data Science, Lingnan University(岭南大学数据科学学院)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TOSS框架,通过令牌级数据选择提升LLM微调的安全性,同时在下游任务性能上优于现有样本级防御方法。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06377 2026-03-03 cs.LG cs.AI cs.DB 86%

Relational Transformer: Toward Zero-Shot Foundation Models for Relational Data

关系变换器:面向关系数据的零样本基础模型

Rishabh Ranjan, Valter Hudovernik, Mark Znidar, Charilaos Kanatsoulis, Roshan Upendra, Mahmoud Mohammadi, Joe Meyer, Tom Palczewski, Carlos Guestrin, Jure Leskovec

专题命中 指令微调 :foundation model(title,abstract);LLM(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 关系变换器通过零样本迁移能力,为关系数据提供高效的基础模型解决方案。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12186 2026-03-03 cs.LG cs.AI cs.CR 86%

Self-Destructive Language Model

自我毁灭型语言模型

Yuhui Wang, Rongyi Zhu, Ting Wang

机构 * Department of Computer Science(计算机科学系)

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 SEAM是一种通过自我毁灭机制增强大语言模型安全性的新型防御方法,通过使模型在面对有害数据微调时性能急剧下降,从而有效抵御攻击。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23834 2026-03-02 cs.CR cs.AI cs.LG 86%

Enhancing Continual Learning for Software Vulnerability Prediction: Addressing Catastrophic Forgetting via Hybrid-Confidence-Aware Selective Replay for Temporal LLM Fine-Tuning

增强软件漏洞预测的持续学习:通过混合-置信度感知选择性重放应对灾难性遗忘

Xuhui Dou, Hayretdin Bahsi, Alejandro Guerra-Manzanares

机构 * School of Computer Science, University of Nottingham, Nottingham, United Kingdom(诺丁汉大学计算机科学学院) School of Informatics and Computing, Northern Arizona University, Flagstaff, United States of America(北亚利桑那大学信息学院) School of Computer Science, University of Nottingham, Ningbo, China(诺丁汉大学宁波校区)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Hybrid-CASR方法,通过置信度感知和类平衡的选性重放,提升LLM在时间漂移下的漏洞检测准确率和效率。

Comments Accepted for publication in the Proceedings of the 2026 International Conference on Information Systems Security and Privacy (ICISSP)

Journal ref Proceedings of the 12th International Conference on Information Systems Security and Privacy - Volume 1, ISBN 978-989-758-800-6, ISSN 2184-4356, pages 474-485, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07989 2026-02-20 cs.CL cs.AI 86%

State of the Art in Text Classification for South Slavic Languages: Fine-Tuning or Prompting?

南斯拉夫语言文本分类的现状:微调还是提示?

Taja Kuzman Pungeršek, Peter Rupnik, Ivan Porupski, Vuk Dinić, Nikola Ljubešić

机构 * Jožef Stefan Institute(乔泽夫·斯塔芬研究所) Faculty of Computer and Information Science(计算机与信息科学系) University of Ljubljana(卢布尔雅纳大学) Institute of Contemporary History(当代历史研究所)

专题命中 指令微调 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了南斯拉夫语言文本分类中微调BERT模型与LLMs的性能,发现LLMs在零样本设置下表现优异,但存在推理慢和计算成本高等问题,故微调模型仍更实用。

Comments 17 pages; 4 figures; 3 tables. Submitted to the LLMs4SSH workshop, co-located with the LREC 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04103 2026-02-16 cs.AI cs.LG stat.ML 86%

How to Train Your LLM Web Agent: A Statistical Diagnosis

如何训练你的LLM网络代理:一种统计诊断

Dheeraj Vattikonda, Santhoshi Ravichandran, Emiliano Penaloza, Hadi Nekoei, Megh Thakkar, Thibault Le Sellier de Chezelles, Nicolas Gontier, Miguel Muñoz-Mármol, Sahar Omidi Shayegan, Stefania Raimondo, Xue Liu, Alexandre Drouin, Laurent Charlin, Alexandre Piché, Alexandre Lacoste, Massimo Caccia

机构 * ServiceNow AI Research(ServiceNow人工智能研究) Mila-Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学)

专题命中 指令微调 :LLM(title,abstract);post-training(abstract);SFT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于统计的计算分配方法,通过结合监督微调与基于策略的强化学习,有效提升LLM网络代理性能,减少计算成本,缩小与闭源模型的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11220 2026-02-13 cs.LG cs.CL 86%

Patch the Distribution Mismatch: RL Rewriting Agent for Stable Off-Policy SFT

修补分布不匹配:用于稳定离策略SFT的RL重写代理

Jiacheng Wang, Ping Jian, Zhen Yang, Zirong Chen, Keren Liao, Zhongbin Guo

机构 * School of Computer Science & Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

专题命中 指令微调 :SFT(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于强化学习的RL重写代理,通过优化分布对齐和多样性,提升下游SFT效果并减少遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17489 2026-02-05 cs.CL cs.AI 86%

MapCoder-Lite: Distilling Multi-Agent Coding into a Single Small LLM

MapCoder-Lite:将多智能体编码 distilling 进单一小型 LLM

Woongkyu Lee, Junhee Cho, Jungwook Choi

机构 * Hanyang University(翰阳大学) Samsung SDS(三星SDS)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 MapCoder-Lite通过三支柱方法将多智能体编码distilling进单一7B模型,显著提升代码生成性能并降低资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03237 2026-02-04 cs.LG cs.CL 86%

Merging Beyond: Streaming LLM Updates via Activation-Guided Rotations

超越合并:通过激活引导的旋转进行流式LLM更新

Yuxuan Yao, Haonan Sheng, Qingsong Lv, Han Wu, Shuqi Liu, Zehua Liu, Zengyan Liu, Jiahui Gao, Haochen Tan, Xiaojin Fu, Haoli Bai, Hing Cheung So, Zhijiang Guo, Linqi Song

机构 * City University of Hong Kong, Hong Kong SAR(香港城市大学) Tsinghua University(清华大学) Huawei Noah’s Ark Lab, Hong Kong SAR(华为诺亚实验室(香港)) University of Hong Kong(香港大学) Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出ARM策略,通过激活引导的旋转实现流式LLM更新,有效超越收敛模型,提供高效适应框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17133 2026-01-27 cs.LG cs.AI cs.CR cs.DC cs.MA 86%

Learning to Collaborate: An Orchestrated-Decentralized Framework for Peer-to-Peer LLM Federation

学习协作:一种协同-去中心化框架用于点对点大语言模型联邦

Inderjeet Singh, Eleonore Vissol-Gaudin, Andikan Otung, Motoyoshi Sekiya

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 KNEXA-FL通过协同去中心化框架提升点对点大语言模型联邦学习的效率与稳定性

Comments Accepted to AAAI 2026. 13 pages, 3 figures, 10 tables. Code available at: https://github.com/FujitsuResearch/knexa-fl

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05501 2026-01-12 cs.LG cs.CL 86%

Hi-ZFO: Hierarchical Zeroth- and First-Order LLM Fine-Tuning via Importance-Guided Tensor Selection

Hi-ZFO:通过重要性引导的张量选择实现层次化零阶和一阶LLM微调

Feihu Jin, Ying Tan

机构 * School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 Hi-ZFO通过结合一阶和零阶优化,提升LLM微调的精度与探索能力,有效解决训练中的局部极小值问题。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03320 2026-01-08 cs.LG cs.AI 86%

Ratio-Variance Regularized Policy Optimization for Efficient LLM Fine-tuning

基于比率方差正则化的策略优化用于高效的LLM微调

Yu Luo, Shuo Han, Yihan Hu, Dong Li, Jianye Hao

机构 * Department of Foundation Model, 2012 Labs, Huawei(华为2012实验室基础模型部门) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 R²VPO通过正则化策略比率的方差,提升LLM微调的稳定性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00942 2026-01-06 cs.LG cs.CL 86%

Reliability Under Randomness: An Empirical Analysis of Sparse and Dense Language Models Across Decoding Temperatures

可靠性与随机性:在解码温度下对稀疏和密集语言模型的实证分析

Kabir Grover

机构 * Kabir Grover(独立研究者)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了稀疏和密集语言模型在不同解码温度下的可靠性,发现指令微调比架构稀疏性对稳定性影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22378 2025-12-30 cs.CL cs.AI 86%

Towards Efficient Post-Training via Fourier-Driven Adapter Architectures

面向通过傅里叶驱动适配架构的高效后训练

Donggyun Bae, Jongil Park

机构 * Konkuk University(韩国康 kuk 大学)

专题命中 指令微调 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 FAA通过傅里叶驱动的适配架构实现大型语言模型的高效后训练,通过频率感知调节提升性能并降低计算开销。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏