arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-08 至 2026-01-08 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 16 篇

2601.03725 2026-01-08 cs.LG 89%

EDCO: Dynamic Curriculum Orchestration for Domain-specific Large Language Model Fine-tuning

EDCO:面向领域特定大语言模型微调的动态课程编排

Jing-Cheng Pang, Liu Sun, Chang Zhou, Xian Tang, Haichuan Ma, Kun Jiang, Jianlong Wang, Kai Zhang, Sijie Wu, Haoran Cai, Chenwei Wu, Xubin Li, Xin Chen

机构 * Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 EDCO通过动态课程编排和熵估计提升领域特定大语言模型微调效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03320 2026-01-08 cs.LG cs.AI 86%

Ratio-Variance Regularized Policy Optimization for Efficient LLM Fine-tuning

基于比率方差正则化的策略优化用于高效的LLM微调

Yu Luo, Shuo Han, Yihan Hu, Dong Li, Jianye Hao

机构 * Department of Foundation Model, 2012 Labs, Huawei(华为2012实验室基础模型部门) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 R²VPO通过正则化策略比率的方差,提升LLM微调的稳定性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20118 2026-01-08 cs.CL cs.CR 85%

TrojanStego: Your Language Model Can Secretly Be A Steganographic Privacy Leaking Agent

TrojanStego: 你的语言模型可能 secretly 成为一个隐写术隐私泄露代理

Dominik Meier, Jan Philip Wahle, Paul Röttger, Terry Ruas, Bela Gipp

机构 * University of Göttingen(哥廷根大学) LKA NRW(北莱茵-威斯特法伦州检察署) Bocconi University(博科尼大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 TrojanStego通过语言隐写术在LLM输出中隐秘泄露敏感信息,展示了一种新型被动且危险的LLM数据外泄攻击方式。

Comments 9 pages, 5 figures To be presented in the Conference on Empirical Methods in Natural Language Processing, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03401 2026-01-08 cs.CL 85%

Rendering Data Unlearnable by Exploiting LLM Alignment Mechanisms

通过利用大语言模型对齐机制使数据不可学习

Ruihan Zhang, Jun Sun

机构 * Singapore Management University(新加坡国立管理大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过利用LLM对齐机制,提出免责声明注入方法,使数据对模型不可学习,实现数据保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09900 2026-01-08 cs.AI cs.CE 83%

Boosting In-Silicon Directed Evolution with Fine-Tuned Protein Language Model and Tree Search

通过微调蛋白质语言模型和树搜索提升硅基定向进化

Yaodong Yang, Yang Wang, Jinpeng Li, Pei Guo, Da Han, Guangyong Chen, Pheng-Ann Heng

机构 * Department of Computer Science(计算机科学与工程系) Engineering, The Chinese University of Hong Kong(香港中文大学) Hangzhou Institute of Medicine, Chinese Academy of Sciences(中国科学院杭州医学研究所)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 AlphaDE通过微调蛋白质语言模型和树搜索提升硅基定向进化效率

Comments working in progress, 20 pages, 6 figures, 16 tables, updating template

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03505 2026-01-08 cs.CL cs.AI 82%

Beyond Perplexity: A Lightweight Benchmark for Knowledge Retention in Supervised Fine-Tuning

超越困惑度:一种轻量级的知识保留监督微调基准

Soheil Zibakhsh Shabgahi, Pedram Aghazadeh, Farinaz Koushanfar

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);SFT(abstract)

AI总结 本文提出KR测试,一种轻量级基准,用于区分监督微调中的事实学习与语言学,通过对比示例评估知识保留,提升微调动态的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21578 2026-01-08 cs.AI 81%

NEMO-4-PAYPAL: Leveraging NVIDIA's Nemo Framework for empowering PayPal's Commerce Agent

NEMO-4-PAYPAL:利用NVIDIA的Nemo框架赋能PayPal的商业代理

Sudhanshu Garg, Andrew Wang, Chaitanya Kulkarni, Ali Sahami, Farhad Farahani, Sean Yun-Shiuan Chuang, Jian Wan, Srinivasan Manoharan, Uma Kona, Nitin Sharma, Linsey Pang, Prakhar Mehrotra, Jessica Clark, Mark Moyou

机构 * PayPal AI NVIDIA

专题命中 指令微调 :LLM(abstract);language model(abstract);small language model(abstract);SLM(abstract)

AI总结 NEMO-4-PAYPAL利用NVIDIA Nemo框架优化PayPal商业代理,通过微调Nemotron模型提升检索性能并降低延迟与成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03269 2026-01-08 cs.CL cs.AI 79%

The Instruction Gap: LLMs get lost in Following Instruction

指令鸿沟:LLMs在遵循指令时迷失

Vishesh Tripathi, Uday Allu, Biddwan Ahmed

机构 * Vishesh Tripathi Uday Allu Biddwan Ahmed

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究揭示了LLMs在企业部署中遵循指令的不足,通过评估13种模型发现Claude-Sonnet-4和GPT-5表现最佳,指出指令遵循能力的鸿沟及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03277 2026-01-08 q-bio.OT cs.AI cs.CL cs.LG 75%

MixRx: Predicting Drug Combination Interactions with LLMs

MixRx:利用大语言模型预测药物组合相互作用

Risha Surana, Cameron Saidock, Hugo Chacon

机构 * University of Southern California(南加州大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MixRx利用大语言模型预测药物组合相互作用,通过微调模型在标准和扰动数据集上达到81.5%的准确率,探索LLMs在生物预测任务中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17898 2026-01-08 cs.LG cs.AI 73%

L-MoE: End-to-End Training of a Lightweight Mixture of Low-Rank Adaptation Experts

L-MoE:轻量级低秩适应专家的端到端训练

Shihao Ji, Zihui Song

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 L-MoE通过端到端训练将低秩适应专家与混合专家架构结合,实现轻量级、高效且可扩展的语言模型训练方法。

Comments The authors have identified a technical error in the mathematical formulation regarding the differentiable routing mechanism described in Section 3.2. To ensure the accuracy and integrity of the scientific record, we wish to withdraw the paper to correct these formulations and re-evaluate the theoretical proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04055 2026-01-08 cs.CL 70%

Modular Prompt Optimization: Optimizing Structured Prompts with Section-Local Textual Gradients

模块化提示优化:通过部分局部文本梯度优化结构化提示

Prith Sharma, Austin Z. Henley

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 模块化提示优化通过局部文本梯度优化结构化提示,提升小型开源LLM的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04036 2026-01-08 cs.CL 70%

Analyzing and Improving Cross-lingual Knowledge Transfer for Machine Translation

分析和改进机器翻译中的跨语言知识转移

David Stap

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究分析并改进了机器翻译中的跨语言知识迁移,探讨了语言相似性、检索辅助监督及平行数据微调对翻译效果的影响,以提升多语言NLP系统的鲁棒性和泛化能力。

Comments PhD dissertation defended on November 26th, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01768 2026-01-08 cs.CL 70%

Can LLMs Track Their Output Length? A Dynamic Feedback Mechanism for Precise Length Regulation

LLMs能否追踪其输出长度?一种动态反馈机制用于精确长度控制

Meiman Xiao, Ante Wang, Qingguo Hu, Zhongjian Miao, Huangjun Shen, Longyue Wang, Weihua Luo, Jinsong Su

机构 * School of Informatics, Xiamen University, China(信息学院,厦门大学) Alibaba International Digital Commerce Group(阿里巴巴国际数字 commerce 集团) Li Auto Inc(李汽车公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种动态反馈机制,用于提升LLM在生成文本时对长度的精确控制,通过无训练方法和进一步微调实现更准确的长度调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15577 2026-01-08 cs.CL cs.AI 62%

Relevance to Utility: Process-Supervised Rewrite for RAG

效用相关性:基于过程的重写用于RAG

Jaeyoung Kim, Jongho Kim, Seung-won Hwang, Seoho Song, Young-In Song

机构 * IPAI, Seoul National University(IPAI,首尔国立大学) Naver Corp(Naver公司)

专题命中 指令微调 :preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 R2U通过联合观察重写和回答过程中的推理来近似真实效用,提升检索增强生成系统的生成效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03793 2026-01-08 cs.LG cs.IR 57%

Prompt Tuning without Labeled Samples for Zero-Shot Node Classification in Text-Attributed Graphs

在无标注样本情况下对文本属性图中的零样本节点分类进行提示调优

Sethupathy Parameswaran, Suresh Sundaram, Yuan Fang

机构 * Indian Institute of Science(印度科学研究院) Singapore Management University(新加坡管理大学)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 本文提出一种基于双模态生成器的零样本提示调优框架,通过生成合成样本实现文本属性图中节点分类的无标注样本学习。

Comments Accepted by WSDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01426 2026-01-08 cs.SE cs.CL 57%

SWE-Lego: Pushing the Limits of Supervised Fine-tuning for Software Issue Resolving

SWE-Lego:推动软件问题解决监督微调的极限

Chaofan Tao, Jierun Chen, Yuxin Jiang, Kaiqi Kou, Shaowei Wang, Ruoyu Wang, Xiaohui Li, Sidi Yang, Yiming Du, Jianbo Dai, Zhiming Mao, Xinyu Wang, Lifeng Shang, Haoli Bai

机构 * Huawei Technologies(华为技术有限公司) NTU(国立新加坡大学) HKU(香港大学) CUHK(香港城市大学)

专题命中 指令微调 :SFT(abstract);分类 cs.CL

AI总结 SWE-Lego通过轻量级监督微调方法和改进的测试时扩展技术,在软件问题解决任务中达到最新性能。

Comments Project website: https://github.com/SWE-Lego/SWE-Lego

详情

展开后加载摘要…

URL PDF HTML 收藏