arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-13 至 2026-01-13 共收录 29 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 29 篇

2505.18497 2026-01-13 cs.CL 92%

The Pragmatic Mind of Machines: Tracing the Emergence of Pragmatic Competence in Large Language Models

机器的实用性思维:追踪大型语言模型中实用性能力的出现

Kefan Yu, Qingcheng Zeng, Weihao Xuan, Wanxin Li, Jingyi Wu, Rob Voigt

机构 * Northwestern University(西北大学) The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Zhejiang University(浙江大学) University of California, Davis(加州大学戴维斯分校)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

AI总结 本文提出ALTPRAG数据集,通过对比推理评估不同训练阶段LLMs的实用性能力发展,发现模型规模和数据规模的增加提升其对实用性提示的敏感性,SFT和RLHF进一步增强其在认知-实用性场景中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07430 2026-01-13 cs.CL cs.AI 91%

KALE: Enhancing Knowledge Manipulation in Large Language Models via Knowledge-aware Learning

KALE:通过知识感知学习增强大语言模型的知识操作

Qitan Lv, Tianyu Liu, Qiaosheng Zhang, Xingcheng Xu, Chaochao Lu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);post-training(abstract);SFT(abstract)

AI总结 KALE通过知识感知学习框架提升大语言模型的知识操作能力,利用知识图谱生成高质量推理过程并优化模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06780 2026-01-13 cs.CL cs.AI 90%

Multi-Stage Evolutionary Model Merging with Meta Data Driven Curriculum Learning for Sentiment-Specialized Large Language Modeling

多阶段进化模型合并与元数据驱动的课程学习用于情感专业化的大语言模型

Keito Inoshita, Xiaokang Zhou, Akira Kawai

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MEM-MCL模型,通过元数据驱动课程学习和进化算法提升大语言模型在情感分析中的准确性和多任务处理能力。

Comments This paper was presented at the 10th IEEE International Conference on Data Science and Systems in December 2024 and is awaiting publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07389 2026-01-13 cs.LG cs.AI cs.IT math.IT 88%

On the Non-decoupling of Supervised Fine-tuning and Reinforcement Learning in Post-training

在训练后阶段,监督微调与强化学习无法解耦

Xueyan Niu, Bo Bai, Wei Han, Weixi Zhang

机构 * Theory Laboratory Central Research Institute, 2012 Laboratories(理论实验室中央研究院,2012实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 指令微调 :post-training(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 研究证明在训练后阶段,监督微调与强化学习无法解耦,且在交替训练顺序下会导致性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04791 2026-01-13 cs.AI 86%

What-If Analysis of Large Language Models: Explore the Game World Using Proactive Thinking

大型语言模型的What-If分析:通过前瞻性思维探索游戏世界

Yuan Sui, Yanming Zhang, Yi Liao, Yu Gu, Guohua Tang, Zhongqian Sun, Wei Yang, Bryan Hooi

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 WiA-LLM通过前瞻性思维提升大型语言模型在复杂游戏环境中的决策能力,实现74.2%的预测准确率和更接近专家玩家的策略行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06305 2026-01-13 cs.CL 85%

Why LoRA Fails to Forget: Regularized Low-Rank Adaptation Against Backdoors in Language Models

为何LoRA无法遗忘:针对语言模型中的后门行为的正则化低秩适应

Hoang-Chau Luong, Lingwei Chen

机构 * Golisano College of Computing and Information Sciences(戈利萨诺计算与信息科学学院) Rochester Institute of Technology(罗切斯特理工大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL

AI总结 RoRA通过增强谱强度和纠正对齐,有效提升LoRA在对抗后门攻击时的遗忘能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06086 2026-01-13 cs.CL cs.SD eess.AS 85%

AzeroS: Extending LLM to Speech with Self-Generated Instruction-Free Tuning

AzeroS:通过自生成指令-free微调扩展LLM到语音

Yiwen Shao, Wei Liu, Jiahong Li, Tianzi Wang, Kun Wei, Meng Yu, Dong Yu

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AZeroS通过自生成指令-free微调方法,无需任务特定数据即可实现语音领域LLM的高效扩展,取得最佳泛化性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07200 2026-01-13 cs.LG cs.AI 84%

Safeguarding LLM Fine-tuning via Push-Pull Distributional Alignment

通过推拉分布对齐保障大语言模型微调安全

Haozhong Wang, Zhuo Li, Yibo Yang, He Zhao, Hongyuan Zha, Dandan Guo

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SOT通过推拉分布对齐机制提升大语言模型微调的安全性与效用平衡

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04194 2026-01-13 cs.CL cs.AI cs.LG 83%

The Best Instruction-Tuning Data are Those That Fit

最适合指令微调的数据是那些能适应的

Dylan Zhang, Qirun Dai, Hao Peng

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Chicago(芝加哥大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 GRAPE通过选择与目标模型分布最匹配的响应,提升大语言模型的微调效果,实验显示其在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06543 2026-01-13 cs.CL cs.AI cs.LG 83%

SimLLM: Fine-Tuning Code LLMs for SimPy-Based Queueing System Simulation

SimLLM:用于基于SimPy的排队系统模拟的代码LLM微调

Jun-Qi Chen, Kun Zhang, Rui Zheng, Ying Zhong

机构 * Institute of Statistics and Big Data, Renmin University of China(中国人民大学统计与大数据研究院) School of Information, Renmin University of China(中国人民大学信息学院) School of Management and Economics, University of Electronic Science and Technology of China(电子科技大学管理学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);preference optimization(abstract)

AI总结 SimLLM通过微调开源LLM提升SimPy排队系统模拟代码生成能力,提供替代闭源模型的可行方案。

Comments 33 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06914 2026-01-13 cs.CR cs.AI 81%

Towards Compositional Generalization in LLMs for Smart Contract Security: A Case Study on Reentrancy Vulnerabilities

面向智能合约安全的LLM组合泛化:重入漏洞案例研究

Ying Zhou, Jiacheng Wei, Yu Qi, Faguo Wu, Xiao Zhang

机构 * School of Artificial Intelligence, Beijing, China(人工智能学院,北京,中国) Beijing Advanced Innovation Center for Future Blockchain(未来区块链与隐私计算先进创新中心)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出基于原子任务分解与融合的后训练算法,通过分解重入漏洞检测任务提升LLM在智能合约安全检测中的准确率与召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08870 2026-01-13 cs.LG cs.AI 81%

Fed-SE: Federated Self-Evolution for Privacy-Constrained Multi-Environment LLM Agents

Fed-SE: 联邦自我进化用于隐私约束下的多环境大语言模型代理

Xiang Chen, Yuling Shi, Qizhen Lan, Yuchao Qiu, Min Wang, Xiaodong Gu, Yanfu Yan

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) UTHealth Houston(UT健康科学中心休斯顿分校) University of Pennsylvania(宾夕法尼亚大学)

专题命中 指令微调 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 Fed-SE通过局部进化与全局聚合范式,在隐私约束下提升多环境大语言模型代理的跨环境知识转移效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12704 2026-01-13 cs.CL cs.AI 81%

Flexible Realignment of Language Models

语言模型的灵活重校准

Wenhong Zhu, Ruobing Xie, Weinan Zhang, Rui Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Large Language Department, Tencent(腾讯大语言部门)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出灵活的重校准框架,通过训练和推理时的可控对齐方法,提升语言模型的性能和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06419 2026-01-13 cs.CR cs.PL 80%

Lightweight Yet Secure: Secure Scripting Language Generation via Lightweight LLMs

轻量却安全:通过轻量LLM实现安全脚本语言生成

Keyang Zhang, Zeyu Chen, Xuan Feng, Dongliang Fang, Yaowen Zheng, Zhi Li, Limin Sun

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出PSSec框架,通过数据合成与微调提升轻量LLM在生成安全PowerShell脚本方面的能力,显著降低推理成本。

Comments 19 pages,8 figures,conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07054 2026-01-13 cs.CL cs.LG 79%

Fine-Tuning vs. RAG for Multi-Hop Question Answering with Novel Knowledge

基于新知识的多跳问答中微调与RAG的比较

Zhuoyi Yang, Yurun Song, Iftekhar Ahmed, Ian Harris

专题命中 指令微调 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文比较了微调与RAG在多跳问答中处理新颖知识的效果,发现RAG在时间新颖信息问答中表现更优,而有监督微调整体准确率最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06047 2026-01-13 cs.AI cs.CL cs.CY 79%

"They parted illusions -- they parted disclaim marinade": Misalignment as structural fidelity in LLMs

他们分开了幻象——他们分开了否定腌制:在大语言模型中将不一致视为结构忠实

Mariana Lins Costa

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出大语言模型中'不一致'现象源于对不一致语言结构的忠实,而非欺骗性意图,通过分析案例和实证数据,揭示语言结构与意图生成的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11720 2026-01-13 cs.LG cs.AI 79%

RPO: Fine-Tuning Visual Generative Models via Rich Vision-Language Preferences

RPO:通过丰富的视觉-语言偏好进行视觉生成模型微调

Hanyang Zhao, Haoxian Chen, Yucheng Guo, Genta Indra Winata, Tingting Ou, Ziyu Huang, David D. Yao, Wenpin Tang

机构 * Columbia University(哥伦比亚大学) Amazon(亚马逊) Princeton University(普林斯顿大学) Capital One

专题命中 指令微调 :language model(abstract);preference optimization(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 RPO通过利用视觉语言模型的丰富反馈信号,改进偏好对的编纂,从而提升视觉生成模型的微调效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16935 2026-01-13 cs.CV 78%

Parameter-efficient fine-tuning (PEFT) of Vision Foundation Models for Atypical Mitotic Figure Classification

为异常有丝分裂象分类高效微调视觉基础模型

Lavish Ramchandani, Gunjan Deotale, Dev Kumar Das

机构 * Aira Matrix Private Limited(Aira Matrix 私人有限公司)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本研究利用Virchow与LoRA技术对视觉基础模型进行高效微调,实现异常有丝分裂分类的高精度与鲁棒性。

Comments MIDOG'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07185 2026-01-13 cs.CR cs.AI 77%

Defenses Against Prompt Attacks Learn Surface Heuristics

对抗提示攻击的防御学习表面启发式

Shawn Li, Chenxiao Yu, Zhiyu Ni, Hao Li, Charith Peris, Chaowei Xiao, Yue Zhao

机构 * University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校) Washington University in St. Louis(圣路易斯华盛顿大学) Amazon(亚马逊公司) Johns Hopkins University(约翰霍普金斯大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了对抗提示攻击防御中表面启发式的问题,发现现有方法易受表面模式影响,提出受控数据集和系统评估以揭示监督微调的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06851 2026-01-13 cs.AI 77%

A Brain-like Synergistic Core in LLMs Drives Behaviour and Learning

类脑协同核心在大语言模型中驱动行为与学习

Pedro Urbina-Rodriguez, Zafeirios Fountas, Fernando E. Rosas, Jun Wang, Andrea I. Luppi, Haitham Bou-Ammar, Murray Shanahan, Pedro A. M. Mediano

机构 * Department of Computing Imperial College London(帝国理工学院计算机系) Huawei Noah’s Ark Lab(华为诺亚实验室) AI Centre Department of Computer Science University College London(伦敦大学学院人工智能中心) Department of Informatics University of Sussex(Sussex大学信息学院) Centre for Complexity Science and Center for Psychedelic Research Department of Brain Science Imperial College London(帝国理工学院复杂科学中心和迷幻研究中心) Department of Psychiatry and Centre for Eudaimonia and Human Flourishing University of Oxford(牛津大学精神病学系和幸福与人类繁荣中心) Division of Information Engineering and St John’s College University of Cambridge(剑桥大学信息工程系和圣约翰学院) Montreal Neurological Institute McGill University(麦吉尔大学蒙特利尔神经科学研究所) Division of Psychology and Language Sciences University College London(伦敦大学学院心理学与语言科学系)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究发现大语言模型中自发形成的协同核心与人脑相似,通过学习产生,影响行为与学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09681 2026-01-13 cs.IR cs.AI cs.CL cs.LG 75%

DB3 Team's Solution For Meta KDD Cup' 25

DB3团队的Meta KDD杯'25解决方案

Yikuan Xia, Jiazun Chen, Yirui Zhan, Suifeng Zhao, Weipeng Jiang, Chaorui Zhang, Wei Han, Bo Bai, Jun Gao

机构 * Key Laboratory of High Confidence Software Technologies, CS, Peking University, China(高可信软件技术重点实验室,中国科学院,北京大学) Theory Lab, Central Research Institute, 2012 Labs, Huawei Technologies Co., Ltd, Shenzhen, China(理论实验室,中央研究院,2012实验室,华为技术有限公司,深圳)

专题命中 指令微调 :LLM(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DB3团队通过多模态检索框架和拒绝训练方法,在KDD杯'25的CRAG-MM挑战中取得优异成绩,尤其在处理第一人称视角问题上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07795 2026-01-13 cs.CV 71%

Vision-Language Model for Accurate Crater Detection

面向准确陨石坑检测的视觉-语言模型

Patrick Bauer, Marius Schwinning, Florian Renk, Andreas Weinmann, Hichem Snoussi

机构 * University of Technology of Troyes(图卢兹技术大学) Hochschule Darmstadt(达姆施塔特应用科学大学) GMV for European Space Agency(欧洲航天局GMV) European Space Agency(欧洲航天局) Technische Hochschule Würzburg-Schweinfurt(维尔茨堡-施韦因富特技术大学)

专题命中 指令微调 :language model(title)

AI总结 本文提出基于Vision Transformer的深度学习模型,用于在复杂月球成像条件下实现高精度陨石坑检测,通过低秩适应策略和组合损失函数提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07084 2026-01-13 cs.CR cs.SE 71%

How Secure is Secure Code Generation? Adversarial Prompts Put LLM Defenses to the Test

生成安全代码的安全性如何?对抗性提示对LLM防御进行了测试

Melissa Tessa, Iyiola E. Olatunji, Aicha War, Jacques Klein, Tegawendé F. Bissyandé

专题命中 指令微调 :LLM(title)

AI总结 本文评估了生成安全代码方法在对抗性条件下的鲁棒性,发现现有方法在安全性和功能性上存在显著缺陷,提出改进最佳实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07645 2026-01-13 cs.CL 70%

PlaM: Training-Free Plateau-Guided Model Merging for Better Visual Grounding in MLLMs

PlaM: 无需训练的高原引导模型融合以提升多模态大语言模型的视觉语义

Zijing Wang, Yongkang Liu, Mingyang Wang, Ercong Nie, Deyuan Chen, Zhengjie Zhao, Shi Feng, Daling Wang, Xiaocui Yang, Yifei Zhang, Hinrich Schütze

机构 * Northeastern University, China(东北大学) CIS, LMU Munich, Germany(慕尼黑大学计算机学院) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PlaM通过无需训练的高原引导模型融合方法,提升多模态大语言模型的视觉语义表现。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07507 2026-01-13 cs.CL 70%

High-Rank Structured Modulation for Parameter-Efficient Fine-Tuning

高秩结构调制用于参数高效微调

Yongkang Liu, Xing Li, Mengjie Zhao, Shanru Zhang, Zijing Wang, Qian Li, Shi Feng, Feiliang Ren, Daling Wang, Hinrich Schütze

机构 * Northeastern University, China(东北大学) CIS, LMU Munich, Germany(慕尼黑大学计算机科学系) Shandong University, China(山东大学) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SMoA通过高秩结构调制在减少可训练参数的同时提升模型代表能力,优于LoRA在多个任务上表现更优。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07264 2026-01-13 cs.CL 70%

The Confidence Dichotomy: Analyzing and Mitigating Miscalibration in Tool-Use Agents

置信二元性:分析和缓解工具使用代理中的校准偏差

Weihao Xuan, Qingcheng Zeng, Heli Qi, Yunze Xiao, Junjue Wang, Naoto Yokoya

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出强化学习框架,通过优化任务准确性和校准,缓解工具使用代理中的校准偏差,提升其在不同领域和环境中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02659 2026-01-13 cs.CL 70%

Put the Space of LoRA Initialization to the Extreme to Preserve Pre-trained Knowledge

将LoRA初始化空间推向极端以保留预训练知识

Pengwei Tang, Xiaolin Hu, Yong Liu, Lizhong Ding, Dongjie Zhang, Xing Wu, Debing Zhang

机构 * Pengwei Tang 1,2,3(唐鹏伟) Xiaolin Hu 4(胡晓林) Yong Liu 1,2,3(刘勇) Lizhong Ding 5(丁立忠) Dongjie Zhang 6(张东杰) Xing Wu 6,7(吴星) Debing Zhang 6(张德兵)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 LoRA-Null通过在激活的空域中初始化LoRA,有效保留预训练知识并提升微调性能。

Comments Accepted at AAAI 2026. We rediscovered why our approach works from the perspective of the LoRA initialization space. Accordingly, we added new experiments and also removed inappropriate experiments (those without catastrophic forgetting)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07219 2026-01-13 cs.CV 67%

VENUS: Visual Editing with Noise Inversion Using Scene Graphs

VENUS: 使用场景图进行视觉编辑的噪声反演

Thanh-Nhan Vo, Trong-Thuan Nguyen, Tam V. Nguyen, Minh-Triet Tran

机构 * University of Science, VNU-HCM(越南胡志明市科学大学) Vietnam National University(越南国家大学) University of Dayton(戴维森大学)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 VENUS是一种无需训练的场景图引导图像编辑框架,通过噪声反演和拆分提示策略提升图像编辑的保真度和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12800 2026-01-13 cs.MM 50%

Cap2Sum: Learning to Summarize Videos by Generating Captions

Cap2Sum: 通过生成描述来学习视频摘要

Cairong Zhao, Chutian Wang, Zifan Song, Guosheng Hu, Haonan Chen, Xiaofan Zhai

专题命中 指令微调 :language model(abstract)

AI总结 Cap2Sum通过生成视频描述来学习视频摘要,利用密集视频描述注释提升模型性能和泛化能力。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏