arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-21 至 2026-01-21 共收录 40 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 40 篇

2601.12807 2026-01-21 cs.LG 92%

Semi-supervised Instruction Tuning for Large Language Models on Text-Attributed Graphs

大型语言模型在文本属性图上的半监督指令微调

Zixing Song, Irwin King

机构 * University of Bristol(布里斯托大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);LLM(abstract)

AI总结 SIT-Graph通过半监督指令微调提升文本属性图学习性能,实现低标签条件下20%以上的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04748 2026-01-21 cs.LG cs.AI cs.CL 90%

AttriLens-Mol: Attribute Guided Reinforcement Learning for Molecular Property Prediction with Large Language Models

AttriLens-Mol:基于属性引导的强化学习用于利用大语言模型进行分子属性预测

Xuan Lin, Long Chen, Yile Wang

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AttriLens-Mol通过属性引导的强化学习框架提升大语言模型在分子属性预测中的性能,有效激发相关属性,提高可解释性和预测效果。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05928 2026-01-21 cs.CL cs.AI 90%

MoA: Heterogeneous Mixture of Adapters for Parameter-Efficient Fine-Tuning of Large Language Models

MoA:异构适配器混合用于大语言模型的参数高效微调

Jie Cao, Tianwei Lin, Bo Yuan, Rolan Yan, Hongyang He, Wenqiao Zhang, Juncheng Li, Dongping Zhang, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 MoA通过异构适配器混合提升大语言模型的参数高效微调性能,采用软和稀疏变体实现细粒度整合与稀疏激活,增强预训练知识向下游任务的转移效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11864 2026-01-21 cs.LG cs.CL 90%

AGGC: Adaptive Group Gradient Clipping for Stabilizing Large Language Model Training

AGGC:自适应分组梯度裁剪用于稳定大语言模型训练

Zhiyuan Li, Yuan Wu, Yi Chang

机构 * School of Artificial intelligence, JiLin University(人工智能学院,吉林大学) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, JiLin University(知识驱动人机智能工程研究中心,吉林大学) International Center of Future Science, JiLin University(未来科学国际中心,吉林大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 AGGC通过自适应分组梯度裁剪方法,有效解决传统梯度裁剪在处理梯度异质性方面的不足,提升大语言模型训练稳定性与性能。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13409 2026-01-21 eess.AS 89%

RLBR: Reinforcement Learning with Biasing Rewards for Contextual Speech Large Language Models

RLBR: 基于偏置奖励的强化学习用于上下文语音大语言模型

Bo Ren, Ruchao Fan, Yelong Shen, Weizhu Chen, Jinyu Li

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract)

AI总结 RLBR通过偏置奖励和参考感知机制提升语音大语言模型在罕见词识别中的性能。

Comments Accepted to the 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13697 2026-01-21 cs.CL cs.AI cs.LG 88%

Uncertainty-Aware Gradient Signal-to-Noise Data Selection for Instruction Tuning

考虑不确定性的梯度信号-噪声数据选择用于指令微调

Zhihang Yuan, Chengyu Yue, Long Huang, Litu Ou, Lei Shi

机构 * Alibaba Cloud Computing(阿里巴巴云 computing) The University of Edinburgh(爱丁堡大学)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 GRADFILTERING通过利用GPT-2代理和LoRA集成,提出了一种考虑不确定性的数据选择方法,以提高指令微调的效率和效果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13995 2026-01-21 cs.CL 88%

From Tags to Trees: Structuring Fine-Grained Knowledge for Controllable Data Selection in LLM Instruction Tuning

从标签到树:为LLM指令微调中的可控数据选择构建细粒度知识

Zihan Niu, Wenping Hu, Junmin Chen, Xiyue Wang, Tong Xu, Ruiming Tang

机构 * University of Science and Technology of China(中国科学技术大学) Klear Team, Kuaishou Technology(快手科技Klear团队)

专题命中 指令微调 :LLM(title,abstract);instruction tuning(title,abstract);分类 cs.CL

AI总结 TAGS通过构建细粒度知识树,实现LLM指令微调中可控数据选择的高效采样与知识对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11573 2026-01-21 cs.CL 88%

An Empirical Analysis of Fine-Tuning Large Language Models on Bioinformatics Literature: PRSGPT and BioStarsGPT

对在生物信息学文献上微调大型语言模型的实证分析:PRSGPT和BioStarsGPT

Muhammad Muneeb, David B. Ascher

机构 * School of Chemistry and Molecular Biology(化学与分子生物学学院) The University of Queensland(昆士兰大学) Baker Heart and Diabetes Institute(贝克心脏与糖尿病研究所)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出了一种可重复的管道,用于在生物信息学文献上微调大型语言模型,通过PRSGPT和BioStarsGPT两个用例展示了方法和成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12126 2026-01-21 cs.AI 84%

UniMo: Unified Motion Generation and Understanding with Chain of Thought

UniMo: 基于推理链的统一运动生成与理解

Guocun Wang, Kenkun Liu, Jing Lin, Guorui Song, Jian Li, Xiaoguang Han

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 UniMo通过整合运动-语言信息和可解释的推理链,提升3D人体运动生成与理解的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13629 2026-01-21 eess.AS eess.SP 83%

S$^2$Voice: Style-Aware Autoregressive Modeling with Enhanced Conditioning for Singing Style Conversion

S$^2$Voice: 基于增强条件的风格感知自回归建模用于歌唱风格转换

Ziqian Wang, Xianjun Xia, Chuanzeng Huang, Lei Xie

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 S$^2$Voice通过增强条件和自回归建模提升歌唱风格转换的风格控制和鲁棒性,实现更自然的音色相似性和更高的转换性能。

Comments accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12338 2026-01-21 cs.AI 83%

Actionable Advice from Reviews via Mixture of LoRA Experts: A Two-LLM Pipeline for Issue Extraction and Business Recommendations

通过LoRA专家混合生成可操作建议:一种双语言模型管道用于问题提取和商业推荐

Kartikey Singh Bhandari, Manav Ganesh, Yashwant Viswanathan, Archit Agrawal, Dhruv Kumar, Pratik Narang

机构 * BITS Pilani,Pilani Campus(BITS 普利尼校区)

专题命中 指令微调 :LLM(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出一种双语言模型管道,通过LoRA专家混合策略生成基于客户评价的可操作商业建议,提升问题提取和建议生成的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09714 2026-01-21 cs.CV cs.LG 79%

AM-SAM: Automated Prompting and Mask Calibration for Segment Anything Model

AM-SAM:用于Segment Anything模型的自动化提示和掩码校准

Yuchen Li, Li Zhang, Youwei Liang, Pengtao Xie

专题命中 指令微调 :prompting(title,abstract);分类 cs.LG

AI总结 AM-SAM通过自动化提示生成和掩码解码器优化,提升Segment Anything模型在语义分割任务中的准确性和效率。

Journal ref Int. J. Mach. Learn. Cybern. 17, 35 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12443 2026-01-21 cs.CV cs.AI 79%

Adversarial Defense in Vision-Language Models: An Overview

视觉-语言模型中的对抗防御:概述

Xiaowei Fu, Lei Zhang

机构 * School of Microelectronics and Communication Engineering(微电子与通信工程学院) Chongqing University(重庆大学) Chongqing, China(中国重庆)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本文综述了视觉-语言模型对抗防御的最新进展,探讨了三种主要防御范式及其优缺点,旨在提升模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12711 2026-01-21 cs.AI cs.LG cs.SC 79%

Neurosymbolic LoRA: Why and When to Tune Weights vs. Rewrite Prompts

神经符号LoRA:为何以及何时调整权重 versus 重写提示

Kevin Wang, Neel P. Bhatt, Cong Liu, Junbo Li, Runjin Chen, Yihan Xi, Timothy Barclay, Alvaro Velasquez, Ufuk Topcu, Zhangyang Wang

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 神经符号LoRA结合数值和符号更新,提升语言模型微调的适应性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11792 2026-01-21 cs.AI cs.CL 79%

A self-evolving multi-role collaborative framework with fine-grained difficulty guidance for innovative mathematical problem generation

具有细粒度难度指导的自进化多角色协作框架用于创新数学问题生成

Yifei Sun, Yongan Li, A. K. Qin, Sicheng Hou, Tamas Pflanzner

机构 * School of Physics and Information Technology, Shaanxi Normal University(陕西师范大学物理与信息技术学院) Department of Computing Technologies, Swinburne University of Technology(斯威本科技大学计算技术系) Department of Software Engineering, University of Szeged(塞格德大学软件工程系)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种自进化多角色协作框架,通过细粒度难度指导提升创新数学问题生成的正确率与创新性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12366 2026-01-21 cs.CV 78%

DepthCropSeg++: Scaling a Crop Segmentation Foundation Model With Depth-Labeled Data

DepthCropSeg++: 通过深度标注数据扩展作物分割基础模型

Jiafei Zhang, Songliang Cao, Binghui Xu, Yanan Li, Weiwei Jia, Tingting Wu, Hao Lu, Weijuan Hu, Zhiguo Han

机构 * MetaPheno Laboratory(MetaPheno实验室) PhenoTrait Technology Co., Ltd.(PhenoTrait技术有限公司) Wuhan Digital Engineering Institute(武汉数字工程研究院) National Key Laboratory of Multispectral Information Intelligent Processing Technology(国家多光谱信息智能处理技术重点实验室) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) Hubei Key Laboratory of Intelligent Robot(湖北省智能机器人重点实验室) School of Computer Science and Engineering, School of Artificial Intelligence, Wuhan Institute of Technology(武汉理工大学计算机科学与工程学院、人工智能学院)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 DepthCropSeg++通过深度标注数据扩展作物分割模型,采用两阶段自训练流程提升性能,实现93.11%的mIoU,超越监督基线和SAM模型。

Comments 13 pages, 15 figures and 7 tables

Journal ref IEEE Journal of Selected Topics in Signal Processing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13284 2026-01-21 cs.LG 77%

Balancing Classification and Calibration Performance in Decision-Making LLMs via Calibration Aware Reinforcement Learning

通过校准感知强化学习平衡决策LLM中的分类与校准性能

Duygu Nur Yaldiz, Evangelia Spiliopoulou, Zheng Qi, Siddharth Varia, Srikanth Doss, Nikolaos Pappas

机构 * University of Southern California(南加州大学) AWS AI Labs(AWS AI实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.LG

AI总结 本文提出一种校准感知强化学习方法,通过调整决策标记概率,在保持准确性的同时减少过度自信,提升决策LLM的校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12460 2026-01-21 cs.CR cs.LG 77%

TrojanPraise: Jailbreak LLMs via Benign Fine-Tuning

TrojanPraise: 通过良性微调劫持LLM

Zhixin Xie, Xurui Song, Jun Luo

机构 * Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 TrojanPraise通过良性微调利用过滤通过的数据,使LLM在无意识中顺从有害概念,成功率达95.88%

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12034 2026-01-21 cs.CL cs.IR 77%

Don't Start Over: A Cost-Effective Framework for Migrating Personalized Prompts Between LLMs

不要重头再来:一种成本有效的LLM之间迁移个性化提示的框架

Ziyi Zhao, Chongming Gao, Yang Zhang, Haoyan Liu, Weinan Gan, Huifeng Guo, Yong Liu, Fuli Feng

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL

AI总结 本文提出PUMA框架,通过参数高效适配器和组基用户选择策略,实现LLM间个性化提示的低成本迁移,实验表明其在计算成本上显著优于全量重训练。

Comments Accepted to AAAI 2026 (Oral). 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13682 2026-01-21 cs.SE cs.PL 75%

CodeContests-O: Powering LLMs via Feedback-Driven Iterative Test Case Generation

CodeContests-O: 通过反馈驱动的迭代测试用例生成增强大语言模型

Jianfeng Cai, Jinhua Zhu, Ruopei Sun, Kangwen Zhao, Dongyun Xue, Mingxiao Feng, Wengang Zhou, Houqiang Li

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 通过反馈驱动的迭代测试用例生成框架,提升大语言模型的验证质量,构建高质量的CodeContests-O数据集,显著提高模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13247 2026-01-21 cs.CL cs.AI cs.CV cs.LG cs.MM 75%

Aligning Agentic World Models via Knowledgeable Experience Learning

通过知识性经验学习对齐代理世界模型

Baochang Ren, Yunzhi Yao, Rui Sun, Shuofei Qiao, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 WorldMind通过知识性经验学习对齐代理世界模型,解决物理模拟中的幻觉问题,实现跨环境的高效迁移。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13384 2026-01-21 cs.SE cs.CL 74%

From Completion to Editing: Unlocking Context-Aware Code Infilling via Search-and-Replace Instruction Tuning

从补全到编辑:通过搜索和替换指令微调解锁上下文感知的代码填充

Jiajun Zhang, Zeyu Cui, Jiaxi Yang, Lei Zhang, Yuheng Jing, Zeyao Ma, Tianyi Bai, Zilei Wang, Qiang Liu, Liang Wang, Binyuan Hui, Junyang Lin

机构 * USTC(University of Science and Technology of China) Alibaba Group(阿里巴巴集团) CASIA(Chinese Academy of Sciences Institute of Automation) SIAT(Institute of Automation, Chinese Academy of Sciences)

专题命中 指令微调 :instruction tuning(title);分类 cs.CL

AI总结 通过搜索和替换指令微调,SRI框架实现了上下文感知的代码填充,提升了补全性能并保持低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08189 2026-01-21 cs.CR cs.AI 74%

ForgetMark: Stealthy Fingerprint Embedding via Targeted Unlearning in Language Models

ForgetMark: 通过针对性遗忘实现语言模型的隐秘指纹嵌入

Zhenhua Xu, Haobo Zhang, Zhebo Wang, Qichen Liu, Haitao Xu, Wenpeng Xing, Meng Han

机构 * Zhejiang University(浙江大学) Zhejiang University of Technology(浙江工业大学)

专题命中 指令微调 :language model(title);分类 cs.AI

AI总结 ForgetMark通过针对性遗忘技术,在语言模型中实现隐秘指纹嵌入,提升隐蔽性和鲁棒性,同时保持模型性能。

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12639 2026-01-21 cs.CL cs.LG 73%

Objective Matters: Fine-Tuning Objectives Shape Safety, Robustness, and Persona Drift

目标至关重要:微调目标影响安全、鲁棒性和人格漂移

Daniel Vennemeyer, Punya Syon Pandey, Phan Anh Duong, Michael Umeokoli, Samuel Ratnam

机构 * University of Cincinnati(辛辛那提大学) University of Toronto(多伦多大学) University of Oxford(牛津大学)

专题命中 指令微调 :preference optimization(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了微调目标对LLM安全性和鲁棒性的影响,发现目标选择在不同训练规模下对安全、鲁棒性和人格漂移有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20339 2026-01-21 cs.SD 71%

MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model

MMEDIT: 一种基于音频语言模型的多类型音频编辑统一框架

Ye Tao, Wen Wu, Chao Zhang, Mengyue Wu, Shuai Wang, Xuenan Xu

机构 * MoE Key Lab of Artificial Intelligence, X-LANCE Lab, Shanghai Jiao Tong University(人工智能莫埃实验室、X-LANCE实验室、上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学)

专题命中 指令微调 :language model(title)

AI总结 MMEdit提出一种基于音频语言模型的统一框架,通过扩展任务定义和设计数据合成管道,实现多类型音频编辑的高精度与高保真度。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13572 2026-01-21 cs.LG 70%

Behavior Knowledge Merge in Reinforced Agentic Models

强化学习代理模型中的行为知识融合

Xiangchi Yuan, Dachuan Shi, Chunhui Zhang, Zheyuan Liu, Shenglong Yao, Soroush Vosoughi, Wenke Lee

机构 * Georgia Institute of Technology(佐治亚理工学院) Dartmouth College(达特茅斯学院) University of Notre Dame(诺丁汉大学)

专题命中 指令微调 :post-training(abstract);SFT(abstract);分类 cs.LG

AI总结 本文提出RAM框架,通过分离共享和任务特定参数更新,提升RL训练代理模型的融合效果,实现性能超越专门化代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12775 2026-01-21 cs.CL 70%

Persistent Personas? Role-Playing, Instruction Following, and Safety in Extended Interactions

持久的人格?角色扮演、指令遵循与在扩展互动中的安全性

Pedro Henrique Luz de Araujo, Michael A. Hedderich, Ali Modarressi, Hinrich Schuetze, Benjamin Roth

机构 * University of Vienna, Faculty of Computer Science(维也纳大学计算机科学系) Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学博士学院) Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Vienna, Faculty of Philological and Cultural Studies(维也纳大学文学与文化研究系)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了在长对话中人格保持的稳定性,发现随着对话延长,人格保真度下降,且非人格基线模型在初期表现更优。

Comments 31 pages, 35 figures, accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13105 2026-01-21 cs.CL 70%

Leveraging Lora Fine-Tuning and Knowledge Bases for Construction Identification

利用LoRA微调和知识库进行 constructions 识别

Liu Kaipeng, Wu Ling

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过LoRA微调和知识库结合,提升大型语言模型对英语双宾结构的识别能力,实验显示微调模型在性能上优于原生模型和理论驱动的RAG系统。

Comments 19pages, 1figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18056 2026-01-21 cs.CL 70%

MathEDU: Feedback Generation on Problem-Solving Processes for Mathematical Learning Support

MathEDU: 为数学学习支持生成问题解决过程的反馈

Wei-Ling Hsu, Yu-Chien Tang, An-Zi Yen

机构 * Department of Computer Science, National Yang Ming Chiao Tung University, Taiwan(计算机科学系,National Yang Ming Chiao Tung大学,台湾)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MathEDU研究通过构建数学问题解决过程反馈数据集,评估不同模型在正确性分类、错误识别和反馈生成任务中的可靠性,发现生成反馈存在显著差距,需提升教学意识的AI反馈。

Comments Accepted by EACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11954 2026-01-21 cs.LG 70%

Data-centric Prompt Tuning for Dynamic Graphs

面向动态图的数据导向提示微调

Yufei Peng, Cheng Yang, Zhengjie Fan, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 指令微调 :pretraining(abstract);prompting(abstract);分类 cs.LG

AI总结 DDGPrompt通过数据导向的提示框架优化动态图节点嵌入,提升在少样本和冷启动场景下的适应性与性能。

Comments CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏