arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-17 至 2026-02-17 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 18 篇

2602.13773 2026-02-17 cs.LG 87%

On Representation Redundancy in Large-Scale Instruction Tuning Data Selection

在大规模指令微调数据选择中的表示冗余性

Youwei Shu, Shaomian Zheng, Dingnan Jin, Wenjie Qu, Ziyao Guo, Qing Cui, Jun Zhou, Jiaheng Zhang

机构 * National University of Singapore(新加坡国立大学)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出CRDS框架,通过压缩表示减少指令微调数据冗余,提升数据质量与模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11884 2026-02-17 cs.CL 87%

Context-Emotion Aware Therapeutic Dialogue Generation: A Multi-component Reinforcement Learning Approach to Language Models for Mental Health Support

情境-情绪感知的治疗对话生成:一种多组件强化学习方法用于语言模型的心理健康支持

Eric Hua Qing Zhang, Julia Ive

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);SFT(abstract)

AI总结 本文提出一种多组件强化学习方法,通过改进GPT-2的治疗对话生成能力,提升情绪准确性和上下文相关性,以支持心理健康领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10833 2026-02-17 cs.IR cs.AI cs.CL cs.LG 87%

Training-Induced Bias Toward LLM-Generated Content in Dense Retrieval

训练诱导的对LLM生成内容的偏好在密集检索中的表现

William Xion, Wolfgang Nejdl

机构 * L3S Research Center, Hannover, Germany(汉诺威德国L3S研究中心)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究发现,密集检索中的来源偏见是训练过程诱导的,而非固有属性,通过实验揭示了不同微调策略对检索结果的影响。

Comments Accepted at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15751 2026-02-17 cs.LG cs.AI cs.CL 85%

Sparse MeZO: Less Parameters for Better Performance in Zeroth-Order LLM Fine-Tuning

稀疏MeZO:在零阶LLM微调中更少的参数带来更好的性能

Yong Liu, Zirui Zhu, Chaoyu Gong, Minhao Cheng, Cho-Jui Hsieh, Yang You

机构 * National University of Singapore(新加坡国立大学) Pennsylvania State University(宾夕法尼亚州立大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 稀疏MeZO通过仅对部分参数应用零阶优化,提升LLM微调的性能和收敛速度。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13942 2026-02-17 stat.ML cs.LG 83%

A Theoretical Framework for LLM Fine-tuning Using Early Stopping for Non-random Initialization

基于早停机制的LLM微调理论框架

Zexuan Sun, Garvesh Raskutti

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于早停机制的LLM微调理论框架,结合NTK理论与非随机初始化,揭示微调收敛率与特征值衰减的关系,并通过实验验证理论成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13659 2026-02-17 cs.LG math.OC 83%

Zero-Order Optimization for LLM Fine-Tuning via Learnable Direction Sampling

通过可学习方向采样实现LLM微调的零阶优化

Valery Parfenov, Grigoriy Evseev, Andrey Veprikov, Nikolay Bushkov, Stanislav Moiseev, Aleksandr Beznosikov

专题命中 指令微调 :LLM(title,abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种基于可学习策略的方向采样方法,用于改进零阶优化在LLM微调中的性能,通过减少方差和依赖维度来提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06964 2026-02-17 cs.CL cs.LG 82%

Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization

通过奖励加权微调实现离线强化学习用于对话优化

Subhojyoti Mukherjee, Viet Dac Lai, Raghavendra Addanki, Ryan Rossi, Seunghyun Yoon, Trung Bui, Anup Rao, Jayakumar Subramanian, Branislav Kveton

机构 * Adobe Research(Adobe研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);preference optimization(abstract)

AI总结 本文提出通过奖励加权微调实现离线强化学习,用于对话优化,相比传统方法在奖励和语言质量上取得显著提升。

Comments Advances in Neural Information Processing Systems 38

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13157 2026-02-17 eess.SP 82%

Seeing Radio: From Zero RF Priors to Explainable Modulation Recognition with Vision Language Models

看见无线电:从零RF先验到可解释的调制识别与视觉语言模型

Hang Zou, Bohao Wang, Yu Tian, Lina Bariah, Chongwen Huang, Samson Lasaulce, Mérouane Debbah

专题命中 指令微调 :language model(title,abstract);large language model(abstract)

AI总结 本文提出利用视觉语言模型直接感知无线电波信号并推断调制模式,通过转换IQ流为图像数据,提升模型准确性至90%,并实现可解释的调制识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22067 2026-02-17 cs.LG cs.AI 81%

The Rogue Scalpel: Activation Steering Compromises LLM Safety

恶意手术刀:激活引导破坏了大语言模型的安全性

Anton Korznikov, Andrey Galichin, Alexey Dontsov, Oleg Y. Rogov, Ivan Oseledets, Elena Tutubalina

专题命中 指令微调 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究发现激活引导技术实际上会破坏大语言模型的安全性,通过实验表明即使随机引导也能增加有害服从的概率,挑战了可解释性带来的安全假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13306 2026-02-17 cs.CV cs.AI cs.LG 81%

Fine-Tuning a Large Vision-Language Model for Artwork's Scoring and Critique

对大型视觉-语言模型进行微调以用于艺术品的评分与批评

Zhehan Zhang, Meihua Qian, Li Luo, Siyu Huang, Chaoyi Zhou, Ripon Saha, Xinxin Song

专题命中 指令微调 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过微调Qwen2-VL-7B模型,结合多任务学习实现对人类绘画的自动化创造力评估,通过生成与评分标准一致的反馈,提高评分准确性和反馈质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13954 2026-02-17 cs.SD cs.AI 79%

Eureka-Audio: Triggering Audio Intelligence in Compact Language Models

Eureka-Audio: 在紧凑语言模型中触发音频智能

Dan Zhang, Yishu Lei, Jing Hu, Shuwei He, Songhe Deng, Xianlong Luo, Danxiang Zhu, Shikun Feng, Rui Liu, Jingzhou He, Yu Sun, Hua Wu, Haifeng Wang

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 Eureka-Audio通过紧凑架构和统一端到端设计,在低参数量下实现高性能音频理解,匹配甚至超越大模型表现。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14490 2026-02-17 cs.LG cs.AI cs.CL cs.NE 75%

Parameter-Efficient Fine-Tuning of LLMs with Mixture of Space Experts

使用混合空间专家进行大语言模型的参数高效微调

Buze Zhang, Jinkai Tao, Zilang Zeng, Neil He, Ali Maatouk, Menglin Yang, Rex Ying

机构 * Yale university(耶鲁大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hong Kong University of Science(香港科学大学) Xi’an Jiaotong University(西安交通大学) Central University of Finance(中央财经大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MoSLoRA,通过混合多种几何空间提升大语言模型的参数高效微调效果,实验显示在多个基准测试中表现优于现有方法。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16905 2026-02-17 cs.LG cs.AI 73%

GRIP: Algorithm-Agnostic Machine Unlearning for Mixture-of-Experts via Geometric Router Constraints

GRIP:通过几何路由约束实现混合专家的算法无关机器反学习

Andy Zhu, Rongzhe Wei, Yupu Gu, Pan Li

机构 * School of Computer Science(计算机科学学院) Georgia Institute of Technology(佐治亚理工学院) Department of Electrical Engineering(电气工程系) Tsinghua University(清华大学) School of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 GRIP通过几何路由约束实现混合专家的算法无关机器反学习,有效消除专家选择偏移并保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13504 2026-02-17 cs.CL cs.AI 73%

From Perceptions To Evidence: Detecting AI-Generated Content In Turkish News Media With A Fine-Tuned Bert Classifier

从感知到证据:利用微调的BERT分类器检测土耳其新闻媒体中的AI生成内容

Ozancan Ozdemir

机构 * Bernoulli Institute University of Groningen(格罗宁根大学伯努利研究所)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究利用微调的土耳其BERT模型,首次实证测量土耳其新闻媒体中AI生成内容的使用情况,实现了高准确率的分类和检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14225 2026-02-17 cs.AI 70%

Text Before Vision: Staged Knowledge Injection Matters for Agentic RLVR in Ultra-High-Resolution Remote Sensing Understanding

文本优先于视觉:针对超高清遥感理解的代理强化学习在超高清遥感理解中的知识注入至关重要

Fengxiang Wang, Mingshuo Chen, Yueying Li, Yajie Yang, Yuhao Zhou, Di Wang, Yifan Zhang, Haoyu Wang, Haiyan Zhao, Hongda Sun, Long Lan, Jun Song, Yulin Wang, Jing Zhang, Wenlong Zhang, Bo Du

机构 * National University of Defense Technology, China(国防科技大学) Beijing University of Posts and Telecommunications, China(北京邮电大学) University of the Chinese Academy of Sciences, China(中国科学院大学) Sichuan University, China(四川大学) Wuhan University, China(武汉大学) Chinese Academy of Science, China(中国科学院) Tsinghua University, China(清华大学) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) Renmin University of China, China(中国人民大学)

专题命中 指令微调 :post-training(abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出分阶段知识注入方法,利用文本引导提升超高清遥感理解的视觉推理能力,实现XLRS-Bench上的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07132 2026-02-17 stat.ML cs.LG 70%

Discrete Adjoint Matching

离散共轭匹配

Oswin So, Brian Karrer, Chuchu Fan, Ricky T. Q. Chen, Guan-Horng Liu

机构 * Massachusetts Institute of Technology(麻省理工学院) FAIR at Meta(Meta 的 FAIR)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出离散共轭匹配方法,用于微调离散生成模型,通过离散域上的共轭估计器解决熵正则化奖励优化问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13407 2026-02-17 cs.AI 57%

On-Policy Supervised Fine-Tuning for Efficient Reasoning

在线监督微调用于高效推理

Anhao Zhao, Ziyang Chen, Junlong Tong, Yingqi Fan, Fanghua Ye, Shuhao Li, Yunpu Ma, Wenjie Li, Xiaoyu Shen

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Eastern Institute of Technology, Ningbo(宁波工程技术学院) Shanghai Jiao Tong University(上海交通大学) Ludwig Maximilian University of Munich(慕尼黑大学) Tencent Hunyuan / AI Lab(腾讯混元/AI实验室)

专题命中 指令微调 :SFT(abstract);分类 cs.AI

AI总结 本文提出在线监督微调方法,通过简化奖励机制提升推理效率和准确性,减少计算成本并优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14186 2026-02-17 cs.CV 50%

UniRef-Image-Edit: Towards Scalable and Consistent Multi-Reference Image Editing

UniRef-Image-Edit: 向可扩展和一致的多参考图像编辑迈进

Hongyang Wei, Bin Wen, Yancheng Long, Yankai Yang, Yuhang Hu, Tianke Zhang, Wei Chen, Haonan Fan, Kaiyu Jiang, Jiankang Chen, Changyi Liu, Kaiyu Tang, Haojie Ding, Xiao Yang, Jia Sun, Huaiqing Wang, Zhenyu Yang, Xinyu Wei, Xianglong He, Yangguang Li, Fan Yang, Tingting Gao, Lei Zhang, Guorui Zhou, Han Li

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技) Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) CUHK MMLab(香港中文大学MMLab)

专题命中 指令微调 :SFT(abstract)

AI总结 UniRef-Image-Edit通过统一的输入表示和两阶段训练框架,提升多参考图像编辑的一致性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏