arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-12 至 2026-02-12 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 13 篇

2601.09718 2026-02-12 cs.CL cs.AI 94%

StatLLaMA: Multi-Stage training for domain-optimized statistical large language models

StatLLaMA:面向统计领域优化的多阶段训练方法

Jing-Yi Zeng, Guan-Hua Huang

机构 * Institute of Statistics, National Yang Ming Chiao Tung University(统计研究所,国立阳明交通大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 StatLLaMA通过多阶段训练方法优化统计领域,实现高效且平衡的模型性能。

Comments 31 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10597 2026-02-12 cs.CY 93%

Llama-Polya: Instruction Tuning for Large Language Model based on Polya's Problem-solving

Llama-Polya:基于波利亚问题解决框架的大型语言模型指令调优

Unggi Lee, Yeil Jeong, Chohui Lee, Gyuri Byun, Yunseo Lee, Minji Kang, Minji Jeon

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);LLM(abstract)

AI总结 Llama-Polya通过整合波利亚问题解决框架,提升大型语言模型在数学推理和教学对齐方面的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10815 2026-02-12 cs.CV cs.LG 89%

Why Does RL Generalize Better Than SFT? A Data-Centric Perspective on VLM Post-Training

为什么强化学习比监督微调在泛化能力上更优?一种以数据为中心的视觉语言模型后训练视角

Aojun Lu, Tao Feng, Hangjie Yuan, Wei Li, Yanan Sun

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 指令微调 :post-training(title,abstract);SFT(title,abstract);language model(abstract);分类 cs.LG

AI总结 本文通过数据视角揭示了RL在VLM后训练中泛化能力优于SFT的原因,提出DC-SFT方法提升OOD性能并提高稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15922 2026-02-12 cs.CL 89%

Aligning Dialogue Agents with Global Feedback via Large Language Model Multimodal Reward Decomposition

通过大语言模型多模态奖励分解对齐对话代理

Dong Won Lee, Hae Won Park, Cynthia Breazeal, Louis-Philippe Morency

机构 * MIT(麻省理工学院) CMU(卡内基梅隆大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出了一种基于大语言模型的多模态奖励分解方法,通过分解会话级反馈来提升对话生成质量,无需人工反馈。

Comments 9 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05228 2026-02-12 cs.AI 88%

Surgery: Mitigating Harmful Fine-Tuning for Large Language Models via Attention Sink

手术:通过注意力sink缓解大型语言模型的有害微调

Guozhi Liu, Weiwei Lin, Tiansheng Huang, Ruichao Mo, Qi Mu, Xiumin Wang, Li Shen

机构 * South China University of Technology(南方科技大学) Pengcheng Laboratory(鹏城实验室) Sun Yat-sen University(中山大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 Surgery通过注意力sink机制在微调阶段抑制有害模式学习,提升模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11000 2026-02-12 cs.DC cs.AI cs.LG 85%

Fine-Tuning GPT-5 for GPU Kernel Generation

为GPU内核生成微调GPT-5

Ali Tehrani, Yahya Emara, Essam Wissam, Wojciech Paluch, Waleed Atallah, Łukasz Dudziak, Mohamed S. Abdelfattah

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 通过强化学习微调GPT-5提升GPU内核生成性能,实现正确率和效率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10819 2026-02-12 cs.LG 77%

RePO: Bridging On-Policy Learning and Off-Policy Knowledge through Rephrasing Policy Optimization

RePO:通过重新表述策略优化弥合基于策略学习和基于策略知识的差距

Linxuan Xia, Xiaolong Yang, Yongyuan Chen, Enyue Zhao, Deng Cai, Yasheng Wang, Boxi Wu

机构 * State Key Laboratory of CAD\&CG, the College of Computer Science Technology, Zhejiang University. FiT, Tencent, Shenzhen, China. School of Software Technology, Zhejiang University

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.LG

AI总结 RePO通过重新表述策略优化,有效结合基于策略学习和基于策略知识,提升困难样本利用和模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10490 2026-02-12 cs.IR 75%

ChainRec: An Agentic Recommender Learning to Route Tool Chains for Diverse and Evolving Interests

ChainRec: 一个用于路由工具链的代理推荐学习系统,以应对多样化和演变的兴趣

Fuchun Li, Qian Li, Xingyu Gao, Bocheng Pan, Yang Wu, Jun Zhang, Huan Yu, Jie Jiang, Jinsheng Xiao, Hailong Shi

专题命中 指令微调 :large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 ChainRec通过动态选择推理工具的代理推荐系统,提升冷启动和兴趣演变场景下的推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10404 2026-02-12 cs.LG cs.AI cs.CL 75%

Modular Multi-Task Learning for Chemical Reaction Prediction

模块化多任务学习用于化学反应预测

Jiayun Pang, Ahmed M. Zaitoun, Xacobe Couso Cambeiro, Ivan Vulić

机构 * University of Greenwich(格林威治大学) University of Cambridge(剑桥大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出使用LoRA进行模块化多任务学习,以提高有机反应预测的准确性和泛化能力。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19844 2026-02-12 cs.CV 75%

ProAPO: Progressively Automatic Prompt Optimization for Visual Classification

ProAPO:逐步自动提示优化用于视觉分类

Xiangyan Qu, Gaopeng Gou, Jiamin Zhuang, Jing Yu, Kun Song, Qihao Wang, Yili Li, Gang Xiong

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Information Engineering, Minzu University of China(民族大学信息工程学院) University of Science and Technology Beijing(北京科技大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 ProAPO通过逐步自动优化提示,提升视觉分类性能,优于现有方法并在多个数据集上取得显著改进。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06968 2026-02-12 cs.AI cs.CL 73%

Scaling Towards the Information Boundary of Instruction Sets: The Infinity Instruct Subject Technical Report

向指令集的信息边界扩展:Infinity Instruct主体技术报告

Li Du, Hanyu Zhao, Yiming Ju, Tengfei Pan

机构 * BAAI(北京人工智能研究院)

专题命中 指令微调 :foundation model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出系统化的指令数据构建框架,构建高质量的Infinity Instruct Subject数据集,提升模型在复杂指令任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02216 2026-02-12 math.OC 71%

Parameter-Efficient Subspace Optimization for LLM Fine-Tuning

参数高效子空间优化用于大语言模型微调

Yuchen Lou, Zeqi Ye, Minshuo Chen

专题命中 指令微调 :LLM(title)

AI总结 本文提出PESO框架,通过参数高效子空间优化方法提升大语言模型微调的收敛性能与内存效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10549 2026-02-12 cs.CV cs.AI 57%

Enhancing Weakly Supervised Multimodal Video Anomaly Detection through Text Guidance

通过文本引导增强弱监督多模态视频异常检测

Shengyang Sun, Jiashen Hua, Junyi Feng, Xiaojin Gong

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) Alibaba Cloud(阿里云) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 本文提出文本引导框架,通过多阶段文本增强和多尺度瓶颈Transformer融合模块,提升弱监督多模态视频异常检测的性能。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏