arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11653 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11653 篇

2606.00494 2026-06-03 cs.LG 89%

ProjQ: Project-and-Quantize for Adapter-Aware LLM Compression

ProjQ:面向适配器感知的大语言模型压缩的投影与量化

Wenya Yu, Chao Zhang, Li Wang, Samson Lasaulce, Merouane Debbah

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出ProjQ框架,通过正交子空间投影将量化噪声约束到低秩流形,利用交替算法将主导误差卸载给适配器,实现更优的量化误差补偿和下游任务微调。

Comments Acceppted paper in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01137 2026-06-01 cs.LG 89%

Re-examining Low Rank adaptation for private LLM fine-tuning

重新审视用于私有LLM微调的低秩适应

Ali Dadsetan, Frank Rudzicz

机构 * Dalhousie University(达尔豪斯大学) Vector Institute(向量研究所)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究差分隐私SGD中噪声导致的梯度奇异值膨胀问题,提出通过部分恢复原始奇异值分布来提升DP-SGD的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22655 2026-05-28 cs.AI cs.CV cs.MM 89%

Text-Only Data Synthesis for Vision Language Model Training

仅文本数据合成用于视觉语言模型训练

Xiaomin Yu, Wenjie Zhang, Ziyue Qiao, Chengwei Qin, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Great Bay University(大湾大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);pretraining(abstract)

AI总结 提出一个跨集成的三阶段多模态数据合成框架,仅从文本生成高质量多模态训练数据,用于视觉语言模型的预训练和指令微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23969 2026-05-26 cs.CL 89%

SLAP: Stratified Loss-based Pruning for On-Policy Data-Efficient Instruction Tuning

SLAP: 基于分层损失剪枝的在线策略数据高效指令微调

Run Zou, Jianhang Ding, Yifan Ding, Wen Wu, Hao Chen, Renshu Gu

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) Hangzhou Lingju Intelligence AI Lab(杭州灵居智能AI实验室) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 提出SLAP框架,通过分布感知分层采样和相对距离优化实现批次级数据选择,在减少20-40%训练数据的同时保持或提升LLM性能。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16274 2026-05-19 cs.HC cs.AI 89%

ChartDesign: Towards LLM Designer of Data Visualization

ChartDesign: 向数据可视化设计的LLM设计师迈进

Mohammed Afaan Ansari, Aniruddh Bansal, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ChartDesign,利用大语言模型生成数据可视化设计属性,提升图表设计性能,实现84%的准确率,并在未见领域中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20863 2026-05-12 cs.CL 89%

GIFT: Guided Importance-Aware Fine-Tuning for Diffusion Language Models

GIFT: 用于扩散语言模型的引导重要性感知微调

Guowei Xu, Wenxin Xu, Jiawang Zhao, Kaisheng Ma

机构 * Institute for Interdisciplinary Information Sciences(交叉信息科学研究院)

专题命中 指令微调 :SFT(summary_cn,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出GIFT方法,通过根据熵分配不同重要性权重来优化扩散语言模型的微调,从而在多个基准测试中优于标准SFT。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07977 2026-05-11 cs.LG 89%

Self-Play Enhancement via Advantage-Weighted Refinement in Online Federated LLM Fine-Tuning with Real-Time Feedback

通过优势加权细化的自我扮演增强在线联邦大语言模型微调与实时反馈

Seohyun Lee, Wenzhi Fang, Dong-Jun Han, Seyyedali Hosseinalipour, Christopher G. Brinton

机构 * Purdue University(普渡大学) Yonsei University(延世大学) University at Buffalo-SUNY(布法罗大学-苏尼扬大学)

专题命中 指令微调 :LLM(title,summary_cn);foundation model(abstract);分类 cs.LG

AI总结 本文提出SPEAR算法,通过反馈引导的自我扮演循环生成对比对,利用标准最大似然和置信度加权不似然训练,在无需昂贵组生成和真实上下文的情况下实现高效的在线联邦LLM微调。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20426 2026-04-30 cs.AI 89%

Learning to Rewrite Tool Descriptions for Reliable LLM-Agent Tool Use

学习重写工具描述以实现可靠的LLM-代理工具使用

Ruocheng Guo, Kaiwen Dong, Xiang Gao, Kamalika Das

机构 * Intuit AI Research(Intuit AI研究院)

专题命中 指令微调 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 本文提出Trace-Free+框架,通过渐进式转移监督从轨迹丰富设置到轨迹自由部署,提升代理在大规模工具库中的鲁棒性与泛化能力,同时提高查询成功率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19060 2026-04-22 cs.AI 89%

Reinforcement Learning Improves LLM Accuracy and Reasoning in Disease Classification from Radiology Reports

强化学习提升LLM在放射学报告疾病分类中的准确性和推理能力

Yishu Wei, Yi Lin, Adam Flanders, George Shih, Yifan Peng

机构 * Department of Population Health Sciences, Weill Cornell Medicine, New York, NY(人口健康科学系,韦尔·柯林斯医学中心,纽约,NY) Department of Radiology, Weill Cornell Medicine, New York, NY(放射科,韦尔·柯林斯医学中心,纽约,NY) Department of Radiology, Thomas Jefferson University, Philadelphia, PA(放射科,托马斯·杰斐逊大学,费城,PA)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出两阶段方法,通过监督微调优化疾病标签,再用GRPO提升预测准确性与格式,增强推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18489 2026-04-21 cs.SD cs.CL eess.AS 89%

Aligning Language Models for Lyric-to-Melody Generation with Rule-Based Musical Constraints

基于规则的音乐约束对齐语言模型用于歌词到旋律生成

Hao Meng, Siyuan Zheng, Shuran Zhou, Qiangqiang Wang, Yang Song

机构 * Zuoyebang Education Technology(中关村教育科技)

专题命中 指令微调 :language model(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);preference optimization(abstract)

AI总结 本文提出基于规则的音乐约束对齐框架,通过DPO和KTO优化减少旋律生成中的约束违规,提升音乐性和连贯性。

Comments Accepted by IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00761 2026-04-21 cs.LG 89%

Downgrade to Upgrade: Optimizer Simplification Enhances Robustness in LLM Unlearning

降级到升级:优化器简化增强了大语言模型去学习的鲁棒性

Yicheng Lang, Yihua Zhang, Chongyu Fan, Changsheng Wang, Jinghan Jia, Sijia Liu

机构 * The OPTML Lab, Dept. CSE, Michigan State University(奥普特ML实验室,计算机科学与工程系,密歇根州立大学) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM沃森人工智能实验室,IBM研究院)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究优化器对大语言模型去学习鲁棒性的影响,发现降级优化器能提升鲁棒性,提出混合优化器提升去学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16333 2026-04-14 cs.CV cs.LG 89%

RL makes MLLMs see better than SFT

强化学习使多模态大语言模型比监督微调看得更清楚

Junha Song, Sangdoo Yun, Dongyoon Han, Jaegul Choo, Byeongho Heo

机构 * NAVER AI Lab(NAVER AI实验室)

专题命中 指令微调 :SFT(title,abstract);LLM(abstract);language model(abstract);pretraining(abstract)

AI总结 本文研究了强化学习在多模态大语言模型中的视觉编码器影响,发现RL能产生更精确的视觉表示,提出PIVOT方法提升视觉编码性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07754 2026-04-10 cs.CR cs.CL 89%

The Art of (Mis)alignment: How Fine-Tuning Methods Effectively Misalign and Realign LLMs in Post-Training

对齐的艺术:细调方法如何有效地对齐和重新对齐训练后的LLM

Rui Zhang, Hongwei Li, Yun Shen, Xinyue Shen, Wenbo Jiang, Guowen Xu, Yang Liu, Michael Backes, Yang Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学) Flexera CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :post-training(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究探讨细调方法在对齐和重新对齐LLM中的效果,揭示攻击与防御间的机制不对称,发现ORPO在对齐方面最有效,DPO在重新对齐中表现优异但牺牲了模型实用性,同时发现模型特定的抗性及多轮对抗动态的残留效应。

Comments Accepted by ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28191 2026-03-31 cs.CL 89%

DongYuan: An LLM-Based Framework for Integrative Chinese and Western Medicine Spleen-Stomach Disorders Diagnosis

东元:一种基于大语言模型的整合中西医脾胃疾病诊断框架

Hua Li, Yingying Li, Xiaobin Feng, Xinyi Fu, Lifeng Dong, Qingfeng Yang, Yanzhe Chen, Xiaoju Feng, Zhidong Cao, Jianbin Guo, Yanru Du

机构 * Beijing Wenge Technology Co., Ltd.(北京文歌科技有限公司) Hebei Provincial Hospital of Traditional Chinese Medicine(河北省中医院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tianjin University(天津大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出东元框架,通过构建三个中西医脾胃疾病数据集,开发核心诊断LLM和咨询导航模型,建立评估基准,显著提升中西医脾胃疾病诊断性能。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11193 2026-03-13 cs.CL 89%

DeReason: A Difficulty-Aware Curriculum Improves Decoupled SFT-then-RL Training for General Reasoning

DeReason: 一种考虑难度的课程改进了解耦的SFT-然后-RL训练以促进一般推理

Hanxu Hu, Yuxuan Wang, Maggie Huan, Jannis Vamvas, Yinya Huang, Zhijiang Guo, Rico Sennrich

机构 * University of Zurich(苏黎世大学) University of Pennsylvania(宾夕法尼亚大学) ETH Zurich(苏黎世联邦理工学院) HKUST (GZ)(香港科技大学(广州))

专题命中 指令微调 :SFT(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 DeReason通过基于难度的数据解耦策略,优化SFT与RL的训练分配,提升一般推理能力。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07230 2025-10-21 cs.CL 89%

Customer-R1: Personalized Simulation of Human Behaviors via RL-based LLM Agent in Online Shopping

Ziyi Wang, Yuxuan Lu, Yimeng Zhang, Jing Huang, Dakuo Wang

机构 * Northeastern University(东北大学) Michigan State University(密歇根州立大学) Amazon(亚马逊)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11588 2025-10-14 cs.AI 89%

Analyzing and Internalizing Complex Policy Documents for LLM Agents

Jiateng Liu, Zhenhailong Wang, Xiaojiang Huang, Yingjie Li, Xing Fan, Xiang Li, Chenlei Guo, Ruhi Sarikaya, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07370 2025-09-12 cs.CL 89%

PersonaFuse: A Personality Activation-Driven Framework for Enhancing Human-LLM Interactions

Yixuan Tang, Yi Yang, Ahmed Abbasi

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Notre Dame(诺丁汉大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04030 2025-08-11 cs.SE cs.CL 89%

OpenCodeInstruct: A Large-scale Instruction Tuning Dataset for Code LLMs

Wasi Uddin Ahmad, Aleksander Ficek, Mehrzad Samadi, Jocelyn Huang, Vahid Noroozi, Somshubra Majumdar, Boris Ginsburg

机构 * NVIDIA Santa Clara, CA 95051, USA(NVIDIA圣克拉拉分校)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01104 2025-06-03 cs.CL 89%

Contextual Candor: Enhancing LLM Trustworthiness Through Hierarchical Unanswerability Detection

Steven Robinson, Antonio Carlos Rivera

机构 * EDP University of Puerto Rico: San Sebastian(EDP巴尔的摩大学:圣塞巴斯蒂安)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11937 2025-05-12 cs.CL 89%

Precise Length Control in Large Language Models

Bradley Butcher, Michael O'Keefe, James Titchener

机构 * Strategic Research Group(战略研究组)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Journal ref Precise length control for large language models, Natural language processing Vol 11 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19898 2025-04-29 cs.CL 89%

GenCLS++: Pushing the Boundaries of Generative Classification in LLMs Through Comprehensive SFT and RL Studies Across Diverse Datasets

Mingqian He, Fei Zhao, Chonggang Lu, Ziyan Liu, Yue Wang, Haofu Qian

机构 * Zhejiang University(浙江大学) Xiaohongshu Inc.(小红书公司) Beijing University of Posts and Telecommunications(北京邮电大学) Nanjing University(南京大学)

专题命中 指令微调 :SFT(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09223 2025-03-13 cs.IR cs.AI 89%

LREF: A Novel LLM-based Relevance Framework for E-commerce

Tian Tang, Zhixing Tian, Zhenyu Zhu, Chenyang Wang, Haiqing Hu, Guoyu Tang, Lin Liu, Sulong Xu

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08770 2025-02-12 cs.AI 89%

Model Surgery: Modulating LLM's Behavior Via Simple Parameter Editing

Huanqian Wang, Yang Yue, Rui Lu, Jingxin Shi, Andrew Zhao, Shenzhi Wang, Shiji Song, Gao Huang

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

Comments 23 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08716 2025-01-16 cs.CL 89%

The Inherent Limits of Pretrained LLMs: The Unexpected Convergence of Instruction Tuning and In-Context Learning Capabilities

Irina Bigoulaeva, Harish Tayyar Madabushi, Iryna Gurevych

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments The code for this paper is available at: https://github.com/UKPLab/arxiv2025-inherent-limits-plms

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06913 2024-12-23 cs.CL 89%

Utilize the Flow before Stepping into the Same River Twice: Certainty Represented Knowledge Flow for Refusal-Aware Instruction Tuning

Runchuan Zhu, Zhipeng Ma, Jiang Wu, Junyuan Gao, Jiaqi Wang, Dahua Lin, Conghui He

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Equal contribution: Runchuan Zhu, Zhipeng Ma, Jiang Wu; Corresponding author: Conghui He

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06074 2024-11-12 cs.CV cs.AI 89%

Aquila: A Hierarchically Aligned Visual-Language Model for Enhanced Remote Sensing Image Comprehension

Kaixuan Lu, Ruiqian Zhang, Xiao Huang, Yuxing Xie

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09144 2024-04-04 cs.CL cs.HC 89%

Grounding Gaps in Language Model Generations

Omar Shaikh, Kristina Gligorić, Ashna Khetan, Matthias Gerstgrasser, Diyi Yang, Dan Jurafsky

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);instruction tuning(abstract)

Comments NAACL 2024; 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14970 2023-10-24 cs.CL 89%

Towards LLM-driven Dialogue State Tracking

Yujie Feng, Zexin Lu, Bo Liu, Liming Zhan, Xiao-Ming Wu

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments Accepted at EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17397 2026-08-18 quant-ph cs.AI cs.LG 版本更新 88%

Quantum Large Language Models via Tensor Network Disentanglers

基于张量网络解纠缠器的量子大语言模型

Borja Aizpurua, Fernando Loren, Saeed S. Jahromi, Sukhbinder Singh, Roman Orus

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出将量子计算与预训练大语言模型融合的框架,用张量网络解纠缠器压缩模型参数,经量子处理器验证可提升性能,为量子增强语言模型提供实用方案。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏