arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11692 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11692 篇

2604.10508 2026-04-14 cs.SE cs.AI 87%

How Many Tries Does It Take? Iterative Self-Repair in LLM Code Generation Across Model Scales and Benchmarks

需要多少次尝试?跨模型规模和基准的LLM代码生成中的迭代自修复

Johin Johny Arimbur

机构 * Independent Researcher(独立研究员)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究探讨了在不同模型规模和基准测试中,通过迭代自修复提高代码生成正确率的方法,发现自修复显著提升了通过率,且现代模型无需微调即可实现有效自修复。

Comments 11 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08926 2026-04-13 cs.LG 87%

Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning

弥合SFT与RL:面向鲁棒推理的动态策略优化

Taojie Zhu, Dongyang Xu, Ding Zou, Sen Zhao, Qiaobo Hao, Zhiguo Yang, Yonghong He

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Intelligent System Department, Zhongxing Telecom Equipment (ZTE)(中兴通讯股份有限公司智能系统部) Institute of Advanced Interdisciplinary Studies, Chongqing University of Posts and Telecommunications(重庆邮电大学前沿交叉研究院)

专题命中 指令微调 :SFT(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出DYPO框架,通过组对齐损失、多教师蒸馏和动态探索-利用门控机制,解决SFT与RL间的偏倚-方差权衡问题,提升复杂推理和分布外任务性能。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07361 2026-04-13 cs.LG 87%

BLEG: LLM Functions as Powerful fMRI Graph-Enhancer for Brain Network Analysis

BLEG: LLM作为强大的fMRI图增强器用于脑网络分析

Rui Dong, Zitong Wang, Jiaxing Li, Weihuang Zheng, Youyong Kong

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出BLEG方法,通过结合大语言模型与图神经网络,提升fMRI脑网络分析性能,采用三阶段流程增强图神经网络表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10238 2026-04-08 cs.CV cs.AI 87%

ForgeryGPT: A Multimodal LLM for Interpretable Image Forgery Detection and Localization

ForgeryGPT: 一种多模态大语言模型用于可解释的图像伪造检测与定位

Fanrui Zhang, Jiawei Liu, Jiaying Zhu, Esther Sun, Dong Li, Qiang Zhang, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 ForgeryGPT通过多模态大语言模型捕捉伪造图像的高阶取证知识关联,实现可解释的图像伪造检测与定位,提升检测精度和交互能力。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05629 2026-03-02 cs.LG 87%

On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification

在SFT的泛化上:从强化学习视角的奖励校正

Yongliang Wu, Yizhou Zhou, Zhou Ziheng, Yingzhe Peng, Xinyu Ye, Xinting Hu, Wenbo Zhu, Lu Qi, Ming-Hsuan Yang, Xu Yang

机构 * Southeast University(东南大学) University of California, Los Angeles(加州大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) Wuhan University(武汉大学) University of California, Merced(加州大学默塞德分校)

专题命中 指令微调 :SFT(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出动态微调方法,通过奖励校正提升SFT的泛化能力,在多个任务中表现优于传统SFT。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17835 2026-02-23 cs.LG 87%

Influence-Preserving Proxies for Gradient-Based Data Selection in LLM Fine-tuning

保留影响的梯度基数据选择代理

Sirui Chen, Yunzhe Qi, Mengting Ai, Yifan Sun, Ruizhong Qiu, Jiaru Zou, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 Iprox通过两阶段框架直接从目标模型生成保留影响的代理,有效提升LLM微调中基于梯度的数据选择效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13773 2026-02-17 cs.LG 87%

On Representation Redundancy in Large-Scale Instruction Tuning Data Selection

在大规模指令微调数据选择中的表示冗余性

Youwei Shu, Shaomian Zheng, Dingnan Jin, Wenjie Qu, Ziyao Guo, Qing Cui, Jun Zhou, Jiaheng Zhang

机构 * National University of Singapore(新加坡国立大学)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出CRDS框架,通过压缩表示减少指令微调数据冗余,提升数据质量与模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11884 2026-02-17 cs.CL 87%

Context-Emotion Aware Therapeutic Dialogue Generation: A Multi-component Reinforcement Learning Approach to Language Models for Mental Health Support

情境-情绪感知的治疗对话生成:一种多组件强化学习方法用于语言模型的心理健康支持

Eric Hua Qing Zhang, Julia Ive

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);SFT(abstract)

AI总结 本文提出一种多组件强化学习方法,通过改进GPT-2的治疗对话生成能力,提升情绪准确性和上下文相关性,以支持心理健康领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03073 2026-02-04 cs.LG 87%

TMS: Trajectory-Mixed Supervision for Reward-Free, On-Policy SFT

TMS:轨迹混合监督用于无奖励、在线策略微调

Rana Muhammad Shahroz Khan, Zijie Liu, Zhen Tan, Charles Fleming, Tianlong Chen

专题命中 指令微调 :SFT(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 TMS通过轨迹混合监督在无奖励的情况下提升大语言模型的保留能力,有效弥补了传统SFT与RL之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01461 2026-02-03 cs.CL cs.SD eess.AS 87%

Bridging the gap: A comparative exploration of Speech-LLM and end-to-end architecture for multilingual conversational ASR

弥合差距:Speech-LLM与端到端架构在多语言对话ASR中的比较探索

Yuxiang Mei, Dongxing Xu, Jiaen Liang, Yanhua Long

机构 * Shanghai Normal University(上海师范大学) Unisound AI Technology Co., Ltd.(Unisound AI技术有限公司)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SLM(abstract)

AI总结 本文提出一种结合微调Whisper和mHuBERT编码器与LLM的ASR框架,通过交叉注意力机制提升多语言对话ASR性能,实验表明其在性能上接近端到端模型,但仍有提升空间。

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14598 2026-02-03 cs.SE cs.AI 87%

HELIOS: Hierarchical Graph Abstraction for Structure-Aware LLM Decompilation

HELIOS:基于结构的图抽象用于结构感知的LLM反编译

Yonatan Gizachew Achamyeleh, Harsh Thomare, Mohammad Abdullah Al Faruque

机构 * Dept. of Electrical Engineering and Computer Science, University of California, Irvine, CA, USA(电气工程与计算机科学系,加州大学伊文斯顿分校)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 HELIOS通过结构化图抽象提升LLM反编译的准确性和可编译性,实现功能正确性和语法正确性的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18225 2026-01-27 cs.AI 87%

ShopSimulator: Evaluating and Exploring RL-Driven LLM Agent for Shopping Assistants

ShopSimulator: 评估和探索基于强化学习的LLM代理用于购物助手

Pei Wang, Yanan Wu, Xiaoshuai Song, Weixun Wang, Gengru Chen, Zhongwen Li, Kezhong Yan, Ken Deng, Qi Liu, Shuaibing Zhao, Shaopan Xiong, Xuepeng Liu, Xuefeng Chen, Wanxi Deng, Wenbo Su, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出ShopSimulator,一个大规模中文购物环境,用于评估和探索基于强化学习的LLM代理在购物助手中的性能和改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15879 2026-01-23 cs.SE cs.CL 87%

Evaluating and Achieving Controllable Code Completion in Code LLM

评估和实现可控的代码补全在代码LLM中

Jiajun Zhang, Zeyu Cui, Lei Zhang, Jian Yang, Jiaxi Yang, Qiang Liu, Zilei Wang, Binyuan Hui, Liang Wang, Junyang Lin

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出可控代码补全基准C3-Bench,评估了40种LLM在代码补全中的指令遵循能力,开发数据合成管道并推出Qwen2.5-Coder-C3模型,实现代码补全性能的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05867 2026-01-23 cs.CR cs.CL 87%

Can LLM Infer Risk Information From MCP Server System Logs?

LLM能否从MCP服务器系统日志中推断风险信息?

Jiayi Fu, Yuansen Zhang, Yinggui Wang

机构 * Southern University of Science and Technology(南方科技大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出首个评估LLM从MCP服务器系统日志中识别安全风险的合成基准,通过训练不同模型展示强化学习在提升LLM安全性能中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09750 2026-01-16 cs.SE cs.AI cs.HC cs.MA 87%

SAGE: Tool-Augmented LLM Task Solving Strategies in Scalable Multi-Agent Environments

SAGE:可扩展多智能体环境中基于工具的LLM任务解决策略

Robert K. Strehlow, Tobias Küster, Oskar F. Kupke, Brandon Llanque Kurps, Fikret Sivrikaya, Sahin Albayrak

机构 * Technische Universität Berlin(柏林技术大学) DAI-Labor, TU Berlin, Chair of Agent Technologies(柏林技术大学DAI实验室,代理技术系) GT-ARC gGmbH(GT-ARC公司)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 SAGE通过OPACA框架实现动态工具整合,提供灵活的任务解决策略,提升LLM在多智能体环境中的效率与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15456 2025-12-12 cs.CL 87%

Teaching Language Models to Evolve with Users: Dynamic Profile Modeling for Personalized Alignment

教导语言模型与用户共同进化:面向个性化对齐的动态资料模型

Weixiang Zhao, Xingyu Sui, Yulin Hu, Jiahe Guo, Haixiao Liu, Biye Li, Yanyan Zhao, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

AI总结 本研究提出RLPA框架,通过动态资料推断提升个性化对话性能,Qwen-RLPA在多个基准测试中超越现有方法。

Comments NeurIPS 2025 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08179 2025-12-10 q-fin.ST cs.AI 87%

RAG-IT: Retrieval-Augmented Instruction Tuning for Automated Financial Analysis -- A Case Study for the Semiconductor Sector

RAG-IT:基于检索的指令微调用于自动化财务分析——半导体行业案例研究

Hai-Thien To, Tien-Cuong Bui, Van-Duc Le

机构 * University of Transport Technology(运输技术大学) Arontier Co., Ltd.(阿隆蒂尔公司)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 RAG-IT通过检索增强和指令微调,提升LLM在半导体行业财务分析中的性能,实现与商业系统相当的财务报告生成能力。

Comments We updated title, abstract and added more details in experiment section. We also updated the list of authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20059 2025-11-21 cs.CL 87%

Is Preference Alignment Always the Best Option to Enhance LLM-Based Translation? An Empirical Analysis

基于偏好对齐是否总是提升基于大语言模型的翻译质量的最佳选项?一项实证分析

Hippolyte Gisserot-Boukhlef, Ricardo Rei, Emmanuel Malherbe, Céline Hudelot, Pierre Colombo, Nuno M. Guerreiro

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本研究通过实证分析探讨了基于偏好的对齐在提升大语言模型翻译质量中的效果,发现CPO在高质量数据上表现优异,但可能在下游度量上存在不稳定性,同时基础模型生成翻译的表现与多个外部系统相当且更一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02234 2025-11-05 cs.MM cs.CL cs.SD 87%

An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM

Jiawei Liu, Enis Berk Çoban, Zarina Schevchenko, Hao Tang, Zhigang Zhu, Michael I Mandel, Johanna Devaney

机构 * The Graduate Center, CUNY(CUNY研究生中心) Brooklyn College, CUNY(CUNY布鲁克林学院) Borough of Manhattan Community College, CUNY(CUNY曼哈顿社区学院) The City College of New York, CUNY(CUNY纽约城市学院)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14824 2025-10-17 cs.CL cs.CV cs.IR 87%

Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking

Ziqi Dai, Xin Zhang, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Meishan Zhang, Wenjie Li, Min Zhang

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11121 2025-10-14 cs.LG 87%

Refining Hybrid Genetic Search for CVRP via Reinforcement Learning-Finetuned LLM

Rongjie Zhu, Cong Zhang, Zhiguang Cao

机构 * School of Teacher Education, Nanjing University of Information Science and Technology, China(南京信息工程大学教师教育学院) Nanyang Technological University, Singapore(新加坡南洋理工大学) Singapore Management University, Singapore(新加坡管理大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01339 2025-10-14 cs.LG 87%

Invariance Makes LLM Unlearning Resilient Even to Unanticipated Downstream Fine-Tuning

Changsheng Wang, Yihua Zhang, Jinghan Jia, Parikshit Ram, Dennis Wei, Yuguang Yao, Soumyadeep Pal, Nathalie Baracaldo, Sijia Liu

机构 * Michigan State University(密歇根州立大学) IBM Research(IBM研究院)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09347 2025-10-13 cs.CL 87%

LLP: LLM-based Product Pricing in E-commerce

Hairu Wang, Sheng You, Qiheng Zhang, Xike Xie, Shuguang Han, Yuchen Wu, Fei Huang, Jufeng Chen

机构 * University of Science and Technology of China(中国科学技术大学) Xianyu of Alibaba(阿里巴巴闲鱼)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12299 2025-10-01 cs.CR cs.AI 87%

QGuard:Question-based Zero-shot Guard for Multi-modal LLM Safety

Taegyeong Lee, Jeonghwa Yoo, Hyoungseo Cho, Soo Yong Kim, Yunho Maeng

机构 * FnGuide Inc.(FnGuide公司) Safe Generative AI Lab, MODULABS(MODULABS安全生成AI实验室) A.I.MATICS Inc.(A.I.MATICS公司) Ewha Womans University(成均馆大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accept to ACLW 2025 (WOAH); fix typo

Journal ref ACL Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05021 2025-10-01 cs.CL cs.CR 87%

Safety is Not Only About Refusal: Reasoning-Enhanced Fine-tuning for Interpretable LLM Safety

Yuyou Zhang, Miao Li, William Han, Yihang Yao, Zhepeng Cen, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20957 2025-09-26 cs.CL 87%

Tool Calling for Arabic LLMs: Data Strategies and Instruction Tuning

Asim Ersoy, Enes Altinisik, Husrev Taha Sencar, Kareem Darwish

机构 * Qatar Computing Research Institute, HBKU(卡塔尔计算研究所,哈塔姆大学)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Journal ref ArabicNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01035 2025-09-03 cs.CL 87%

We Politely Insist: Your LLM Must Learn the Persian Art of Taarof

Nikta Gohari Sadr, Sahar Heidariasl, Karine Megerdoomian, Laleh Seyyed-Kalantari, Ali Emami

机构 * Brock University(布鲁克大学) Zoorna AI York University(约克大学) Emory University(埃默里大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12458 2025-08-19 cs.CL 87%

M3PO: Multimodal-Model-Guided Preference Optimization for Visual Instruction Following

Ruirui Gao, Emily Johnson, Bowen Tan, Yanfei Qian

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 指令微调 :preference optimization(title,abstract);language model(abstract);SFT(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08635 2025-08-13 cs.LG 87%

Classifier Language Models: Unifying Sparse Finetuning and Adaptive Tokenization for Specialized Classification Tasks

Adit Krishnan, Chu Wang, Chris Kong

机构 * Amazon Web Services Inc.(亚马逊网络服务公司)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);small language model(abstract);pretraining(abstract)

Comments 10 pages, 4 figures, currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09368 2025-08-12 cs.AI 87%

Aligning Instruction Tuning with Pre-training

Yiming Liang, Tianyu Zheng, Xinrun Du, Ge Zhang, Jiaheng Liu, Xingwei Qu, Wenqiang Zu, Xingrun Xing, Chujie Zheng, Lei Ma, Guoyin Wang, Zhaoxiang Zhang, Wenhao Huang, Xiang Yue, Jiajun Zhang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏