arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11714 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11714 篇

2604.06253 2026-04-09 cs.LG cs.AI cs.PL 73%

FLeX: Fourier-based Low-rank EXpansion for multilingual transfer

FLeX:基于傅里叶的低秩扩展用于多语言迁移

Gaurav Narasimhan

机构 * Stanford University(斯坦福大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了通过低秩适应和优化器改进提升Python到Java等语言的跨语言迁移效果,发现低秩适应和傅里叶正则化能显著提升迁移性能。

Comments 19 pages, 25 figures, Stanford CS224N Custom Project

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02795 2026-04-06 cs.CL cs.AI 73%

Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks

评分标准到标记:在指令遵循任务中连接响应级评分标准和标记级奖励

Tianze Xu, Yanzhao Zheng, Pengrui Lu, Lyumanshan Ye, Yong Wu, Zhentao Zhang, Yuanqiang Yu, Chao Ma, Jihuai Zhu, Pengfei Liu, Baohua Dong, Hangcheng Zhu, Ruohui Huang, Gang Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) GAIR

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RTT框架,通过引入标记级相关性判别器和RTT-GRPO方法,解决响应级奖励稀疏性和模糊性问题,提升指令遵循任务的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01268 2026-04-03 cs.CL cs.AI 73%

The Overlooked Repetitive Lengthening Form in Sentiment Analysis

情感分析中被忽视的重复延长形式

Lei Wang, Eduard Dragut

机构 * Temple University(天普大学)

专题命中 指令微调 :language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了重复延长形式(RLF)在情感分析中的重要性及语言模型的理解能力,构建了首个多领域RLF数据集并提出ExpInstruct框架,验证了RLF在文档级情感分析中的潜力。

Comments Findings of EMNLP 2024

Journal ref EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04823 2026-04-03 cs.AI cs.CL 73%

DR-LoRA: Dynamic Rank LoRA for Fine-Tuning Mixture-of-Experts Models

DR-LoRA:动态秩LoRA用于混合专家模型的微调

Guanzhi Deng, Bo Li, Ronghao Chen, Xiujin Liu, Zhuo Han, Huacan Wang, Lijie Wen, Linqi Song

机构 * City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Peking University(北京大学) University of Michigan(密歇根大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DR-LoRA通过动态分配不同秩的LoRA模块,提升混合专家模型微调效果,实验表明其优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26317 2026-03-30 cs.CV cs.AI cs.LG 73%

Label-Free Cross-Task LoRA Merging with Null-Space Compression

无标签跨任务LoRA融合与空域压缩

Wonyoung Lee, Wooseong Jeong, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出无标签的NSC融合方法,通过适配器几何设置合并权重,实现跨分类、回归和序列生成任务的高效融合,优于现有方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10700 2026-03-27 cs.CL cs.AI 73%

LLMs know their vulnerabilities: Uncover Safety Gaps through Natural Distribution Shifts

大语言模型知其弱点:通过自然分布偏移揭示安全漏洞

Qibing Ren, Hao Li, Dongrui Liu, Zhanxu Xie, Xiaoya Lu, Yu Qiao, Lei Sha, Junchi Yan, Lizhuang Ma, Jing Shao

机构 * MoE Key Lab of Artificial Intelligence, Shanghai Jiao Tong University(人工智能大模型关键实验室,上海交通大学) Beihang University(北京航空航天大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大语言模型对自然分布偏移的脆弱性,提出ActorBreaker攻击方法,通过识别有毒提示相关角色构建多轮提示,揭示模型安全漏洞,并构建安全数据集提升鲁棒性。

Comments ACL 2025 main conference. Code is available at https://github.com/AI45Lab/ActorAttack

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19345 2026-03-26 cs.LG cs.AI 73%

Smooth Gate Functions for Soft Advantage Policy Optimization

用于软优势策略优化的平滑门函数

Egor Denisov, Svetlana Glazyrina, Maksim Kryzhanovskiy, Roman Ischenko

机构 * Institute for Artificial Intelligence, Lomonosov Moscow State University(莫斯科罗蒙诺索夫莫斯科国立大学人工智能研究所) Lomonosov Moscow State University(莫斯科罗蒙诺索夫莫斯科国立大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了通过平滑门函数提升策略优化稳定性和模型性能,分析了不同门函数在数学推理任务中的实验结果,为大语言模型训练提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00430 2026-03-26 cs.LG cs.AI cs.CV 73%

PromptLoop: Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment

PromptLoop: 通过潜在反馈实现扩散模型对齐的即插即用提示精炼

Suhyeon Lee, Jong Chul Ye

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 PromptLoop通过引入潜在反馈的逐步提示精炼方法,提升扩散模型在奖励优化、泛化能力及对抗奖励黑客方面的性能,同时保持灵活性和通用性。

Comments CVPR26 poster. 25 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08686 2026-03-25 cs.CL cs.CY cs.LG 73%

LatentQA: Teaching LLMs to Decode Activations Into Natural Language

LatentQA: 教授大语言模型将激活解码为自然语言

Alexander Pan, Lijie Chen, Jacob Steinhardt

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 指令微调 :LLM(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出LatentQA任务,通过生成激活与自然语言描述的数据库,训练解码器LLM以回答关于激活的开放性问题,并验证其在阅读任务和行为控制中的优越性。

Comments ICLR 2026; project page at https://latentqa.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14893 2026-03-17 cs.CL cs.AI 73%

LLMs as Signal Detectors: Sensitivity, Bias, and the Temperature-Criterion Analogy

LLMs作为信号检测器:灵敏度、偏差以及温度-准则类比

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLMs作为信号检测器的灵敏度和偏差,探讨温度是否如同心理物理学中的准则调整,并发现温度同时影响灵敏度和准则,揭示SDT框架在评估LLMs校准方面的必要性。

Comments 15 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14493 2026-03-17 cs.CV cs.CL cs.LG 73%

Fine-tuning MLLMs Without Forgetting Is Easier Than You Think

对多模态大语言模型进行微调而不遗忘比你想象的更容易

He Li, Yuhui Zhang, Xiaohan Wang, Kaifeng Lyu, Serena Yeung-Levy

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过实验框架展示,简单调整微调方法可缓解灾难性遗忘,提出数据混合训练策略解决特定任务过拟合问题,并证明该方法可扩展至持续学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13792 2026-03-17 cs.LG cs.AI 73%

IGU-LoRA: Adaptive Rank Allocation via Integrated Gradients and Uncertainty-Aware Scoring

IGU-LoRA: 通过集成梯度和不确定性感知评分实现自适应秩分配

Xuan Cui, Huiyue Li, Run Zeng, Yunfei Zhao, Jinrui Qian, Wei Duan, Bo Liu, Zhanpeng Zhou

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 IGU-LoRA通过计算层内集成梯度敏感度并结合不确定性感知方案,实现自适应秩分配,提升参数高效微调效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13318 2026-03-17 cs.LG cs.AI 73%

Residual Stream Analysis of Overfitting And Structural Disruptions

残差流分析过拟合与结构破坏

Quan Liu, Han Zhou, Wenquan Wu, Hua Wu, Sen Su

机构 * BUPT(北京邮电大学) Baidu(百度)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过分析残差流几何揭示安全数据导致的虚假拒绝问题,提出VCL正则化方法降低虚假拒绝率并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12298 2026-03-16 cs.LG cs.AI 73%

Global Evolutionary Steering: Refining Activation Steering Control via Cross-Layer Consistency

全局进化引导:通过跨层一致性精炼激活引导控制

Xinyan Jiang, Wenjing Yu, Di Wang, Lijie Hu

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GER-steer框架,通过利用网络表示演化的几何稳定性,精炼激活引导向量,有效分离稳健语义意图与正交噪声,提升模型对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07490 2026-03-16 cs.CL cs.LG 73%

Mask-Enhanced Autoregressive Prediction: Pay Less Attention to Learn More

增强的自回归预测:少关注多学习

Xialie Zhuang, Zhikai Jia, Jianjin Li, Zhenyu Zhang, Li Shen, Zheng Cao, Shiwei Liu

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MEAP方法,通过整合MLM与NTP提升上下文检索能力,实验显示其在关键信息检索和长上下文推理任务中表现优异,且在常识推理任务中不逊色。

Comments 17 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11114 2026-03-13 cs.LG cs.AI 73%

Task-Conditioned Routing Signatures in Sparse Mixture-of-Experts Transformers

稀疏混合专家变压器中的任务条件路由签名

Mynampati Sri Ranganadha Avinash

机构 * MSR Avinash Independent Researcher(MSR阿文纳什独立研究员)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究发现稀疏混合专家变压器中的路由机制具有任务条件结构,通过路由签名分析显示同类任务提示具有高相似性,不同任务提示相似性较低,且基于路由签名的分类器在任务分类中表现优异。

Comments 11 pages, 5 figures. Empirical analysis of routing behavior in sparse Mixture-of-Experts transformers using OLMoE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09951 2026-03-11 cs.LG cs.AI cs.SE 73%

Towards a Neural Debugger for Python

迈向Python的神经调试器

Maximilian Beck, Jonas Gehring, Jannik Kossen, Gabriel Synnaeve

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出神经调试器,通过模拟传统调试器实现交互式代码执行控制,提升神经模型在代码执行预测与逆向推理中的能力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08014 2026-03-10 cs.LG cs.AI 73%

FedMomentum: Preserving LoRA Training Momentum in Federated Fine-Tuning

FedMomentum: 在联邦微调中保持LoRA训练动量

Peishen Yan, Yang Hua, Hao Wang, Jiaru Zhang, Xiaoyu Wu, Tao Song, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学) Queen's University Belfast(女王大学贝尔法斯特分校) Stevens Institute of Technology(史蒂文斯理工学院) Purdue University(普渡大学) Rice University(里奇大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 FedMomentum通过奇异值分解实现结构化且动量保持的LoRA聚合,提升联邦微调中的收敛速度和准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06958 2026-03-10 cs.LG cs.CL 73%

Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards

Chart-RL: 通过可验证奖励的强化学习实现通用图表理解

Xin Zhang, Xingyu Li, Rongguang Wang, Ruizhong Miao, Zheng Wang, Dan Roth, Chenyang Li

机构 * Oracle AI

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.CL、cs.LG

AI总结 Chart-RL通过可验证奖励的强化学习提升图表理解能力,在多个基准测试中超越监督微调,展现强大的泛化和迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06816 2026-03-10 cs.CL cs.AI q-bio.NC 73%

"Dark Triad" Model Organisms of Misalignment: Narrow Fine-Tuning Mirrors Human Antisocial Behavior

黑暗三联征模型生物:对齐偏差:狭窄微调映射人类反社会行为

Roshni Lulla, Fiona Collins, Sanaya Parekh, Thilo Hagendorff, Jonas Kaplan

机构 * Brain & Creativity Institute, University of Southern California(大脑与创造力研究所,南加州大学) Department of Psychology, University of Southern California(心理学系,南加州大学) Interchange Forum for Reflecting on Intelligent Systems, University of Stuttgart(智能系统反思交流论坛,斯图加特大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过黑暗三联征框架,研究LLM中的对齐偏差问题,通过微调诱导反社会行为,揭示LLM中潜在的人格结构。

Comments 38 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04772 2026-03-06 cs.CL cs.AI 73%

TSEmbed: Unlocking Task Scaling in Universal Multimodal Embeddings

TSEmbed: 解锁通用多模态嵌入中的任务扩展

Yebo Wu, Feng Liu, Ziwei Xie, Zhiyuan Liu, Changwang Zhang, Jun Wang, Li Li

机构 * State Key Laboratory of IOTSC, University of Macau(物联网科学与技术国家重点实验室,澳门大学) OPPO Research Institute(OPPO研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TSEmbed通过融合MoE与LoRA,结合专家感知负采样策略,提升通用多模态嵌入的任务扩展能力,并在基准和工业数据集上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04436 2026-03-06 cs.LG cs.AI 73%

ZorBA: Zeroth-order Federated Fine-tuning of LLMs with Heterogeneous Block Activation

ZorBA: 零阶联邦微调LLM的异构块激活

Chuiyang Meng, Ming Tang, Vincent W. S. Wong

机构 * Department of Electrical and Computer Engineering, The University of British Columbia, Vancouver, Canada(电气与计算机工程系,不列颠哥伦比亚大学) Department of Computer Science and Engineering, Southern University of Science and Technology, China(计算机科学与工程系,南方科技大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ZorBA通过异构块激活和零阶优化,有效降低LLM联邦微调的VRAM使用和通信开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01792 2026-03-03 cs.CL cs.AI 73%

ALTER: Asymmetric LoRA for Token-Entropy-Guided Unlearning of LLMs

ALTER: 用于LLM中基于令牌熵引导的不对称LoRA去学习

Xunlei Chen, Jinyu Guo, Yuang Li, Zhaokun Wang, Yi Gong, Jie Zou, Jiwei Wei, Wenhong Tian

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ALTER通过不对称LoRA架构实现基于令牌熵引导的LLM高效去学习,取得SOTA性能并保留高模型效用。

Comments Accepted at The 40th Annual AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01651 2026-03-03 cs.CL cs.AI 73%

LexChronos: An Agentic Framework for Structured Event Timeline Extraction in Indian Jurisprudence

LexChronos:一个用于印度法理学中结构化事件时间线提取的代理框架

Anka Chandrahas Tummepalli, Preethu Rose Anish

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LexChronos通过双代理架构提取印度最高法院判决中的结构化事件时间线,提升法律文本理解和推理能力。

Comments Published in AILaw @ AAAI 2026 Conference

Journal ref AILaw @ AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13328 2026-03-02 cs.LG cs.AI 73%

Thompson Sampling via Fine-Tuning of LLMs

通过微调大语言模型进行汤普森采样

Nicolas Menet, Aleksandar Terzić, Michael Hersche, Andreas Krause, Abbas Rahimi

机构 * IBM Research – Zurich(IBM瑞士研究院) Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过微调大语言模型实现高效汤普森采样,提升贝叶斯优化的样本和计算效率。

Comments accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22817 2026-02-27 cs.LG cs.AI 73%

Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks

长周期代理任务的分层组策略优化

Shuo He, Lang Feng, Qi Wei, Xin Cheng, Lei Feng, Bo An

机构 * Nanyang Technological University(南洋理工大学) Southeast University(东南大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HGPO通过分层组策略优化解决长周期代理任务中分步优势估计的上下文不一致问题,提升策略优化效果。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21420 2026-02-26 cs.LG cs.AI 73%

Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning

过度自信的错误需要更强的纠正:强化学习中的非对称置信度惩罚

Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang

机构 * LinkedIn Corporation(领英公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出非对称置信度感知错误惩罚(ACE)以解决强化学习中过度自信错误的问题,通过动态调节负优势提升模型推理能力与生成多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14462 2026-02-25 cs.LG cs.AI 73%

Silent Inconsistency in Data-Parallel Full Fine-Tuning: Diagnosing Worker-Level Optimization Misalignment

数据并行全微调中的沉默不一致:诊断工作级别优化不一致

Hong Li, Zhen Zhou, Honggang Zhang, Yuping Luo, Xinyue Wang, Han Gong, Zhiyuan Liu

机构 * School of Transportation Southeast University(交通学院东南大学) Department of Logistics and Maritime Studies The Hong Kong Polytechnic University(物流与海运研究部香港理工大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种轻量诊断框架,用于检测数据并行微调中工作级别优化的不一致问题,通过损失分散度、梯度范数分散度和方向一致性指标,揭示隐藏的不稳定性模式。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25684 2026-02-25 cs.CL cs.AI 73%

LD-MoLE: Learnable Dynamic Routing for Mixture of LoRA Experts

LD-MoLE: 可学习动态路由用于LoRA专家混合

Yuan Zhuang, Yi Shen, Yuexin Bian, Qing Su, Shihao Ji, Yuanyuan Shi, Fei Miao

机构 * University of Connecticut(康涅狄格大学) University of Pennsylvania(宾夕法尼亚大学) University of California San Diego(圣地亚哥大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LD-MoLE通过可学习动态路由机制实现自适应的token依赖和层间专家分配,提升大型语言模型在下游任务中的性能。

Comments International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12779 2026-02-24 cs.LG cs.AI 73%

Scalable Multi-Objective and Meta Reinforcement Learning via Gradient Estimation

可扩展的多目标与元强化学习通过梯度估计

Zhenshuo Zhang, Minxuan Duan, Youran Ye, Hongyang R. Zhang

专题命中 指令微调 :language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PolicyGradEx算法,通过梯度估计实现多目标强化学习的高效优化,实验表明其在机器人控制和Meta-World基准测试中优于现有方法,效率提升达26倍。

Comments 25 pages. Appeared in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏