arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11653 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11653 篇

2608.11342 2026-08-13 cs.LG cs.CL 新提交 88%

Weightless Fine-Tuning: Personalizing LLMs via Logit-Space Transport

无权重微调:通过对数几率空间迁移实现大语言模型的个性化

Bohan Zhang, Anqi Ni, Yixin Wang, Paramveer S. Dhillon

机构 * University of Michigan(密歇根大学) University of Chicago(芝加哥大学)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.LG

AI总结 针对个性化场景下LLM微调成本过高的问题,提出无需权重更新的WFT方法,在LaMP基准上性能优于多数基线,仅用不到7%计算量接近SFT效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08164 2026-08-11 cs.CL cs.AI 新提交 88%

STEMMA: An Adversarial Multi-Agent Framework for Evaluating Self-Identity Consistency in LLMs

STEMMA:用于评估大语言模型(LLM)自我身份一致性的对抗性多智能体框架

Nuthakki Siva Gopala Krishna, Kanishka Jain

专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM自我身份一致性评估问题,提出对抗性多智能体框架STEMMA,结合手动设计的对抗性提示开展实验,发现多数LLM存在自我表征不一致的问题。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17239 2026-08-11 cs.CL cs.AI 88%

SafeMERGE: Preserving Safety Alignment in Fine-Tuned Large Language Models via Selective Layer-Wise Model Merging

SafeMERGE: 通过选择性层间模型融合在微调大语言模型中保持安全对齐

Aladin Djuhera, Swanand Ravindra Kadhe, Farhan Ahmed, Syed Zawad, Holger Boche

机构 * Technical University Munich(慕尼黑技术大学) IBM Research(IBM研究院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SafeMERGE,一种轻量级后微调框架,通过选择性融合层间模型来恢复安全对齐,同时保持下游性能,减少有害输出并提升实用性。

Journal ref Findings of the ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00910 2026-08-03 cs.IT cs.AI cs.LG math.IT 版本更新 88%

Curvature-Weighted Capacity Allocation: A Minimum Description Length Framework for Layer-Adaptive Large Language Model Optimization

曲率加权容量分配:一种基于最小描述长度原理的层适应性大语言模型优化框架

Theophilus Amaefuna, Hitesh Vaidya, Anshuman Chhabra, Ankur Mali

机构 * Bellini College of Artificial Intelligence, Cybersecurity and Computing(人工智能与网络安全与计算学院) University of South Florida(佛罗里达州立大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于最小描述长度原理的曲率加权容量分配框架,用于层适应性大语言模型优化,通过曲率调整的层增益计算,实现高效容量分配和剪枝,具有理论保证和计算效率。

Comments Accepted to UAI 2026. To be published in PMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04844 2026-07-30 cs.CL cs.AI 88%

Mitigating Catastrophic Forgetting in Target Language Adaptation of LLMs via Source-Shielded Updates

通过源保护更新缓解LLM目标语言适应中的灾难性遗忘

Atsuki Yamaguchi, Terufumi Morishita, Aline Villavicencio, Nikolaos Aletras

机构 * University of Sheffield(谢菲尔德大学) Hitachi, Ltd.(日立株式会社) University of Exeter(埃克塞特大学) Federal University of Rio Grande do Norte(里奥格兰德杜纳粹大学)

专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出源保护更新策略,利用少量源数据和参数重要性评分,在低资源条件下有效缓解LLM在目标语言适应中的灾难性遗忘问题,实验表明其在保持源语言能力的同时提升了目标语言性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02580 2026-07-28 cs.CL cs.AI 版本更新 88%

Reconstructing Item Characteristic Curves using Fine-Tuned Large Language Models

利用微调的大语言模型重建项目特征曲线

Christopher Ormerod

机构 * Cambium Assessment(坎布里乌姆评估)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用微调大语言模型生成合成项目特征曲线,以估计IRT参数,方法在评估项目数据集上表现优异,尤其在区分度建模方面效果显著。

Comments 19 pages, 5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19604 2026-07-23 cs.CL cs.LG 新提交 88%

Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models

基于超网络的大语言模型知识注入的缩放定律

Nischay Dhankhar, Dos Baha, Abulhair Saparov

机构 * Nace AI(Nace人工智能公司) Purdue University(普渡大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型训练时知识注入问题,核心方法是用超网络生成LoRA适配器,主要贡献是发现超网络注入能力随规模变化规律,能可靠进行分布外泛化,为训练时适应提供新基础及缩放定律。

Comments Preprint, 22 pages, 14 figures. Dataset collection available at https://huggingface.co/collections/nace-ai/hypernetwork-datasets

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18691 2026-07-22 cs.AI cs.CL 新提交 88%

Semantic Primes as Explanans for Emotion in Large Language Models

语义原素作为大语言模型中情感的解释因素

Frank Xing

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型中情感的解释问题,通过在四个指令微调的LLMs上实验,发现自然语义元语言的语义原素是可恢复的内部元素,能更有效控制情感,且与相应情感可互换,是比其他选项更好的情感解释因素。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16991 2026-07-21 cs.LG cs.AI 版本更新 88%

Sparsity-Aware Low-Rank Representation for Efficient Fine-Tuning of Large Language Models

稀疏感知低秩表示用于大型语言模型高效微调

Longteng Zhang, Sen Wu, Shuai Hou, Zhengyu Qing, Zhuo Zheng, Danning Ke, Qihong Lin, Qiang Wang, Shaohuai Shi, Xiaowen Chu

专题命中 指令微调 :language model(title,abstract);large language model(title);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 SALR 通过结合低秩适应与稀疏剪枝,实现大型语言模型的高效微调,达到 50% 稀疏度并提升推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12341 2026-07-01 cs.CL cs.AI 版本更新 88%

Learning by Surprise: Adaptive Mitigation of Model Collapse in Large Language Models

通过惊喜学习:大型语言模型中模型崩溃的自适应缓解

Daniele Gambetta, Gizem Gezici, Fosca Giannotti, Dino Pedreschi, Alistair Knott, Luca Pappalardo

机构 * University of Pisa(比萨大学) ISTI-CNR(意大利国家研究委员会信息科学与技术研究所) Scuola Normale Superiore(比萨高等师范学校) Victoria University of Wellington(惠灵顿维多利亚大学)

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对AI自噬导致的模型崩溃问题,提出基于困惑度的过滤策略,优先使用高惊喜文档进行微调,无需区分人写或AI生成内容,有效缓解崩溃并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29614 2026-06-30 cs.CL cs.AI 88%

Do We Still Need Fine Tuning? Turkish Sentiment Analysis in the Era of Large Language Model

我们还需要微调吗?大语言模型时代的土耳其语情感分析

Sercan Karakaş, Yusuf Şimşek

机构 * University of Chicago(芝加哥大学) Fırat University(费拉特大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型时代土耳其语情感分析是否需要监督微调,通过对比经典机器学习、微调预训练语言模型和提示大语言模型,发现微调BERTurk在三分类任务中表现最佳,而大语言模型在中性类别上表现不佳。

Comments Accepted to the 34th IEEE Signal Processing and Communications Applications Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04556 2026-06-30 cs.CL cs.LG 88%

BA-LoRA: Bias-Alleviating Low-Rank Adaptation to Mitigate Catastrophic Inheritance in Large Language Models

BA-LoRA: 降低偏差的低秩适应以减轻大语言模型中的灾难性继承

Yupeng Chang, Yi Chang, Yuan Wu

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出BA-LoRA,通过引入一致性、多样性及SVD项正则化,缓解低秩适应中的灾难性继承问题,提升模型鲁棒性和公平性。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26982 2026-06-26 cs.CL cs.AI 新提交 88%

Auditing Framing-Sensitive Behavioral Instability in Large Language Models for Mental Health Interactions

审计心理健康交互中大语言模型的框架敏感行为不稳定性

Abla Bedoui, Ashley L. Greene, Mohammed Cherkaoui

机构 * a School of computer science, digital engineering and AI, Long Island University, Brooklyn, NY, USA(a 计算科学与数字工程及人工智能学院,罗格斯大学,布鲁克林,纽约,美国) b Department of Psychology, Long Island University, Brooklyn, NY, USA(b 心理学系,罗格斯大学,布鲁克林,纽约,美国)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过控制匹配提示,调查大语言模型在不同上下文框架下的行为变异性,发现框架系统性改变解释响应倾向,且内部表征可解码,激活操控可部分调节行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26350 2026-06-26 cs.AI cs.LG 新提交 88%

OpenFinGym: A Verifiable Multi-Task Gym Environment for Evaluating Quant Agents

OpenFinGym: 一个可验证的多任务Gym环境,用于评估量化智能体

Kaicheng Zhang, Wen Ge, Lei Jiang, Weixin Yang, Jordan Langham-Lopez, Jialin Yu, Lukasz Szpruch, Hao Ni

机构 * University of Edinburgh(爱丁堡大学) University College London(伦敦大学学院) Alan Turing Institute(艾伦·图灵研究所) University of Oxford(牛津大学)

专题命中 指令微调 :LLM(summary_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出OpenFinGym统一环境,覆盖预测、市场生成、实时交易和欺诈检测等量化金融任务,支持自动化任务构建、容器化验证和延迟解析,以全面评估LLM智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19528 2026-06-19 cs.LG cs.AI 新提交 88%

Techniques for Peak Memory Reduction for LoRA Fine-tuning of LLMs on Edge Devices

边缘设备上LLM LoRA微调峰值内存降低技术

Hassan Dbouk, Matthias Reisser, Prathamesh Mandke, Likhita Arun Navali, Christos Louizos

专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对边缘设备上LLM LoRA微调的内存瓶颈,提出四种互补技术(量化、检查点、softmax近似、logits掩码),在Llama-3.2 3B和Qwen-2.5 3B上实现高达26倍和28倍的峰值内存降低。

Comments Hassan Dbouk and Matthias Reisser contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02995 2026-06-15 cs.CR cs.AI cs.IR cs.LG 版本更新 88%

Patcher: Post-Hoc Patching of Backdoored Large Language Models

Patcher: 后门大型语言模型的事后修补

Anjun Gao, Yueyang Quan, Yufei Xia, Zhuqing Liu, Minghong Fang

机构 * University of Louisville(路易斯维尔大学) University of North Texas(北得克萨斯大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Patcher框架,仅利用单个失败案例和模型参数,通过基于梯度的显著性定位后门触发器,并采用约束微调消除触发-响应关联,同时保持模型效用。

Comments To appear in the USENIX Security Symposium, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15723 2026-06-09 cs.LG cs.CL 版本更新 88%

Federated Large Language Models: Current Progress and Future Directions

联邦大语言模型:当前进展与未来方向

Yuhang Yao, Jianyi Zhang, Junda Wu, Chengkai Huang, Yu Xia, Tong Yu, Ruiyi Zhang, Sungchul Kim, Ryan Rossi, Ang Li, Lina Yao, Julian McAuley, Yiran Chen, Carlee Joe-Wong

机构 * Carnegie Mellon University(卡内基梅隆大学) Duke University(杜克大学) University of California San Diego(加州大学圣地亚哥分校) The University of New South Wales(新南威尔士大学) Adobe Research(Adobe研究) University of Maryland College Park(马里兰大学学院公园分校) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织Data61)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文综述联邦学习与大语言模型结合(FedLLM)的最新进展,重点分析联邦微调和联邦提示学习如何应对效率、个性化和安全挑战,并展望联邦预训练和联邦智能体等方向。

Comments Accepted by PAKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02857 2026-06-03 cs.LG cs.AI 88%

GRZO: Group-Relative Zeroth-Order Optimization for Large Language Model Fine-Tuning

GRZO:用于大语言模型微调的组相对零阶优化

Liyan Tan, Yequan Zhao, Yifan Yang, Ruijie Zhang, Xinling Yu, Zheng Zhang

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出GRZO优化器,通过组相对归一化聚合每个样本的损失,在不增加前向成本的情况下将有效梯度方向数从1提升至批量大小,降低方差并改善收敛,在多个模型和任务上优于MeZO。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30675 2026-06-01 cs.CL cs.AI 88%

Human-Alignment, Calibration, and Activation Patterns in Large Language Model Uncertainty

大型语言模型不确定性中的人类对齐、校准与激活模式

Kyle Moore, Jesse Roberts, Daryl Watson, William Ward, Grayson Heyboer

机构 * Vanderbilt University(范德比大学) Tennessee Technological University(田纳西技术大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大型语言模型的不确定性与人类不确定性的相似性,通过分析行为与内部激活模式,发现模型在多项选择和开放式事实回忆数据集上同时存在对齐与校准,并描述了指令微调的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11171 2026-05-29 cs.CL cs.AI 88%

A Language-Guided Bayesian Optimization for Efficient LoRA Hyperparameter Search

语言引导的贝叶斯优化用于高效LoRA超参数搜索

Baek Seong-Eun, Lee Jung-Mok, Kim Sung-Bin, Tae-Hyun Oh

机构 * Grad. School of AI, POSTECH, Pohang, Korea(POSTECH人工智能研究生院,韩国坡安) School of EE, KAIST, Daejeon, Korea(韩国科学技术院电子工程学院,韩国大田) School of Computing, KAIST, Daejeon, Korea(韩国科学技术院计算学院,韩国大田)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出一种利用预训练LLM领域知识的贝叶斯优化框架,通过语言提示将超参数映射到连续空间,结合子集训练代理评估,仅需约30次迭代即可发现比标准超参数提升20%以上性能的LoRA超参数。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29009 2026-05-29 cs.LG cs.AI 88%

Label-Free Reinforcement Learning via Cross-Model Entropy

无标签强化学习:跨模型熵方法

Matt Gorbett, Hossein Shirazi

机构 * Independent Researcher(独立研究者) San Diego State University(圣地亚哥州立大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出跨模型熵(CME)作为无标签奖励信号,用于强化学习后训练大语言模型,在开放指令遵循任务上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26111 2026-05-26 cs.CV cs.AI cs.GR cs.LG cs.MM 88%

Squeezing Capacity from Multimodal Large Language Models for Subject-driven Generation

从多模态大语言模型中榨取能力用于主题驱动生成

Shuhong Zheng, Aashish Kumar Misraa, Yu-Teng Li, Yu-Jhe Li, Igor Gilitschenski

机构 * University of Toronto & Vector Institute(多伦多大学及向量研究所) Adobe(Adobe公司) Google(谷歌公司)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种结合多模态大语言模型和VAE身份条件的方法,通过双层级聚合模块和多阶段去噪策略,在主题驱动图像生成中实现多模态理解与身份保持的平衡,优于现有方法。

Comments 33 pages, 18 figures, Project Page: https://zsh2000.github.io/squeeze-mllm-subject-gen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12474 2026-05-26 cs.CL cs.AI 88%

Integrating Structural and Semantic Signals in Text-Attributed Graphs with BiGTex

在文本属性图中整合结构信号与语义信号:BiGTex

Azadeh Beiranvand, Seyed Mehdi Vahidipour

机构 * Faculty of Electrical and Computer Engineering, University of Kashan(卡尚大学电气与计算机工程学院)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出BiGTex架构,通过堆叠图-文本融合单元实现GNN与LLM的双向注意力,以参数高效微调(LoRA)在节点分类和链接预测任务上达到最优性能。

Comments 26 pages, 4 figures

Journal ref Machine Learning with Applications 24 (2026) 100921

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09199 2026-05-26 cs.LG cs.AI cs.DC 88%

FLoRIST: Singular Value Thresholding for Efficient and Accurate Federated Fine-Tuning of Large Language Models

FLoRIST: 用于高效准确的大语言模型联邦微调的奇异值阈值化方法

Hariharan Ramesh, Jyotikrishna Dass

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构,匿名城市,匿名地区,匿名国家)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出FLoRIST框架,通过奇异值阈值化在紧凑中间空间中对局部适配器进行分解,实现数学上准确的聚合,同时保持通信和计算高效。

Comments 21 pages, 12 figures

Journal ref Ninth Conference on Machine Learning and Systems (MLSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24957 2026-05-21 cs.LG cs.AI 88%

Compute Aligned Training: Optimizing for Test Time Inference

计算对齐训练:优化测试时间推断

Adam Ousherovitch, Ambuj Tewari

机构 * Department of Statistics(统计学系) University of Michigan(密歇根大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出计算对齐训练方法,通过将训练目标与测试时间策略对齐,提升大语言模型在测试时的推断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16632 2026-05-19 cs.LG cs.AI cs.LO 88%

Learning How to Cube

学习如何求立方

Ferhat Erata, Sam Kouteili, Thanos Typaldos, Timos Antonopoulos, Robert B. Jones, Byron Cook, Ruzica Piskac

机构 * Yale University(耶鲁大学) AWS Agentic AI(AWS智能体AI)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);post-training(abstract);preference optimization(abstract)

AI总结 本文提出一种神经符号后训练框架,通过MCTS数据整理管道和符号启发式方法,使4B参数模型在SAT竞赛基准上取得53的pass@5分数,超越了Claude-Sonnet-4等前沿LLM。

Comments 33 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12242 2026-05-13 cs.CL cs.AI 88%

Mind the Pause: Disfluency-Aware Objective Tuning for Multilingual Speech Correction with LLMs

注意暂停:基于LLMs的多语言语音纠错中的不流畅意识目标调优

Deepak Kumar, Baban Gain, Asif Ekbal

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Indian Institute of Technology Patna(印度理工学院帕纳瓦)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出一种多语言语音纠错方法,通过序列标注器标记不流畅词并指导LLM指令微调,结合对比学习目标提升纠错可靠性,实验证明在印地语、孟加拉语和马拉地语上优于现有基线模型。

Comments Accepted to ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18113 2026-05-12 cs.LG cs.AI 88%

VC-Soup: Value-Consistency Guided Multi-Value Alignment for Large Language Models

VC-Soup:基于价值一致性指导的多价值对齐方法用于大语言模型

Hefei Xu, Le Wu, Yu Wang, Min Hou, Han Wu, Zhen Zhang, Meng Wang

机构 * Key Laboratory of Knowledge Engineering with Big Data(知识工程与大数据重点实验室) Hefei University of Technology(合肥工业大学) Innovation School of Artificial Intelligence(人工智能创新学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出VC-Soup方法,通过数据过滤和参数融合框架解决多价值对齐中的冲突问题,提升模型在多价值下的表现。

Comments 12 pages; Accepted to WWW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14258 2026-05-05 cs.AI cs.LG 88%

GFT: From Imitation to Reward Fine-Tuning with Unbiased Group Advantages and Dynamic Coefficient Rectification

GFT:从模仿到奖励微调:无偏组优势与动态系数校正

Wangjie Gan, Miao Pan, Linbo Xi, Wenqi Zhang, Jintao Chen, Jianwei Yin, Xuhong Zhang

机构 * OmniAl Group of ZJU ACES Lab(OMNIAL集团浙江大学ACES实验室) School of Software Technolog,Zhejiang University(浙江大学软件技术学院)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出GFT框架,通过组优势学习和动态系数校正解决SFT的奖励稀疏性问题,提升模型泛化能力与知识注入效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00761 2026-04-30 cs.SE cs.AI cs.CL 88%

Identifying the Achilles' Heel: An Iterative Method for Dynamically Uncovering Factual Errors in Large Language Models

找出阿基里斯之踵:一种用于动态揭示大语言模型事实错误的迭代方法

Wenxuan Wang, Yuk-Kit Chan, Zixuan Ling, Juluan Shi, Youliang Yuan, Jen-tse Huang, Yifei Zhang, Wenxiang Jiao, Zhaopeng Tu, Michael R. Lyu

机构 * Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学) Xiaohongshu Inc.(小红书公司) Tencent Inc.(腾讯公司)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出HalluHunter框架,通过知识图谱和规则基NLP技术,系统揭示大语言模型的事实错误,测试表明可触发55%的问题错误。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏