arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11601 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11601 篇

2510.07239 2026-05-19 cs.CL 91%

Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts

Red-Bandit:通过带引导的LoRA专家实现LLM红队测试的测试时适应

Christos Ziakas, Nicholas Loo, Nishita Jain, Alessandra Russo

机构 * Imperial College London(伦敦帝国学院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Red-Bandit框架,通过带引导的LoRA专家在不同攻击风格下实现LLM的测试时适应,通过强化学习生成不安全提示,并利用多臂老虎机策略动态选择攻击风格专家,从而在AdvBench上取得最佳结果,同时生成更易读的提示。

Comments Accepted to the Main Conference at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15393 2026-05-18 cs.LG 91%

LPDS: Evaluating LLM Robustness Through Logic-Preserving Difficulty Scaling

LPDS:通过逻辑保持难度扩展评估LLM鲁棒性

Philipp Mondorf, Samuel J. Bell, Jesse Dodge, Dieuwke Hupkes

机构 * FAIR at Meta(Meta 的 FAIR 部门) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出LPDS框架,通过系统搜索逻辑保持变化来评估LLM鲁棒性,发现难度增加导致性能下降,且微调困难变体能获得更一致的鲁棒性提升。

Comments 41 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11907 2026-05-15 cs.LG 91%

Procedural-skill SFT across capacity tiers: A W-Shaped pre-SFT Trajectory and Regime-Asymmetric Mechanism on 0.8B-4B Qwen3.5 Models

跨容量层级的程序技能SFT:一种W形的预SFT轨迹和 regime-不对称机制在0.8B-4B Qwen3.5模型上

Igor Strozzi

机构 * Applied Mathematics Department(应用数学系)

专题命中 指令微调 :SFT(title,title_cn);LLM(abstract);分类 cs.LG

AI总结 本文研究了不同规模Qwen3.5模型在程序技能SFT上的贡献,发现预SFT轨迹呈W形,且SFT效果在不同模型容量上呈现不对称性,通过实验验证了这一机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13411 2026-05-14 cs.CR cs.CL 91%

Model-Agnostic Lifelong LLM Safety via Externalized Attack-Defense Co-Evolution

基于外部化攻击-防御共演的模型无关持续LLM安全

Xiaozhe Zhang, Chaozhuo Li, Hui Liu, Shaocheng Yan, Bingyu Yan, Qiwei Ye, Haoliang Li

机构 * City University of Hong Kong(香港城市大学) Beijing University of Posts and Telecommunications(北京邮电大学) Wuhan University(武汉大学) Beihang University(北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出EvoSafety框架,通过外部结构实现持续安全改进,采用对抗技能库和轻量防御模型,在单一训练中实现攻击探测与防御提升,实验显示其在Guard模式下防御成功率高达99.61%。

Comments 48 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03412 2026-04-30 cs.CL 91%

Verified Critical Step Optimization for LLM Agents

用于大语言模型代理的验证关键步骤优化

Mukai Li, Qingcheng Zeng, Tianqing Fang, Zhenwen Liang, Linfeng Song, Qi Liu, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) The University of Hong Kong(香港大学) Northwestern University(西北大学)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出CSO方法,通过验证关键步骤进行强化学习,以提升代理在复杂任务中的表现,实验显示其在GAIA-Text-103和XBench-DeepSearch上优于SFT基线。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20835 2026-04-23 cs.CL 91%

Parallel-SFT: Improving Zero-Shot Cross-Programming-Language Transfer for Code RL

并行SFT:改进代码RL的零样本跨编程语言转移

Zhaofeng Wu, Shiqi Wang, Boya Peng, Anuj Goyal, Melanie Kambadur, Sebastian Ruder, Yoon Kim, Chloe Bi

机构 * Meta Superintelligence Labs(Meta超智能实验室) MIT(麻省理工学院)

专题命中 指令微调 :SFT(title,title_cn);language model(abstract);分类 cs.CL

AI总结 本文提出零样本跨编程语言转移任务,通过并行SFT策略提升代码RL在不同语言间的迁移能力,发现通用化SFT初始化能提升模型泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17210 2026-04-21 cs.LG 91%

Guardrails in Logit Space: Safety Token Regularization for LLM Alignment

对数空间中的Guardrails:用于LLM对齐的安全令牌正则化

Thong Bach, Truyen Tran

机构 * Applied Artificial Intelligence Initiative (A2I2)(应用人工智能倡议(A2I2)) Deakin University(德克萨斯大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出安全令牌正则化(STR)方法,通过约束关键令牌的logits来保持细调模型的安全性,实验显示其在安全性和任务性能方面表现优异。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12469 2026-04-15 cs.LG 91%

Analyzing the Effect of Noise in LLM Fine-tuning

分析在LLM微调中的噪声影响

Lingfang Li, Procheta Sen

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究不同噪声类型对LLM微调内部学习动态的影响,分析噪声在不同任务和模型中的表现,发现标签噪声导致最大性能下降,而语法和拼写噪声可能带来轻微正则化收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14347 2025-09-23 cs.CL 91%

QA-prompting: Improving Summarization with Large Language Models using Question-Answering

Neelabh Sinha

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 指令微调 :language model(title,abstract);prompting(title,abstract);large language model(title);分类 cs.CL

Comments Accepted at The Fifth Workshop on New Frontiers in Summarization (NewSumm) in The 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18466 2025-08-27 cs.CL 91%

Integrating gender inclusivity into large language models via instruction tuning

Alina Wróblewska, Bartosz Żuk

机构 * Institute of Computer Science Polish Academy of Sciences(计算机科学研究所波兰科学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16478 2025-08-25 cs.CL cs.IR 91%

LLM-as-classifier: Semi-Supervised, Iterative Framework for Hierarchical Text Classification using Large Language Models

Doohee You, Andy Parisi, Zach Vander Velden, Lara Dantas Inojosa

机构 * Google(谷歌)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL

Comments 20 pages excluding reference list, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11532 2025-01-07 cs.CL 91%

Chain-of-Instructions: Compositional Instruction Tuning on Large Language Models

Shirley Anugrah Hayati, Taehee Jung, Tristan Bodding-Long, Sudipta Kar, Abhinav Sethy, Joo-Kyung Kim, Dongyeop Kang

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title);分类 cs.CL

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20329 2024-02-29 cs.CL cs.SE 91%

InstructCoder: Instruction Tuning Large Language Models for Code Editing

Kaixin Li, Qisheng Hu, Xu Zhao, Hui Chen, Yuxi Xie, Tiedong Liu, Qizhe Xie, Junxian He

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23220 2025-12-01 cs.CV 91%

Instruction Tuning of Large Language Models for Tabular Data Generation-in One Day

针对表格数据生成的大型语言模型指令微调——一天内完成

Milad Abdollahzadeh, Abdul Raheem, Zilong Zhao, Uzair Javaid, Kevin Yee, Nalam Venkata Abhishek, Tram Truong-Huu, Biplab Sikdar

机构 * SIT(新加坡科技学院) NUS(新加坡国立大学)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(title);language model(title);LLM(abstract)

AI总结 本文提出了一种在有限资源下通过指令微调提升LLM表格数据生成能力的方法,利用高质量数据集和少量指令实现与GPT-4o相当的生成性能。

Comments Accepted International Conference on Machine Learning (ICML 2025), 1st Workshop on Foundation Models for Structured Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12658 2026-08-11 cs.CL cs.AI 版本更新 91%

Beyond Static Models: An Evolving Framework for Continual Learning in Large Language Models across Training Stages

在大型语言模型中进行持续学习:方法、挑战与机遇

Hongyang Chen, Zhongwu Sun, Hongfei Ye, Kunchi Li, Xuemin Lin

机构 * Research Center for Scientific Data Hub, Zhejiang Lab(科学数据枢纽研究中心,浙江实验室)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文综述了针对大型语言模型的持续学习方法,分析了持续预训练、微调和对齐的核心阶段,探讨了传统方法在持续学习中的适应性与改进,并指出在跨任务和时间尺度的知识整合中仍存在挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25073 2026-08-06 cs.CR cs.AI cs.LG 91%

Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions

大型语言模型微调生命周期中的安全:威胁、防御、评估与未来方向

Wenjuan Li, Yitao Liu, Runze Chen, Rajkumar Buyya

机构 * Hangzhou Normal University(杭州师范大学) Zhejiang University(浙江大学) China Mobile (Zhejiang) Innovation Research Institute Co., Ltd.(中国移动(浙江)创新研究院有限公司) Quantum Cloud Computing and Distributed Systems (qCLOUDS) Lab, School of Computing and Information Systems(量子云计算与分布式系统(qCLOUDS)实验室,计算与信息学院) The University of Melbourne(墨尔本大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文系统综述了大型语言模型微调过程中的安全威胁与防御,提出了基于生命周期的三阶段框架,并通过统一实验评估了攻击与防御的有效性及跨阶段局限性。

Comments 39 pages, 7 figures, 22 tables

Journal ref Software: Practice and Experience, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07260 2026-07-30 cs.AI cs.HC cs.LG 版本更新 91%

HealthSLM-Bench: Benchmarking Small Language Models for Mobile and Wearable Healthcare Monitoring

HealthSLM-Bench:面向移动与可穿戴医疗监护的小型语言模型基准测试

Xin Wang, Ting Dang, Xinyu Zhang, Vassilis Kostakos, Michael J. Witbrock, Hong Jia

机构 * School of Computing and Information Systems, University of Melbourne, Australia(墨尔本大学计算机与信息系统学院) School of Computer Science, University of Auckland, New Zealand(奥克兰大学计算机科学学院)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本研究构建HealthSLM-Bench基准,评估小型语言模型(SLMs)在医疗预测任务的表现,发现SLMs性能接近大型语言模型且效率、隐私性更优,为隐私保护型医疗监护提供新方向。

Comments 9 pages, 6 tables, 6 figures. Accepted at NeurIPS 2025 Workshop on GenAI4Health

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20456 2026-07-24 cs.CL cs.AI 新提交 91%

Learn2Zinc: Fine-tuning Small Language Models for Text-to-Model Translation in MiniZinc

Learn2Zinc:微调小型语言模型以实现MiniZinc中的文本到模型翻译

Serdar Kadioglu, Karthik Uppuluri

机构 * AI Center of Excellence, Fidelity Investments(富达投资卓越人工智能中心) Department of Computer Science, Brown University(布朗大学计算机科学系)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 研究针对小型语言模型在MiniZinc文本到模型翻译的难题,提出跨模型错误引导方法,收集语法错误构建训练数据集微调模型,提升执行准确率至98%,虽语法可学但约束推理仍具挑战,且开源相关资源供后续研究。

Comments CP 2026 Workshop on LLMs meet Constraint Solving

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06358 2026-07-07 cs.CL cs.AI 版本更新 91%

SHINE: A Scalable In-Context Hypernetwork for Mapping Context to LoRA in a Single Pass

SHINE:一种可扩展的上下文超网络,用于在单次传递中将上下文映射到LoRA

Yewei Liu, Xiyuan Wang, Yansheng Mao, Yoav Gelbery, Haggai Maron, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Technion, NVIDIA(技术学院与NVIDIA) University of Oxford(牛津大学) School of Electronics Engineering(电子工程学院) Computer Science, Peking University(计算机科学,北京大学)

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SHINE,一种可扩展的上下文超网络,用于在单次传递中将多样且有意义的上下文映射到高质量的LoRA适配器,通过重用冻结LLM的自身参数和引入架构创新,克服了先前超网络的关键限制,以较少的参数实现了强大的表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28992 2026-06-30 cs.CL cs.AI 91%

Fine-Tuning General-Purpose Large Language Models for Agricultural Applications:A Reproducible Framework and Evaluation Protocol Based on Qwen3-8B

面向农业应用的通用大语言模型微调:基于Qwen3-8B的可复现框架与评估协议

Zhaoyang Li, Ruijie Zhang, Jiaqi Liu, Zhaoji Sun

机构 * Sanya University(三亚大学) Hebei International Studies University(河北国际 Studies 大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出AgriTune-R框架,通过数据治理、指令构建、LoRA/QLoRA微调、检索增强生成和专家评估,将通用大语言模型适配到农业任务,并设计了包含事实性、安全性、证据一致性和不确定性表达的评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03217 2026-06-29 cs.CL cs.AI cs.CY cs.IR 版本更新 91%

Hybrid Fact-Checking that Integrates Knowledge Graphs, Large Language Models, and Search-Based Retrieval Agents Improves Interpretable Claim Verification

混合事实核查:集成知识图谱、大语言模型和基于搜索的检索代理提高可解释的声明验证

Shaghayegh Kolli, Richard Rosenbaum, Timo Cavelius, Lasse Strothe, Andrii Lata, Jana Diesner

机构 * Technical University Munich(慕尼黑工业大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出一种混合事实核查方法,集成知识图谱、大语言模型和实时搜索代理,通过三步流水线(KG检索、LM分类、Web搜索)在FEVER基准上达到0.93 F1分数,无需微调,并有效处理信息不足情况。

Comments Paper has been accepted at 9th wiNLP workshop at EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26027 2026-06-25 cs.CL cs.LG 新提交 91%

Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It

为什么多步工具使用强化学习会崩溃以及监督信号如何修复它

Yupu Hao, Zhuoran Jin, Huanxuan Liao, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究发现RL训练LLM工具使用时会出现控制token概率尖峰导致性能崩溃,而交错SFT与RL可提升稳定性,但OOD评估下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20641 2026-06-23 cs.RO cs.AI cs.LG 新提交 91%

MAGNIFIED: RL Fine-tuning of Multimodal Large Language Models for Motion Planning

MAGNIFIED: 多模态大语言模型的强化学习微调用于运动规划

Letian Chen, Yiren Lu, Justin Fu, Yichen Xie, Runsheng Xu, Jyh-Jing Hwang, Ben Sapp, Drago Anguelov

机构 * Waymo LLC(Waymo有限责任公司)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出MAGNIFIED方法,通过强化学习微调多模态大语言模型,利用令牌级奖励优化规划目标,在Waymo数据集上显著降低重叠率和偏离道路率。

Journal ref ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18699 2026-06-16 cs.LG cs.CL 版本更新 91%

Mechanistic Analysis of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning

大型语言模型在持续微调过程中灾难性遗忘的机制分析

Gustav Olaf Yunus Laitinen-Fredriksson Lundstrom-Imanov

机构 * Division of Statistics and Machine Learning (STIMA), Department of Computer and Information Science (IDA), Linköping University(统计与机器学习系(STIMA)、计算机与信息科学系(IDA)、利厄普堡大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.CL、cs.LG

AI总结 本文系统比较了20个顶级LLM在持续微调中的灾难性遗忘,通过行为分析和机制解释定位易受参数覆盖的神经回路,并提出低秩电路投影(LRCP)方法,在开放权重模型中恢复高达94.2%的祖先能力。

Comments 12 pages, 8 figures, 5 tables. Preprint submitted to Elsevier

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11206 2026-06-11 cs.CL cs.LG 新提交 91%

Compatibility-Aware Dynamic Fine-Tuning for Large Language Models

兼容性感知的动态微调用于大型语言模型

Yucheng Zhou, Junwei Sheng, Qianning Wang, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学科技学院电脑与信息科学系及智慧城市物联网国家重点实验室) Auckland University of Technology(奥克兰理工大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出兼容性感知动态微调(CADFT),通过模型似然度动态调整监督更新,抑制不兼容样本的高方差梯度,提升训练稳定性和泛化能力。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08676 2026-06-09 cs.SE cs.AI cs.CL 新提交 91%

Lost in the Flow with Code Talkers: Unveiling the Instruction-Tuning Tax of Large Language Models in Code Tasks

迷失在代码对话者的流程中:揭示代码任务中大语言模型的指令微调税

Shi Ying Chang, Chiok Yew Ho, Yichen Li, Yintong Huo

机构 * Singapore Management University(新加坡国立管理学院) The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);instruction tuning(abstract)

AI总结 本研究首次实证发现指令微调在代码任务中导致权衡:增强指令遵循能力却削弱代码填充性能,称之为“指令微调税”,并通过定性和定量分析总结出七项发现和四项启示。

Comments 25 pages, 6 figures. Evaluation toolkit and dataset: https://github.com/arkosioscambions/CodeTalkers

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09783 2026-06-09 cs.LG cs.AI stat.ML 版本更新 91%

Large Language Models for Imbalanced Classification: Diversity makes the difference

大语言模型用于不平衡分类:多样性至关重要

Dang Nguyen, Sunil Gupta, Kien Do, Thin Nguyen, Taylor Braund, Alexis Whitton, Svetha Venkatesh

机构 * Applied Artificial Intelligence Initiative (A 2 I 2 )(应用人工智能倡议(A2I2)) Deakin University(德肯大学) Black Dog Institute(黑狗研究所) University of New South Wales(新南威尔士大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出基于大语言模型的过采样方法,通过条件采样、排列微调和插值样本增强多样性,在10个表格数据集上优于8个基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16165 2026-06-01 cs.LG cs.AI 91%

HiPER: Hierarchical Reinforcement Learning with Explicit Credit Assignment for Large Language Model Agents

HiPER: 具有显式信用分配的分层强化学习用于大型语言模型智能体

Jiangweizhi Peng, Yuanxin Liu, Ruida Zhou, Charles Fleming, Zhaoran Wang, Alfredo Garcia, Mingyi Hong

机构 * University of Minnesota Northwestern University Amazon AGI Texas A\&M University Cisco Research

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 针对稀疏奖励长程任务中LLM智能体信用分配困难的问题,提出HiPER分层规划-执行框架,通过分层优势估计(HAE)在规划和执行层面显式分配信用,在ALFWorld和WebShop上达到97.4%和83.3%的成功率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21909 2026-05-29 cs.AI cs.CL 91%

From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning

从元思维到执行:面向通用且可靠的大语言模型推理的认知对齐后训练

Shaojie Wang, Liang Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 指令微调 :LLM(title,abstract);post-training(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出一种认知启发的两阶段后训练框架,通过元思维链监督学习通用策略和置信度校准强化学习优化执行可靠性,在分布内和分布外分别提升2.10%和3.86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28084 2026-05-28 cs.CL cs.AI 91%

SMILE-Next: Teaching Large Language Models to Detect, Classify, and Reason about Laughter

SMILE-Next: 教授大型语言模型检测、分类和推理笑声

Lee Jung-Mok, Kim Sung-Bin, Joohyun Chang, Lee Hyun, Tae-Hyun Oh

机构 * School of EE, KAIST(韩国科学技术院电子工程系) Dept. of EE, POSTECH(POSTECH电子工程系) School of Computing, KAIST(韩国科学技术院计算机科学系)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出SMILE-Next数据集和包含笑声特定Self-Instruct与混合笑声专家框架的方法,用于实现多模态笑声理解,显著优于基线模型。

Journal ref Annual Meetings of the Association for Computational Linguistics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏