arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11619 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11619 篇

2603.22017 2026-06-10 cs.LG 版本更新 90%

Domain Adapted Large Language Models for Additive Manufacturing

面向增材制造的领域自适应大语言模型

Peter Pak, Amir Barati Farimani

机构 * Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);pretraining(abstract)

AI总结 本文通过约5000万token的小型数据集对开源大语言模型进行领域自适应预训练和指令微调,构建多模态领域自适应模型,在增材制造基准测试中达到90%以上准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05781 2026-06-09 cs.LG 版本更新 90%

Domain-Adapted Small Language Models with Hybrid Post-Processing: Achieving Cost-Efficient, Low-Latency Multi-Label Structured Prediction via LoRA Fine-Tuning on Scarce Data

领域自适应的小语言模型与混合后处理:通过LoRA微调在稀缺数据上实现成本高效、低延迟的多标签结构化预测

Srinivasan Manoharan, Dilipkumar Nallusamy, Sachin Kumar, Haifeng Wu

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);LLM(abstract_cn);large language model(abstract)

AI总结 提出一种结合LoRA微调的小语言模型(LLaMA 3.1 8B)和确定性规则后处理的混合框架,在仅219个样本上训练,实现多标签合规评估,达到100% JSON结构有效性和83.0%人工验证准确率,成本降低46-76%。

Comments 4 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07026 2026-06-08 cs.CV cs.AI cs.MM 版本更新 90%

Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models

模态间隙驱动的子空间对齐训练范式用于多模态大语言模型

Xiaomin Yu, Yi Xin, Yuhui Zhang, Wenjie Zhang, Chonghan Liu, Hanzhen Zhao, Chen Liu, Xiaoxing Hu, Ziyue Qiao, Hao Tang, Xiaobin Hu, Chengwei Qin, Hui Xiong, Yu Qiao, Shuicheng Yan

机构 * HKUST(GZ)(香港科技大学(广州)) NUS(新加坡国立大学) sh AILab SII Stanford(斯坦福大学) UCLA(加州大学洛杉矶分校) Yale(耶鲁大学) SJTU(上海交通大学) GBU(国防大学) PKU(北京大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);pretraining(abstract)

AI总结 针对多模态对比学习中的模态间隙问题,提出固定帧模态间隙理论,并基于该理论设计无训练的对齐策略ReAlign和可扩展训练范式ReVision,利用无配对数据实现视觉与语言表示的高效对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16282 2026-06-03 cs.CL 90%

Instant Personalized Large Language Model Adaptation via Hypernetwork

通过超网络实现即时个性化大型语言模型自适应

Zhaoxuan Tan, Zixuan Zhang, Haoyang Wen, Zheng Li, Rongzhi Zhang, Pei Chen, Fengran Mo, Zheyuan Liu, Qingkai Zeng, Qingyu Yin, Meng Jiang

机构 * University of Notre Dame(诺丁汉大学) Amazon.com Inc(亚马逊公司) Université de Montréal(蒙特利尔大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出Profile-to-PEFT框架,使用超网络将用户编码直接映射到适配器参数,实现无需用户训练的即时个性化,在降低计算成本的同时优于现有方法。

Comments accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24675 2026-05-26 cs.CV cs.AI 90%

VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation

VaaWIT: 面向多语言网页图像翻译的大语言模型视觉感知适配

Bo Li, Ronghao Chen, Ningyuan Deng, Huacan Wang, Shaolin Zhu, Lijie Wen

机构 * The Hong Kong University of Science(香港科技大学) Tianjin University(天津大学) Tsinghua University(清华大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对网页图像翻译中视觉表示差距问题,提出VaaWIT框架,通过双流注意力模块和视觉感知适配器,实现大语言模型对细粒度视觉特征的动态融合,在多个基准上超越开源模型并接近闭源模型性能。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06858 2026-05-25 physics.soc-ph cs.AI nlin.AO 90%

Disentangling Interaction and Bias Effects in Opinion Dynamics of Large Language Models

大型语言模型中意见动态的交互与偏差效应的分离

Vincent C. Brockers, David A. Ehrlich, Viola Priesemann

机构 * Max-Planck-Institute for Dynamics and Self-Organization(马克斯·普朗克动态与自组织研究所) Institute for the Dynamics of Complex Systems(复杂系统动力学研究所) University of Göttingen(哥廷根大学) Campus Institute for Dynamics of Biological Networks(校园生物网络动力学研究所)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出贝叶斯框架分离主题偏差、同意偏差和锚定偏差,分析LLM在多步对话中的意见轨迹,发现意见快速收敛至共享吸引子,且微调可改变吸引子位置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03526 2026-05-21 cs.CL eess.AS 90%

Enhancing Speech Large Language Models through Reinforced Behavior Alignment

通过强化行为对齐增强语音大语言模型

Yansong Liu, Jiateng Li, Yuan Liu

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出了一种名为强化行为对齐(RBA)的框架,通过自合成方法生成高质量对齐数据来提升语音大语言模型(SpeechLMs)的语言生成能力,实验表明该方法显著提升了SpeechLMs的指令遵循能力,并可扩展至语音问答和语音转文本翻译等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04161 2026-05-19 cs.CL 90%

Traces of Social Competence in Large Language Models

大语言模型中社会能力的踪迹

Tom Kouwenhoven, Michiel van der Meer, Max van Duijn

机构 * Leiden Institute of Advanced Computer Science(莱顿先进计算机科学研究所) Leiden University(莱顿大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);post-training(abstract)

AI总结 本文研究了大语言模型在虚假信念测试中的表现,通过贝叶斯逻辑回归分析模型大小和训练方法对社会认知能力的影响,发现模型规模扩大有助于性能提升,但并非绝对,同时指出解释命题态度会改变响应模式,进一步的推理导向微调会加剧这种影响。

Comments Presented at the 2026 Conference on Computational Natural Language Learning (CoNLL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14636 2026-05-15 cs.AI 90%

Teaching Large Language Models When Not to Know: Learning Temporal Critique for Ex-Ante Reasoning

教大语言模型何时不知:学习事前推理的临时批评

Chenlu Ding, Jiancan Wu, Yanchen Luo, Zheyuan Liu, Yancheng Yuan, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) University of Notre Dame(圣母大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract);prompting(abstract)

AI总结 本文研究大语言模型在时间截止下的推理失败,提出TCFT框架通过训练模型识别时间泄漏并判断响应的可接受性,实验表明其在减少时间泄漏方面优于提示和监督微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25340 2026-05-14 cs.CL 90%

Large Language Model as Token Compressor and Decompressor

大语言模型作为令牌压缩机和解压机

Wenbing Li, Yiran Wang, Zikai Song, Jielei Zhang, Tianhao Zhao, Junkai Lin, Wei Yang

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL

AI总结 本文研究能否将现成的LLM适配为离散可变长度令牌压缩机和解压机以处理长上下文。设计了自表达自动编码框架,通过轻量LoRA适配器微调预训练LLM,将长文本映射为紧凑的学得潜在代码序列Z-令牌,并解码回自然语言或任务输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00195 2026-05-12 cs.LG 90%

Diversity in Large Language Models under Supervised Fine-Tuning

大型语言模型在监督微调下的多样性

Roman Klypa, Oleksandr Cherednichenko

机构 * Univ. Grenoble Alpes, CNRS, Grenoble INP, LJK, 38000 Grenoble, France(格勒诺布尔阿尔卑斯大学,国家科学研究中心,格勒诺布尔INP,LJK,法国格勒诺布尔) Department of Mathematics and Mathematical Statistics, Integrated Science Lab, Umeå University, Sweden(乌梅大学数学与统计学系,整合科学实验室,瑞典)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.LG

AI总结 本文研究监督微调对大型语言模型生成多样性的影响,提出TOFU损失函数以解决低频模式忽略和知识遗忘问题,验证微调后生成多样性下降,并展示TOFU提升输出多样性同时保持高质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08766 2026-05-12 cs.IR cs.CL 90%

UserGPT Technical Report

UserGPT 技术报告

Yunyi Xuan, Hao Yi, Fengling Mao, Daye Cai, Leikun Liang, Xingsheng He, Jiangnan Xie, Guoshuai Wang, Yushan Han, Wenwen Guo, Xiaoxiao Xu, Lin Qu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出UserGPT框架,通过属性生成和摘要生成提升LLM的人格理解能力,结合行为模拟引擎和数据导向语义化模块,实现对长行为历史的高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14018 2026-05-11 cs.SE cs.AI 90%

PerfCoder: Large Language Models for Interpretable Code Performance Optimization

PerfCoder:用于可解释代码性能优化的大型语言模型

Jiuding Yang, Shengyao Lu, Hongxuan Liu, Shayan Shirahmad Gale Bagi, Zahra Fazel, Tomasz Czajkowski, Di Niu

机构 * University of Alberta(阿尔伯塔大学) University of Victoria(维多利亚大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 PerfCoder通过可解释的定制化优化生成高性能代码,优于现有模型,在代码性能基准上实现更高效的优化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27929 2026-05-01 cs.CL 90%

DPN-LE: Dual Personality Neuron Localization and Editing for Large Language Models

DPN-LE: 大语言模型双人格神经元定位与编辑

Lifan Zheng, Xue Yang, Jiawei Chen, Chenyan Wu, Jingyuan Zhang, Fanheng Kong, Xinyi Zeng, Xiang Chen, Yu Tian

机构 * Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) Zhejiang University of Technology(浙江工业大学) Kuaishou Technology(快手科技) Northeastern University(东北大学) Tsinghua University(清华大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出DPN-LE方法,通过对比高特质与低特质样本的MLP激活,定位并编辑双人格神经元,实现精准的人格控制与能力保留。

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16006 2026-04-24 cs.CL 90%

Exploring Continual Fine-Tuning for Enhancing Language Ability in Large Language Model

探索连续微调以增强大语言模型的语言能力

Divyanshu Aggarwal, Sankarshan Damle, Navin Goyal, Satya Lokam, Sunayana Sitaram

机构 * Microsoft(微软) Microsoft Research India(微软印度研究院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究了连续微调对大语言模型语言适应性的影响,发现相同比例数据集可保持任务能力,而数据不相似时会导致性能下降,通过层冻结和生成重放方法提升语言能力。

Comments 19 pages, 6 tables, 4 figures, Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19087 2026-04-22 cs.AI 90%

OLLM: Options-based Large Language Models

OLLM:基于选项的大型语言模型

Shashank Sharma, Janina Hoffmann, Vinay Namboodiri

机构 * Department of Computer Science(计算机科学系) University of Bath(巴斯大学) Department of Psychology(心理学系)

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 OLLM通过引入学习选项提升语言模型的生成可控性与鲁棒性,利用低维选项空间实现更高效的奖励优化,减少常见对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07177 2026-04-15 cs.CL 90%

Towards EnergyGPT: A Large Language Model Specialized for the Energy Sector

迈向EnergyGPT:一种专门用于能源领域的大型语言模型

Amal Chebbi, Babajide Kolade

机构 * Meta

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出EnergyGPT,通过微调LLaMA 3.1-8B模型提升能源领域语言理解与生成能力,两种适应策略在性能与成本间取得平衡。

Comments Code and artifacts available at: https://github.com/fitila/energygpt-release

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04215 2026-04-07 cs.CL 90%

DARE: Diffusion Large Language Models Alignment and Reinforcement Executor

DARE:扩散大语言模型对齐与强化执行器

Jingyi Yang, Yuxian Jiang, Xuhao Hu, Shuang Cheng, Biqing Qi, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);post-training(abstract);preference optimization(abstract)

AI总结 DARE框架整合了监督微调、参数高效微调、偏好优化和强化学习,为扩散大语言模型提供统一的执行栈,支持多种模型家族,实现算法覆盖、可重复评估和实际加速。

Comments 14 pages,3 figures,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24767 2026-03-27 cs.CL 90%

Fine-Tuning A Large Language Model for Systematic Review Screening

为系统综述筛查微调大型语言模型

Kweku Yamoah, Noah Schroeder, Emmanuel Dorley, Neha Rani, Caleb Schutz

机构 * University of Florida(佛罗里达大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文通过微调大型语言模型提升系统综述中文献筛选效率,实验显示微调模型在F1分数和与人类评分者的一致性上显著优于基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08068 2026-03-10 cs.AI 90%

In-Context Reinforcement Learning for Tool Use in Large Language Models

上下文强化学习用于大型语言模型中的工具使用

Yaoqi Ye, Yiran Zhao, Keyu Duan, Zeyu Zheng, Kenji Kawaguchi, Cihang Xie, Michael Qizhe Shieh

机构 * National University of Singapore(新加坡国立大学) Salesforce AI Research(Salesforce AI研究) University of California Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract);prompting(abstract)

AI总结 本文提出ICRL框架,通过强化学习无需微调即可实现大型语言模型的工具使用能力,实验显示其在推理和工具任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11863 2026-02-13 cs.LG 90%

In-Context Function Learning in Large Language Models

大型语言模型中的上下文函数学习

Elif Akata, Konstantinos Voudouris, Vincent Fortuin, Eric Schulz

机构 * Helmholtz Munich(海德堡-慕尼黑亥姆霍兹研究中心) University of Tübingen(图宾根大学) University of Technology Nuremberg(纽伦堡技术大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 本研究通过高斯过程视角分析大型语言模型的上下文学习机制,发现其学习曲线受函数生成核影响,并通过训练后处理可调整归纳偏置以提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02075 2026-02-09 cs.CE cs.LG 90%

MDAgent2: Large Language Model for Code Generation and Knowledge Q&A in Molecular Dynamics

MDAgent2:用于分子动力学中代码生成和知识问答的大型语言模型

Zhuofan Shi, Hubao A, Yufei Shao, Dongliang Huang, Hongxu An, Chunxiao Xin, Haiyang Shen, Zhenyu Wang, Yunshan Na, Gang Huang, Xiang Jing

机构 * Peking University(北京大学) National Key Laboratory of Data Space Technology and System(国家数据空间技术与系统重点实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Liaoning Technical University(辽宁技术大学) Wenjing Future Lab (Beijing) Technology Co., Ltd(文景未来实验室(北京)科技有限公司)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);post-training(abstract);SFT(abstract)

AI总结 MDAgent2是首个能同时进行分子动力学知识问答和代码生成的端到端框架,通过领域特定数据集和强化学习方法提升性能。

Comments 24 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23161 2026-02-02 cs.SD cs.CL 90%

DIFFA-2: A Practical Diffusion Large Language Model for General Audio Understanding

DIFFA-2:一种实用的扩散大型语言模型用于通用音频理解

Jiaming Zhou, Xuxin Cheng, Shiwan Zhao, Yuhang Jia, Cao Liu, Ke Zeng, Xunliang Cai, Yong Qin

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Meituan LongCat Interaction Team(美团LongCat交互团队)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);preference optimization(abstract)

AI总结 DIFFA-2是一种基于扩散模型的实用大型音频语言模型,通过升级语音编码器和双适配器提升音频理解性能,且在实际训练预算下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18754 2026-01-06 cs.CV cs.AI 90%

COLT: Enhancing Video Large Language Models with Continual Tool Usage

COLT: 通过持续工具使用增强视频大语言模型

Yuyang Liu, Meng Cao, Xinyuan Shi, Xiaondan Liang

机构 * University of Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed大学人工智能学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

AI总结 COLT通过持续工具使用增强视频大语言模型,解决工具数据持续变化的问题,提升视频理解性能。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00254 2026-01-05 cs.SE cs.AI 90%

An Empirical Evaluation of LLM-Based Approaches for Code Vulnerability Detection: RAG, SFT, and Dual-Agent Systems

基于大型语言模型的代码漏洞检测方法实证评估:RAG、SFT和双智能体系统

Md Hasan Saju, Maher Muhtadi, Akramul Azim

机构 * Department of Electrical, Computer, and Software Engineering(电气、计算机与软件工程系) Ontario Tech University(安大略技术大学)

专题命中 指令微调 :LLM(title,abstract);SFT(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过实证评估,比较了RAG、SFT和双智能体系统在代码漏洞检测中的有效性,发现RAG在准确率和F1分数上表现最佳,SFT和双智能体系统也展示了良好的性能,证明了领域专业知识对LLM在实际漏洞检测中的重要性。

Journal ref https://conf.researchr.org/home/cascon-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12182 2025-11-12 cs.CL 90%

Instruction Tuning and CoT Prompting for Contextual Medical QA with LLMs

Chenqian Le, Ziheng Gong, Chihang Wang, Haowei Ni, Panfeng Li, Xupeng Chen

机构 * New York University(纽约大学) Columbia University(哥伦比亚大学) University of Michigan(密歇根大学)

专题命中 指令微调 :instruction tuning(title,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted by 2025 International Conference on Artificial Intelligence, Human-Computer Interaction and Natural Language Processing

Journal ref Proceedings of the 2025 International Conference on Artificial Intelligence, Human-Computer Interaction and Natural Language Processing (ICAHN), 2025, pp. 43-46

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07074 2025-11-11 cs.CL 90%

Importance-Aware Data Selection for Efficient LLM Instruction Tuning

Tingyu Jiang, Shen Li, Yiyao Song, Lan Zhang, Hualei Zhu, Yuan Zhao, Xiaohang Xu, Kenjiro Taura, Hao Henry Wang

专题命中 指令微调 :LLM(title,abstract);instruction tuning(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted by AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04710 2025-11-10 cs.CL 90%

GEMMA-SQL: A Novel Text-to-SQL Model Based on Large Language Models

Hari Mohan Pandey, Anshul Gupta, Subham Sarkar, Minakshi Tomer, Schneider Johannes, Yan Gong

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00130 2025-11-05 cs.LG 90%

A Comparative Analysis of LLM Adaptation: SFT, LoRA, and ICL in Data-Scarce Scenarios

Bernd Bohnet, Rumen Dangovski, Kevin Swersky, Sherry Moore, Arslan Chaudhry, Kathleen Kenealy, Noah Fiedel

机构 * Google(谷歌)

专题命中 指令微调 :LLM(title,abstract);SFT(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10974 2025-10-14 cs.CL 90%

Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning

Zhiwen Ruan, Yixia Li, He Zhu, Yun Chen, Peng Li, Yang Liu, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Peking University(北京大学) Shanghai University of Finance and Economics(上海金融学院) Tsinghua University(清华大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏