arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11619 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11619 篇

2206.02252 2022-06-07 cs.CL 83%

Exploring Cross-lingual Textual Style Transfer with Large Multilingual Language Models

Daniil Moskovskiy, Daryna Dementieva, Alexander Panchenko

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.09226 2022-04-22 cs.LG stat.ML 83%

Why Do Pretrained Language Models Help in Downstream Tasks? An Analysis of Head and Prompt Tuning

Colin Wei, Sang Michael Xie, Tengyu Ma

专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.01652 2022-02-10 cs.CL 83%

Finetuned Language Models Are Zero-Shot Learners

Jason Wei, Maarten Bosma, Vincent Y. Zhao, Kelvin Guu, Adams Wei Yu, Brian Lester, Nan Du, Andrew M. Dai, Quoc V. Le

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);分类 cs.CL

Comments Version 5. Find list of changes in Appendix F (page 35)

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.10126 2021-09-22 cs.CL 83%

ConvFiT: Conversational Fine-Tuning of Pretrained Language Models

Ivan Vulić, Pei-Hao Su, Sam Coope, Daniela Gerz, Paweł Budzianowski, Iñigo Casanueva, Nikola Mrkšić, Tsung-Hsien Wen

专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.CL

Comments EMNLP 2021 (long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.12651 2020-04-28 cs.CL 83%

Recall and Learn: Fine-tuning Deep Pretrained Language Models with Less Forgetting

Sanyuan Chen, Yutai Hou, Yiming Cui, Wanxiang Che, Ting Liu, Xiangzhan Yu

专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02414 2026-08-18 cs.CL cs.LG 版本更新 82%

Misconception Diagnosis From Student-Tutor Dialogue: Generate, Retrieve, Rerank

从学生-辅导对话中诊断误解:生成、检索、重排序

Joshua Mitton, Prarthana Bhattacharyya, Digory Smith, Thomas Christie, Ralph Abboud, Simon Woodhead

机构 * Eedi Renaissance Philanthropy Learning Engineering Virtual Institute(Eedi 理性慈善学习工程虚拟研究所)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出利用大语言模型从学生-辅导对话中检测误解的方法,通过生成、检索和重排序提升误解识别的准确性。

Comments Published as Oral Paper at Learning at Scale, 2026. Link: https://dl.acm.org/doi/10.1145/3774398.3811609. 21 pages, 8 figures, 8 tables. Joshua Mitton and Prarthana Bhattacharyya contributed equally to this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10628 2026-08-12 cs.CV cs.CL cs.LG 新提交 82%

InSight-doc: Agentic Visual Perception for Long-Document Understanding

InSight-doc:面向长文档理解的智能体视觉感知框架

Kaican Li, Weiyan Xie, Lewei Yao, Jiannan Wu, Lanqing Hong, Yongxiang Huang, Nevin L. Zhang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Huawei(华为)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 本研究提出智能体视觉感知框架InSight-doc,通过自适应选择放大高分辨率区域处理长文档,经SFT+RL训练后在文档VQA任务中显著提升准确率、降低幻觉与推理延迟,相关资源已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09742 2026-08-11 cs.LG cs.AI cs.DC 新提交 82%

Rethinking Factor Sharing in Federated LoRA: A Rank-Aware Adaptive Approach

重新思考联邦LoRA中的因子共享:一种秩感知自适应方法

Xinyi Xu, Bingnan Xiao, Shuang Qin, Gang Feng, Tony Q. S. Quek

机构 * University of Electronic Science and Technology of China(电子科技大学) Fudan University(复旦大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对联邦LoRA的因子共享问题,提出FedAS-LoRA方法,通过RSS指标在训练前选择共享侧,提升了大语言模型联邦微调的性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04433 2026-08-06 cs.CL cs.AI 新提交 82%

MERaLiON-GR: Speech Gender Recognition Model for English and SEA Languages

MERaLiON-GR:适用于英语及东南亚语言的语音性别识别模型

Qiongqiong Wang, Ai Ti Aw, Nancy F. Chen, Ying Lay Chiu, Yang Ding, Yingxu He, Ridong Jiang, Zhuohan Liu, Yanfeng Lu, Yi Ma, Muhammad Huzaifah, Nabilah Binte Md Johan, Nattadaporn Lertcheva, Pham Minh Duc, Sailor Hardik Bhupendra, Siti Umairah Binte Mohammad Salleh, Shuo Sun, Tarun Kumar Vangani, Jeremy H. M. Wong, Jinyang Wu, Longyin Zhang

机构 * Institute of Advanced Intelligence and Computing (IAIC), A*STAR(先进智能与计算研究院(IAIC),新加坡科技研究局)

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出MERaLiON-GR语音性别识别模型,通过微调MERaLiON-SpeechEncoder-2并结合LoRA及多尺度ECAPA-TDNN网络,在多语言东南亚数据集上性能优于Vox-Profile和Audio-LLM,凸显专用语音模型的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00513 2026-08-06 cs.LG cs.AI cs.CV cs.IR 版本更新 82%

MOON3.0: Reasoning-aware Multimodal Representation Learning for E-commerce Product Understanding

MOON3.0: 基于推理的多模态表示学习用于电商产品理解

Junxian Wu, Chenghan Fu, Zhanheng Nie, Daoze Zhang, Bowen Wan, Wanxian Guan, Chuan Yu, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MOON3.0通过多头模态融合、联合对比与强化学习框架及细粒度残差增强模块,提升电商产品细粒度属性建模能力,并在大规模多模态电商基准MBe3.0上实现零样本最优性能。

Comments Accepted by the 34th ACM International Conference on Multimedia (ACM MM), 2026. 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20697 2026-08-05 cs.LG cs.CL 版本更新 82%

Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning

Token Buncher: 保护大语言模型免受有害强化学习微调的威胁

Weitao Feng, Lixu Wang, Peizhuo Lv, Tianyi Wei, Jie Zhang, Chongyang Gao, Sinong Zhan, Wei Dong

机构 * Nanyang Technological University(南洋理工大学) Centre for Frontier AI Research, A*STAR(前沿人工智能研究中心,A*STAR) Northwestern University(西北大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出TokenBuncher,通过限制模型响应熵来防御基于强化学习的有害微调,实验显示其能有效抑制有害行为同时保持正常任务性能。

Comments Accepted by ACM CCS 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09842 2026-08-04 cs.LG cs.CL 版本更新 82%

From Direction to Magnitude: How Multimodal Instruction-Tuning Reorganizes the Geometric Encoding of Identity-Specifying Prompts in Transformer Hidden States

从方向到大小:多模态指令微调如何在Transformer隐藏状态中重新组织身份指定提示的几何编码

Jorge A. Castillo, Marco Torres Yévenes, Juan Carlos Lanas

机构 * Axis Dynamics SpA(轴动力公司)

专题命中 指令微调 :language model(abstract);post-training(abstract);SFT(abstract);RLHF(abstract)

AI总结 研究四种训练后模式的Transformer语言模型,通过五个几何指标比较三种提示条件,发现多模态指令微调会使身份编码从方向重组为大小,此重组特定于该模式,还定位了W_1作为方法贡献。

Comments 16 pages, 8 tables. Working draft v0.3. Uses Ollivier-Ricci curvature and edge-wise Wasserstein-1 as primary geometric statistic; four models (Gemma-4-E4B, Gemma-4-E4B-it, DeepSeek-R1-Distill-Qwen-7B, Qwen2.5-7B-Instruct)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00015 2026-08-03 eess.SP cs.AI cs.CV cs.LG 版本更新 82%

TimeRFT: Stimulating Generalizable Time Series Forecasting for TSFMs via Reinforcement Finetuning

TimeRFT:通过强化微调提升TSFMs的时间序列预测通用性

Siyang Li, Yize Chen, Zijie Zhu, Yuxin Pan, Yan Guo, Ming Huang, Hui Xiong

机构 * University of Alberta(阿尔伯塔大学) Alibaba Cloud(阿里云) City University of Hong Kong(香港城市大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 TimeRFT通过强化微调方法解决时间序列基础模型在特定任务适应中的泛化问题,提升预测精度和抗分布偏移能力。

Comments 15 pages, 8 figures, In Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27536 2026-07-31 cs.GT cs.AI cs.LG cs.MA 新提交 82%

Strategy, Not Payoffs: A Behavioural Embedding of Normal-Form Games

策略,而非收益:标准型博弈的行为嵌入

Joshua Caiata, Sreepriya Pulyassary, Xiang Li, Kate Larson

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出轻量双特征行为嵌入,可预测大型语言模型在不同标准型博弈间微调后的策略能力变化,证明策略能力迁移由决策行为结构而非收益几何决定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22724 2026-07-28 cs.LG cs.AI 新提交 82%

Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks

用于长期代理任务的进度条件分组策略优化

Kaibing Yang, Guangfeng Cai, Shengtian Yang, Shuo He, Yu Li, Mengyi Liu, Pengwei Chen, Jun Xu, Lei Feng

机构 * Southeast University(东南大学) Kuaishou Technology(快手科技) Meituan(美团)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究长期代理任务中基于分组策略优化的采样不平衡问题,提出进度条件分组策略优化(ProGPO),通过特定条件下利用首次访问观察覆盖率,为访问更多新状态的轨迹或步骤赋予优势,实验证明该方法优于基线,尤其在困难任务上效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21861 2026-07-27 cs.CL cs.AI 新提交 82%

Data Quality over Capacity: Internalizing Documents into LoRA Adapters for Closed-Book QA

容量之上的数据质量:将文档内化到LoRA适配器中用于闭卷问答

Joan Figuerola Hurtado

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 研究将文档内化到LoRA适配器用于闭卷问答,发现适配器容量足够时,训练数据质量主导闭卷准确率,一次整理大幅提升准确率,确认容量趋势及秩与学习率耦合,内化适配器在低延迟下表现优于检索基线,还报告了调试LLM训练的过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06487 2026-07-23 cs.LG cs.AI 版本更新 82%

ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking

ArenaRL: 通过基于比赛的相对排名扩展强化学习以应对开放性智能体

Qiang Zhang, Boli Chen, Fanrui Zhang, Ruixue Ding, Shihang Wang, Qiuchen Wang, Yinfeng Huang, Haonan Zhang, Rongxiang Zhu, Pengyong Wang, Ailin Ren, Xin Li, Pengjun Xie, Jiawei Liu, Ning Guo, Jingren Zhou, Zheng-Jun Zha

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 ArenaRL通过基于比赛的相对排名机制,提升开放性智能体在复杂任务中的表现,实现效率与精度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18293 2026-07-22 cs.LG cs.CL 新提交 82%

One Student, Many Teachers: Multi-Task On-Policy Distillation via Soft-Prompt Privileged Context

一个学生,多个教师:通过软提示特权上下文进行多任务在线策略蒸馏

Yingzi Ma, Zichen Zhu, Ming Jiang, Chaowei Xiao

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究提出一种多任务在线策略蒸馏方法,教师与学生仅通过可学习软提示区分,在骨干冻结时训练特定任务教师。单任务变体训练参数少且效果好,多任务变体保持通用能力基准同时实现最佳总体平均水平。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11893 2026-07-15 cs.CL cs.AI 新提交 82%

I'm Sorry, but I Can't Help with Braille: Revealing Accessibility Failures in State-of-the-Art LLMs

对不起,我无法处理盲文:揭示当前最先进语言模型中的无障碍性缺陷

Abdullah Abdullah

机构 * orinu Inc.(奥里努公司)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究评估先进语言模型在韩语-盲文翻译上的表现,发现其存在缺陷。通过人工标注数据集测试,发现输出差且不稳定。对比发现,对小模型进行监督微调效果更好,揭示了当前语言模型的局限,证明特定监督的有效性。

Comments Accepted at the LTEDI Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23597 2026-07-08 cs.CL cs.LG 82%

Structure-Guided Entity Resolution: Fine-Tuning LLMs for Robust Name Matching in Complex Linguistic Contexts

结构引导的实体解析:微调大语言模型以实现复杂语言上下文中的鲁棒姓名匹配

Shivam Chourasia, Hitesh Kapoor, Nilesh Patil

机构 * Dream Sports

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出结构引导实体解析(SGER)框架,通过两阶段课程微调大语言模型,先学习姓名语法结构再优化匹配任务,在印度身份数据上达到99.02%准确率和0.994 F1分数,已部署于Dream11平台服务2.5亿+用户。

Comments Accepted to ACL 2026. 8 pages, 1 figure, 2 tables

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 6: Industry Track), pages 1461-1468, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03833 2026-07-07 cs.CL cs.AI 新提交 82%

Beyond Static Rules: Automated Discovery of Latent Vulnerabilities in Text-to-SQL

超越静态规则:文本到SQL中潜在漏洞的自动发现

Hanqing Wang, Yongdong Chi, Jian Yang, Lei Yang, Jiehui Zhao, Yun Chen, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海财经大学) Beihang University(北京航空航天大学) Deepexi Technology Co. Ltd.(深圳市智元机器有限公司) Southern University of Science and Technology(南方科技大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究LLMs在文本到SQL任务中潜在可靠性问题,提出SAGE框架,通过生成漏洞假设、参考漏洞法典设计扰动来发现潜在故障模式,实验证明其能发现大量故障案例及法典的跨模型转移性。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01927 2026-07-03 cs.CL cs.AI 新提交 82%

TUDUM: A Turkish-Thinking Reasoning Pipeline for Qwen3.5-27B

TUDUM:面向Qwen3.5-27B的土耳其语思维推理流水线

Baran Bingol, Bahaeddin Turkoglu

机构 * Department of Artificial Intelligence and Data Engineering(人工智能与数据工程系) Faculty of Engineering(工程学院) Ankara University(安卡拉大学)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出TUDUM流水线,通过SFT和GRPO强化学习将Qwen3.5-27B适配为土耳其语思维模型,使推理过程本身使用土耳其语,而非仅输出本地化答案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31813 2026-07-01 cs.LG cs.AI 新提交 82%

Geometry-Preserving Orthonormal Initialization for Low-Rank Adaptation in RLVR

保持几何的正交初始化用于RLVR中的低秩适应

Ruijia Zhang, Jiacheng Zhu, Hanqing Zhu, Laixi Shi

机构 * Johns Hopkins University(约翰霍普金斯大学) Meta Superintelligence Labs(Meta超级智能实验室) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对RLVR中LoRA初始化问题,提出保持几何的正交初始化方法(RLPO和RLMO),理论证明其最小化与全微调差距,实验表明稳定训练且优于标准LoRA。

Comments 30 pages, accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28843 2026-06-30 cs.CL cs.AI 82%

The Heterogeneous Safety Impacts of Benign Multilingual Fine-Tuning

良性多语言微调的安全影响异质性

Will Hawkins, Kaivalya Rawal, Jonathan Rystrøm, Stratis Tsirtsis, Zihao Fu, Greta Warren, Ryan Brown, Eoin Delaney, Sandra Wachter, Brent Mittelstadt, Chris Russell

专题命中 指令微调 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过多语言良性数据微调LLM,发现安全结果对微调语言和评估语言高度敏感,对抗性合规率在某些设置下增加四倍,且多语言安全漂移与通用能力指标脱钩,呈现异质性。

Comments 9 pages

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05852 2026-06-30 cs.CL cs.AI 82%

Can Fine-Tuning Erase Your Edits? On the Fragile Coexistence of Knowledge Editing and Adaptation

微调是否会抹去你的修改?关于知识编辑与适应脆弱共存的研究

Yinjie Cheng, Paul Youssef, Christin Seifert, Jörg Schlötterer, Zhixue Zhao

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究探讨了微调对知识编辑的影响,发现微调会显著降低编辑效果,且仅微调编辑层可有效去除编辑,同时保持下游性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28182 2026-06-29 cs.LG cs.AI cs.CV cs.RO 新提交 82%

LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior

LLawCo: 学习合作法则以建模具身多智能体行为

Qinhong Zhou, Chuang Gan, Anoop Cherian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出LLawCo框架,通过反思失败提取行为模式并推导高层合作法则,结合监督微调融入推理,提升具身多智能体在分散部分可观测环境中的合作效率与任务成功率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20911 2026-06-23 cs.CL cs.AI 新提交 82%

Latent Personal Memory: Represent personal memory as dynamic soft prompts

潜在个人记忆:将个人记忆表示为动态软提示

Debrup Das, Avinash Amballa, Yashas Malur Saidutta, Vijay Srinivasan, Vivek Kulkarni, Srinivas Chappidi

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Samsung Research America(三星美国研究院)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出潜在个人记忆(LPM)框架,通过可解释的潜在槽矩阵和交叉注意力网络生成动态软提示,在冻结大语言模型上高效编码用户历史,在PersonaMem v1和LoCoMO基准上优于LoRA和提示调优,并大幅降低KV缓存使用。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18307 2026-06-18 cs.LG cs.AI 新提交 82%

DRIFT: Refining Instruction Data via On-Policy Data Attribution

DRIFT: 通过在线策略数据归因优化指令数据

Zefan Wang, Lincheng Li, Tianyu Yu, Yuan Yao

机构 * Tsinghua University(清华大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出DRIFT方法,利用在线策略影响函数解决标准影响函数在指令微调数据归因中的近邻偏差和梯度范数偏差问题,通过模型自身生成作为验证目标,提升7B模型性能上限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15080 2026-06-16 cs.CL cs.AI 新提交 82%

AdaMame: A Training Recipe for Adaptive Multilingual Reasoning

AdaMame: 一种自适应多语言推理的训练方案

Dayeon Ki, Kevin Duh, Marine Carpuat

机构 * University of Maryland(马里兰大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 针对多语言推理中的语言崩溃问题,提出两阶段训练方案AdaMame,通过SFT建立多语言能力,再以自适应GRPO优化推理语言对齐,在准确率、语言保真度和令牌效率上达到帕累托最优。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03120 2026-06-15 cs.LG cs.AI 版本更新 82%

Quantized Evolution Strategies: High-precision Fine-tuning of Quantized LLMs at Low-precision Cost

量化进化策略:以低精度代价实现量化大语言模型的高精度微调

Yinggan Xu, Kajetan Schweighofer, Risto Miikkulainen, Xin Qiu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Cognizant AI Lab(Cognizant AI实验室) UT Austin(得克萨斯大学奥斯汀分校)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出量化进化策略(QES),通过集成累积误差反馈和无状态种子重放,直接在量化空间进行全参数微调,无需反向传播,显著优于现有零阶微调方法。

Comments Added more tasks and baselines

详情

展开后加载摘要…

URL PDF HTML 收藏