arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11619 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11619 篇

2606.12318 2026-06-11 cs.LG cs.AI 新提交 82%

Harness In-Context Operator Learning with Chain of Operators

利用算子链实现上下文算子学习

Minghui Yang, Ling Guo, Liu Yang

机构 * Department of Mathematics, Shanghai Normal University(上海师范大学数学系) Department of Mathematics, National University of Singapore(新加坡国立大学数学系)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出Chain of Operators (CHOP)框架,通过构造显式初等变换与冻结ICON的算子链,无需微调即可提升上下文算子网络在分布外算子任务上的泛化能力,在标量守恒律和平均场控制问题中降低推理误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09885 2026-06-11 cs.CL cs.AI 82%

Diffusion-Inspired Masked Fine-Tuning for Knowledge Injection in Autoregressive LLMs

受扩散启发的掩码微调用于自回归大语言模型中的知识注入

Xu Pan, Ely Hahami, Jingxuan Fan, Ziqian Xie, Haim Sompolinsky

机构 * Harvard University(哈佛大学) University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校) Hebrew University(希伯来大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种掩码微调方法,通过重构原始文本提升自回归大语言模型的知识注入能力,无需依赖改写并克服反向诅咒,实验证明其在知识密集型任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10327 2026-06-10 cs.CL cs.LG 新提交 82%

The Order Matters: Sequential Fine-Tuning of LLaMA for Coherent Automated Essay Scoring

顺序重要:LLaMA的序列微调用于连贯的自动作文评分

Ali Keramati, Mark Warschauer

机构 * University of California, Irvine(加州大学伊文斯分校)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出对LLaMA-3.1-8B进行任务感知的序列微调,按作文话语结构顺序训练,在PERSUADE 2.0语料上证据F1达65%、结论F1达87%,超越独立训练和70B基线,证明课程设计可提升自动作文评分性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09475 2026-06-10 cs.AI cs.LG 版本更新 82%

Emergent alignment and the projectability of ethical personas

涌现对齐与伦理人格的可投射性

Guillermo Del Pinal, Youngchan Lee, Calum McNamara, Alejandro Perez Carballo

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究微调大语言模型在窄任务上如何引发广泛对齐行为,通过宪法AI方法赋予模型伦理人格,发现窄对齐可投射到未训练类别,并提出对齐策略应评估可投射性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09396 2026-06-09 cs.CL cs.LG 新提交 82%

PriFT: Prior-Support Guided Supervised Fine-Tuning

PriFT: 先验支持引导的监督微调

Ke Wang, Shuangqi Li, Mathieu Salzmann, Pascal Frossard

机构 * EPFL(瑞士联邦理工学院洛桑分校)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 提出PriFT方法,利用冻结的预训练模型计算token权重,避免在线模型导致的自我强化动态,在数学推理、代码生成和医疗问答任务中取得SFT最优结果,并为后续RL提供更好初始化。

Comments The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08471 2026-06-09 cs.CL cs.AI 新提交 82%

More Yap Less Meaning: Uncovering Self-Improvement Behavior in SLMs

更多废话,更少意义:揭示小语言模型中的自我改进行为

Marina Igitkhanian, Erik Arakelyan

机构 * American University of Armenia(亚美尼亚美国大学) NVIDIA(英伟达)

专题命中 指令微调 :SLM(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过构建充分性测试,发现小语言模型在自我纠正中仅获得4.4%的准确率提升,且较长的提示反而与错误答案正相关,表明其推理能力有限。

Comments GEM Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07970 2026-06-09 cs.CL cs.AI 新提交 82%

Defending Against Malicious Finetuning by Scaling Train-time Adversarial Attacks

通过扩展训练时对抗攻击防御恶意微调

Haoming Wen, Shi Chen, Qingyu Shi, Siyuan Liu, Minrui Luo, Jingzhao Zhang, Tianxing He

机构 * Xiongan AI Institute(雄安人工智能研究院) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Shanghai Qi Zhi Institute(上海期智研究院)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对全参数微调的安全威胁,提出基于对抗训练和双层优化的Patcher方法,通过扩展对抗循环中的优化步数增强防御,并设计并行算法提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07445 2026-06-09 cs.CL cs.LG 版本更新 82%

Few Tokens, Big Leverage: Preserving Safety Alignment by Constraining Safety Tokens during Fine-tuning

少令牌,大杠杆:在微调期间通过约束安全令牌保持安全对齐

Guoli Wang, Haonan Shi, Tu Ouyang, An Wang

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出PACT框架,通过约束安全相关令牌的置信度来防止微调导致的安全对齐漂移,同时保持下游任务性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07479 2026-06-08 cs.CL cs.AI 新提交 82%

Supervision versus Demonstration-Based In-Context Learning for Multiword Expression Classification

基于监督与基于演示的上下文学习在多词表达分类中的比较

Sercan Karakaş, Yusuf Şimşek

机构 * University of Chicago(芝加哥大学) Fırat University(费拉特大学)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究土耳其语多词表达分类,对比监督基线(BERTurk)与指令微调LLM在零样本、单样本和少样本提示下的表现,发现提示敏感性和演示偏差影响显著。

Comments Accepted to ACL SRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06920 2026-06-08 cs.LG cs.AI 新提交 82%

The Fine-Tuning Trap: Evaluating Negative Transfer and the Role of PEFT in Sub-1B Mathematical Reasoning

微调陷阱:评估负迁移及PEFT在亚十亿参数数学推理中的作用

Rahul Nair, Chun Tao

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 指令微调 :SLM(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究评估了五种亚十亿参数模型在数学推理任务中的微调策略,发现全量微调对小于3亿参数的模型造成负迁移,而参数高效微调(PEFT)是稳定性要求。

Comments 8 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20654 2026-06-04 cs.LG cs.AI 82%

REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak

REFLECTOR: 内化逐步反思以对抗间接越狱

Jiachen Ma, Jiawen Zhang, Xiangtian Li, Bo Zou, Chaochao Lu, Chao Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出REFLECTOR两阶段框架,通过教师引导生成反思数据并进行监督微调,再结合强化学习内化自主反思能力,在复杂间接攻击下实现超过90%的防御成功率,同时提升通用性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02162 2026-06-02 cs.CV cs.AI cs.CL cs.IR 82%

Multimodal Approaches for Visually-Rich Document Type Classification: A Comparative Analysis

视觉丰富文档类型分类的多模态方法:一项比较分析

Catyana Heyne, Jürgen Frikel, Filippo Riccio

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 针对视觉丰富文档类型分类中多模态建模策略难以系统比较的问题,本文在统一实验框架下对基于Transformer和LLM的四种代表性模型进行受控对比,发现专用多模态Transformer优于LLM方法,且图像信息贡献最大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16129 2026-06-02 cs.MA cs.AI cs.LG cs.RO 82%

MARFT: Multi-Agent Reinforcement Fine-Tuning

MARFT: 多智能体强化微调

Junwei Liao, Muning Wen, Jun Wang, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) OPPO Research Institute(OPPO研究院)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对基于大语言模型的多智能体系统,提出多智能体强化微调(MARFT)框架,通过引入Flex-MG马尔可夫博弈公式和通用算法,解决异步交互、异构架构等挑战,提升系统鲁棒性和适应性。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24696 2026-06-02 cs.LG cs.AI 82%

T-POP: Test-Time Personalization with Online Preference Feedback

T-POP:基于在线偏好反馈的测试时个性化

Zikun Qu, Min Zhang, Mingze Kong, Xiang Li, Zhiwei Shang, Zhiyong Wang, Yikun Ban, Shuang Qiu, Yao Shu, Zhongxiang Dai

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China Normal University(华东师范大学) Shenzhen Loop Area Institute(深圳河套学院) Tianjin University(天津大学) The Chinese University of Hong Kong(香港中文大学) Beihang University(北京航空航天大学) City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对新用户冷启动问题,提出T-POP算法,通过在线成对偏好反馈和决斗式强盗机制,在不更新模型参数的情况下实时学习用户偏好并引导解码过程,实现快速数据高效的个性化。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31455 2026-06-01 cs.LG cs.CL 82%

DRIFT: Decoupled Rollouts and Importance-Weighted Fine-Tuning for Efficient Multi-Turn Optimization

DRIFT: 解耦的轨迹采样与重要性加权微调以实现高效的多轮优化

Jian Mu, Tianyi Lin, Chengwei Qin, Zhongxiang Dai, Yao Shu

机构 * The Hong Kong University of Science(香港科学与技术大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对多轮交互中在线强化学习成本高而离线监督微调存在分布偏移的问题,提出DRIFT框架,通过将KL正则化强化学习目标等价转化为重要性加权监督学习,实现高效且稳定的多轮优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30903 2026-06-01 cs.LG cs.AI 82%

Inverse Reinforcement Learning without an Optimal Demonstrator: A Feasible Reward Set Approach

无最优演示者的逆强化学习:一种可行奖励集方法

Kihyun Kim, Shripad Deshmukh, Nikos Vlassis, Jiawei Zhang

机构 * MIT LIDS(麻省理工学院媒体实验室) University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校) Adobe Research(Adobe研究院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对多个非最优演示者数据,提出可行奖励集框架,通过线性约束联合可行集单调收缩,并给出恢复保证与高维环境离线算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29502 2026-05-29 cs.CL cs.AI 82%

Source-Grounded Semantic Reinforcement Learning for Low-Resource Target-Language Generation

源语言锚定的语义强化学习用于低资源目标语言生成

Zeli Su, Ziyin Zhang, Zewei Pan, Zhou Liu, Dingcheng Huang, Dehan Li, Zhankai Xu, Longfei Zheng, Xiaolu Zhang, Jun Zhou, Wentao Zhang

机构 * Minzu University of China(中国民族大学) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Harbin Institute of Technology(哈尔滨工业大学) South China University of Technology(华南理工大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出源语言锚定的语义强化学习(SG-SRL),通过跨语言语义奖励模型利用源语言单语数据,结合轻量级恢复阶段解决奖励黑客问题,在低资源目标语言生成中提升语义锚定和事实覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28819 2026-05-28 cs.LG cs.CL 82%

PEFT-Arena: Understanding Parameter-Efficient Finetuning from a Stability-Plasticity Perspective

PEFT-Arena:从稳定性-可塑性角度理解参数高效微调

Yangyi Huang, Ruotian Peng, Zeju Qiu, Jiale Kang, Yandong Wen, Bernhard Schölkopf, Weiyang Liu

机构 * The Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学) MPI for Intelligent Systems(智能系统研究所)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出PEFT-Arena基准,通过稳定性-可塑性困境评估参数高效微调方法,发现正交微调在帕累托前沿上最优,并从权重空间和激活空间分析其几何特性。

Comments Technical report v1 (28 pages, 9 figures, project page: https://spherelab.ai/PEFT-Arena/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27971 2026-05-28 cs.CL cs.AI 82%

Semantic Flow Regularization: Teaching LLMs to Generate Diverse Yet Coherent Responses

语义流正则化:教会LLMs生成多样且连贯的回复

Kerui Peng, Feifei Li, Xingyu Fan, Wenhui Que

机构 * Tencent Inc.(腾讯公司) Beijing, China(中国北京)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型微调时输出多样性严重受限的跨风格坍缩问题,提出语义流正则化(SFR),通过条件流匹配监督骨干网络使用连续句子嵌入,在零部署成本下提升多样性和风格保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16679 2026-05-28 cs.CL cs.AI cs.CY 82%

PICACO: Pluralistic In-Context Value Alignment of LLMs via Total Correlation Optimization

PICACO: 通过总相关优化实现大语言模型的多元情境价值对齐

Han Jiang, Dongyao Zhu, Xiaoyuan Yi, Ziang Xiao, Zhihua Wei, Xing Xie

机构 * Johns Hopkins University, Baltimore, MD, USA(约翰霍普金斯大学) North Carolina State University, Raleigh, NC, USA(北卡罗来纳州立大学) Microsoft Research Asia, Beijing, China(微软亚洲研究院) Tongji University, Shanghai, China(同济大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对情境对齐中价值冲突导致的指令瓶颈问题,提出PICACO方法,通过优化元指令并最大化指定价值与模型响应的总相关,无需微调即可实现多元价值平衡对齐。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02979 2026-05-26 cs.CL cs.LG 82%

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning

CPMobius: 无数据强化学习的迭代式教练-玩家推理

Ran Li, Zeyuan Liu, Yinghao Chen, Bingxiang He, Jiarui Yuan, Zixuan Fu, Weize Chen, Jinyi Hu, Chen Qian, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出CPMobius协作式教练-玩家范式,通过无外部数据的合作优化循环提升数学推理能力,在Qwen2.5-Math-7B-Instruct上总体准确率提升4.9%,OOD准确率提升5.4%。

Comments Accepted to the ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05108 2026-05-26 cs.AI cs.LG cs.NE 82%

Algorithm Discovery With LLMs: Evolutionary Search Meets Reinforcement Learning

利用大语言模型发现算法:进化搜索遇见强化学习

Anja Surina, Amin Mansouri, Lars Quaedvlieg, Amal Seddas, Maryna Viazovska, Emmanuel Abbe, Caglar Gulcehre

机构 * EPFL(苏黎世联邦理工学院) Apple(苹果公司)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出通过强化学习微调持续优化大语言模型,结合进化搜索加速发现更优算法,在组合优化任务上验证有效性。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12677 2026-05-26 cs.CL cs.AI 82%

Fine-Tuning Causal LLMs for Text Classification: Embedding-Based vs. Instruction-Based Approaches

微调因果大语言模型用于文本分类:基于嵌入与基于指令的方法

Amirhossein Yousefiramandi, Ciaran Cooney

机构 * Clarivate Intellectual Property(Clarivate知识产权)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探索在资源受限下微调解码器-only大语言模型用于文本分类,比较了基于嵌入的分类头方法和基于指令的微调方法,并采用4位量化与LoRA实现高效训练,实验表明嵌入头方法在单标签分类中匹配或超越微调BERT基线,而指令微调仅在多标签且大参数量时有效。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19394 2026-05-20 cs.CL cs.AI 82%

EmbGen: Teaching with Reassembled Corpora

EmbGen:利用重组语料库进行教学

Arun K Lenin, Kai Rouse, Andrea Nicastro, Anna Leontjeva

机构 * Commonwealth Bank of Australia(澳大利亚联邦银行)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出EmbGen,一种通过重组语料库生成合成数据的pipeline,旨在提高在不同语义异质性数据集上指令微调模型的性能,通过实体-描述对的分解、基于嵌入相似性的重组以及基于聚类的采样生成问题-答案对,从而在固定token预算下提升二元准确率。

Comments 8 pages, 4 images (32 pages with appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09872 2026-05-20 cs.LG cs.AI 82%

WARC-Bench: Web Archive Based Benchmark for GUI Subtask Executions

WARC-Bench:基于网络存档的GUI子任务执行基准

Sanjari Srivastava, Gang Li, Cheng Chang, Rishu Garg, Manpreet Kaur, Charlene Y. Lee, Yuezhang Li, Yining Mao, Ignacio Cases, Yanan Xie, Peng Qi

机构 * Uniphore

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出WARC-Bench,一个基于网络存档的GUI子任务执行基准,通过438个任务评估多模态AI代理在子任务上的能力,实验表明SFT和RLVR方法在提升子任务执行效果上取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18832 2026-05-20 cs.LG cs.AI 82%

Precision Tracked Transformer via Kalman Filtering, Kriging and Process Noise

通过卡尔曼滤波、克里格法和过程噪声的精确跟踪变压器

Bo Long, Deepak Agarwal, Jelena Markovic-Voronov, Yi Wang, Liuqing Li

机构 * LinkedIn Core AI(LinkedIn核心AI)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于贝叶斯滤波的变压器(BFT),通过引入精度权重的克里格法、自适应卡尔曼更新和动态模型,解决了传统变压器在处理不确定性方面的不足,提升了序列推荐和大语言模型在噪声环境下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18795 2026-05-20 cs.LG cs.AI 82%

HELLoRA: Hot Experts Layer-Level Low-Rank Adaptation for Mixture-of-Experts Models

HELLoRA: Hot Experts Layer-Level Low-Rank Adaptation for Mixture-of-Experts Models

Jia Wei, Zhonghao Zhang, Ping Chen, Qianyang li, Yancheng Pan, Shaoxun Wang, Ziyi Qiu, Longxiang Wang

机构 * Department of Computer Science and Technlogy(计算机科学与技术系) Tsinghua University(清华大学) School of Computer Science and Technlogy(计算机科学与技术系) Xi’an Jiaotong University(西安交通大学) The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高科技区(滨江)区块链与数据安全研究院)

专题命中 指令微调 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出HELLoRA,一种针对混合专家模型的层级低秩适应方法,通过仅对最活跃的专家添加LoRA模块,减少可训练参数和计算量,同时提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18703 2026-05-19 cs.CL cs.LG 82%

EnvFactory: Scaling Tool-Use Agents via Executable Environments Synthesis and Robust RL

EnvFactory: 通过可执行环境合成和鲁棒强化学习扩展工具使用智能体

Minrui Xu, Zilin Wang, Mengyi DENG, Zhiwei Li, Zhicheng Yang, Xiao Zhu, Yinhong Liu, Boyu Zhu, Baiyu Huang, Chao Chen, Heyuan Deng, Fei Mi, Lifeng Shang, Xingshan Zeng, Zhijiang Guo

机构 * LARK, HKUST (GZ)(LARK,香港科技大学(广州)) University of Cambridge(剑桥大学) UCL(伦敦大学学院) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出EnvFactory框架,通过自动合成可执行环境和鲁棒强化学习,解决工具使用智能体扩展中的环境可扩展性和训练数据不足问题,显著提升训练效率和下游性能。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14366 2026-05-15 cs.CL cs.LG 82%

Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment Tax

基于语义奖励的强化学习实现低资源语言扩展而不产生对齐税

Zeli Su, Ziyin Zhang, Zhou Liu, Xuexian Song, Zhankai Xu, Longfei Zheng, Xiaolu Zhang, Rong Fu, Guixian Xu, Wentao Zhang

机构 * Minzu University of China(中国民族大学) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) University of Macau(澳门大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hainan International College, Minzu University of China(中国民族大学海南国际学院)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于语义空间对齐的GRPO方法,通过嵌入层语义奖励优化,减少对预训练知识的破坏性干扰,提升低资源语言扩展效果。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14055 2026-05-15 cs.CL cs.AI 82%

PEML: Parameter-efficient Multi-Task Learning with Optimized Continuous Prompts

PEML:参数高效多任务学习与优化连续提示

Anjir Ahmed Chowdhury, Syed Zawad, Xiaolong Ma, Xu Dong, Feng Yan

机构 * IBM Research(IBM研究院) Argonne National Laboratory(阿贡国家实验室)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PEML,通过优化连续提示和低秩适应实现多任务学习的高效微调,实验显示在多个基准测试中准确率提升显著。

Comments 26 pages, 8 figures, 18 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏