arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-27 至 2026-08-27 共收录 41 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 41 篇

2607.26326 2026-08-27 cs.CV 版本更新 92%

Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models

视觉还是认知?多模态大语言模型的视觉上下文敏感性

Jiaang Li, Chengzu Li, Zhaochong An, Yifei Yuan, Xi Liu, Serge Belongie, Vésteinn Snæbjarnarson

机构 * University of Copenhagen(哥本哈根大学) University of Cambridge(剑桥大学) ETH Zürich(苏黎世联邦理工学院) Clemson University(克莱姆森大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn)

AI总结 该研究探究多模态大语言模型在视觉证据与先验冲突任务上的失效原因,引入WhatIfVis基准,发现其能编码视觉证据但难以控制对其的依赖,监督微调等方法可提升可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25068 2026-08-27 cs.CV 新提交 91%

SHIFT-LLM: Distribution Shift Correction in Depth-Pruned LLMs

SHIFT-LLM:深度剪枝大语言模型中的分布偏移校正

Ali Bahri, Hang Li, Hongliang Li, Zhitang Chen

机构 * Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 SHIFT-LLM是一种无需训练的剪枝后校正框架,通过插入线性残差适配器缓解深度剪枝大语言模型的分布偏移,可在低样本无梯度下恢复准确率,在Llama-3.1-8B-Instruct上增益达15.7个点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24988 2026-08-27 cs.CL cs.AI cs.LG 新提交 91%

Does Fine-Tuning Undo Activation Steering? Behavioural Recovery Without Weight-Edit Reversal

微调会撤销激活引导吗?无需权重编辑反转的行为恢复

Philipp E. Glass, Allan Tucker, Yongmin Li, Alina Miron

机构 * Brunel University of London(布鲁内尔伦敦大学)

专题命中 指令微调 :SFT(summary_cn,abstract);RLHF(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究语言模型嵌入的激活引导在SFT、RLHF微调后的稳定性,发现其机制耐久但功能脆弱,需下游训练后重新验证行为。

Comments Accepted at EMNLP 2026 Main. Earlier version at ICLR 2026 Re^4-Align Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16244 2026-08-27 cs.CR cs.AI 版本更新 90%

Activating Latent Security Knowledge through LLM-Guided Risk Analysis for Secure Code Generation

SPARK: 基于安全知识引导与表示激活的LLM安全代码生成

Xiaoyun Xu, Lichao Wu, Jona te Lintelo, Siyu Zhang, Keke Gai, Stjepan Picek

机构 * Radboud University(拉德堡德大学) University of Bristol(布里斯托大学) University of Zagreb(扎格雷布大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出SPARK方法,通过检索CWE条目并添加结构化提示激活模型内隐安全知识,结合预计算令牌偏置,无需重训练即可提升代码安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11612 2026-08-27 cs.CL cs.AI 版本更新 90%

When Emotion Becomes Trigger: Emotion-style dynamic Backdoor Attack Parasitising Large Language Models

当情绪成为触发:利用情绪风格动态后门攻击寄生大语言模型

Ziyu Liu, Tao Li, Tao Yang, Tianjie Ni, Xiaolong Lan, Wengang Ma, Junjiang He

机构 * School of Cyber Science and Engineering, Sichuan University(四川大学计算机科学与工程学院) School of Computer Science, China West Normal University(西南大学计算机科学学院) School of Electronic and Information Engineering, Lanzhou Jiaotong University(兰州交通大学电子信息工程学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出Paraesthesia攻击,通过情绪风格动态后门触发机制,在大语言模型中实现高隐蔽性的恶意输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21852 2026-08-27 cs.LG cs.AI 版本更新 90%

A Comedy of Estimators: On KL Regularization in RL Training of LLMs

估计器的喜剧:关于在LLM训练中的KL正则化

Vedant Shah, Johan Obando-Ceron, Vineet Jain, Brian Bartoldson, Bhavya Kailkhura, Sarthak Mittal, Glen Berseth, Pablo Samuel Castro, Yoshua Bengio, Esmeralda S. Whitammer, Moksh Jain, Siddarth Venkatraman, Aaron Courville

机构 * McGill University(麦吉尔大学) LawZero(法零) LLNL(劳伦斯利弗莫尔国家实验室) University of Edinburgh(爱丁堡大学) CIFAR AI Chair(CIFAR人工智能主席) CIFAR Fellow

专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在LLM训练中使用KL正则化的估计器方法,分析了不同配置对训练稳定性及下游性能的影响,发现偏导数估计器可能导致训练不稳定,而无偏导数估计器能提升模型在领域内外任务的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25579 2026-08-27 cs.CL 新提交 89%

Cross-Dataset Stability of Expert-Informed Skill Prompting and Fine-Tuning for Chinese Metaphor Identification

面向中文隐喻识别的专家指导型技能提示与微调的跨数据集稳定性

Yufeng Wu, Meichun Liu

机构 * City University of Hong Kong(香港城市大学)

专题命中 指令微调 :prompting(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究比较四种方法在中文隐喻识别中的跨数据集表现,发现专家指导型技能提示可提升跨数据集稳定性,微调则在原生数据集上更具优势。

Comments 6 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08873 2026-08-27 cs.AI 版本更新 88%

UCO: A Multi-Turn Interactive Reinforcement Learning Method for Adaptive Teaching with Large Language Models

UCO:一种用于基于大语言模型的自适应教学的多轮交互强化学习方法

Shouang Wei, Min Zhang, Xin Lin, Bo Jiang, Kun Kuang, Jingyuan Chen, Zhongxiang Dai

机构 * East China Normal University(东华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 UCO通过多轮交互强化学习方法,利用进展奖励和支架奖励函数,提升大语言模型在教育场景中的自适应教学能力。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06087 2026-08-27 cs.CL cs.AI 版本更新 88%

LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents

LatentSkill: 从上下文文本技能到LLM智能体的权重内隐技能

Aofan Yu, Chenyu Zhou, Tianyi Xu, Zihan Guo, Rong Shan, Zhihui Fu, Jun Wang, Weiwen Liu, Yong Yu, Weinan Zhang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Sun Yat-Sen University(中山大学) Shanghai Innovation Institute(上海创新研究院) OPPO Research Institute(OPPO研究院)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出LatentSkill框架,通过预训练超网络将文本技能转换为即插即用的LoRA适配器,将技能知识存储在权重空间而非上下文空间,从而减少预填充令牌并提升性能。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26574 2026-08-27 cs.CR 版本更新 88%

GradSentry: Gradient Spectral Entropy for Backdoor Sample Filtering in Large Language Model Fine-Tuning

GradSentry: 大语言模型微调中基于梯度谱熵的后门样本过滤

Haodong Zhao, Tianyi Xu, Tianhang Zhao, Zhuosheng Zhang, Gongshen Liu

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract)

AI总结 提出GradSentry方法,利用每个样本梯度的谱熵区分后门样本与干净样本,无需聚类即可在任意投毒比例下有效过滤后门样本。

Comments Accepted as EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25981 2026-08-27 cs.CL 版本更新 87%

AgentDiff: Meaning-Bearing Rewrites Trigger Deeper Divergence than Presentation Changes in LLM Agents

LLM 代理何时对表面噪声与语义噪声做出不同处理?一项基于 68 个单元格的测量研究及留出轨迹级验证

Liyun Zhang, Jiayi Guo

机构 * School of Information and Software Engineering, UESTC(信息与软件工程学院,电子科技大学) Jacobs School of Engineering, UC San Diego(工程学院,加州大学圣地亚哥分校)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL

AI总结 本研究通过 68 个单元格的测量实验,发现大语言模型驱动的思维链和 ReAct 代理对语义扰动(如释义、同义词)比表现扰动(如格式、重排序)更敏感,并基于留出模型和轨迹级机制分析提出了“隐蔽发散”解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25428 2026-08-27 cs.CL cs.AI 新提交 87%

DCGC: Draft-Conditioned Global Correction for Complex Reasoning with Masked Diffusion Models

DCGC:基于草稿条件的全局修正,用于带掩码扩散模型的复杂推理

Minhae Oh, Nakyung Lee, Jungwoo Lee

机构 * Seoul National University(首尔大学)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DCGC是结合SFT与动态双CFG机制的MDM框架,用于修正LLMs推理错误,在多推理基准中优于现有方法,可作为无验证器的全局修正模块。

Comments 21 pages, 3 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25243 2026-08-27 cs.CL cs.LG 新提交 87%

From Memorization to Absorption: Mixed-Policy RL for Continual Knowledge Injection

从记忆到吸收:用于持续知识注入的混合策略强化学习

Zhibo Hou, Fan Zhao, Zhiyu An, Wan Du

机构 * University of California, Merced(加州大学默塞德分校)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对大语言模型持续知识注入中监督微调泛化不足的问题,提出三阶段自学习框架GRIN,其核心为混合策略RL算法Golden-GRPO,引入两个基准验证,结果表明GRIN性能优于SFT及混合策略RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12264 2026-08-27 cs.CR cs.CL cs.LG 版本更新 87%

Reconstruction of Personally Identifiable Information from Proprietary Data in Supervised Fine-Tuned Models

从监督微调模型中重建个人身份信息

Sae Furukawa, Alina Oprea

机构 * Northeastern University(东北大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了从监督微调模型中重建个人身份信息的问题,提出COVA算法在前缀攻击下优于现有提取方法,揭示了不同PII类型泄露程度差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13538 2026-08-27 cs.CL 版本更新 86%

Synthesizing Instruction-Tuning Datasets with Contrastive Decoding

通过对比解码合成指令微调数据集

Tatsuya Ichinose, Youmi Ma, Masanari Oi, Ryuto Koike, Naoaki Okazaki

机构 * Department of Computer Science, School of Computing, Institute of Science Tokyo(东京科学大学计算机科学系) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) Research and Development Center for Large Language Models, NII(大型语言模型研究与开发中心,日本信息产业技术综合研究所)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出CoDIT方法,通过对比解码分离预训练知识与指令遵循能力,提升指令微调效果。实验表明基于CoDIT构建的数据集在多个基准上表现更优。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01990 2026-08-27 cs.LG cs.AI 版本更新 86%

SAME: Stabilized Mixture-of-Experts for Multimodal Continual Instruction Tuning

SAME: 用于多模态持续指令调优的稳定混合专家模型

Zhen-Hao Xie, Jun-Tao Tang, Yu-Cheng Shi, Han-Jia Ye, De-Chuan Zhan, Da-Wei Zhou

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对多模态持续指令调优中专家路由漂移和专家漂移问题,提出稳定混合专家模型(SAME),通过正交子空间分解路由动态和曲率感知缩放更新专家,实现无重放的状态最优性能。

Comments Accepted to ICML 2026. Code is available at this https URL (https://github.com/LAMDA-CL/Prism)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04632 2026-08-27 cs.CL cs.AI 版本更新 85%

From National Curricula to Cultural Awareness: Constructing Open-Ended Culture-Specific Question Answering Dataset

从国家课程到文化意识:构建开放性文化特定问答数据集

Haneul Yoo, Won Ik Cho, Geunhye Kim, Jiyoon Han

机构 * KAIST AI Center(韩国国立科学技术院人工智能中心) Samsung Electronics(三星电子) Hankuk University of Foreign Studies(韩国外语大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出CuCu框架,利用国家课程构建文化特定的开放性问答数据集KCaQA,以提升语言模型在文化对齐方面的表现。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25605 2026-08-27 cs.CL 新提交 84%

From Specialization to Generalization: Instruction-tuned LLMs for Robust Harmful Content Mitigation

从专业化到通用化:用于稳健有害内容缓解的指令调优大语言模型

Lukas Edman, Daryna Dementieva, Alexander Fraser

机构 * School of Computation, Information and Technology, TU Munich(慕尼黑工业大学计算、信息与技术学院) Munich Center for Machine Learning(慕尼黑机器学习中心) Munich Data Science Institute(慕尼黑数据科学研究所)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 该研究针对LLMs在仇恨言论检测等敏感领域表现不佳的问题,基于Qwen3,通过统一36个英语仇恨言论数据集进行指令调优,提升了模型在有害内容缓解上的跨域、跨语言泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25429 2026-08-27 cs.AI cs.LG 新提交 84%

Distance Is Not Enough: Forget-Retain Alignment Gap Predicts LLM Relearning Robustness

距离并不足够:遗忘-保留对齐间隙可预测大语言模型的再学习鲁棒性

Yi Chen, Hanna Hsieh, Shuhong Liu, Chuanbo Hua, Zihan Ma, Kun Wang, Joo-Young Kim

机构 * The University of Tokyo(东京大学) KAIST(韩国科学技术院)

专题命中 指令微调 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 该研究提出FRAG预测器,基于权重选择性而非距离,结合FRP方法提升LLM再学习鲁棒性,揭示权重选择性对鲁棒性的解释力优于单独距离。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25826 2026-08-27 cs.CL cs.AI cs.LG 新提交 83%

Unfolding Scientific Papers into Multi-Turn Generation Trajectories for Continued Pre-Training

将科学论文展开为多轮生成轨迹用于持续预训练

Qiankai Xu, Qiguang Chen, Zixin Su, Wenhao Huang, Yue Gao, Jiaheng Liu, Ge Zhang

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出将科学论文展开为多轮生成轨迹的流程构建CPT语料库,经CPT后微调可提升写作性能与长文档阅读能力,混合SFT数据可进一步优化学术写作表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24901 2026-08-27 cs.CL cs.HC cs.LG 新提交 82%

Detection != Reliable Control: Decodable Empathy Directions Yield at Most Partial Shifts in Automated Empathy Scores

检测≠可靠控制:可解码的共情方向在自动共情评分中仅产生最多部分偏移

Haoran Jisun

机构 * University of Southern California(南加州大学)

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 本研究针对EPITOME的认知与情感共情维度,在三个指令微调LLM中发现,可解码的共情方向仅能部分控制自动共情评分,认知维度的控制不可靠,需对认知共情主张做测量敏感性检验。

Comments Under review at BlackboxNLP 2026 (EMNLP). 8 pages body, 10 figures/tables, plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14237 2026-08-27 cs.CL cs.LG 版本更新 82%

Ladder Up, Memory Down: Low-Cost Fine-Tuning With Side Nets

向上爬,记忆下降:低成本微调与侧边网络

Estelle Zheng, Nathan Cerisara, Sébastien Warichet, Emmanuel Helbert, Christophe Cerisara

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 LST通过轻量级侧边网络实现高效微调,比QLoRA更节省内存,同时在多个任务中保持竞争力。

Comments 24 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25580 2026-08-27 cs.CV cs.AI 新提交 81%

V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning

V-Rubrics:基于评分规则的强化学习实现视觉忠实性

Shulin Tian, Minglun Li, Yuhao Dong, Hao Ding, Jiarui Yao, Haiwen Diao, Jingkang Yang, Hongyuan Zhu, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(新加坡南洋理工大学S-Lab) UIUC(伊利诺伊大学厄巴纳-香槟分校) A*STAR(新加坡科技研究局)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 该研究针对视觉-语言模型回答缺乏视觉依据的问题,提出基于评分规则的强化学习方法V-Rubrics,通过分解响应为原子命题并从三方面评分,训练的模型在相关推理基准上性能优于基线。

Comments Proj page: this https URL (https://shulin16.github.io/v-rubrics/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14857 2026-08-27 cs.AI 版本更新 81%

World Models for Policy Refinement in StarCraft II

为《星际2》政策细化设计的世界模型

Yixin Zhang, Ziyi Wang, Yiming Rong, Haoxi Wang, Jinling Jiang, Shuang Xu, Haoran Wu, Shiyu Zhou, Bo Xu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 StarWM为《星际2》政策细化设计的世界模型,通过预测未来观察和结构化文本表示提升策略决策性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26044 2026-08-27 math.AC 新提交 80%

Polynomial extensions do not preserve the strong finite type property

多项式扩张不保持强有限型性质

Viet-Hoang Tran, Phan Thanh Toan, Thieu N. Vo, Tan M. Nguyen

专题命中 指令微调 :SFT(summary_cn,abstract)

AI总结 该研究针对多项式扩张是否保持强有限型(SFT)性质这一公开问题,构造出SFT环R但R[X]非SFT,给出了否定解答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25048 2026-08-27 cs.SI 新提交 78%

Tabular Foundation Models for Multi-View Information Cascade Popularity Prediction

面向多视图信息级联流行度预测的表格基础模型

Wenting Zhu, Chenghua Gong, Sanchuan Guo, Chaozhuo Li, Yueyue Zhang, Xi Zhang

专题命中 指令微调 :foundation model(title,abstract)

AI总结 该研究针对信息级联流行度预测的现有局限,提出双分支设计的TFM4POP框架,结合表格基础模型与神经ODE编码器,通过参数高效微调实现多视图建模,在多数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11838 2026-08-27 cs.LG cs.AI 版本更新 73%

A Layer-wise Analysis of Supervised Fine-Tuning

对监督微调的分层分析

Qinghua Zhao, Xueling Gong, Xinyu Chen, Zhongfeng Kang, Xinlu Li

机构 * Hefei University(合肥大学) Lanzhou University(兰州大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文通过信息论、几何和优化指标分析模型规模,揭示了中间层稳定而顶层敏感的分层特性,并提出Mid-Block Efficient Tuning方法,在GSM8K数据集上优于LoRA,证明有效对齐是局部而非分布的。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26013 2026-08-27 cs.CL 新提交 70%

VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following

VISA:用于多模态指令遵循的智能体式自进化数据合成

Min Zeng, Guanxin Tan, Libin Cen, Yawei Wen, Rui Hu, Liuyang Bian, Xiaolong Chen, Xiaoxin Chen

机构 * vivo AI Lab(vivo AI实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 VISA是一种智能体式自进化数据合成框架,通过自进化循环优化多模态指令合成,在MM-IFEval等基准上提升了多模态指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09772 2026-08-27 cs.AI 版本更新 70%

Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning

两个脑袋胜过一个:测试时扩展多智能体协作推理

Can Jin, Hongwu Peng, Qixin Zhang, Yang Zhou, Yujin Tang, Tong Che, Dimitris N. Metaxas

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对单智能体测试时扩展(TTS)的瓶颈,提出用多智能体系统(MAS)升级TTS,引入M500数据集并结合CEO智能体的自适应策略,微调的Qwen2.5-32B-MAS等模型性能优于基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25677 2026-08-27 cs.CL cs.AI cs.LG 新提交 67%

Learning New Facts with QLoRA: An Acquisition-Retention Frontier

用QLoRA学习新事实:获取-保留前沿

Estelle Zheng, Sébastien Warichet, Emmanuel Helbert, Christophe Cerisara

机构 * LORIA, CNRS(洛林信息学与应用实验室,法国国家科学研究中心) Alcatel-Lucent Enterprise(阿尔卡特朗讯企业通信)

专题命中 指令微调 :pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究以Qwen3-4B为对象,对比FFT与不同秩的QLoRA,发现秩会形成事实获取与保留的前沿,该效应在需安装新事实关联时更显著。

Comments accepted EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏