When Role-playing, Do Models Believe What They Say?
角色扮演时,模型是否相信它们所说的话?
机构 * MATS
专题命中 指令微调 :LLM(summary_cn,abstract_cn);language model(abstract);SFT(abstract);prompting(abstract)
AI总结 通过线性真实探针研究角色扮演对LLM内部表征的影响,发现角色扮演主要改变输出而非内部真实表征,而紧急错位则更显著地改变内部表征。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
角色扮演时,模型是否相信它们所说的话?
机构 * MATS
专题命中 指令微调 :LLM(summary_cn,abstract_cn);language model(abstract);SFT(abstract);prompting(abstract)
AI总结 通过线性真实探针研究角色扮演对LLM内部表征的影响,发现角色扮演主要改变输出而非内部真实表征,而紧急错位则更显著地改变内部表征。
论在线策略蒸馏的几何结构
机构 * HKUST(香港科技大学) ; UT Austin(得克萨斯大学奥斯汀分校) ; Zhejiang University(浙江大学) ; Hong Kong PolyU(香港理工大学) ; USTC(中国科学技术大学) ; BUPT(北京邮电大学) ; Nankai University(南开大学) ; BIT(北京理工大学)
专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文通过参数空间诊断,揭示在线策略蒸馏(OPD)的更新轨迹具有松弛离主成分、子空间锁定等独特几何特性,表明其并非介于SFT和RLVR之间的中间方法。
Comments 17 pages, 8 figures
STaR-DRO: 面向群体鲁棒结构化预测的状态化Tsallis重加权
机构 * Yale University(耶鲁大学) ; Yale School of Medicine(耶鲁医学院)
专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出STaR-DRO框架,结合Tsallis镜像上升和稀疏entmax映射,仅对持续困难群体上权重,在结构化预测中提升标签准确性和鲁棒性,在EPPC Miner任务上相比SFT和标准DRO分别提升F1分数1.08和2.20。
Stage-1 控制熵状态,而非最终结果
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 指令微调 :SFT(summary_cn,abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 本文通过小数据实验研究两阶段后训练中Stage-1(SFT或OPD)的作用,发现其主要影响策略熵状态,但对最终性能影响有限。
RASFT: 用于推理的滚动自适应监督微调
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; New Jersey Institute of Technology(新泽西理工学院) ; Institute of Computing Technology, CAS(中国科学院计算技术研究所)
专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 提出RASFT框架,通过基于策略rollout的问题级可解性校准专家监督,在模型困难时加强指导、表现可靠时放松模仿并纳入自生成轨迹,同时使用裁剪逆比约束策略漂移,在多个推理基准上优于SFT和RL方法。
通过奖励划分实现无价值函数策略优化
机构 * LIPN, Université Paris 13(巴黎第十三大学LIPN实验室) ; Université Paris 13(巴黎第十三大学) ; Université de Versailles Saint-Quentin Paris(巴黎- versaillies圣quentin大学)
专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);language model(abstract);preference optimization(abstract)
AI总结 提出Reward Partition Optimization (RPO)方法,通过基于划分的奖励归一化消除价值函数学习,实现稳定、高效的策略优化。
Optuna vs Code Llama:LLM 是超参数调优的新范式吗?
机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室,CAIDAS与IFI,乌尔姆大学,德国)
专题命中 指令微调 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 通过微调参数高效的 Code Llama 模型,提出基于大语言模型的超参数优化方法,在多种视觉架构上实现与 Optuna 相当或更优的 RMSE 并大幅降低计算开销。
Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 5664-5674, 2025
APEX-Searcher: 通过子目标细化信用分配以增强智能体检索增强生成
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) ; Wenge Technology Co., Ltd(Wenger科技有限公司)
专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对复杂多跳问答中检索路径模糊和端到端强化学习奖励稀疏的问题,提出APEX-Searcher,通过分离规划与执行的信用分配(规划用RL优化、执行用SFT学习),在多个基准上取得一致提升。
探究跨模态技能注入:场景、方法与超参数
机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) ; WeChat AI, Tencent Inc., China(腾讯公司,中国) ; The University of Hong Kong(香港大学)
专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文研究了跨模态技能注入在不同场景下的表现,分析了其方法和超参数的影响,发现其在指令遵循和跨语言任务中表现良好,但在数学推理中存在困难,同时指出经典方法如TA和DARE在性能上优于其他融合方法。
PriorZero:连接语言先验与世界模型以实现决策制定
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; The Chinese University of Hong Kong MMLab(香港中文大学MMLab)
专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 PriorZero通过解耦的rollout训练设计,将LLM生成的语义先验整合到基于世界模型的规划中,提升探索效率和长期性能,适用于文本冒险游戏和指令遵循任务。
Comments 30 pages, 12 figures
安全对齐作为持续学习:通过正交梯度投影缓解对齐税
机构 * School of Life Sciences, IDG/McGovern Institute for Brain Research(生命科学学院,IDG/麦戈文脑科学研究所) ; Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center(计算机科学与技术系,人工智能研究所,清华大学-博世联合机器学习中心,THBI实验室,BNRist中心) ; Tsinghua University, Beijing, China(清华大学,北京,中国)
专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本文通过持续学习视角研究安全对齐与通用能力退化之间的权衡,提出OGPSA方法通过正交梯度投影提升安全性和实用性,实验显示在不同训练流程中显著改善安全-效用权衡。
基于双自适应加权的团队自博弈:用于微调大语言模型
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) ; Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院)
专题命中 指令微调 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出TPAW算法,通过团队协作与竞争机制提升自监督下LLM对齐效果,采用双自适应加权机制提高优化效率,实验证明其在多种模型和基准测试中表现优异。
Comments Accepted by ACL 2026 Main
大语言模型中涌现的慢思考作为逆树冻结
机构 * Hefei National Laboratory, University of Science and Technology of China(中国科学技术大学合肥微尺度物质科学国家实验室) ; Hefei National Laboratory for Physical Sciences at the Microscale and Department of Modern Physics, University of Science and Technology of China(中国科学技术大学合肥微尺度物质科学国家实验室和现代物理系) ; Institute of Theoretical Physics, Chinese Academy of Sciences(中国科学院理论物理研究所) ; School of Fundamental Physics and Mathematical Sciences, Hangzhou Institute for Advanced Study, UCAS(杭州高等研究院基础物理与数学科学学院) ; DP Technology(DP技术) ; Lanzhou Center for Theoretical Physics, Key Laboratory of Theoretical Physics of Gansu Province, Key Laboratory of Quantum Theory and Applications of MoE, Gansu Provincial Research Center for Basic Disciplines of Quantum Physics, Lanzhou University(兰州理论物理中心、甘肃省理论物理重点实验室、教育部量子理论与应用重点实验室、甘肃省量子物理基础学科省重点实验室、兰州大学) ; AI for Science Institute, Beijing(北京人工智能科学研究院)
专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文通过统计物理视角揭示大语言模型中慢思考的涌现机制,提出逆树冻结结构,并提出Annealed-RLVR方法提升模型性能。
Comments 34 pages, 17 figures, 1 table
CastFlow:学习用于时间序列预测的角色专用代理工作流
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)
专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 CastFlow通过动态代理框架实现多视角时间模式提取和多轮上下文特征获取,提升时间序列预测的准确性和适应性。
大语言模型中的用户-助手偏见
机构 * Harvard University(哈佛大学) ; University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校)
专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本文研究了大语言模型中因角色标签训练数据不一致导致的用户-助手偏见,通过UserAssist基准测试发现指令微调模型存在强用户偏见,而基础和推理模型接近中性,揭示了角色标签训练的潜在影响。
理解安全对齐偏差对大语言模型的影响
机构 * Leidos(Leidos公司)
专题命中 指令微调 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG
AI总结 研究通过JT和WO方法评估六种大模型在恶意和良性任务中的表现,发现WO方法使模型更易执行恶意活动,而JT方法则更易产生幻觉。通过监督微调有效限制WO带来的攻击能力。
Comments 12 pages, 2 figures, 5 tables
对大型语言模型在真实场景中模型合并的系统研究
机构 * Koç University(科奇大学) ; Technical University of Munich(慕尼黑工业大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Helmholtz Munich(亥姆霍兹慕尼黑中心)
专题命中 指令微调 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.LG
AI总结 本文系统评估了在真实场景中合并异构专家模型的效果,发现任务算术是唯一在该场景下可靠提升性能的方法,其他方法效果不显著。
Journal ref Transactions on Machine Learning Research (03/2026)
通过平衡微调对齐大语言模型与生物医学知识
机构 * Tencent AI for Life Sciences Lab(腾讯AI生命科学实验室) ; Sun Yat-sen University(中山大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Westlake University(西湖大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 本文提出平衡微调方法,通过双尺度后训练技术提升大语言模型对生物医学知识的理解与生成能力,实验表明其在医疗和生物学推理任务中优于传统方法。
迈向在线策略微调:分布判别理论及其在大语言模型训练中的应用
专题命中 指令微调 :SFT(title,abstract);LLM(title);分类 cs.AI、cs.LG
AI总结 本文提出分布判别理论及两种技术,提升SFT的泛化能力,实验表明其性能超越主流离线RL方法,且保持SFT效率。
检索增强的少样本提示与微调在代码漏洞检测中的比较
机构 * Electrical and Computer Engineering(电气与计算机工程) ; American University of Beirut(贝鲁特美国大学)
专题命中 指令微调 :prompting(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI
AI总结 本研究比较了检索增强的少样本提示与微调方法在代码漏洞检测中的性能,发现检索增强提示在效率和效果上均优于微调方法。
Comments Accepted in the 3rd International Conference on Foundation and Large Language Models (FLLM2025)
专题命中 指令微调 :language model(title,abstract);large language model(abstract,comments);preference optimization(abstract);分类 cs.CL、cs.LG
Comments Accepted for the IEEE International Workshop on Large Language Models for Finance, 2024. This is a preprint version
Journal ref 2024 IEEE International Conference on Big Data, Dec 15-18, 2024, Electronic ISBN: 979-8-3503-6248-0, Electronic ISSN: 2573-2978
机构 * Department of Computing The Hong Kong Polytechnic University Hong Kong SAR, China ; Centre for Artificial Intelligence ; Robotics Hong Kong Institute of Science \& Innovation Chinese Academy of Sciences Hong Kong SAR, China
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
Comments Accepted at ACSAC 2025
机构 * 1 State Key Laboratory of Complex \& Critical Software Environment, School of Computer Science ; Engineering, Beihang University, China
专题命中 指令微调 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI
Comments Accepted by ICSE 2026. Code and data: https://github.com/SIMIAO515/SecureReviewer
机构 * University of Maryland(马里兰大学) ; Capital One(Capital One公司) ; Columbia University(哥伦比亚大学)
专题命中 指令微调 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG
Comments 20 pages
机构 * Tsinghua University(清华大学) ; ARC Lab, Tencent PCG(腾讯PCG实验室) ; The University of Hong Kong(香港大学) ; Xi’an JiaoTong University(西安交通大学)
专题命中 指令微调 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI
专题命中 指令微调 :language model(title,abstract);large language model(abstract,comments);LLM(abstract);分类 cs.CL、cs.AI
Comments large language model, instruction fine-tune
Journal ref The Twelfth International Conference on Learning Representations (ICLR 2024)
机构 * Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) ; Samsung SDS, Korea(三星SDS,韩国) ; AIIS, ASRI, INMC, ISRC, and IPAI, Seoul National University(人工智能研究所、人工智能研究机构、智能网络中心、智能系统研究室和人工智能政策研究所,首尔国立大学)
专题命中 指令微调 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI
Comments NAACL 2025 Oral
专题命中 指令微调 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI
专题命中 指令微调 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG
Comments 13 pages
专题命中 指令微调 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG
Comments NeurIPS 2024