Detecting Instruction Fine-tuning Attacks using Influence Function
利用影响函数检测指令微调攻击
机构 * Tsinghua University(清华大学)
专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出一种无需先验知识的检测方法,通过影响函数和语义转换识别污染示例,提升模型鲁棒性。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
利用影响函数检测指令微调攻击
机构 * Tsinghua University(清华大学)
专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出一种无需先验知识的检测方法,通过影响函数和语义转换识别污染示例,提升模型鲁棒性。
ShellForge: 基于对抗性共进化的小壳生成与多视角检测的稳健小壳防御
机构 * Beijing Electronic Science and Technology Institute(北京电子科技研究所) ; Technology Institute(技术研究所)
专题命中 指令微调 :LLM(abstract);分类 cs.AI
AI总结 ShellForge通过对抗性共进化框架,结合自动化小壳生成与多视角检测,提升Webshell防御的鲁棒性与准确性。
InstructPLM-mu:在1小时内微调ESM2在蛋白质突变预测中优于ESM3
机构 * The Chinese University of Hong Kong(香港中文大学) ; Hangzhou Institute of Medicine, CAS(杭州医学研究所,中国科学院) ; Hangzhou Institute for Advanced Study, UCAS(杭州先进研究 institute,中国科学院大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tianjin University(天津大学)
专题命中 指令微调 :language model(abstract);分类 cs.AI
AI总结 InstructPLM-mu通过1小时微调ESM2在蛋白质突变预测中超越ESM3,揭示了结构输入对模型性能的关键影响。
Comments preprint
TwinBrainVLA: 通过非对称Transformer混合释放通用视觉语言模型在具身任务中的潜力
机构 * HIT(哈尔滨工业大学) ; ZGCA(中钢集团人工智能研究院) ; ZGCI(中钢集团智能计算研究院) ; HUST(华中科技大学) ; HKUST(GZ)(香港科技大学(广州)) ; BUAA(北京航空航天大学) ; ECNU(华东师范大学) ; CASIA(中国科学院自动化研究所) ; DeepCybo
专题命中 指令微调 :language model(abstract)
AI总结 TwinBrainVLA通过非对称Transformer混合机制,利用冻结的通用视觉语言模型和可训练的专家路径,实现机器人任务中的具身智能提升。
Comments GitHub: https://github.com/ZGC-EmbodyAI/TwinBrainVLA
PersonaAct: 通过个性化代理模拟短视频用户以进行反事实过滤气泡审计
专题命中 指令微调 :LLM(abstract)
AI总结 PersonaAct通过个性化代理模拟短视频用户,提升过滤气泡审计的保真度和深度,揭示内容压缩现象并释放首个开源数据集。
无需裁剪的策略优化用于大语言模型
机构 * KUIS AI Center, Koç University, Istanbul, Türkiye(Koç大学) ; Koç University, Istanbul, Türkiye(Koç大学) ; University of California, Berkeley, CA, USA(加州大学伯克利分校)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)
AI总结 CFPO通过凸二次惩罚替代裁剪机制,实现稳定策略优化,适用于大语言模型的训练。
Comments 23 pages, 10 tables, 8 figures
在有噪声反馈下,偏好优化能有多好?
机构 * Department of Computer Sciences(计算机科学系) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文研究了在噪声反馈下偏好优化的一般化能力,分析了不同噪声类型和强度对模型性能的影响,并验证了其在实际LLM训练中的有效性。
Comments TMLR 2026
通过多智能体辩论进行语言模型的自改进
机构 * Meta AI ; Columbia University(哥伦比亚大学) ; Meta Superintelligence Labs(Meta超智能实验室)
专题命中 后训练与偏好优化 :language model(title);post-training(title);SFT(abstract);分类 cs.AI
AI总结 通过多智能体辩论和强化学习提升语言模型的自我改进能力,实现推理准确性、自洽性和泛化能力的提升。
SP^2DPO: 一种基于大语言模型的语义逐对DPO泛化
机构 * Alibaba--NTU Global e-Sustainability CorpLab (ANGEL), Singapore(阿里-NTU全球可持续性公司实验室(ANGEL),新加坡) ; Alibaba Group, China(阿里集团,中国)
专题命中 后训练与偏好优化 :LLM(title);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SP^2DPO通过语义逐对DPO泛化提升AlpacaEval 2.0的长度控制胜率,避免每模型beta扫描。
Comments 39 pages, 15 figures, 16 tables, 60 equations
并非你,而是剪裁:通过概率平滑的软信任区域进行大语言模型强化学习
机构 * University of Southampton(索姆塞特大学) ; The Alan Turing Institute(艾伦·图灵研究所)
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出PSPO方法,通过概率平滑改进大语言模型强化学习中的信任区域,提升数学推理任务的性能。
评估基于参考-free LLM的文档接地的效用
机构 * Department of Computer Science and Cornell Tech, Cornell University(计算机科学系和Cornell Tech,康奈尔大学)
专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(abstract);分类 cs.CL
AI总结 本文提出GroGU,一种无需注释的模型特定指标,用于评估RAG中文档接地的效用,通过优化查询重写器提升了检索性能。
多样而非简短:一种长度控制的数据选择策略以提高语言模型的响应多样性
机构 * University of Massachusetts Lowell(马萨诸塞大学洛维尔分校) ; Yale University(耶鲁大学) ; Pennsylvania State University(宾夕法尼亚州立大学) ; Amazon AGI(亚马逊人工智能研究院)
专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.CL
AI总结 Diverse-NS通过长度控制的数据选择策略提升语言模型响应多样性,适用于创造性生成任务,并在不同规模模型间展示出显著效果。
Comments Accepted to EMNLP 2025 Main
SAFER: 通过稀疏自动编码器探索奖励模型的安全性
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)
AI总结 SAFER通过稀疏自动编码器探索奖励模型的安全性,揭示可解释特征并改进安全性对齐。
后退一步:前缀重要性比率稳定了策略优化
机构 * The University of Sydney(悉尼大学) ; ByteDance(字节跳动) ; Nanyang Technological University(南洋理工大学)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本文提出MinPRO目标,通过使用非累积的最小token级比率替代累积前缀比率,以稳定LLM在非策略性条件下的训练和优化。
MARE: 多模态对齐与强化学习用于通过视觉-语言模型的可解释深度伪造检测
机构 * School of Computer Science and Engineering, MoE Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology, Sun Yat-sen University, Guangzhou 510006, China(计算机科学与工程学院,信息技术MOE实验室,广东省信息安全技术重点实验室,中山大学,广州510006,中国) ; State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) ; Department of Computer and Information Science, University of Macau.(计算机与信息科学系,澳门大学)
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract)
AI总结 MARE通过多模态对齐和强化学习提升视觉-语言模型在深度伪造检测中的准确性和可靠性。
通过苏格拉底提问缩小LLM指令的表达差距
机构 * Nankai University(南开大学) ; Shanghai Innovation Institute(上海创新研究院) ; Wuhan University(武汉大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shanda AI Research(上海沙达人AI研究所)
专题命中 后训练与偏好优化 :LLM(title);分类 cs.AI
AI总结 通过苏格拉底提问方法,提出Nous代理以主动探测用户意图,解决人类与AI协作中的意图表达差距问题,提升效率和输出质量。
IRPM:基于组间相对偏好的点wise生成奖励模型
机构 * HUJING Digital Media \& Entertainment Group (XingYun Lab), Beijing, China ; Department of Automation, Tsinghua University, Beijing, China ; Fudan University, Shanghai, China ; Beihang University, Beijing, China ; Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China
专题命中 后训练与偏好优化 :post-training(abstract);RLHF(abstract);分类 cs.AI、cs.LG
AI总结 IRPM通过组间比较扩展Bradley-Terry模型,从成对偏好数据中训练点wise GRMs,实现高效可扩展的奖励建模。
Comments Comments: Updated title for clarity; improved theoretical derivations; added experiments at additional parameter scales and more ablations; added experimental details in the appendix; updated author list (added five co-authors) to reflect contributions to experiments and writing
从绝对到相对:重新思考基于群体的强化学习中的奖励塑造
机构 * Tianjin University(天津大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出RLRR框架,通过将奖励塑造从绝对评分转为相对排名,解决群体强化学习中奖励稳定性与监督稀疏性问题,并在推理和生成任务中取得性能提升。
FunPRM:基于元奖励校正的函数作为步骤过程奖励模型用于代码生成
机构 * University of California, San Diego(加州大学圣迭戈分校)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 FunPRM通过元学习的奖励校正机制提升代码生成性能,实现更高质量的代码输出。
IRIS:内在奖励图像合成
机构 * Department of Computer Science, University of California, Los Angeles, USA(计算机科学系,加州大学洛杉矶分校)
专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 IRIS通过内在奖励提升自回归T2I模型性能,改进图像生成质量并促进细致推理。
MC-GRPO:用于小回滚强化学习的中位数中心组相对策略优化
机构 * Amazon(亚马逊)
专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG
AI总结 MC-GRPO通过使用中位数基线替代平均基线,提高小回滚强化学习的稳定性和准确性。
ReNCE: 通过噪声对比估计学习推理
机构 * Rutgers University(罗杰斯大学)
专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.LG
AI总结 ReNCE通过噪声对比估计学习提升大语言模型的推理能力,采用显式对比学习方法在数学基准测试中表现优异。
为何GRPO需要规范化:从局部曲率角度探讨自适应梯度
机构 * Department of Aeronautics and Astronautics, MIT(麻省理工学院航空与宇航系) ; Department of Statistics, University of Wisconsin--Madison(威斯康星大学麦迪逊分校统计系) ; Department of Informatics, King's College London(伦敦国王学院信息学系) ; Department of Computer Sciences, University of Wisconsin--Madison(威斯康星大学麦迪逊分校计算机科学系)
专题命中 后训练与偏好优化 :language model(abstract);分类 cs.LG
AI总结 GRPO中标准差规范化通过局部曲率视角解释了其自适应梯度机制,理论和实验表明规范化能提升收敛速度并优化训练阶段表现。
区域归一化的DPO用于在噪声裁判下的医学图像分割
机构 * Institute for AI in Medicine (IKIM), University Hospital Essen (AöR), Essen, Germany(人工智能医学研究所(IKIM)、埃森大学医院(AöR)) ; Department of Nuclear Medicine, University Hospital Essen (AöR), Essen, Germany(核医学系、埃森大学医院(AöR)) ; Department of Physics, TU Dortmund, Dortmund, Germany(物理系、多特蒙德技术大学) ; Heidelberg University Hospital, Heidelberg, Germany(海德堡大学医院)
专题命中 后训练与偏好优化 :preference optimization(abstract)
AI总结 本文提出区域归一化的DPO方法,用于在噪声裁判下提升医学图像分割的性能和稳定性。
Post-LayerNorm 是回潮:稳定、富有表现力且深
机构 * ByteDance Seed(字节跳动种子)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 Keel通过采用Highway风格连接的Post-LN架构,在极端深度下实现稳定训练,提升LLM的表达能力和扩展性。
MiTa: 一种具有内存集成和任务分配的分层多智能体协作框架
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) ; Ping An Technology (Shenzhen) Co., Ltd., Shenzhen, China(平安科技(深圳)有限公司,深圳,中国)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 MiTa通过分层结构和内存整合提升多智能体协作效率,实现全局任务分配与片段记忆整合。
Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)
受认知神经科学启发的深度搜索与分层元认知监控
机构 * Gaoling School of Artificial Intelligence\ University of China Beijing China ; School of Information Technology ; Search Applications Department, Tencent Beijing China ; Beijing University of Posts ; Gaoling School of Artificial Intelligence\ University of China ; Search Applications Department, Tencent
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究提出DS-MCM框架,通过分层元认知监控机制提升深度搜索的性能和鲁棒性。
Comments 11 pages, 3 figures
注意力与残差汇流的统一视角:异常驱动的重缩放对变换器训练至关重要
机构 * Qwen Team(Qwen团队) ; University of Edinburgh(爱丁堡大学) ; Stanford University(斯坦福大学) ; Tsinghua University(清华大学)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出异常驱动重缩放对变换器训练的重要性,通过统一注意力与残差汇流的起源,展示了异常值在训练稳定性与性能提升中的关键作用。
利用数据说不:基于记忆的插拔式选择预测
机构 * University of Maryland, College Park(马里兰大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; Qualcomm AI(高通人工智能) ; Yale University(耶鲁大学) ; Meta AI
专题命中 长上下文与记忆 :language model(abstract);foundation model(abstract);分类 cs.LG
AI总结 本文提出基于记忆的插拔式选择预测方法,通过增强视觉语言嵌入来减少方差并改进分数校准,提升图像描述、匹配和细粒度分类性能。
Comments ICLR 2026
达尔文记忆:一种无训练的自调节记忆系统用于GUI代理进化
机构 * Didichuxing Co. Ltd(滴滴出行有限公司) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Tianjin University(天津大学) ; Sun Yat-sen University(中山大学) ; Fudan University(复旦大学)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 达尔文记忆系统通过自进化架构提升GUI代理的执行稳定性与成功率,无需额外训练或架构开销。