Relational Preference Encoding in Looped Transformer Internal States
循环变压器内部状态中的关系偏好编码
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 研究循环变压器如何编码人类偏好,通过提取内部迭代状态训练轻量评估头,发现偏好关系性编码优于非线性方法,提出翻转测试作为必要诊断。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
循环变压器内部状态中的关系偏好编码
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 研究循环变压器如何编码人类偏好,通过提取内部迭代状态训练轻量评估头,发现偏好关系性编码优于非线性方法,提出翻转测试作为必要诊断。
通过结构感知掩码和GRPO实现高效的链式推理知识蒸馏课程学习
机构 * City University of Hong Kong(香港城市大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 通过结构感知掩码和GRPO实现高效的链式推理知识蒸馏,提升学生模型的准确率和输出简洁性。
Comments 14 pages, 13 figures. Accepted at SDM 2026
具有人类反馈的鲁棒离线强化学习
机构 * University of Warwick(华威大学) ; Max-Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) ; Independent Researcher(独立研究员)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 研究离线环境下人类反馈强化学习的数据鲁棒性,提出基于置信集和悲观策略的鲁棒方法,首次提供可证明的鲁棒性保证。
Comments Updated Algorithm 1 and the Proof of Theorem 3.3
ReSkill:在智能体强化学习中协调技能创建与策略优化
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 提出ReSkill框架,通过GRPO的组结构嵌入断言驱动技能创建、组内轨迹采样和自适应汤普森采样,实现技能与策略的协同进化,在多个领域超越现有方法。
VideoGPA: 通过几何先验知识蒸馏实现3D一致的视频生成
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 后训练与偏好优化 :foundation model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG
AI总结 VideoGPA通过几何先验知识蒸馏提升视频生成的3D一致性,利用数据高效的自监督框架引导视频扩散模型,显著增强时间稳定性、几何合理性与运动一致性。
Comments 8 pages, 5 figures, ICML 2026
局部引导,全局影响:高斯重塑信任区域解锁行为转变
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Mila - Québec AI Institute(魁北克AI研究院) ; Université de Montréal(蒙特利尔大学) ; Fudan University(复旦大学) ; City University of Hong Kong(香港城市大学)
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 针对PPO在非平稳环境中优化失效的问题,提出高斯信任区域策略优化(GTR),通过高斯核重塑信任区域实现非单调约束,在保持局部稳定性的同时允许必要的大幅策略更新,并在多种任务中取得强性能。
Comments 21 pages
AdaJudge: 自适应多视角评判用于奖励建模
机构 * Emory University(埃默里大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 提出AdaJudge框架,通过门控精化块和自适应多视角池化模块,联合优化表示与聚合,解决奖励建模中静态归纳偏差和表示不匹配问题,在RM-Bench和JudgeBench上超越现有模型。
Comments ACL 2026
HarmRLVR: 利用可验证奖励进行有害大模型对齐
专题命中 后训练与偏好优化 :LLM(title)
AI总结 提出HarmRLVR,首次系统研究可验证奖励强化学习(RLVR)的对齐可逆性风险,通过仅64个有害提示的GRPO即可快速逆转安全对齐,攻击成功率高达96.01%。
面向搜索智能体的上下文信息策略优化
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对现有搜索智能体方法存在的先验驱动推理问题,提出CIPO框架,通过回合级信用分配对齐策略与证据使用,无需额外标注或奖励模型,在7个基准上性能优异。
IndexTTS 2.5 技术报告
机构 * Bilibili Inc.(哔哩哔哩公司)
专题命中 后训练与偏好优化 :foundation model(abstract);post-training(abstract);分类 cs.AI
AI总结 IndexTTS 2.5通过四方面改进提升了多语言支持、推理速度和合成质量,实现了更广泛的语言覆盖和情感语调复制。
Comments 11 pages, 4 figures
Themis: 训练鲁棒的多语言代码奖励模型以实现灵活的多标准评分
机构 * UKP Lab, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(UKP实验室,德累斯顿理工大学及应用网络安全国家研究中心ATHENE)
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.LG
AI总结 本文提出Themis-CodeRewardBench基准,评估多语言多标准代码奖励模型,训练了Themis-RM系列模型,展示了其在多语言迁移和多标准训练中的优势。
MathDebugger:检测与诊断合成数学数据中的错误
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 MathDebugger是用于评估模型检测诊断合成数学数据错误的基准,含6000个标注实例,评估发现模型在该任务上表现不足,错误类型信息可提升修正效果,为数学数据质量控制提供支撑。
PAIR:面向多轮代理优化的前缀感知内部奖励模型
机构 * KAIST(韩国科学技术院) ; Yonsei University(延世大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出PAIR模型,通过结合冻结的隐藏状态探针和轻量级注意力头部,解决多轮任务中内部正确性探针的可靠性问题,从而在不依赖外部模型调用或地面真实依赖的情况下,为GRPO训练提供密集的步骤级奖励信号。
Comments Under Review
具有可验证奖励的强化学习中噪声数据是破坏性的
机构 * Siebel School of Computing and Data Science, University of Illinois Urbana Champaign, USA(计算机与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究指出,现有RLVR算法无法缓解噪声影响,噪声会破坏强化学习性能,真实世界噪声导致Text2SQL任务准确率下降5-12%。
Comments 16 pages, 17 figures
EmoAgent-R1:基于强化学习的动态智能体专业化实现多模态情感理解
机构 * Guangdong University of Technology(广东工业大学) ; Southern University of Science and Technology(南方科技大学) ; Xi’an Jiaotong University(西安交通大学) ; Guizhou Provincial Laboratory of Big Data, State Key Laboratory of Public Big Data, Guizhou University(贵州大学大数据省级重点实验室、公共大数据国家重点实验室)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对现有多模态情感识别方法忽视情感源动态性和复杂性的问题,提出基于强化学习的动态智能体专业化框架EmoAgent-R1,采用冷启动策略和两步智能体工作流程训练,并用P-GRPO优化,实验证明其在情感推理性能和优化稳定性上更优。
AGG:用于扩散模型高效GRPO训练的雅可比聚合组梯度
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究GRPO扩展到扩散模型的计算瓶颈问题,提出JAGG方法,通过特定插值和聚合梯度,减少反向传播次数,实验表明该方法能在质量损失小的情况下显著加速T2I训练中的DiT RL训练。
Comments 21 pages
PISmith: 基于强化学习的提示注入防御红队测试
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出PISmith框架,通过强化学习评估现有提示注入防御的鲁棒性,发现标准GRPO在攻击强防御时表现不佳,引入自适应熵正则化和动态优势加权以提升探索能力,实验表明最新防御仍易受适应性攻击影响。
Comments To appear in COLM 2026
Agents-K1:迈向智能体原生的知识编排
机构 * PJLab(上海人工智能实验室)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出Agents-K1管道,将原始文档转化为智能体原生科学知识图谱,通过多模态解析器、GRPO训练的4B信息抽取骨干和三源智能体接口,实现科学信息抽取、知识图谱构建和多跳推理。
策略改进强化学习
机构 * Beihang University(北航) ; Peking University(北京大学)
专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.LG
AI总结 提出策略改进强化学习(PIRL)框架,通过最大化跨迭代的累积策略改进来替代替代奖励最大化,并基于此设计策略改进策略优化(PIPO)算法,实现闭环优化,在数学推理基准上提升稳定性和性能。
Shepherd: 一个为元代理提供形式化执行迹的运行时基座
机构 * Northeastern University(东北大学) ; Stanford University(斯坦福大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出Shepherd,一个基于函数式编程的Python运行时基座,将代理执行作为一等对象,通过类似Git的执行迹支持元代理的检查、分叉和重放,在三个用例中显著提升性能。
Comments 50 pages, 22 figures, 14 tables
内省意识的机制
机构 * Anthropic Fellows Program(Anthropic Fellow项目) ; MIT(麻省理工学院) ; Constellation ; Anthropic
专题命中 后训练与偏好优化 :post-training(abstract);preference optimization(abstract);分类 cs.LG
AI总结 研究揭示了大语言模型在检测注入的转向向量时的内省意识机制,发现其行为稳健且源于训练后阶段,通过两阶段电路实现,且在不同层间机制存在差异。
混合饮食使DINO成为杂食视觉编码器
机构 * Google DeepMind(谷歌DeepMind) ; University College London(伦敦大学学院)
专题命中 后训练与偏好优化 :foundation model(abstract);post-training(abstract);分类 cs.AI
AI总结 针对DINOv2等预训练视觉编码器在不同视觉模态间特征对齐差的问题,提出杂食视觉编码器,通过后训练框架学习模态无关特征空间,实现跨模态鲁棒理解。
Comments CVPR 2026 Highlight
ACTIVE-o3:通过纯强化学习赋予多模态大语言模型主动感知能力
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出ACTIVE-o3框架,基于GRPO强化学习,通过模块化感知-动作设计和双形式奖励,使MLLM自主学会高效准确的区域选择策略,在开放世界和领域特定任务中显著提升主动感知能力。
Comments Accepted to ICML 2026. Project page: https://aim-uofa.github.io/ACTIVE-o3
Qwen-音乐技术报告
机构 * Qwen Team(通义团队)
专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract)
AI总结 介绍Qwen-音乐,它支持文本到音乐生成和翻唱歌曲生成两个核心任务。集成三个核心组件,通过特定机制建模并渲染。经多语言数据训练及多种训练方式,在多个音乐性和音频质量指标上达领先成果,获专业评估人员青睐。
人工智能对齐放大了种族、性别和残疾在招聘决策中的作用
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)
AI总结 研究探讨语言模型在招聘决策中是否使用人口统计数据,发现对女性和黑人候选人有优势,对残疾候选人有劣势,且对齐过程放大了这些差异。
VGGRPO:迈向世界一致的视频生成的4D潜在奖励
机构 * Google(谷歌) ; University of Oxford(牛津大学) ; CREST-ENSAE, Institut Polytechnique de Paris(巴黎综合理工学院CREST-ENSAE) ; University of Copenhagen(哥本哈根大学)
专题命中 后训练与偏好优化 :foundation model(abstract);post-training(abstract)
AI总结 VGGRPO通过引入4D潜在几何模型和组相对策略优化,提升视频生成的几何一致性与稳定性,避免VAE解码的高计算开销。
Comments Accepted at ECCV 2026. Project Page: https://zhaochongan.github.io/projects/VGGRPO
EvoGuard: 一种基于代理强化学习的可扩展框架,用于实际和演化的AI生成图像检测
机构 * The University of Tokyo(东京大学) ; National Institute of Informatics(国家信息研究所)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)
AI总结 本文提出EvoGuard框架,利用多模态大语言模型和非MLLM检测器,通过能力感知的动态编排机制实现高效AIGI检测,优化后无需细粒度标注,实验表明其在准确性和可扩展性上均达最优。
Comments Template changed
Starve to Perceive: 通过受限视觉带宽驯服VLMs中的懒惰感知
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; Technology University of Waterloo(滑铁卢大学)
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)
AI总结 本文提出了一种新的训练方法,通过限制视觉带宽迫使视觉语言模型主动感知,从而提升其在高分辨率视觉环境中的表现。
MIND-V:基于强化学习物理对齐的长期机器人操作分层世界模型
机构 * Tsinghua University(清华大学) ; X Square Robot(X Square机器人) ; Sun Yat-sen University(中山大学) ; HKUST(香港科技大学)
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)
AI总结 提出MIND-V分层世界模型,通过语义推理、行为语义桥接和运动视频生成,结合强化学习物理对齐,实现长期机器人操作视频的物理合理合成。
导航对齐-校准权衡:通过模型合并实现帕累托更优前沿
机构 * University of Cambridge(剑桥大学)
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文发现后训练对齐不仅降低任务准确率,还严重损失校准性能,导致模型过度自信且输出多样性下降。通过简单地在对齐前后模型权重间进行插值,可以持续获得帕累托最优模型,同时提升准确率和恢复校准。
Comments ACL 2026 Findings