Reinforcement learning for question answering in programming domain using public community scoring as a human feedback
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.AI、cs.LG
Comments 8 pages (16 pages with references and appendix), 11 figures
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG
Comments 26+19 pages; v2 typos fixed, refs added, figure scale / colors fixed; v3 correct very non-standard TruthfulQA formatting and metric, alignment implications slightly improved
COPA:用于自适应提示注入防御的持续偏好优化
专题命中 后训练与偏好优化 :preference optimization(title,abstract)
AI总结 该研究提出COPA框架,将提示注入防御视为终身学习问题,通过GRPO优化和边际加权经验回放实现持续防御,使攻击成功率最高降低6.3倍、平均降低4.4倍。
面向不确定性引导的扩散模型后训练的样本自适应潜在奖励
专题命中 后训练与偏好优化 :post-training(title,abstract)
AI总结 本文提出\textsc{SURE}框架,含\textsc{SURE-LRM}与\textsc{SURE-REFL},通过样本自适应潜在奖励与不确定性引导反馈优化扩散模型,在偏好预测、SOTA性能及VBench指标上表现优异。
超越 token 级交叉熵:用于自回归图像生成的 Fréchet 分布后训练
机构 * UESTC(电子科技大学)
专题命中 后训练与偏好优化 :post-training(title,abstract)
AI总结 该研究针对自回归图像生成器预训练与评估的目标及上下文不匹配问题,提出 FD-loss 后训练方法,在 ImageNet 256×256 任务上大幅降低 FID 与 FD_r6,提升生成质量且无额外参数或推理步骤。
通过受滞约束的回放协调实现高效的异步RL后训练
专题命中 后训练与偏好优化 :post-training(title,abstract)
AI总结 StaleFlow通过受滞约束的回放协调,解决RL后训练中数据滞留与偏斜问题,提升系统吞吐量。
Comments SIGMOD 2027
当物理偏好遇到语义约束:用于文本到视频生成的物理和语义直接偏好优化
机构 * University of Nevada, Reno(内华达大学雷诺分校) ; Zhejiang University(浙江大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract)
AI总结 文本到视频生成模型存在物理合理性与语义一致性的矛盾,提出物理和语义直接偏好优化方法(PSDPO),通过调节偏好对贡献,限制语义漂移,实现更可靠平衡,实验验证其在提高物理合理性和保持语义一致性上优于基线和现有方法。
Comments This work is accepted by ACM MM 2026
端到端自动驾驶中的训练后处理
机构 * Northeastern University(东北大学) ; Purdue University(普渡大学)
专题命中 后训练与偏好优化 :post-training(title,abstract)
AI总结 探讨端到端自动驾驶中训练后处理技术,针对传统方法不足,将现有文献按监督形式分四类,阐述各分类的能力、局限与挑战,助力系统理解该领域并推动相关研究。
FdAudio:用于一步文本到音频生成的均值流锚定弗雷歇距离训练后处理
机构 * National Taiwan University(国立台湾大学) ; Amazon(亚马逊)
专题命中 后训练与偏好优化 :post-training(title,abstract)
AI总结 研究针对几步采样文本到音频生成模型一步生成质量落后的问题,提出FdAudio方法,通过多表示弗雷歇距离损失优化分布,并引入均值流一致性目标防止多步退化,在几步系统中提升了一步生成质量且解决了多步退化问题。
Comments Project website: https://fdoneaudio.github.io/
TACO:作为可扩展VLA训练后自校正器的触觉世界模型
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室) ; AI 2 Robotics(人工智能与机器人研究所) ; Sun Yat-sen University(中山大学) ; Beihang University(北京航空航天大学)
专题命中 后训练与偏好优化 :post-training(title,abstract)
AI总结 研究VLA模型在接触丰富任务中的问题,提出TACO框架,通过触觉感知世界模型驱动可扩展VLA训练后校正,结合多种方法提升策略,实验表明其能显著提高成功率。
VLM-AR3L:用于强化学习中绝对和相对奖励的视觉-语言模型
机构 * National Tsing Hua University(国立清华大学) ; NVIDIA AI Technology Center (NVAITC)(英伟达AI技术中心)
专题命中 后训练与偏好优化 :language model(title,abstract)
AI总结 提出VLM-AR3L框架,利用视觉-语言模型从偏好标签中学习绝对和相对奖励,结合状态评估与比较监督,在多种基准任务中优于先前方法。
Comments Accepted at IJCAI 2026. Project website: https://vlm-ar3l.github.io/
直接扩散分数偏好优化:通过逐步对比策略对监督
机构 * Dept. of CSE, Korea University(韩国大学计算机科学与工程系) ; NVIDIA
专题命中 后训练与偏好优化 :preference optimization(title,abstract)
AI总结 提出DDSPO方法,通过对比策略对直接监督反向去噪步骤,无需奖励建模或人工标注,在文本-图像对齐和美学质量任务上优于现有方法。
Comments Accepted to ECCV 2026
ECHO:基于回合信度的认知自适应语言智能体学习
专题命中 后训练与偏好优化 :language agent(title,abstract)
AI总结 提出认知决策过程(EDP)框架,通过回合级信度分配策略梯度目标ECHO,在证据寻求任务中提升智能体的信息获取效率与认知校准能力。
World Engine:迈向自动驾驶后训练时代
机构 * The University of Hong Kong(香港大学) ; Huawei(华为) ; Shanghai Innovation Institute(上海创新研究院) ; Archon Robotics(Archon机器人) ; KE:SAI ; NVIDIA Research(NVIDIA研究) ; NTU(南洋理工大学) ; Tsinghua University(清华大学)
专题命中 后训练与偏好优化 :post-training(title,abstract)
AI总结 提出World Engine生成式框架,通过从真实日志重建高保真交互环境并外推安全关键变体,利用强化后训练对齐策略与安全约束,显著减少罕见安全关键场景故障,提升自动驾驶安全性。
Comments Technical Report. Project Page: https://opendrivelab.com/WorldEngine/
自问式视觉语言模型:用于组合视觉推理的强化学习
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 后训练与偏好优化 :language model(title,abstract)
AI总结 提出自问式框架,通过GRPO强化学习训练VLM自动分解问题并回答子问题,提升组合视觉推理能力,在CLEVR和A-OKVQA上验证有效性。
FoA-SR: 忠实还是美观?面向真实世界图像超分辨率的轮廓感知偏好优化
机构 * Department of Computer Science(计算机科学系) ; University of Kentucky(肯塔基大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract)
AI总结 提出FoA-SR,基于偏好优化实现真实世界图像超分辨率,通过忠实和美观两种轮廓分别优化适配器,在RealSR和DIV2K上验证了可分离的恢复策略。
Comments 17 pages, 6 figures, 9 tables. Preprint
学习攻击与防御:通过GRPO对语言模型进行自适应红队测试
机构 * Microsoft AI Red Team(微软AI红队) ; Microsoft Azure(微软Azure)
专题命中 后训练与偏好优化 :language model(title);分类 cs.CL、cs.AI、cs.LG
AI总结 提出AdvGRPO框架,通过密集多通道奖励和分离优势归一化实现GRPO在攻击者-防御者联合优化中的稳定训练,产生高效可迁移攻击,防御者优于基线。
通过以感知为中心的过程奖励模型改进视觉-语言模型
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) ; Bytedance(字节跳动) ; University of California, San Diego(加州大学圣地亚哥分校) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 后训练与偏好优化 :language model(title,abstract)
AI总结 本文提出Perceval模型,通过token级错误定位提升视觉-语言模型的推理能力,通过感知驱动的监督策略实现细粒度训练与推理优化,实验显示在多个领域基准上显著提升性能。
Comments 8 pages
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 33099-33109
PaddleOCR-VL-1.6:通过欠优化区域精炼和渐进式后训练扩展文档解析前沿
机构 * PaddlePaddle Team, Baidu Inc.(百度公司PaddlePaddle团队)
专题命中 后训练与偏好优化 :post-training(title,abstract)
AI总结 提出PaddleOCR-VL-1.6,通过区域感知数据优化框架识别并增强前代模型的薄弱区域,结合渐进式后训练策略,在OmniDocBench v1.6上达到96.33%的新SOTA。
World2Act:基于世界模型动力学的潜在动作后训练
机构 * MBZUAI
专题命中 后训练与偏好优化 :post-training(title,abstract)
AI总结 提出World2Act框架,通过潜在空间对齐世界模型动力学与动作嵌入,避免像素级监督,在仿真和真实机器人上提升VLA策略的成功率。
Comments Updated version. Project page: https://wm2act.github.io/
位置:预/后训练边界应主导产业学术ML合作中的知识产权
专题命中 后训练与偏好优化 :post-training(title,abstract)
AI总结 本文提出PBOS合同模板,通过定义预训练和后训练成果的边界来解决产业学术ML合作中的知识产权问题,主张该模板应成为默认合同。
RankE: 用于离散文本到图像生成的端到端后训练方法 with Decoder Co-Evolution
机构 * Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; Tsinghua University(清华大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 后训练与偏好优化 :post-training(title,abstract)
AI总结 本文提出RankE,一种端到端的后训练框架,通过解码器与策略的协同进化,解决离散自回归文本到图像生成中策略优化导致的潜在协变量偏移问题,同时提升图像质量和对齐度。
SafeDiffusion-R1: 在线奖励引导用于安全扩散后训练
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Michigan State University(密歇根州立大学)
专题命中 后训练与偏好优化 :post-training(title,abstract)
AI总结 本文提出了一种在线强化学习框架,通过在负样本和正样本文本提示上进行后训练,利用组相对策略优化(GRPO)解决数据稀缺和模型退化问题,引入了引导奖励机制以提高扩散模型的安全性,实验表明其在减少不适当内容和提升生成质量方面表现优异。
Comments Page 28, Image 20, Table 6
具有事后训练可达性验证的安全强化学习用于机器人导航
机构 * University of Liverpool(利物浦大学) ; Université Grenoble Alpes(格勒诺布尔阿尔卑斯大学)
专题命中 后训练与偏好优化 :post-training(title,abstract)
AI总结 本文提出一种基于条件价值风险约束的强化学习框架,通过训练对高成本尾部结果敏感的策略,并在训练后利用神经网络可达性验证评估其安全边际,实验表明该方法在导航任务中实现了更高的安全验证率。
文本到图像模型的强化后训练与超线性优势塑造
机构 * Nanyang Technological University(南洋理工大学) ; Baidu Inc.(百度公司) ; Zhejiang University(浙江大学) ; City University of Hong Kong(香港城市大学) ; Tsinghua University(清华大学) ; Jimei University(集美大学)
专题命中 后训练与偏好优化 :post-training(title,abstract)
AI总结 本文提出超线性优势塑造方法,通过信息几何视角优化文本到图像模型的后训练过程,提升训练效率和生成质量,减少奖励黑客问题。
RewardHarness: 自我进化代理的后训练
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; Kolors Team, Kuaishou Technology(快手团队) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Waterloo(滑铁卢大学) ; Etude AI ; Tsinghua University(清华大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 后训练与偏好优化 :post-training(title);分类 cs.CL、cs.AI、cs.LG
AI总结 RewardHarness通过自我进化代理框架,利用少量人类偏好示例迭代优化工具库,实现高效图像编辑评估,准确率达47.4%,超越GPT-5 5.3个百分点。
Comments Project page: https://rewardharness.com
面向视觉语言模型的无对象幻觉强化反学习
机构 * Xiamen University(厦门大学)
专题命中 后训练与偏好优化 :language model(title,abstract)
AI总结 本文提出HFRU框架,通过视觉编码器深度语义删除,结合对齐破坏与GRPO优化,实现高效反学习,减少对象幻觉,实验显示在目标识别和人脸识别任务中性能优异。
NSFL:一种用于神经嵌入中布尔运算的后训练神经符号模糊逻辑框架
机构 * Huawei Tel-Aviv Research Center(华为特拉维夫研究中心)
专题命中 后训练与偏好优化 :post-training(title);分类 cs.CL、cs.AI、cs.LG
AI总结 NSFL框架通过适应形式t-范数和t-余范数,为神经嵌入空间提供多原子逻辑约束的计算方法,提升检索性能,实现高达81%的mAP提升。
Comments 23 pages (16 main + 7 appendix), 2 figures, 10 tables, 1 algorithm
ReinDriveGen:强化学习后训练用于分布外驾驶场景生成
机构 * MMLab, CUHK(MMLab,香港中文大学) ; CASIA(中国科学院自动化研究所) ; SenseTime Research(商汤科技研究院)
专题命中 后训练与偏好优化 :post-training(title,abstract)
AI总结 ReinDriveGen通过动态点云场景生成与强化学习后训练,实现对驾驶场景的可控生成,提升安全关键场景的模拟质量。
Comments Project page: https://drive-sim.github.io/ReinDriveGen/