arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3278 篇

2608.08326 2026-08-12 cs.AI 版本更新 57%

StructReward: Efficient Structured Process Rewards for Self-Correcting Multimodal Reasoning

StructReward:用于自修正多模态推理的高效结构化过程奖励

Yifan Li, Ruxin Sun, Tongzhou Zhao

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本研究提出StructReward框架,通过结构化步骤级奖励对齐结合GRPO目标等方式,在无额外验证器的情况下降低多模态强化学习开销,实现自修正多模态推理。

Comments 9 pages, 3 figures. Yifan Li and Ruxin Sun contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08058 2026-08-11 cs.CY 新提交 57%

Representational Equality in Cross-country Value Simulation: A Systematic Analysis of Large Language Models

跨国价值观模拟中的表征平等:对大型语言模型的系统分析

Xiaowen Jian, Xinyi Mou, Daisong Gong, Chen Qian, Huimin Chen, Maosong Sun

专题命中 偏好对齐 :alignment(abstract);分类 cs.CY

AI总结 本研究分析59国的LLM跨国价值观模拟,发现富裕技术先进国家人群模拟更准确,且两种干预路径的准确率提升未必带来表征平等,为构建更具包容性的LLM模拟提供指导。

Comments Accepted for publication in Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07509 2026-08-11 cs.HC cs.AI 新提交 57%

PIVOT: Preference-based Intervention Vectors for Pedagogical Tutor Steering

PIVOT:用于教学导师引导的基于偏好的干预向量

Fares Fawzi, Jiaxu Zhao, Tanya Nazaretsky, Tanja Käser

机构 * EPFL(洛桑联邦理工学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 研究针对LLM对话辅导缺乏教学策略推理时控制的问题,提出PIVOT框架,通过偏好干预向量实现导师动作控制,在用户研究中获多数教师认可。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00754 2026-08-11 cs.SE cs.LG 版本更新 57%

Themis: Training Robust Multilingual Code Reward Models for Flexible Multi-Criteria Scoring

Themis: 训练鲁棒的多语言代码奖励模型以实现灵活的多标准评分

Indraneil Paul, Goran Glavaš, Iryna Gurevych

机构 * UKP Lab, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(UKP实验室,德累斯顿理工大学及应用网络安全国家研究中心ATHENE)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文提出Themis-CodeRewardBench基准,评估多语言多标准代码奖励模型,训练了Themis-RM系列模型,展示了其在多语言迁移和多标准训练中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00997 2026-08-11 cs.CL 版本更新 57%

Uncertainty-Aware Variational Reward Factorization via Probabilistic Preference Bases for LLM Personalization

基于概率偏好基的不确定性感知变分奖励分解用于大语言模型个性化

Gyuseok Lee, Wonbin Kweon, Zhenrui Yue, SeongKu Kang, Jiawei Han, Dong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Korea University(高丽大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出变分奖励分解框架,通过概率偏好基和变分分布实现用户偏好建模,提升LLM个性化效果。

Comments COLM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07419 2026-08-10 cs.LG 新提交 57%

Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration

超越事后温度缩放:用于大语言模型校准的双层优化方法

Ruochen Jin, Zhanliang Wang, Zongyu Dai, Jiancong Xiao, Bojian Hou

机构 * Dartmouth College(达特茅斯学院) University of Pennsylvania(宾夕法尼亚大学) National University of Singapore(新加坡国立大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 针对LLM偏好对齐导致的过度自信与校准问题,提出基于双层优化的校准方法,通过最大化预测分布熵实现,在多项选择与开放式问答任务中提升了校准效果与域外泛化能力。

Comments Third Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03808 2026-08-06 cs.CV cs.LG 版本更新 57%

From Brute Force to Semantic Insight: Performance-Guided Data Transformation Design with LLMs

从暴力到语义洞察:基于LLM的性能引导数据转换设计

Usha Shrestha, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg(计算机视觉实验室、CAIDAS与IFI、乌尔姆大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种基于LLM的性能引导数据转换设计方法,通过经验反馈实现闭环优化,减少穷举搜索需求,提升代码生成的准确性与任务对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03892 2026-08-05 cs.AI 新提交 57%

Intertemporal Preference Steering in Qwen3 via Contrastive Activation Addition

通过对比激活加法实现Qwen3的跨期偏好调控

Michal Mráz, Justin Shenk

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

AI总结 本研究针对Qwen3-32B大模型,通过对比线性探针识别时间范围方向,利用对比激活加法调控实现跨期偏好的双向大幅改变,还提升了规划相关能力,为相关AI系统及安全问题提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01835 2026-08-04 cs.AI 新提交 57%

Rewriting or Reweighting? A Geometric Account in Language Models

重写还是重加权?语言模型中的几何视角

Juntong Wang, Shengkun Yang, Xiyuan Wang, Muhan Zhang

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本研究提出行为流形分析方法,通过ACT与NOC空间的几何视角,发现监督微调重写语言模型行为几何、奖励优化重加权该几何的机制差异,为理解后训练目标提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01458 2026-08-04 cs.CL 新提交 57%

PALMs: Using Multi Construct-Grounded Rationales for Modeling Population Preferences in LLMs

PALMs:使用多构造基础理由对大语言模型中的群体偏好进行建模

Priyanka Dey, Brihi Joshi, Preyashi Poddar, Jieyu Zhao, Emilio Ferrara

机构 * University of Southern California(南加州大学) Information Sciences Institute(信息科学研究所)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 该研究提出了群体对齐语言模型PALMs,通过结合心理与文化构造的理由进行偏好调优,在多维度评估中优于基准模型,且下游任务泛化能力强

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00932 2026-08-04 cs.CL 新提交 57%

Gaokerena: A Small Persian Medical Language Model Family

Gaokerena:一个小型波斯语医疗语言模型家族

Mehrdad Ghassabi, Hamidreza Baradaran Kashani, Pedram Rostami, Sadra Hakim, Zahra Kazemi, Audrina Ebrahimi

机构 * University of Isfahan(伊斯法罕大学) University of Tehran(德黑兰大学) University of Windsor(温莎大学) Alzahra University(阿勒扎哈拉大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 偏好对齐 :safety(abstract);分类 cs.CL

AI总结 针对波斯语医疗语言模型研究不足的问题,该研究推出Gaokerena家族,包含Gaokerena-V和Gaokerena-R两款模型,在医疗问答基准上取得性能提升,还配备不确定性头,为本地化数字医疗提供基础但仍需完善。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01715 2026-08-04 cs.AI 版本更新 57%

Distributionally Robust Listwise Preference Optimization

分布鲁棒列表偏好优化

Xudong Wu, Jian Qian, Pangpang Liu, Vaneet Aggarwal, Jiayu Chen

机构 * The University of Hong Kong(香港大学) Yale University(耶鲁大学) Purdue University(普渡大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 针对列表偏好排序标签不确定性,提出点态全变差鲁棒Plackett-Luce目标,将内层最大化简化为排序,在离线和在线设置中均具有理论保证,实验表明能保持干净标签性能并提升噪声鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01350 2026-08-04 cs.CL 版本更新 57%

LLM Output Detectability and Task Performance Can be Jointly Optimized

大语言模型输出可检测性与任务性能可以联合优化

Koshiro Saito, Ryuto Koike, Masahiro Kaneko, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究所) MBZUAI National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) NII LLMC(日本信息基础设施中心LLMC)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 本文提出PUPPET框架,通过强化学习优化大语言模型,使其输出更易检测且在下游任务中表现更优,实验表明其在长文问答、摘要和作文写作中均优于传统水印方法。

Comments 15 pages, 9 figures, 20 tables. Code: https://github.com/pakapaka333/PUPPET

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27760 2026-07-31 cs.IR cs.AI 新提交 57%

Hierarchical Latent Reasoning for LLM-based Recommendation

面向基于大语言模型(LLM)的推荐系统的分层潜在推理方法

Peiyu Hu, Siying Gu, Weihai Lu, Zhuodong Liu, Yuntian Tang, Jiahao Liang, Yiying Xie, Jiang Rong, Zhaokai Luo, Zhiyong Wang, Jia Wang

机构 * Xiaohongshu(小红书) Peking University(北京大学) Beijing Jiaotong University(北京交通大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文针对基于LLM的推荐系统提出分层潜在推理框架HiLaR,通过层感知强化优化提升推荐性能,在四个Amazon基准数据集上优于多种主流基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27379 2026-07-31 cs.CL 新提交 57%

HSS-Synth: Humanities and Social Sciences Data Synthesis for LLMs

HSS-Synth:面向大语言模型的人文社科数据合成

Ru Peng, Tianyu Zhao, Xijun Gu, Zhiting Fan, Haokai Xu, Jinyang Zhang, Yawen Zeng, Yihong Zhuang, Kexin Yang, Junyang Lin, Dayiheng Liu, Junbo Zhao

机构 * Zhejiang University(浙江大学) Inclusion AI, Ant Group(蚂蚁集团Inclusion AI) Peking University(北京大学) Qwen Team, Alibaba Group(阿里巴巴集团通义千问团队)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文针对LLM的HSS数据稀缺问题,提出以学科为中心的HSS-Synth流水线,生成23.7万指令微调样本,使Qwen3-8B-Base达SOTA并提升相关能力。

Comments ACL Findings 2026 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25366 2026-07-29 cs.IR cs.LG 新提交 57%

Sharpness-aware Model Merging with Salience Recovery for LLM-based Cross-Domain Sequential Recommendation

基于大语言模型的跨域序列推荐的锐度感知模型融合与显著性恢复

Huwei Ji, Jiajie Su, Yuyuan Li, Xiaohua Feng, Chaochao Chen

机构 * Zhejiang University(浙江大学) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 研究基于大语言模型的跨域序列推荐中的问题,提出SharpRec框架,包含锐度感知几何对齐和偏好显著性激活模块,有效解决跨域知识冲突和性能饱和问题,实验证明其性能优于现有基准。

Comments Published in Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD '26). 12 pages, 6 figures, 4 tables. Code available at https://github.com/muyiahhh/SharpRec

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 9-13, 2026, Jeju Island, Republic of Korea, ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13434 2026-07-29 cs.CL 版本更新 57%

$M^2PO$: Multi-Perspective Multi-Pair Preference Optimization for Machine Translation

$M^2PO$:用于机器翻译的多视角多对偏好优化

Hao Wang, Linlong Xu, Heng Liu, Yangyang Liu, Xiaohu Zhao, Bo Zeng, Liangying Shao, Yichen Dong, Xinwei Wu, Jiang Zhou, Tianyu Dong, xiangxiang Zeng, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商业)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 研究针对机器翻译中主流方法受误导性奖励信号影响的问题,提出$M^2PO$框架,通过双视角机制和多对目标优化偏好,实验证明该框架能使模型性能提升,超越开源基线并接近专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14032 2026-07-28 cs.CL 版本更新 57%

RM-Distiller: Exploiting Generative LLM for Reward Model Distillation

RM-Distiller: 利用生成式大语言模型进行奖励模型蒸馏

Hongli Zhou, Hui Huang, Wei Liu, Chenglong Wang, Xingyuan Bu, Lvyuan Han, Fuhai Song, Muyun Yang, Wenhao Jiang, Hailong Cao, Tiejun Zhao

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 RM-Distiller通过系统利用教师LLM的精炼、评分和生成能力,提升奖励模型蒸馏效果,首次系统性地探索了生成式LLM在奖励建模中的应用。

Comments Accepted to IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20556 2026-07-27 cs.AI 版本更新 57%

KeySI: An Interaction Framework for Tuning Text Embeddings Based on Human Feedback

KeySI:基于人类反馈调整文本嵌入的交互框架

Yan Zhu, Y. Chen, Rebecca Faust

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 研究针对预训练语言模型调整难的问题,提出KeySI交互框架,通过基于关键词的概念规范实现特征级反馈,减少人工文档处理需求,经用户研究等评估,证明其能有效捕捉用户意图并改善嵌入对齐。

Comments Accepted to IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16431 2026-07-21 cs.CL 新提交 57%

RIMS: Preference Optimization via Smoothed Multi-pair Aggregation for Small-Scale LLM Retrieval-Augmented Generation

RIMS:通过平滑多对聚合进行偏好优化以实现小规模语言模型检索增强生成

Pei Tian, Zihan Dong, Tianci Liu, Linjun Zhang, Haoyu Wang

机构 * Columbia University(哥伦比亚大学) Rutgers University(罗格斯大学) Purdue University(普渡大学) SUNY Albany(纽约州立大学奥尔巴尼分校)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 研究针对小规模语言模型检索增强生成中对噪声证据敏感的问题,提出RIMS框架,通过合成偏好数据、软聚合机制及偏好优化,实现更好性能,在多基准测试中优于现有方法

Journal ref COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16117 2026-07-20 cs.CL 新提交 57%

Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content

语言编码的速率-效用前沿:在受控语言内容下比较词元、字节和像素

Ingo Ziegler, Martin Krebs, Desmond Elliott

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 研究在内容和下游能力受控时语言编码保留了什么,利用多语言平行句子通过共享瓶颈比较词元、字节和像素以追踪速率-效用前沿,评估三种效用,发现各编码在不同方面表现不同,选择编码需考虑多因素进行速率-效用权衡。

Comments Preprint. Code available at https://github.com/ziegler-ingo/rate-utility-frontiers

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13998 2026-07-16 cs.SI cs.AI cs.GT cs.MA 新提交 57%

The Dynamic Verifiable Multi-Agent Human Agentic Loyalty Loop (DVM-HALL) Model and the Net Human-Agent Score (NHAS) in Autonomous Commerce

自主商业中的动态可验证多智能体人类智能忠诚循环(DVM-HALL)模型与净人机分数(NHAS)

Sai Srikanth Madugula, Peplluis Esteva de la Rosa, Daya Shankar

机构 * School of Technology, Woxsen University(沃森大学技术学院) Universitat de Girona(格尔纳达大学) School of Sciences, Woxsen University(沃森大学科学学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 研究人工智能发展下传统客户忠诚度范式受扰问题,提出动态可验证多智能体人类智能忠诚循环(DVM-HALL)模型,通过特定公式及机制确定品牌选择、校准信任等,还引入净人机分数(NHAS)并给出实证验证计划,为品牌应对转变提供理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09570 2026-07-15 cs.CL cs.HC 版本更新 57%

UXBench: Benchmarking User Experience in AI Assistants

UXBench:AI助手中的用户体验基准测试

Mengze Hong, Xia Zeng, Zeyang Lei, Sheng Wang, Chen Jason Zhang, Di Jiang, Taiming Fu, Jinfeng Huang, Mengqiao Liu, Qinghe Chang, Haosheng Zou, Qiongyi Zhou, Sijun He, Simonjmdeng, Haojing Huang, Zijian Li, Lucas Mu Li, Fubao Zhang, Mona Zhou, Wei Ma, Yuan Hua, Qi Zhu, Shuo Jiang, Chenxuan Ma, Yuanmeng Zhang, Jian Song, Minlong Peng, Di Liang, Davey Chen

机构 * Hong Kong Polytechnic University(香港理工大学) Tencent(腾讯)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 提出首个基于真实用户反馈的用户中心基准UXBench,包含三个任务和7400个测试实例,评估26个前沿语言模型,发现用户反馈预测是可学习的能力,并揭示了LLM作为评判者的系统偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06362 2026-07-14 cs.AI 版本更新 57%

Do Implicit Personalization and Explicit Styles Conflict? PsPLUG: A Lightweight Plug-in for Balancing Personalization and Style in Customized LLMs

隐式个性化与显式风格冲突吗?PsPLUG:用于在定制大语言模型中平衡个性化与风格的轻量级插件

Yutong Song, Jiang Wu, Shaofan Yuan, Chengze Shen, Jian Wang, Yu Wang, Nikil Dutt, Amir M. Rahmani

机构 * University of California, Irvine(加州大学伊文斯顿分校) TikTok Inc.(TikTok公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 研究个性化大语言模型中显式风格指令与隐式用户偏好冲突问题,提出轻量级插件PsPLUG,它能在考虑风格后学习用户特定残差并可调整个性化强度,实验证明其能更好平衡个性化与风格遵循,保留用户偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05441 2026-07-08 cs.IR cs.AI 新提交 57%

PORTS: Preference-Optimized Retrievers for Tool Selection with Large Language Models

PORTS:用于大语言模型工具选择的偏好优化检索器

Lorenzo Molfetta, Giacomo Frisoni, Nicolò Monaldini, Gianluca Moro

机构 * Department of Computer Science and Engineering, University of Bologna(计算机科学与工程系,博洛尼亚大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 研究针对大语言模型工具选择中现有检索器与LLMs不一致问题,提出PORTS方法,利用受困惑度启发的偏好信号,通过优化相关性及施加对比语义损失微调检索器,经多实验验证其通用性及提高工具选择准确性的能力,且计算需求低便于推广。

Comments Please cite the definitive, peer-reviewed version of this article published in the Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, edited by Christos Christodoulopoulos et al., Association for Computational Linguistics, pp. 10007-10030, 2025. DOI: https://doi.org/10.18653/v1/2025.emnlp-main.507

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, Association for Computational Linguistics, pp. 10007-10030, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03025 2026-07-07 cs.AI cs.MA 新提交 57%

Human-Centric Reflective Architecture for Human-AI Collaborative Decision-Making

用于人类与人工智能协作决策的以人类为中心的反思架构

Andreas Kouridakis, Dimitrios Patiniotis Spyropoulos, George Vouros

机构 * University of Piraeus(比雷埃夫斯大学)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

AI总结 研究人类与人工智能协作决策问题,将其建模为随机博弈,提出以人类为中心的反思架构,整合人类校准模型与强化学习智能体,提升决策有效性并给出高质量建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01392 2026-07-07 cs.CL 新提交 57%

Multi-Objective Exploration and Preference Optimization via Mutual Information

基于互信息的多目标探索与偏好优化

Hongyan Xie, Yikun Ban, Ruiyu Fang, Zixuang Huang, Deqing Wang, Jianxin Li, Shuangyong Song

机构 * School of Computer, Beihang University(北京航空航天大学计算机学院) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰AGI实验室,中国电信人工智能技术(北京)有限公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 提出MI-EPO框架,通过最大化生成响应、偏好反馈和偏好向量的联合条件互信息,统一多目标探索与对齐,实现可控且稳定的多目标权衡。

Comments Accepted at ECML/PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07145 2026-07-07 cs.LG 57%

Failures Are Fated, But Can Be Faded: Characterizing and Mitigating Unwanted Behaviors in Large-Scale Vision and Language Models

失败是注定的,但可以被淡化:在大规模视觉和语言模型中表征和缓解 unwanted 行为

Som Sagar, Aditya Taparia, Ransalu Senanayake

机构 * School of Computing and Augmented Intelligence, Arizona State University, Tempe, United States of America(计算与增强智能学院,亚利桑那州立大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文提出利用深度强化学习表征和缓解大规模视觉和语言模型中的失败模式,通过有限的人类反馈重构失败景观,验证了方法在计算机视觉、自然语言处理和视觉-语言任务中的有效性。

Comments 25 pages, 35 figures

Journal ref Proceedings of the 41st International Conference on Machine Learning (ICML 2024), PMLR 235:42999-43023, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24636 2026-07-02 cs.CL 版本更新 57%

OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning

OpenReward: 通过强化学习学习奖励长形式智能体任务

Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren

机构 * Leiden University(莱顿大学) Shandong University(山东大学) Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 提出OpenRM,一种工具增强的长形式奖励模型,通过GRPO训练联合监督工具使用和结果准确性,在长形式任务中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31800 2026-07-01 cs.AI 新提交 57%

Evo-PI: Aligning Medical Reasoning via Evolving Principle-Guided Supervision

Evo-PI:通过演化原则引导的对齐医学推理

Xianda Zheng, Huan Gao, Meng-Fen Chiang, Michael Witbrock, Kaiqi Zhao, Shangyang Li

机构 * School of Computer Science, University of Auckland(奥克兰大学计算机科学学院) Beijing University of Posts and Telecommunications(北京邮电大学) Renyixun Health Technology Co., Ltd.(仁医讯健康科技有限公司) National Yang Ming Chiao Tung University(国立阳明交通大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 提出Evo-PI框架,将推理原则作为可演化的语言监督信号,通过协同进化循环动态调整模型推理,在医学视觉问答中提升准确率最高达24.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏