arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4541 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4541 篇

2601.21985 2026-01-30 cs.LG 57%

Elign: Equivariant Diffusion Model Alignment from Foundational Machine Learning Force Fields

Elign:从基础机器学习力场中等效扩散模型对齐

Yunyang Li, Lin Huang, Luojia Xia, Wenhe Zhang, Mark Gerstein

机构 * Department of Computer Science, Yale University, New Haven, USA(计算机科学系,耶鲁大学,新 Haven,USA) Program in Computational Biology and Biomedical Informatics, Yale University, New Haven, USA(计算生物学与生物医学信息学项目,耶鲁大学,新 Haven,USA) IQuestLab

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 Elign通过结合基础机器学习力场和强化学习优化,实现了等效扩散模型的对齐,提升分子构象生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21943 2026-01-30 cs.LG cs.IT math.IT 57%

Entropy-Based Dimension-Free Convergence and Loss-Adaptive Schedules for Diffusion Models

基于熵的无维度收敛和损失自适应调度方法用于扩散模型

Ahmad Aghapour, Erhan Bayraktar, Ziqing Zhang

机构 * Department of Mathematics, University of Michigan(数学系,密歇根大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出基于熵的无维度收敛方法和损失自适应调度,通过信息论方法提升扩散模型的采样效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11144 2026-01-30 cs.IR cs.AI 57%

Deep GraphRAG: A Balanced Approach to Hierarchical Retrieval and Adaptive Integration

深度图RAG:一种面向层次检索与自适应整合的平衡方法

Yuejie Li, Ke Yang, Tao Wang, Bolin Chen, Bowen Li, Chengjun Mao

机构 * Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI

AI总结 Deep GraphRAG通过分层检索与自适应整合方法,在效率与全面性之间取得平衡,利用动态奖励机制提升知识整合性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06165 2026-01-29 cs.LG eess.SP math.ST stat.ML stat.TH 57%

Higher-Order Feature Attribution: Bridging Statistics, Explainable AI, and Topological Signal Processing

高阶特征归因:连接统计学、可解释AI与拓扑信号处理

Kurt Butler, Guanchao Feng, Petar Djuric

机构 * School of Engineering, The University of Edinburgh(爱丁堡大学工程学院) Causality in Healthcare AI Hub (CHAI)(医疗AI因果性研究中心) Department of Electrical and Computer Engineering, Stony Brook University(石溪大学电气与计算机工程系)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出高阶特征归因理论,基于集成梯度方法,连接统计学与拓扑信号处理,扩展可解释AI框架并验证其有效性。

Comments 5 pages, 3 figures, to be published in the Proceedings of ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19063 2026-01-28 cs.CL cs.SD 57%

Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback

通过AI反馈强化学习优化语音对话系统的对话质量

Siddhant Arora, Jinchuan Tian, Jiatong Shi, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe

机构 * Carnegie Mellon University(卡内基梅隆大学) Sony Group Corporation(索尼集团)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.CL

AI总结 本文提出多奖励RLAIF框架,通过结合语义、音频质量和情感一致性奖励,提升语音对话系统的对话质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23581 2026-01-28 cs.LG 57%

GraphRAG-R1: Graph Retrieval-Augmented Generation with Process-Constrained Reinforcement Learning

GraphRAG-R1: 基于过程约束强化学习的图检索增强生成

Chuanyue Yu, Kuo Zhao, Yuhan Li, Heng Chang, Mingjian Feng, Xiangzhe Jiang, Yufei Sun, Jia Li, Yuzhi Zhang, Jianxin Li, Ziwei Zhang

机构 * Nankai University(南开大学) Huawei Technologies Ltd(华为技术有限公司) Beihang University(北航)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.LG

AI总结 GraphRAG-R1通过过程约束强化学习提升LLM多跳推理能力,结合改进的GRPO方法和两种新型奖励函数,有效解决复杂问题。

Comments Accepted by the Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18824 2026-01-28 cs.GT cs.AI 57%

Differential Voting: Loss Functions For Axiomatically Diverse Aggregation of Heterogeneous Preferences

差异投票:用于异质偏好axiomatically多样聚合的损失函数

Zhiyu An, Duaa Nakshbandi, Wan Du

机构 * University of California, Merced(加州大学梅尔德分校)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI

AI总结 差异投票提出了一种统一框架,通过可微损失函数实现异质偏好聚合,支持多种经典投票规则,提升RLHF中偏好聚合的可控性和理论保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17008 2026-01-27 cs.LG 57%

Turn-PPO: Turn-Level Advantage Estimation with PPO for Improved Multi-Turn RL in Agentic LLMs

Turn-PPO:基于PPO的回合级优势估计以提升代理语言模型中的多回合强化学习

Junbo Li, Peng Zhou, Rui Meng, Meet P. Vadera, Lihong Li, Yang Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Amazon(亚马逊)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.LG

AI总结 本研究提出turn-PPO,通过回合级MDP公式化提升多回合强化学习在代理语言模型中的表现,验证其在WebShop和Sokoban数据集上的有效性。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16400 2026-01-26 cs.CL 57%

Clarify or Answer: Reinforcement Learning for Agentic VQA with Context Under-specification

澄清或回答:基于上下文不充分的代理视觉问答强化学习

Zongwan Cao, Bingbing Wen, Lucy Lu Wang

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 后训练与偏好优化 :prompting(abstract);分类 cs.CL

AI总结 CoA通过强化学习解决上下文不充分的视觉问答问题,通过生成聚焦问题澄清歧义,提升问答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13018 2026-01-26 cs.LG q-bio.QM 57%

Escaping Local Optima in the Waddington Landscape: A Two-Stage TRPO-PPO Approach for Single-Cell Perturbation Analysis

摆脱Waddington景观的局部极值:一种用于单细胞扰动分析的两阶段TRPO-PPO方法

Francis Boabang, Samuel Asante Gyamerah

机构 * Department of Mathematics, Toronto Metropolitan University(数学系,多伦多 Metropolitan 大学)

专题命中 后训练与偏好优化 :pretraining(abstract);分类 cs.LG

AI总结 本文提出一种两阶段TRPO-PPO方法,用于单细胞扰动分析,通过改进初始化策略提升模型在数字双胞胎系统中的泛化能力。

Comments 17 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08421 2026-01-14 cs.LG 57%

Coverage Improvement and Fast Convergence of On-policy Preference Learning

策略学习中的覆盖改进与快速收敛

Juno Kim, Jihun Yun, Jason D. Lee, Kwang-Sung Jun

机构 * UC Berkeley(伯克利大学) KRAFTON(KRAFTON公司) University of Arizona(亚利桑那大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.LG

AI总结 本文提出覆盖改进原理,通过分析在线策略学习中的覆盖变化,证明其在批量大小足够时能实现快速收敛,并设计混合采样器和奖励蒸馏方案,提升语言模型对齐性能。

Comments 46 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06021 2026-01-12 cs.CL 57%

Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards

证据链的构建:基于引用感知的鲁棒深度搜索代理强化学习

Jiajie Zhang, Xin Lv, Ling Feng, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学) Zhipu AI(智谱AI)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL

AI总结 本文提出引用感知评分框架和组相对策略优化方法,用于提升深度搜索代理的鲁棒性和推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23971 2026-01-01 cs.CL 57%

CEC-Zero: Zero-Supervision Character Error Correction with Self-Generated Rewards

CEC-Zero: 无监督字符错误纠正与自生成奖励

Zhiming Lin, Kai Zhao, Sophie Zhang, Peilai Yu, Canran Xiao

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL

AI总结 CEC-Zero通过无监督强化学习框架,利用自动生成的奖励在无需标注的情况下提升大语言模型的字符错误纠正能力,实现了在多个基准测试中的性能提升。

Comments AAAI'26 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23464 2025-12-30 cs.CV cs.AI cs.GR 57%

HY-Motion 1.0: Scaling Flow Matching Models for Text-To-Motion Generation

HY-Motion 1.0:基于流匹配模型的文本到运动生成规模化研究

Yuxin Wen, Qing Shuai, Di Kang, Jing Li, Cheng Wen, Yue Qian, Ningxin Jiao, Changhai Chen, Weijie Chen, Yiran Wang, Jinkun Guo, Dongyue An, Han Liu, Yanyu Tong, Chao Zhang, Qing Guo, Juan Chen, Qiao Zhang, Youyi Zhang, Zihao Yao, Cheng Zhang, Hong Duan, Xiaoping Wu, Qi Chen, Fei Cheng, Liang Dong, Peng He, Hao Zhang, Jiaxin Lin, Chao Zhang, Zhongyi Fan, Yifan Li, Zhichao Hu, Yuhong Liu, Linus, Jie Jiang, Xiaolong Li, Linchao Bao

机构 * Tencent Hunyuan 3D Digital Human Team(腾讯文盈3D数字人团队)

专题命中 后训练与偏好优化 :pretraining(abstract);分类 cs.AI

AI总结 HY-Motion 1.0通过大规模流匹配模型实现文本到3D人体运动的生成,采用全流程训练范式提升运动生成精度和多样性。

Comments Github: see https://github.com/Tencent-Hunyuan/HY-Motion-1.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21921 2025-12-29 cs.CV cs.IR cs.LG 57%

AutoPP: Towards Automated Product Poster Generation and Optimization

AutoPP:迈向自动化产品海报生成与优化

Jiahao Fan, Yuxin Qin, Wei Feng, Yanyin Chen, Yaoyu Li, Ao Ma, Yixiu Li, Li Zhuang, Haoyi Bian, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law

机构 * Project Leader and Corresponding Author(项目负责人及通讯作者)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.LG

AI总结 AutoPP 通过自动化流程生成和优化产品海报,利用统一设计模块和元素渲染模块,结合在线反馈提升点击通过率,实现高质量的海报生成与优化。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21351 2025-12-29 cs.SE cs.AI cs.NE 57%

CosmoCore-Evo: Evolutionary Dream-Replay Reinforcement Learning for Adaptive Code Generation

CosmoCore-Evo: 基于进化梦回的强化学习用于自适应代码生成

Santhosh Kumar Ravindran

机构 * Microsoft Corporation(微软公司)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI

AI总结 CosmoCore-Evo通过进化算法提升代码生成的适应性和新颖性,实现更高性能和更快适应。

Comments 10 pages, 2 figures; Code for Simulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04332 2025-12-25 cs.LG 57%

Data-regularized Reinforcement Learning for Diffusion Models at Scale

大规模扩散模型中的数据正则化强化学习

Haotian Ye, Kaiwen Zheng, Jiashu Xu, Puheng Li, Huayu Chen, Jiaqi Han, Sheng Liu, Qinsheng Zhang, Hanzi Mao, Zekun Hao, Prithvijit Chattopadhyay, Dinghao Yang, Liang Feng, Maosheng Liao, Junjie Bai, Ming-Yu Liu, James Zou, Stefano Ermon

机构 * Stanford University(斯坦福大学) NVIDIA Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 DDRL通过数据正则化方法提升扩散模型的奖励表现,有效缓解奖励黑客问题,实现高分辨率视频生成中的高人偏好和可扩展训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20173 2025-12-24 cs.AI 57%

Offline Safe Policy Optimization From Heterogeneous Feedback

基于异质反馈的离线安全策略优化

Ze Gong, Pradeep Varakantham, Akshat Kumar

机构 * Shenzhen Institute of Advanced Technology (SIAT), CAS(深圳先进技术研究院(SIAT)、中国科学院) Singapore Management University(新加坡管理学院)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI

AI总结 本文提出PreSa方法,通过直接学习基于偏好和安全性的策略,解决离线安全强化学习中的性能下降问题。

Comments Accepted at AAMAS 2026 (Extended Abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17370 2025-12-23 cs.RO cs.AI 57%

TakeAD: Preference-based Post-optimization for End-to-end Autonomous Driving with Expert Takeover Data

TakeAD: 基于偏好的端到端自动驾驶后优化方法与专家接管数据

Deqing Liu, Yinfeng Gao, Deheng Qian, Qichao Zhang, Xiaoqing Ye, Junyu Han, Yupeng Zheng, Xueyi Liu, Zhongpu Xia, Dawei Ding, Yifeng Pan, Dongbin Zhao

机构 * The State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Automation and Electrical Engineering, University of Science and Technology Beijing(北京科技大学自动化与电气工程学院) Chongqing Chang’an Technology Co., Ltd.(重庆长安科技有限公司)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

AI总结 TakeAD通过基于偏好的后优化框架利用专家接管数据,提升端到端自动驾驶闭环性能。

Comments This work has been accepted by IEEE RA-L. Manuscript submitted: July, 8, 2025; Accepted: November, 24, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22182 2025-12-22 cs.IR cs.AI cs.CV 57%

Sell It Before You Make It: Revolutionizing E-Commerce with Personalized AI-Generated Items

在制作之前就出售它:通过个性化AI生成物品革新电子商务

Jianghao Lin, Peng Du, Jiaqi Liu, Weite Li, Yong Yu, Weinan Zhang, Yang Cao

机构 * Antai College of Economics and Management(经济管理学院) Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

AI总结 本文提出PerFusion框架,通过个性化AI生成物品提升电子商务的点击率和转化率,同时降低退货率。

Comments Accepted by KDD 2026 ADS Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12767 2025-12-19 q-bio.NC cond-mat.dis-nn cs.LG hep-th math.PR 57%

Random matrix theory of sparse neuronal networks with heterogeneous timescales

稀疏神经网络的随机矩阵理论:具有异质时间尺度的神经网络

Thiparat Chotibut, Oleg Evnin, Weerawit Horinouchi

机构 * Complex Systems, Department of Physics, Faculty of Science, Chulalongkorn University, Bangkok, Thailand High Energy Physics Research Unit, Faculty of Science, Chulalongkorn University, Bangkok, Thailand International Solvay Institutes, Brussels, Belgium Mark Kac Center for Complex Systems Research, Jagiellonian University, Krak\'ow, Poland Department of Mathematics, King's College London, London, UK

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 研究通过随机矩阵理论分析稀疏神经网络的动态特性,揭示了异质时间尺度对工作记忆计算稳定性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13678 2025-12-16 cs.CV cs.AI 57%

Feedforward 3D Editing via Text-Steerable Image-to-3D

通过文本可控的图像到3D进行前馈编辑

Ziqi Ma, Hongqiao Chen, Yisong Yue, Georgia Gkioxari

机构 * California Institute of Technology(加州理工学院)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

AI总结 Steer3D通过文本可控的图像到3D生成方法,实现高效且准确的3D资产编辑,速度提升显著。

Comments https://glab-caltech.github.io/steer3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13171 2025-12-15 cs.RO cs.AI 57%

Aligning Humans and Robots via Reinforcement Learning from Implicit Human Feedback

通过隐式人类反馈进行人与机器人对齐的强化学习

Suzie Kim, Hye-Bin Shin, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学) Department of Brain and Cognitive Engineering, Korea University(脑科学与认知工程系,韩国大学)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI

AI总结 通过隐式人类反馈的强化学习方法,利用脑电图信号提升机器人与人类的对齐能力。

Comments Accepted to IEEE Int. Conf. Syst., Man, Cybern. (SMC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08449 2025-12-10 cs.AI 57%

From Accuracy to Impact: The Impact-Driven AI Framework (IDAIF) for Aligning Engineering Architecture with Theory of Change

从准确度到影响:用于对齐工程架构与影响理论的影响力驱动AI框架(IDAIF)

Yong-Woon Kim

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI

AI总结 IDAIF通过整合影响理论与AI架构,提供了一种以影响为中心的AI开发框架,旨在提升AI系统的伦理性和社会价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08129 2025-12-10 cs.LG 57%

Improving the Sensitivity of Backdoor Detectors via Class Subspace Orthogonalization

通过类别子空间正交化提高后门检测器的灵敏度

Guangmingmei Yang, David J. Miller, George Kesidis

机构 * School of EECS, Penn State(EECS学院,宾夕法尼亚州立大学) Anomalee Inc.(Anomalee公司) University Park, PA, USA(宾夕法尼亚州大学公园分校) State College, PA, USA(宾夕法尼亚州州立大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出通过抑制类别内在特征并正交化以提高后门检测器灵敏度,针对混合标签和自适应攻击进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00050 2025-12-02 cs.RO cs.AI 57%

Reinforcement Learning from Implicit Neural Feedback for Human-Aligned Robot Control

从隐式神经反馈强化学习实现人对齐的机器人控制

Suzie Kim

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI

AI总结 本文提出利用隐式神经反馈的强化学习框架,通过脑电图信号实现人对齐的机器人控制,实验表明其在复杂任务中表现与人工设计奖励相当。

Comments Master's thesis, Korea University, 2025. arXiv admin note: substantial text overlap with arXiv:2507.13171

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22982 2025-12-01 cs.CV cs.AI 57%

Ovis-Image Technical Report

Ovis-Image 技术报告

Guo-Hua Wang, Liangfu Cao, Tianyu Cui, Minghao Fu, Xiaohao Chen, Pengxin Zhan, Jianshan Zhao, Lan Li, Bowen Fu, Jiaqi Liu, Qing-Guo Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 Ovis-Image 是一个70亿参数的文本到图像模型,通过优化的多模态主干和文本聚焦训练方法,在紧凑架构下实现与大型开源模型相当的文本渲染性能。

Comments Code is released at https://github.com/AIDC-AI/Ovis-Image

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04340 2025-12-01 cs.LG cs.HC 57%

Interactive Groupwise Comparison for Reinforcement Learning from Human Feedback

基于交互式组间比较的强化学习从人类反馈中学习

Jan Kompatscher, Danqing Shi, Giovanna Varni, Tino Weinkauf, Antti Oulasvirta

机构 * Aalto University(阿尔托大学) University of Cambridge(剑桥大学) University of Trento(特伦特大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.LG

AI总结 本文提出交互式组间比较方法,通过可视化和主动学习提升强化学习从人类反馈中学习的奖励和策略效果。

Comments 10 pages, 8 figures in proceedings of Computer Graphics Forum

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18919 2025-11-25 cs.CV cs.AI 57%

Learning What to Trust: Bayesian Prior-Guided Optimization for Visual Generation

学习信任什么:基于贝叶斯先验引导的视觉生成优化

Ruiying Liu, Yuanzhi Liang, Haibin Huang, Tianshu Yu, Chi Zhang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出贝叶斯先验引导优化方法,通过建模奖励不确定性提升视觉生成模型的语义对齐和感知保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17869 2025-11-25 cs.LG 57%

The Horcrux: Mechanistically Interpretable Task Decomposition for Detecting and Mitigating Reward Hacking in Embodied AI Systems

霍克鲁斯:用于检测和缓解具身AI系统中奖励黑客行为的可解释任务分解

Subramanyam Sahoo, Jared Junkin

机构 * Berkeley AI Safety Initiative (BASIS) UC Berkeley(伯克利人工智能安全计划(BASIS)伯克利大学) Department of Electrical and Computer Engineering Johns Hopkins University(电气与计算机工程系约翰霍普金斯大学)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.LG

AI总结 本研究提出MITD方法,通过可解释性任务分解有效检测和缓解具身AI系统中的奖励黑客行为,实验表明分解深度可显著降低奖励黑客频率。

Comments Accepted to the NeurIPS (Mexico City) 2025 Workshop on Embodied and Safe-Assured Robotic Systems (E-SARS). Thanks to Aman Chadha

详情

展开后加载摘要…

URL PDF HTML 收藏