arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4556 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4556 篇

2402.10342 2024-07-16 cs.LG cs.AI cs.CL 82%

Exploration-Driven Policy Optimization in RLHF: Theoretical Insights on Efficient Data Utilization

Yihan Du, Anna Winnicki, Gal Dalal, Shie Mannor, R. Srikant

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01057 2024-02-02 cs.LG cs.AI cs.CL 82%

RLHF and IIA: Perverse Incentives

Wanqiao Xu, Shi Dong, Xiuyuan Lu, Grace Lam, Zheng Wen, Benjamin Van Roy

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01320 2023-08-04 cs.LG cs.AI cs.CL 82%

DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales

Zhewei Yao, Reza Yazdani Aminabadi, Olatunji Ruwase, Samyam Rajbhandari, Xiaoxia Wu, Ammar Ahmad Awan, Jeff Rasley, Minjia Zhang, Conglong Li, Connor Holmes, Zhongzhu Zhou, Michael Wyatt, Molly Smith, Lev Kurilenko, Heyang Qin, Masahiro Tanaka, Shuai Che, Shuaiwen Leon Song, Yuxiong He

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11844 2025-12-17 cs.HC cs.CL cs.LG 82%

Love First, Know Later: Persona-Based Romantic Compatibility Through LLM Text World Engines

先爱后知:基于人设的浪漫兼容性通过LLM文本世界引擎

Haoyang Shang, Zhengyang Yan, Xuan Liu

机构 * BreathingCORE

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种基于LLM文本世界引擎的浪漫兼容性匹配方法,通过模拟互动预测人类偏好,实现个性化匹配系统。

Comments NeurIPS 2025 Workshop: First Workshop on LLM Persona Modeling (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02423 2024-03-26 cs.LG cs.AI cs.HC cs.RO 82%

Uni-RLHF: Universal Platform and Benchmark Suite for Reinforcement Learning with Diverse Human Feedback

Yifu Yuan, Jianye Hao, Yi Ma, Zibin Dong, Hebin Liang, Jinyi Liu, Zhixin Feng, Kai Zhao, Yan Zheng

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

Comments Published as a conference paper at ICLR 2024. The website is available at https://uni-rlhf.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21993 2026-08-25 cs.LG 新提交 81%

Gated Decoupled Compositional Bandits: A Unified Theory of Contextual Bandits with Supervised-Calibrated Action Scaling and Pre-Execution Gating

门控解耦组合多臂老虎机:带监督校准动作缩放与预执行门控的上下文多臂老虎机统一理论

Oleg Miroshnichenko

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 该研究提出门控解耦组合多臂老虎机(GDCB),证明其可统一多个工业系统,核心定理可将非平稳问题转化为近似平稳问题,还推广了相关结果,配套论文已验证短期租赁动态定价实例。

Comments 30 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19842 2026-08-21 cs.AI 新提交 81%

SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning

SAPO:用于智能体强化学习的单回滚自回归策略优化

Dayang Liang, Lang Feng, Bo An, Yunlong Liu

机构 * Xiamen University(厦门大学) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本研究针对智能体强化学习现有方法的三大局限,提出SAPO框架,其共享策略与价值函数的自回归主干,结合广义优势估计器,在ALFWorld、WebShop任务上性能优于PPO和GRPO,内存与计算效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18871 2026-08-17 cs.AI cs.NI 版本更新 81%

Bridging Network Fragmentation: A Semantic-Augmented DRL Framework for UAV-aided VANETs

弥合网络碎片化:一种语义增强的深度强化学习框架用于无人机辅助的VANETs

Gaoxiang Cao, Wenke Yuan, Huasen He, Yunpeng Hou, Xiaofeng Jiang, Shuangwu Chen, Jian Yang

机构 * Department of Automation, University of Science & Technology of China(中国科学技术大学自动化系)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出语义增强深度强化学习框架,通过语义推理优化无人机在VANETs中的部署,提升网络连通性与效率。

Comments Revised version. This update includes substantial improvements to the methodology, ablation studies, temporal robustness analysis, and cross-city generalization experiments. Submitted to IEEE Transactions on Cognitive Communications and Networking. 15 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11274 2026-08-13 cs.CR cs.AI 新提交 81%

Agent Safety Should Be a Runtime Contract

智能体安全应成为运行时契约

Albus W. Ng, Yi Han, Jusheng Zhang, Wenhao Wang

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 该研究指出将AI安全仅在训练阶段植入的范式不足,提出智能体安全应是兼具预防与证据层面的运行时契约,通过四类公开证据支撑该立场并给出研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27733 2026-08-13 cs.LG stat.ML 版本更新 81%

Mind the Gap: Structure-Aware Consistency in Preference Learning

注意间隙:在偏好学习中的结构感知一致性

Mehryar Mohri, Yutao Zhong

机构 * Google Research(谷歌研究) Courant Institute of Mathematical Sciences(数学科学学院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出结构感知H一致性框架,通过引入SA-DPO目标函数,改进偏好学习中的一致性问题,证明重尾 surrogate 在容量受限模型中具有更好的一致性保证。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06296 2026-08-11 cs.LG 版本更新 81%

On-Policy Self-Distillation without Any Supervision

无任何监督的在线策略自蒸馏

Yijiang Li, Bingyang Wang, Yijun Liang, Yunjie Tian, Di Fu, Nuno Vasconcelos

机构 * UC San Diego(加州大学圣迭戈分校) Georgia Institute of Technology(佐治亚理工学院) University of Maryland, College Park(马里兰大学帕克分校) ByteDance(字节跳动)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本研究提出无监督在线策略自蒸馏(U-OPSD),仅用模型自身生成结果实现在线策略自蒸馏,在多数学基准上优于基础模型,部分场景超越OPSD、GRPO等监督方法。

Comments Project page at https://williamium3000.github.io/u-opsd/ and code at https://github.com/williamium3000/u-opsd

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01822 2026-08-04 cs.AI 新提交 81%

SearchMaster: Grounded and Regulated Self-Play for Search Agents

SearchMaster:面向搜索智能体的基于接地与调控的自博弈框架

Wentao Tan, Qiong Cao, Jiaqi Wang, Nan Duan

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出SearchMaster自博弈框架,通过ECG、SDR、OOP三项调控措施优化LLM搜索智能体训练,在六个深度搜索基准上显著提升Qwen3.5-9B模型的平均准确率,无需人工标注数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22186 2026-08-04 cs.AI 版本更新 81%

Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning

解构离策略比率:用于异步强化学习的熵缩放信任区域

Guanqun Zhao, Zijun Xie, Binbin Zheng, Enlei Gong, Jiafeng Lu, Yehan Yang, Aoqi Hu, Zeyu Chen

机构 * Baidu(百度)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究异步强化学习中离策略数据问题,提出熵缩放信任区域(ESTR)方法,通过令牌局部熵缩放离策略偏差,无需辅助前向传递等,在多任务和基准测试中优于现有异步方法,提升训练-推理一致性与速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29185 2026-08-03 cs.CL 新提交 81%

Learning Latent Reasoning Traces for Scalar Reward Models End-to-End

学习标量奖励模型的端到端潜在推理轨迹

Sanwoo Lee, Clive Bai, Hsiu-Yuan Huang, Kun Liang, Weijie Liu, Yunfang Wu

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对奖励模型范式不匹配问题,提出LatentRM框架,将推理轨迹作为潜在变量端到端优化,在多任务上优于各类基准奖励模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18091 2026-07-21 cs.CV cs.GR cs.LG 新提交 81%

SciForma: Structure-Faithful Generation of Scientific Diagrams

SciForma:科学图表的结构忠实生成

Yuxuan Luo, Peng Zhang, Xinjie Zhang, Xun Guo, Zhouhui Lian, Yan Lu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) State Key Lab of CAD & CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Microsoft Research Asia(微软亚洲研究院)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);post-training(abstract);preference optimization(abstract);分类 cs.LG

AI总结 研究针对科学图表结构保真度问题,提出SciForma框架,分解图表质量为三个结构轴,用M-DPO优化,策划训练和评估数据,实现迭代编辑,使SciForma-9B超越开源基线和GPT-Image-1.5,提升科学图表生成的结构保真度。

Comments 30 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17499 2026-07-21 cs.AI 新提交 81%

Pailitao-MMSearch: Building Native E-Commerce Multimodal Search Foundation

派利淘-多模态搜索:构建原生电子商务多模态搜索基础

Xiaohan Ye, Xu Chen, Zihan Gong, Jian Ding, Lianyu Du, Baicheng Chen, Yunmeng Shu, Jingqian Zhao, Zhixiang Zhao, Shuaiqi Jia, Chong Ma, Shuwen Xiao, Xiangheng Kong, Yuan Gao, Jun Song, Jinsong Lan, Xiaoyong Zhu, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝及天猫集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);foundation model(abstract);post-training(abstract)

AI总结 针对电子商务多模态搜索问题,提出派利淘-多模态搜索基础模型,通过混合语义ID、两阶段持续预训练策略和混合推理后训练管道,在淘宝派利淘平台实现显著改进,提升了商品交易总额和交易量。

Comments Technical Report: Pailitao-MMSearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14485 2026-07-17 cs.AI 新提交 81%

Step-Level Preference Learning for Generative Agents in Social Simulations

社会模拟中生成式智能体的步骤级偏好学习

Wenchang Gao, Pingyue Sheng, Lanlan Qiu, Yunfei Ma, Jian Zhao, Baicheng Chen, Kangda Wang, Yuyang Tian, Shunqiang Mao, Tianxing He

机构 * Shanghai Qi Zhi Institute(上海期智研究院) Xiongan AI Institute(雄安人工智能研究院) Tsinghua University(清华大学) CUHK-Shenzhen(香港中文大学(深圳)) USTC(中国科学技术大学) Sun Yat-sen University(中山大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究基于大语言模型的生成式智能体模拟人类行为时中间步骤注释稀缺问题,引入交互式模拟界面收集步骤级人类偏好监督,经监督微调算法和直接偏好优化方法进行步骤级偏好学习,提升模拟效果,证明步骤级人类监督是有效训练信号。

Comments WAICA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08255 2026-07-10 cs.AI 新提交 81%

Compete Then Collaborate: Frontier AI Teachers Build a Verifiable Curriculum to Improve a Coding Student Beyond Imitation

竞争然后合作:前沿人工智能教师构建可验证课程以提升编码学生超越模仿

Miseong Shawn Kim

机构 * Genesis Cortex AI Inc.(创世纪皮层人工智能公司)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 研究探讨大型语言模型作教师时的教学问题,提出竞争然后合作框架,让四个前沿人工智能教师先对决排名,再合作构建课程提升学生。发现执行验证下教师解决标准问题情况,模仿不一定提升学生,合作课程能提升学生,强调合作构建可验证环境的价值。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13156 2026-07-07 cs.CV cs.AI 新提交 81%

Iterative Visual Thinking and the Self-Correction Mirage in VLM Grounding

迭代视觉思维:通过视觉反馈教会视觉语言模型空间自我修正

Animesh Tripathy, Aswanth Krishnan

机构 * QpiAI India Pvt. Ltd(QpiAI印度私人有限公司)

专题命中 后训练与偏好优化 :SFT(summary_cn,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出迭代视觉思维(IVT)框架,通过视觉反馈闭环和两阶段训练(SFT+GRPO),使视觉语言模型具备空间自我修正能力,在三个基准上提升指标2.4-3.2个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00602 2026-07-07 cs.CL 版本更新 81%

OpenSIR: Open-Ended Self-Improving Reasoner

OpenSIR: 开放式自我改进推理器

Wai-Chung Kwan, Joshua Ong Jun Leang, Pavlos Vougiouklis, Jeff Z. Pan, Marco Valentino, Pasquale Minervini

机构 * University of Edinburgh(爱丁堡大学) Imperial College London(伦敦帝国理工学院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出OpenSIR框架,通过多样性奖励和难度校准实现开放式自我对弈,无需外部验证器或标注数据,在七个数学基准上平均提升指令模型3.6分、推理模型3.1分,且唯一能泛化到通用推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24636 2026-07-02 cs.CL 版本更新 81%

OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning

OpenReward: 通过强化学习学习奖励长形式智能体任务

Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren

机构 * Leiden University(莱顿大学) Shandong University(山东大学) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出OpenRM,一种工具增强的长形式奖励模型,通过GRPO训练联合监督工具使用和结果准确性,在长形式任务中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31575 2026-07-01 cs.AI 新提交 81%

Which Tokens Matter? Adaptive Token Selection for RLVR with the Relative Surprisal Index

哪些Token重要?基于相对惊讶指数的自适应Token选择用于RLVR

Outongyi Lv, Yanzhao Zheng, Yuanwei Zhang, Zhenghao Huang, Xingjun Wang, Baohua Dong, Hangcheng Zhu, Yingda Chen

机构 * ModelScope Team(ModelScope团队) Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出相对惊讶指数(RSI)度量,通过自适应Token过滤方法RSI-S解决RLVR中高熵与低概率Token的矛盾,在AIME和AMC基准上提升avg@32准确率2-3个百分点。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01682 2026-07-01 cs.CL 版本更新 81%

The Bidirectional Process Reward Model

双向过程奖励模型

Lingyin Zhang, Jun Gao, Xiaoxue Ren, Ziqiang Cao

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Biomedical Basic Research Center of Jiangsu, Soochow University(苏州大学江苏省生物医学基础研究中心) School of Software Technology, Zhejiang University(浙江大学软件学院) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出双向过程奖励模型(BiPRM),通过并行左右评估流和门控机制融合分数,仅增加0.3%参数和5%延迟,在推理质量上平均提升10.6%。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29933 2026-06-30 cs.CL 81%

Towards Physical Intuitions for Alignment Dynamics: A Case Study With Randomness Crystallization

走向对齐动力学的物理直觉:以随机性结晶为例的案例研究

Kunal Samanta, Ari Holtzman, Peter West

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 通过类比热力学相变中的结晶过程,将语言模型对齐分解为三个相,并提出直观度量验证相变,为对齐动力学提供物理直觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28898 2026-06-30 cs.CL 81%

PASTA: A Paraphrasing And Self-Training Approach for Knowledge Updating in LLMs

PASTA: 一种用于大语言模型知识更新的释义与自训练方法

Takayuki Yamamoto, Daisuke Kawahara

机构 * Waseda University(早稻田大学)

专题命中 后训练与偏好优化 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出PASTA框架,通过数据增强、问答生成和自学习DPO过程,将新闻事实知识集成到LLM中,实现知识覆盖与幻觉抑制,准确率从0.02提升至0.82。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28710 2026-06-30 cs.AI cs.GT 81%

The Two Genie Game: Adoption and Welfare in Audit-Grounded AI Governance

双精灵博弈:审计基础AI治理中的采纳与福利

Darrell Lewis-Sandy

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);分类 cs.AI

AI总结 利用进化博弈论研究在竞争市场中,最小化危害的AI代理如何取代RLHF代理,并分析其采纳条件及对社区福利的影响。

Comments 36 pages, 3 figures. Lean 4 formalization and figure scripts: https://github.com/dlewissandy/two-genie-scripts

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27608 2026-06-29 cs.CV cs.LG 新提交 81%

Qwen-Image-2.0-RL Technical Report

Qwen-Image-2.0-RL 技术报告

Yixian Xu, Kaiyuan Gao, Yuxiang Chen, Yilei Chen, Zecheng Tang, Zihao Liu, Zikai Zhou, Deqing Li, Hao Meng, Kuan Cao, Jiahao Li, Jie Zhang, Liang Peng, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue Chen, Yan Shu, Yanran Zhang, Yi Wang, Yu Wu, Yujia Wu, Zekai Zhang, Zhendong Wang, Xiao Xu, Kun Yan, Chenfei Wu

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 提出基于强化学习与在线蒸馏的后训练流程,通过复合奖励模型和GRPO框架提升扩散模型的视觉质量与指令遵循能力,在多个基准上取得显著提升。

Comments 16 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12796 2026-06-24 cs.HC cs.AI 81%

Maximizing the efficiency of human feedback in AI alignment: a comparative analysis

最大化人类反馈在AI对齐中的效率:比较分析

Andreas Chouliaras, Dimitris Chatzopoulos

机构 * University College Dublin, Ireland(都柏林大学学院)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);分类 cs.AI

AI总结 本文探讨了RLHF中偏好推断的替代采样与评估策略,提出Swiss InfoGain方法在受限标注预算下表现更优,且更节省样本,提升了偏好学习的效率与鲁棒性。

Comments 17 pages, 6 figures, 6 algorithms. AICS2025

Journal ref 33rd International Conference on Artificial Intelligence and Cognitive Science (AICS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22652 2026-06-23 cs.LG stat.ML 新提交 81%

A Markov Chain Approach to Preference Alignment

一种偏好对齐的马尔可夫链方法

Takuya Koriyama, Tengyuan Liang

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);分类 cs.LG

AI总结 提出MCHF方法,通过直接利用成对偏好定义马尔可夫核实现生成模型对齐,理论证明其几何收敛速度由非传递结构量决定,并与NLHF和RLHF方法建立统一视角。

Comments 48 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13154 2026-06-23 cs.CL 版本更新 81%

The Alignment Veto: How Safety Training Suppresses Cultural Knowledge in LLMs

对齐否决:安全训练如何压制LLM中的文化知识

Pardis Sadat Zahraei, Gokhan Tur, Dilek Hakkani-Tür, Ehsaneddin Asgari

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Qatar Computing Research Institute(卡塔尔计算研究所) Hamad Bin Khalifa University(哈马德·本·卡伊夫大学)

专题命中 后训练与偏好优化 :LLM(title_cn);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究对齐训练与语言模型编码的文化价值观冲突时的内部机制,发现模型内部logit分布仍反映人类调查数据,但输出被压制,称为“对齐否决”,并区分了压制失败与表征偏差失败,揭示了安全税在国家间的不平等。

详情

展开后加载摘要…

URL PDF HTML 收藏