arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2602.05261 2026-02-06 cs.CL 70%

Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR

长度无偏序列策略优化:揭示和控制RLVR中的响应长度变化

Fanfan Liu, Youyang Yin, Peng Shi, Siqi Yang, Zhixiong Zeng, Haibo Qiu

机构 * Meituan(美团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出LUSPO算法,通过消除长度偏差解决RLVR中响应长度崩溃问题,并在多个任务中展示出优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04486 2026-02-05 cs.CL 70%

Beyond Unimodal Shortcuts: MLLMs as Cross-Modal Reasoners for Grounded Named Entity Recognition

超越单模态捷径:MLLMs作为跨模态推理器用于 grounded 命名实体识别

Jinlong Ma, Yu Zhang, Xuefeng Bai, Kehai Chen, Yuwei Wang, Zeming Liu, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MCR方法,通过多风格推理模式注入和约束引导的可验证优化,解决MLLMs在跨模态推理中的模态偏见问题,提升 grounded 命名实体识别的性能。

Comments GMNER

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02033 2026-02-04 cs.CV cs.AI cs.MM 70%

One Size, Many Fits: Aligning Diverse Group-Wise Click Preferences in Large-Scale Advertising Image Generation

一个尺寸,多种适配:在大规模广告图像生成中对多样化群体点击偏好进行对齐

Shuo Lu, Haohan Wang, Wei Feng, Weizhen Wang, Shen Zhang, Yaoyu Li, Ao Ma, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Bing Zhan, Yuan Xu, Huizai Yao, Yongcan Yu, Chenyang Si, Jian Liang

机构 * NLPR & MAIS, CASIA(中国科学院长春光学精密机械与物理研究所 & 中国科学院自动化所) School of AI, UCAS(中国科学院大学人工智能学院) HKUST(gz)(香港科技大学) PRLab, NJU(南京大学PRLab)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出OSMF框架,通过自适应分组和群组感知多模态模型,解决广告图像生成中用户群体点击偏好多样性的优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01603 2026-02-03 stat.ML cs.LG 70%

Inference-Aware Meta-Alignment of LLMs via Non-Linear GRPO

通过非线性GRPO实现LLM的推理感知元对齐

Shokichi Takakura, Akifumi Wachi, Rei Higuchi, Kohei Miyaguchi, Taiji Suzuki

机构 * LY Corporation(LY公司) The University of Tokyo(东京大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出IAMA方法,通过非线性GRPO实现LLM在有限计算资源下的多标准对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01443 2026-02-03 cs.AI 70%

SimGym: Traffic-Grounded Browser Agents for Offline A/B Testing in E-Commerce

SimGym:基于流量的浏览器代理用于电子商务中的离线A/B测试

Alberto Castelo, Zahra Zanjani Foumani, Ailin Fan, Keat Yang Koay, Vibhor Malik, Yuanzheng Zhu, Han Li, Meysam Feghhi, Ronie Uliana, Shuang Xie, Zhaoyu Zhang, Angelo Ocana Martins, Mingyu Zhao, Francis Pelland, Jonathan Faerman, Nikolas LeBlanc, Aaron Glazer, Andrew McNamara, Lingyun Wang, Zhong Wu

机构 * Shopify

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SimGym通过基于流量的合成买家和大型语言模型代理,实现快速离线A/B测试,提升电子商务实验效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01382 2026-02-03 cs.CV cs.LG 70%

PromptRL: Prompt Matters in RL for Flow-Based Image Generation

PromptRL: 流基于图像生成中强化学习中提示的重要性

Fu-Yun Wang, Han Zhang, Michael Gharbi, Hongsheng Li, Taesung Park

机构 * The Chinese University of Hong Kong, Hong Kong(香港中文大学) Meta Superintelligence Labs, USA(Meta超智能实验室)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.LG

AI总结 PromptRL通过整合语言模型作为可训练的提示精修代理,提升流基于图像生成中强化学习的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00857 2026-02-03 cs.CL cs.IR 70%

Unifying Adversarial Robustness and Training Across Text Scoring Models

统一文本评分模型中的对抗鲁棒性与训练

Manveer Singh Tamber, Hosna Oyarhoseini, Jimmy Lin

机构 * uwaterloo(滑铁卢大学)

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL

AI总结 本文提出统一文本评分模型中对抗鲁棒性与训练的方法,通过引入多种对抗训练方法提升模型鲁棒性和任务效果,并展示其在RLHF中的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04220 2026-02-03 cs.CL 70%

On Group Relative Policy Optimization Collapse in Agent Search: The Lazy Likelihood-Displacement

关于代理搜索中群体相对策略优化崩溃:懒惰似然位移

Wenlong Deng, Yushu Li, Boying Gong, Yi Ren, Christos Thrampoulidis, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Meta AI

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出LLDS正则化方法,解决GRPO在代理搜索中因LLD导致的训练崩溃问题,提升模型性能达45.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20668 2026-02-03 cs.CL 70%

PIRA: Preference-Oriented Instruction-Tuned Reward Models with Dual Aggregation

PIRA:基于双聚合的偏好导向指令调优奖励模型

Yongfu Xue

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PIRA通过整合三种策略,利用LLM的偏好指令能力,提升奖励模型的鲁棒性和泛化能力,有效缓解奖励过度优化问题。

Comments Accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00453 2026-02-03 cs.LG cs.DC 70%

FedMOA: Federated GRPO for Personalized Reasoning LLMs under Heterogeneous Rewards

FedMOA: 基于异质奖励的联邦GRPO用于个性化推理大语言模型

Ziyao Wang, Daeun Jung, Yexiao He, Guoheng Sun, Zheyu Shen, Myungjin Lee, Ang Li

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) Cisco Research(思科研究)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 FedMOA是一种联邦GRPO框架,用于在异质奖励下实现个性化推理大语言模型的多目标对齐,通过自适应加权机制和任务感知聚合策略提升性能和个性化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23058 2026-02-02 cs.LG 70%

From Absolute to Relative: Rethinking Reward Shaping in Group-Based Reinforcement Learning

从绝对到相对:重新思考基于群体的强化学习中的奖励塑造

Wenzhe Niu, Wei He, Zongxia Xie, Jinpeng Ou, Huichuan Fan, Yuchen Ge, Yanru Sun, Ziyin Wang, Yizhao Sun, Chengshun Shi, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * Tianjin University(天津大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出RLRR框架,通过将奖励塑造从绝对评分转为相对排名,解决群体强化学习中奖励稳定性与监督稀疏性问题,并在推理和生成任务中取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22249 2026-02-02 cs.LG cs.SE 70%

FunPRM: Function-as-Step Process Reward Model with Meta Reward Correction for Code Generation

FunPRM:基于元奖励校正的函数作为步骤过程奖励模型用于代码生成

Ruiyi Zhang, Peijia Qin, Qi Cao, Eric Xue, Pengtao Xie

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 FunPRM通过元学习的奖励校正机制提升代码生成性能,实现更高质量的代码输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16480 2026-01-26 cs.CL 70%

TL-GRPO: Turn-Level RL for Reasoning-Guided Iterative Optimization

TL-GRPO:基于回合的强化学习用于推理引导的迭代优化

Peiji Li, Linyang Li, Handa Sun, Wenjin Mai, Yongkang Chen, Xiaozhe Li, Yue Shen, Yichuan Ma, Yiliu Sun, Jiaxi Cao, Zhishu He, Bo Wang, Xiaoqing Zheng, Zhaori Bi, Xipeng Qiu, Qipeng Guo, Kai Chen, Dahua Lin

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TL-GRPO通过回合级分组采样优化解决迭代优化任务中的轨迹级强化学习问题,实现更精细的优化效果。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20304 2026-01-26 cs.CL 70%

Exploring Generative Process Reward Modeling for Semi-Structured Data: A Case Study of Table Question Answering

探索生成过程奖励建模在半结构化数据中的应用:表格问答的案例研究

Lei Tang, Wei Zhou, Mohsen Mesgar

机构 * University of Augsburg(奥格斯堡大学) Institut für Maschinelle Sprachverarbeitung, University of Stuttgart(斯图加特大学机械语言处理研究所) Bosch Center for Artificial Intelligence(博世人工智能中心)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了生成过程奖励模型在表格问答任务中的应用,发现结合文本和代码验证的PRMs能辅助解决方案选择,但泛化能力有限。

Comments Accepted at EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12730 2026-01-21 cs.LG 70%

Distribution-Centric Policy Optimization Dominates Exploration-Exploitation Trade-off

以分布为中心的策略优化主导探索-利用权衡

Zhaochun Li, Chen Wang, Jionghao Bai, Shisheng Cui, Ge Lan, Zhou Zhao, Yue Wang

机构 * College of Software, Nankai University(南开大学软件学院) Zhongguancun Academy(中关村学院) School of Automation , Beijing Institute of Technology(北京理工大学自动化学院) College of Computer Science(计算机科学学院) Technology, Zhejiang University(浙江大学技术学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出DCPO,通过分布层面的正则化实现可控探索,改进了探索-利用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11147 2026-01-19 cs.AI 70%

Do We Always Need Query-Level Workflows? Rethinking Agentic Workflow Generation for Multi-Agent Systems

我们是否总是需要查询级工作流?重新思考多智能体系统中的代理工作流生成

Zixu Wang, Bingbing Xu, Yige Yuan, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SCALE框架,通过低成本任务级生成替代查询级生成,减少令牌消耗并保持性能。

Comments 17 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10131 2026-01-19 cs.AI cs.MA 70%

M^4olGen: Multi-Agent, Multi-Stage Molecular Generation under Precise Multi-Property Constraints

M^4olGen: 多智能体、多阶段分子生成在精确多属性约束下

Yizhan Li, Florence Cloutier, Sifan Wu, Ali Parviz, Boris Knyazev, Yan Zhang, Glen Berseth, Bang Liu

机构 * DIRO & Université de Montréal(DIRO与蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所) Institut Courtois(Courtois研究所) Samsung AI Lab, Montreal(三星AI实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 M^4olGen通过多智能体和强化学习框架,在多属性约束下实现精确分子生成,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08237 2026-01-14 cs.AI 70%

The End of Reward Engineering: How LLMs Are Redefining Multi-Agent Coordination

奖励工程的终结:大型语言模型如何重新定义多智能体协调

Haoran Su, Yandong Sun, Congjia Yu

机构 * New York University(纽约大学) Lerna AI

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了大型语言模型如何通过语义奖励规范和动态适应替代传统奖励工程,重新定义多智能体协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05607 2026-01-12 cs.LG 70%

Orchestrating Tokens and Sequences: Dynamic Hybrid Policy Optimization for RLVR

协调标记与序列:动态混合策略优化用于RLVR

Zijun Min, Bingshuai Liu, Ante Wang, Long Zhang, Anxiang Zeng, Haibo Zhang, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司语言模型团队) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出动态混合策略优化方法,通过结合标记级和序列级重要性比率,提升RLVR在数学推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25023 2026-01-01 cs.LG 70%

ResponseRank: Data-Efficient Reward Modeling through Preference Strength Learning

ResponseRank: 通过偏好强度学习实现数据高效的奖励建模

Timo Kaufmann, Yannick Metz, Daniel Keim, Eyke Hüllermeier

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.LG

AI总结 ResponseRank通过本地有效相对强度信号稳健学习偏好强度,提升样本效率和鲁棒性,引入Pearson距离相关性度量。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20082 2025-12-25 cs.AI 70%

Adaptive Financial Sentiment Analysis for NIFTY 50 via Instruction-Tuned LLMs , RAG and Reinforcement Learning Approaches

通过指令调优LLMs、RAG和强化学习方法实现NIFTY 50的自适应金融情绪分析

Chaithra, Kamesh Kadimisetty, Biju R Mohan

机构 * National Institute of Technology Karnataka(印度卡纳塔克国家理工学院) Gayatri Vidya Parishad College of Engineering(迦雅利维达帕希拉工程学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出结合指令调优LLMs、RAG和强化学习的方法,提升NIFTY 50金融情绪分析的准确性和市场适应性。

Comments Accepted in CODS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18571 2025-12-23 cs.AI cs.CV 70%

ESearch-R1: Learning Cost-Aware MLLM Agents for Interactive Embodied Search via Reinforcement Learning

ESearch-R1: 通过强化学习学习成本感知的多模态大语言模型代理以进行交互式具身搜索

Weijie Zhou, Xuangtang Xiong, Ye Tian, Lijun Yue, Xinyu Wu, Wei Li, Chaoyang Zhao, Honghui Dong, Ming Tang, Jinqiao Wang, Zhengyou Zhang

机构 * School of Traffic and Transportation, Beijing Jiaotong University(交通与运输学院,北京交通大学) Tencent Robotics X & Futian Laboratory(腾讯机器人X与福田实验室) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心,中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ESearch-R1通过强化学习方法,结合交互对话、记忆检索和导航,实现成本感知的多模态大语言模型代理,有效降低任务执行成本并提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09670 2025-12-19 cs.AI 70%

MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement

MEML-GRPO:异构多专家互学习用于强化学习可验证奖励的进步

Weitao Jia, Jinghui Lu, Haiyang Yu, Siqi Wang, Guozhi Tang, An-Lan Wang, Weijie Yin, Dingkang Yang, Yuxiang Nie, Bin Shan, Hao Feng, Irene Li, Kun Yang, Han Wang, Jingqun Tang, Teng Fu, Changhong Jin, Chao Feng, Xiaohui Lv, Can Huang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MEML-GRPO通过异构多专家互学习机制,提升RLVR在复杂任务中的推理能力,实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19895 2025-12-18 cs.AI 70%

RPM-MCTS: Knowledge-Retrieval as Process Reward Model with Monte Carlo Tree Search for Code Generation

RPM-MCTS:基于蒙特卡洛树搜索的知识检索作为过程奖励模型用于代码生成

Yuanyuan Lin, Xiangyu Ouyang, Teng Zhang, Kaixin Sui

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RPM-MCTS通过结合知识检索与蒙特卡洛树搜索,有效评估代码生成过程中的中间步骤,减少错误并提升效率

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13837 2025-12-17 cs.LG 70%

Explainable reinforcement learning from human feedback to improve alignment

通过人类反馈改进强化学习的可解释性以提升对齐

Shicheng Liu, Siyuan Xu, Wenjie Qiu, Hangfan Zhang, Minghui Zhu

机构 * Department of Electrical Engineering, Pennsylvania State University(宾夕法尼亚州立大学电气工程系) Department of Computer Science, Rutgers University(罗格斯大学计算机科学系) College of Information Sciences and Technology, Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院)

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出通过纠正RLHF中不满意响应的原因来提升语言模型对齐性的方法,结合事后解释与卸载技术改进模型响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12387 2025-12-16 cs.LG 70%

Anchoring Values in Temporal and Group Dimensions for Flow Matching Model Alignment

在时间和群体维度上锚定值以实现流匹配模型对齐

Yawen Shao, Jie Xiao, Kai Zhu, Yu Liu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Tongyi Lab(通义实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 VGPO通过在时间和群体维度上锚定值,改进流匹配模型对齐,提升图像生成质量与任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10575 2025-12-12 cs.CL 70%

RoleRMBench & RoleRM: Towards Reward Modeling for Profile-Based Role Play in Dialogue Systems

RoleRMBench & RoleRM:迈向基于角色扮演的对话系统奖励建模

Hang Ding, Qiming Feng, Dongqi Liu, Qi Zhao, Tao Yao, Shuo Wang, Dongsheng Chen, Jian Li, Zhenye Gan, Jiangning Zhang, Chengjie Wang, Yabiao Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Saarland University(萨尔兰州大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RoleRMBench与RoleRM旨在通过连续隐式偏好训练提升角色扮演对话系统中奖励建模的准确性与连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06060 2025-12-09 cs.SE cs.AI 70%

Reinforcement Learning Integrated Agentic RAG for Software Test Cases Authoring

强化学习集成的代理RAG用于软件测试用例编写

Mohanakrishnan Hariharan

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种结合强化学习与自主代理的RAG框架,用于提升软件测试用例生成的准确性和缺陷检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02631 2025-12-03 cs.LG 70%

SeeNav-Agent: Enhancing Vision-Language Navigation with Visual Prompt and Step-Level Policy Optimization

SeeNav-Agent: 通过视觉提示和分步策略优化增强视觉语言导航

Zhengcheng Wang, Zichuan Lin, Yijun Yang, Haobo Fu, Deheng Ye

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.LG

AI总结 SeeNav-Agent通过视觉提示和分步策略优化提升视觉语言导航性能,实验显示其在导航成功率上优于现有模型。

Comments 12 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06942 2025-12-03 cs.CL cs.CR 70%

HLPD: Aligning LLMs to Human Language Preference for Machine-Revised Text Detection

HLPD: 通过人类语言偏好对齐大语言模型以检测机器修订文本

Fangqi Dai, Xingjian Jiang, Zizhuang Deng

专题命中 后训练与偏好优化 :LLM(abstract);preference optimization(abstract);分类 cs.CL

AI总结 HLPD通过人类语言偏好优化提升机器修订文本检测性能,实现对GPT系列模型和先进大语言模型生成文本的高效识别。

Comments 20 pages, 10 figures, accepted by AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏