arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-01 至 2025-12-01 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 8 篇

2510.13022 2025-12-01 cs.CL cs.AI cs.LG 88%

On the Role of Preference Variance in Preference Optimization

关于偏好方差在偏好优化中的作用

Jiacheng Guo, Zihao Li, Jiahao Qiu, Yue Wu, Mengdi Wang

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Princeton University(普林斯顿大学) AI Lab(人工智能实验室)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究探讨了偏好方差在偏好优化中的作用,发现高方差提示在训练大型语言模型时表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23391 2025-12-01 cs.CL 83%

Ambiguity Awareness Optimization: Towards Semantic Disambiguation for Direct Preference Optimization

模糊性意识优化:朝着直接偏好优化的语义消歧

Jian Li, Shenglin Yin, Yujia Zhang, Alan Zhao, Xi Chen, Xiaohui Zhou, Pengfei Xu

机构 * AI Technology Center of OVB, Tencent, China(腾讯OVB人工智能技术中心,中国) School of Computer Science, Peking University, China(北京大学计算机学院,中国)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 本文提出模糊性意识优化(AAO)方法,通过计算偏好对的语义相似性自动重新加权模糊内容,有效提升直接偏好优化的性能。

Comments Accepted at EMNLP 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12565 2025-12-01 cs.CL 81%

Self Iterative Label Refinement via Robust Unlabeled Learning

通过鲁棒无标签学习实现自迭代标签细化

Hikaru Asano, Tadashi Kozuno, Yukino Baba

机构 * The University of Tokyo(东京大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出了一种通过鲁棒无标签学习实现自迭代标签细化的方法,有效提升了LLM在分类任务中的性能,并在安全对齐和生成任务中展示了优越性。

Comments To appear in the Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23184 2025-12-01 cs.CL cs.AI 81%

Listwise Preference Optimization with Element-wise Confusions for Aspect Sentiment Quad Prediction

基于元素混淆的列表偏好优化用于方面情感四元组预测

Wenna Lai, Haoran Xie, Guandong Xu, Qing Li, S. Joe Qin

机构 * The Hong Kong Polytechnic University(香港理工大学) Lingnan University(岭大) University of Technology Sydney(悉尼大学) The Education University of Hong Kong(香港教育大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于元素混淆的列表偏好优化方法,用于提升方面情感四元组预测的准确性和解释一致性。

Comments 11 pages, 7 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02433 2025-12-01 cs.LG cs.AI 81%

FairPO: Robust Preference Optimization for Fair Multi-Label Learning

FairPO: 为公平多标签学习的鲁棒偏好优化

Soumen Kumar Mondal, Prateek Chanda, Akshit Varmora, Ganesh Ramakrishnan

机构 * IIT Bombay(印度理工学院班加罗尔)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 FairPO通过结合偏好损失和群体鲁棒优化,提升多标签学习中不同标签的公平性,通过针对性改进和平衡目标缓解偏见问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04182 2025-12-01 cs.CL cs.AI 73%

COPO: Causal-Oriented Policy Optimization for Hallucinations of MLLMs

COPO:面向MLLM幻觉的因果导向策略优化

Peizheng Guo, Jingyao Wang, Wenwen Qiang, Jiahuan Zhou, Changwen Zheng, Gang Hua

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) Amazon.com, Inc.(亚马逊公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 COPO通过引入因果完整性奖励和GRPO框架,解决多模态大语言模型的幻觉问题,通过令牌级因果约束确保输出的正确性和证据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22982 2025-12-01 cs.CV cs.AI 57%

Ovis-Image Technical Report

Ovis-Image 技术报告

Guo-Hua Wang, Liangfu Cao, Tianyu Cui, Minghao Fu, Xiaohao Chen, Pengxin Zhan, Jianshan Zhao, Lan Li, Bowen Fu, Jiaqi Liu, Qing-Guo Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 Ovis-Image 是一个70亿参数的文本到图像模型,通过优化的多模态主干和文本聚焦训练方法,在紧凑架构下实现与大型开源模型相当的文本渲染性能。

Comments Code is released at https://github.com/AIDC-AI/Ovis-Image

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04340 2025-12-01 cs.LG cs.HC 57%

Interactive Groupwise Comparison for Reinforcement Learning from Human Feedback

基于交互式组间比较的强化学习从人类反馈中学习

Jan Kompatscher, Danqing Shi, Giovanna Varni, Tino Weinkauf, Antti Oulasvirta

机构 * Aalto University(阿尔托大学) University of Cambridge(剑桥大学) University of Trento(特伦特大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.LG

AI总结 本文提出交互式组间比较方法,通过可视化和主动学习提升强化学习从人类反馈中学习的奖励和策略效果。

Comments 10 pages, 8 figures in proceedings of Computer Graphics Forum

详情

展开后加载摘要…

URL PDF HTML 收藏