arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-24 至 2026-08-24 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 8 篇

2608.20374 2026-08-24 cs.CL cs.AI cs.LG 新提交 90%

VA-DPO: Valence-Arousal Direct Preference Optimization for Controllable Emotion Generation in Language Models

VA-DPO:用于语言模型可控情感生成的效价-唤醒直接偏好优化

Hyunwoo Kim

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对现有情感生成无法表达细粒度情感的问题,提出VA-DPO方法,通过效价-唤醒连续目标优化LoRA适配器,在多模型上实现细粒度情感生成且不损害通用性能。

Comments 9 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21088 2026-08-24 cs.CL 新提交 90%

When the Feature Pool Goes Algorithmic: Extending Mufwene's Ecology of Language Evolution to LLM-Mediated Exposure

当特征池实现算法化:将穆夫温的语言进化生态学扩展至大语言模型介导的语言接触

Kunmei Han

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文将穆夫温的语言进化生态学扩展至LLM介导的场景,提出LLM作为分布中介通过算法重加权变体频率影响语言进化,且人类社会评价仍具决定性,同时产出多项可检验预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11821 2026-08-24 cs.LG 版本更新 90%

Reinforcing Multi-Turn Reasoning in LLM Agents via Fine-Grained Reward Structure and Credit Assignment

通过细粒度奖励结构与信用分配增强大语言模型智能体的多轮推理能力

Quan Wei, Siliang Zeng, Chenliang Li, Zhongruo Wang, William Brown, Oana Frunza, Wei Deng, Anderson Schneider, Yuriy Nevmyvaka, Yang Katie Zhao, Alfredo Garcia, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学) Texas A&M University(德克萨斯A&M大学) Prime Intellect Morgan Stanley(摩根大通)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文针对LLM智能体多轮推理的信用分配问题,提出适配三类奖励结构的GRPO与PPO算法,实验证实密集每轮奖励结构优于稀疏奖励,PPO在搜索任务上表现最优。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17378 2026-08-24 cs.LG cs.AI 版本更新 82%

Efficient Exploration at Scale

大规模高效探索

Seyed Mohammad Asghari, Chris Chute, Vikranth Dwaracherla, Xiuyuan Lu, Mehdi Jafarnia, Victor Minden, Zheng Wen, Benjamin Van Roy

机构 * Google(谷歌) DeepMind(深度思维)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种在线学习算法,通过增量更新奖励和语言模型提升强化学习从人类反馈中的数据效率,采用小幅度正向激励、信念神经网络和信息导向探索等机制,实验表明在少于20k标签下达到200k标签的性能,预计1M标签可匹配1B标签的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16804 2026-08-24 cs.LG cs.AI 版本更新 81%

AutoOR: Scalably Post-training LLMs to Autoformulate Operations Research Problems

AutoOR: 一种可扩展的后训练语言模型用于自动形式化运筹学问题

Sumeet Ramesh Motwani, Chuan Du, Aleksander Petrov, Christopher Davis, Philip Torr, Antonio Papania-Davis, Weishi Yan

机构 * The Moonshot Factory(谷歌登月工厂) University of Oxford(牛津大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 AutoOR通过合成数据生成与强化学习管道,训练语言模型自动形式化运筹学问题,实现线性、混合整数和非线性优化问题的高效解决,取得六个经典运筹学基准测试的领先或竞争性结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14313 2026-08-24 cs.LG cs.AI 版本更新 79%

AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning

你的强化学习奖励函数是你的最佳搜索PRM:统一强化学习与基于搜索的文本生成

Can Jin, Yang Zhou, Qixin Zhang, Hongwu Peng, Di Zhang, Zihan Dong, Marco Pavone, Ligong Han, Zhang-Wei Hong, Tong Che, Dimitris N. Metaxas

机构 * Rutgers University(新泽西州立大学) Nanyang Technological University(南洋理工大学) University of Connecticut(康涅狄格大学) Fudan University(复旦大学) NVIDIA Research(NVIDIA研究) Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AIRL-S,通过强化学习与搜索技术的统一,利用奖励函数直接学习动态PRM,提升推理链扩展和跨任务泛化能力,实验显示性能提升9%并优于基线PRM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20611 2026-08-24 cs.AI 新提交 77%

Difficulty-Aware Semantic-ID Optimization for Generative Recommendation

面向生成式推荐的难度感知语义-ID优化

Xin Yu, Stephen Li, Sina Aghaei, Zifan Zhu, Jiamu Bai, Guanjie Huang, Bo Peng, Yiyao Liu, Lingzhou Xue

机构 * Meta The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 针对生成式推荐中标准GRPO与树结构任务适配差的问题,提出DASO方法,通过前缀匹配深度分配部署组,在公开及内部推荐任务上均取得优于对比方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20913 2026-08-24 cs.CV cs.AI 新提交 57%

Explainable Deepfake Detection with Feature-robust Augmentation and Evidence-grounded Explanation Optimization

基于特征鲁棒增强与证据支撑的解释性深度伪造检测

Zhu Xu, Jiaqi Tang, Pokai Chen, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

AI总结 该研究针对深度伪造检测的鲁棒性与可解释性缺陷,提出含特征鲁棒增强、证据支撑偏好优化的框架,在ACM Multimedia 2026相关任务中获第一名。

详情

展开后加载摘要…

URL PDF HTML 收藏