arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

ByteDance(字节跳动)

2026-08-31 至 2026-08-31 共收录 2
2608.28065 2026-08-31 cs.AI 新提交

Learning to Allocate Incentives for Incentivized Advertising via Offline Model-Based Reinforcement Learning

基于离线模型强化学习的激励式广告激励分配学习

Zilin Zhao, Han Yang, Tianpei Yang, Fangsheng Huang, Yanfei Cui, Kan Peng, Yi Li, Yiming Zong, Hao Zhang, Yinsong Xue

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ByteDance(字节跳动) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本研究针对激励式广告的序列激励分配问题,提出离线模型强化学习框架,实验显示MB-IQL可显著提升人均净利润,验证了该框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27501 2026-08-31 cs.CL 新提交

INSPIRE: An Internalize-Then-Improve Approach for Example-Driven Mathematical Reasoning

INSPIRE:一种用于示例驱动数学推理的“先内化再改进”方法

Shuai Wang, Jiayi Kuang, Yinghui Li, Haojing Huang, Xinnian Liang, Ying Shen, Liang Lin

机构 * Sun Yat-sen University(中山大学) Tsinghua University(清华大学) ByteDance Inc.(字节跳动公司) Peng Cheng Laboratory(鹏城实验室)

AI总结 该研究针对LLMs数学推理中内化不足的问题,提出INSPIRE方法,结合RGSI与分阶段规则偏好训练,提升了示例驱动数学推理能力且未降低通用推理水平。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏