arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-10 至 2025-09-10 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4 篇

2509.06980 2025-09-10 cs.LG cs.AI 90%

RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use

Jiajun Chai, Guojun Yin, Zekun Xu, Chuhuai Yue, Yi Jia, Siyu Xia, Xiaohan Wang, Jiwen Jiang, Xiaoguang Li, Chengqi Dong, Hang He, Wei Lin

机构 * RLFactory Team(RLFactory团队)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18463 2025-09-10 cs.CV 78%

DIP: Unsupervised Dense In-Context Post-training of Visual Representations

Sophia Sirko-Galouchenko, Spyros Gidaris, Antonin Vobecky, Andrei Bursuc, Nicolas Thome

机构 * Sorbonne Université, CNRS, ISIR(索邦大学、国家科学研究中心、ISIR) FEE CTU(捷克技术大学电子工程系) CIIRC CTU Prague(捷克技术大学普拉格研究所) Institut universitaire de France (IUF)(法国国家科学院)

专题命中 后训练与偏好优化 :post-training(title,abstract)

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07006 2025-09-10 cs.CY cs.AI cs.CL cs.LG 75%

ArGen: Auto-Regulation of Generative AI via GRPO and Policy-as-Code

Kapil Madan

机构 * Principled Evolution(原则进化)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 53 pages, 7 figures, 8 tables. Open-source implementation available at: https://github.com/Principled-Evolution/argen-demo. Work explores the integration of policy-as-code for AI alignment, with a case study in culturally-nuanced, ethical AI using Dharmic principles

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07108 2025-09-10 stat.ML cs.LG 57%

ADHAM: Additive Deep Hazard Analysis Mixtures for Interpretable Survival Regression

Mert Ketenci, Vincent Jeanselme, Harry Reyes Nieva, Shalmali Joshi, Noémie Elhadad

机构 * Columbia University(哥伦比亚大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏