Direct Post-Training Preference Alignment for Multi-Agent Motion Generation Models Using Implicit Feedback from Pre-training Demonstrations
专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);分类 cs.AI
Comments ICLR 2025 Spotlight
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);分类 cs.AI
Comments ICLR 2025 Spotlight
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL
Comments ICLR 2025(Spotlight)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract);分类 cs.LG
Comments 15 pages, 2 figures
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);分类 cs.CL
Comments Accepted to ICLR 2025
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :foundation model(title,abstract);post-training(abstract);分类 cs.LG
Comments NeurIPS 2024 Workshop on Time Series in the Age of Large Models
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.AI
Comments NeurIPS 2024
专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);分类 cs.LG
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL
Comments EMNLP 2024; 9 pages, 3 figures
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.AI
Comments 13 pages, 8 figures, The 2024 Conference on Empirical Methods in Natural Language Processing
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL
Comments EMNLP2024, main
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI
专题命中 后训练与偏好优化 :language model(title);RLHF(abstract);preference optimization(abstract);分类 cs.LG
Comments COLM 2024
专题命中 后训练与偏好优化 :LLM(title,abstract);RLHF(abstract);分类 cs.LG
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL
Comments Findings of ACL 2024
专题命中 后训练与偏好优化 :language model(title,abstract);prompting(abstract);分类 cs.LG
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL
Comments published at ICLR 2024
专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL
Comments Published at NeurIPS 2023
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL
Comments NeurIPS 2023 camera-ready
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL
Comments Accepted to BabyLM workshop at CoNLL
专题命中 后训练与偏好优化 :post-training(title);large language model(abstract);language model(abstract);分类 cs.CL
Comments Findings of NAACL 2022
专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.CL
Comments accepted by NAACL 2019
大规模高效探索
机构 * Google(谷歌) ; DeepMind(深度思维)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种在线学习算法,通过增量更新奖励和语言模型提升强化学习从人类反馈中的数据效率,采用小幅度正向激励、信念神经网络和信息导向探索等机制,实验表明在少于20k标签下达到200k标签的性能,预计1M标签可匹配1B标签的性能。