Scaling Synthetic Task Generation for Agents via Exploration
机构 * Apple(苹果公司)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);prompting(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
机构 * Apple(苹果公司)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);prompting(abstract)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);foundation model(abstract);post-training(abstract)
Comments https://tongyi-agent.github.io/blog/introducing-tongyi-deep-research/
机构 * Bilibili Inc.(哔哩哔哩公司) ; Xi’an Jiaotong University(西安交通大学) ; School of Computer Science, Fudan University(复旦大学计算机科学学院)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)
机构 * University of California, Berkeley(加州大学伯克利分校) ; Carnegie Mellon University(卡内基梅隆大学) ; IBM Research(IBM研究院) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)
Comments published at USENIX Security 25
机构 * VinUniversity(文大学) ; VinUni-Illinois Smart Health Center(VinUni-伊利诺伊智能健康中心) ; University of Stuttgart(斯图加特大学) ; University of California Los Angeles (UCLA)(加州大学洛杉矶分校) ; International University - VNUHCM(国际大学 - VNUHCM) ; University of Science - VNUHCM(科学大学 - VNUHCM) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) ; Oldenburg University(奥尔登堡大学) ; Max Planck Research School for Intelligent Systems (IMPRS-IS)(马克斯·普朗克智能系统研究学校)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)
Comments First version
机构 * Leidos(莱迪斯公司)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);preference optimization(abstract)
Comments 27 pages, 19 figures, 4 tables
机构 * GSAI, Renmin University of China(清华大学) ; Large Language Model Department, Tencent(腾讯大语言模型部门) ; University of Macau(澳门大学) ; School of Computer Science, Wuhan University(武汉大学计算机学院)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
Comments Preprint
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);preference optimization(abstract)
Comments ACL 2025 main
机构 * Meta GenAI(Meta 生成式人工智能)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)
机构 * University of Minnesota(明尼苏达大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Grammarly ; University of Arizona(亚利桑那大学)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
Comments Accepted by ICLR 2025. Code is available at https://github.com/open-compass/ANAH
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);RLHF(abstract)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
Comments 12 pages, 6 figures
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
Comments Best student paper award, Published in AIED 2024: The 25th International Conference on Artificial Intelligence in Education
Journal ref In International Conference on Artificial Intelligence in Education (pp. 280-294). Cham: Springer Nature Switzerland (2024)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
Comments Camera ready version for NeurIPS 2024 D&B Track
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
Comments Accepted to EMNLP2024 main conference
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)
专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)
Comments 8 pages, 19 figures
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)
Comments 22 pages, 7 figures
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)
Comments Accepted to Findings of ACL 2024. The code, datasets, and models are publicly available at https://github.com/boschresearch/ACL24-MLLM
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);preference optimization(abstract)