In-Context Learning with Reinforcement Learning for Incomplete Utterance Rewriting
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)
Comments 5 pages, 3 tables, 3 figures
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)
Comments ACL 2024 - SRW
专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);prompting(abstract)
专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);post-training(abstract)
Comments 7 pages, 4 figures
专题命中 指令微调 :large language model(abstract);language model(abstract);small language model(abstract);instruction tuning(abstract)
Comments 12 pages,4 figures; Accepted by ACL 2024 Main Conference
专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)
Comments 20 pages, 8 figures
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)
Comments Accepted by ACL 2024 Findings
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)
专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
Comments 12 pages, 7 tables, accepted at LREC-COLING 2024
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);preference optimization(abstract)
Comments technical report; fixed zephyr numbers
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
Comments 8 pages
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)
专题命中 指令微调 :large language model(abstract);language model(abstract);pretraining(abstract);prompting(abstract)
Comments Accepted by ACL 2023 main conference
专题命中 指令微调 :LLM(abstract,comments);SFT(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at ICLR 2025. Updates in v2 and v3: added GPT-4o, Claude 3.5 Sonnet, o1-mini, and o1-preview results. Code and jailbreak artifacts: https://github.com/tml-epfl/llm-past-tense
专题命中 指令微调 :LLM(abstract,comments);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments The source code and data samples are released at https://github.com/amazon-science/CERET-LLM-refine
Journal ref Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers)
专题命中 指令微调 :LLM(abstract,comments);large language model(abstract);language model(abstract);instruction tuning(abstract)
Comments To appear at USENIX Security Symposium 2025. Key words: prompt injection defense, LLM security, LLM-integrated applications
循环语言模型可提升组合式工具调用能力
机构 * University of Cambridge(剑桥大学)
专题命中 指令微调 :language model(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究在组合式工具调用场景下,通过在多个数据集上对比循环与非循环语言模型,发现循环计算可提升组合式工具使用性能,自适应推理能实现更优计算-性能权衡,为智能体系统提供了有前景的架构。
语言模型微调中的幻影相变
机构 * Mahindra University(马恒达大学)
专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本文研究语言模型微调时,正确补全被近义词竞争而失败的现象,通过序参量分解信号与背景拖拽,发现两种失败模式,并揭示相变为幻影,源于softmax读出而非几何相变。
Comments 25 pages, 9 figures