Attack the Messages, Not the Agents: A Multi-round Adaptive Stealthy Tampering Framework for LLM-MAS
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
机构 * Department of Computer Science(计算机科学系) ; Purdue University(普渡大学)
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG
Comments Accepted by COLM 2025
机构 * Bilibili Inc.(哔哩哔哩公司) ; Xi’an Jiaotong University(西安交通大学) ; School of Computer Science, Fudan University(复旦大学计算机科学学院)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)
专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL、cs.AI
Comments This requires some internal approval before the public release
专题命中 后训练与偏好优化 :post-training(abstract)