Uncovering Cross-Objective Interference in Multi-Objective Alignment
揭示多目标对齐中的跨目标干扰
机构 * University of Notre Dame(诺丁汉大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出CTWA方法,通过保持目标奖励与训练信号的正协方差来缓解多目标对齐中的跨目标干扰问题,并分析了干扰与模型几何属性的关系。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
揭示多目标对齐中的跨目标干扰
机构 * University of Notre Dame(诺丁汉大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出CTWA方法,通过保持目标奖励与训练信号的正协方差来缓解多目标对齐中的跨目标干扰问题,并分析了干扰与模型几何属性的关系。
通过可扩展的交互监督引导大语言模型
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出可扩展的交互监督框架,通过递归决策树提升人类对AI任务的引导能力,实现非专家生成高质量产品需求文档,并通过强化学习优化
概率聚合与定向嵌入优化用于大语言模型中的集体道德推理
机构 * School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) ; School of Social Sciences and Technology, Technical University of Munich(社会科学与技术学院,慕尼黑技术大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种概率聚合与定向嵌入优化方法,通过融合多个大语言模型的道德判断,提升集体道德推理的一致性和准确性。
Comments Accepted to ACL 2025 (Findings)
利用LLM代理识别恶意软件二进制中的攻击战术与技术
专题命中 其他安全 :alignment(abstract)
AI总结 TTPDetect通过结合密集检索与LLM神经检索,利用LLM代理识别恶意软件二进制中的TTPs,实现高精度和召回率。