Improving Multi-Step Reasoning Abilities of Large Language Models with Direct Advantage Policy Optimization
专题命中 安全训练 :alignment(abstract);DPO(abstract);分类 cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :alignment(abstract);DPO(abstract);分类 cs.AI
专题命中 安全训练 :alignment(abstract);trustworthy(abstract);分类 cs.CL
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL
Comments Accepted at Socially Responsible Language Modelling Research (SoLaR) Workshop at NeurIPS 2024
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.AI
Comments Accepted by NeurIPS 2024
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.LG
Comments Added references for related work
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI
专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL
Comments work in progress
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
Comments ICLR 2024
专题命中 安全训练 :safety(abstract);prompt injection(abstract);分类 cs.LG
Comments 19 pages, 7 figures
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI
Comments 37 pages, 5 figures
专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.LG
Comments 111 pages, Added section on Run-time Network Verification
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.LG
Comments 16 pages, 13 figures. AAAI 2023 (Special Track on Safe and Robust AI)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI
专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.CY
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.LG
Comments Proceedings of NeurIPS 2022
专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.LG
Comments To be published in Dependable and Secure Machine Learning (DSML) workshop co-located with the IEEE Conference on Dependable Systems and Networks 2019
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG
Mechanist:作为科学仪器的AI,用于发现智能的机制
机构 * Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; Heriot-Watt University(赫瑞瓦特大学) ; Southern University of Science and Technology(南方科技大学) ; University of California, San Diego(加利福尼亚大学圣迭戈分校) ; Northeastern University(东北大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究推出智能体系统Mechanist,以AI为科学仪器自主发现AI智能机制,其生成假设更有价值、实验更可靠,还能发现安全风险、构建信念机制理论并转化为提升模型性能的干预措施。
Comments Work in progress
多智能体具身自动驾驶:从V2X信息交换到共享世界模型
机构 * Lingnan University, Hong Kong(岭南大学(香港))
专题命中 安全训练 :alignment(abstract);safety(abstract)
AI总结 本文综述了从单车智能向多智能体具身系统转变的自动驾驶技术,通过共享世界模型实现感知共享、意图推断和协同规划,并指出了在仿真评估、实时安全保证等方面的研究空白。
智能体事务:面向ACID兼容的智能体系统
专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出ACID兼容的智能体事务框架,开发对应数据智能体,在基准测试中较含Claude Code的现有智能体提升10.6%,为构建可信可扩展AI智能体开辟新方向。
SomaliBench Eval:衡量开源语言模型中英语到索马里语的拒绝差距
机构 * Independent researcher(独立研究人员)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 通过构建索马里语有害意图基准并评估四个开源模型,发现英语到索马里语的拒绝率存在显著差距,且多数非拒绝输出为不流畅的无效内容。
Comments v2: prose rewritten; classification-pipeline correction (34 judge-declined rows manually labeled); paired bootstrap and McNemar statistics; LLM-use disclosure added
AI的核聚变:可持续为数据中心供电的途径
专题命中 安全训练 :alignment(abstract);safety(abstract)
AI总结 该研究探讨核聚变能否为AI驱动型数据中心提供可持续电源,通过技术经济分析发现其适配数据中心需求,具备成本竞争力与可行性,应优先部署。
Comments Under review
VirtualCrime: 通过沙盒模拟评估大语言模型的犯罪潜力
专题命中 安全训练 :alignment(abstract);safety(abstract)
AI总结 本文提出VirtualCrime框架,通过三代理系统评估大语言模型的犯罪能力,设计40种多样化的犯罪任务,并评估8种强大的LLM,发现模型在犯罪过程中生成详细计划并执行智能犯罪过程,但有时会采取严重行动伤害NPC。