Legal Alignment for Safe and Ethical AI
安全与伦理人工智能的法律对齐
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CY
AI总结 本文通过调查法律对齐的新兴领域,提出三种核心研究路径(合规、解释方法、概念蓝图),以利用法律规则、原则和方法解决AI对齐问题,确保AI系统安全且合乎伦理地运行。
Comments Published in TMLR
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
安全与伦理人工智能的法律对齐
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CY
AI总结 本文通过调查法律对齐的新兴领域,提出三种核心研究路径(合规、解释方法、概念蓝图),以利用法律规则、原则和方法解决AI对齐问题,确保AI系统安全且合乎伦理地运行。
Comments Published in TMLR
验证门控多智能体治理:运行工况迁移下热工水力代理模型的在线自适应
机构 * Department of Nuclear Engineering, Ulsan National Institute of Science and Technology (UNIST)(核工程系,乌山国立科学技术研究所(UNIST))
专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG
AI总结 针对离线训练模型在运行工况迁移时性能退化问题,提出验证门控多智能体治理框架,通过角色分离的智能体协作与确定性门控机制实现可审计的在线自适应,在实验热工水力数据上将平均绝对误差降低19%。
TriEval: 一种资源高效的LLM偏见、毒性和真实性评估流水线
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 提出TriEval流水线,通过同时评估LLM输出的偏见、毒性和真实性,在标准笔记本电脑上高效运行,并揭示开源与闭源模型在毒性和真实性上的差异。
面向边缘嵌入式AI智能体系统的模块化架构
机构 * ETH Zurich(苏黎世联邦理工学院)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 提出一种模块化参考架构,通过分层设计解耦设备端和云端智能体,并引入治理层,解决嵌入式微控制器上部署自主AI的严格资源约束问题。