arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-03 至 2026-06-03 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 4 篇

2601.04175 2026-06-03 cs.CY 79%

Legal Alignment for Safe and Ethical AI

安全与伦理人工智能的法律对齐

Noam Kolt, Nicholas Caputo, Jack Boeglin, Cullen O'Keefe, Rishi Bommasani, Stephen Casper, Mariano-Florentino Cuéllar, Noah Feldman, Iason Gabriel, Gillian K. Hadfield, Lewis Hammond, Peter Henderson, Atoosa Kasirzadeh, Seth Lazar, Anka Reuel, Kevin L. Wei, Jonathan Zittrain

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CY

AI总结 本文通过调查法律对齐的新兴领域,提出三种核心研究路径(合规、解释方法、概念蓝图),以利用法律规则、原则和方法解决AI对齐问题,确保AI系统安全且合乎伦理地运行。

Comments Published in TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03321 2026-06-03 cs.LG cs.MA cs.SY eess.SY 57%

Validation-Gated Multi-Agent Governance for Online Adaptation of Thermal-Hydraulic Surrogate Models under Operating-Regime Shift

验证门控多智能体治理:运行工况迁移下热工水力代理模型的在线自适应

Doyeong Lim, Seungyoon Lee, In Cheol Bang

机构 * Department of Nuclear Engineering, Ulsan National Institute of Science and Technology (UNIST)(核工程系,乌山国立科学技术研究所(UNIST))

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 针对离线训练模型在运行工况迁移时性能退化问题,提出验证门控多智能体治理框架,通过角色分离的智能体协作与确定性门控机制实现可审计的在线自适应,在实验热工水力数据上将平均绝对误差降低19%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03036 2026-06-03 cs.AI 57%

TriEval: A Resource-Efficient Pipeline for LLM Bias, Toxicity, and Truthfulness Assessment

TriEval: 一种资源高效的LLM偏见、毒性和真实性评估流水线

Akshatha Srikantha, Manpreet Singh, Yash Jajoo, Shyamal Lakhanpal

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 提出TriEval流水线,通过同时评估LLM输出的偏见、毒性和真实性,在标准笔记本电脑上高效运行,并揭示开源与闭源模型在毒性和真实性上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02862 2026-06-03 cs.AI cs.MA 57%

Toward a Modular Architecture for Embedded AI Agent Systems at the Edge

面向边缘嵌入式AI智能体系统的模块化架构

Marcus Rüb, Michael Gerhards

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 提出一种模块化参考架构,通过分层设计解耦设备端和云端智能体,并引入治理层,解决嵌入式微控制器上部署自主AI的严格资源约束问题。

详情

展开后加载摘要…

URL PDF HTML 收藏