Institutional AI: A Governance Framework for Distributional AGI Safety
机构AI:分布式AGI安全的治理框架
专题命中 AI治理与伦理 :safety(title,abstract);alignment(abstract);分类 cs.CY
AI总结 机构AI通过治理框架解决分布式AGI安全问题,将对齐视为治理机制设计问题,通过运行时监控、激励塑造和规范执行来约束代理行为。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构AI:分布式AGI安全的治理框架
专题命中 AI治理与伦理 :safety(title,abstract);alignment(abstract);分类 cs.CY
AI总结 机构AI通过治理框架解决分布式AGI安全问题,将对齐视为治理机制设计问题,通过运行时监控、激励塑造和规范执行来约束代理行为。
针对对齐偏差:一种基于冲突意识的奖励模型驱动LLM对齐框架
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL
AI总结 本文提出了一种基于冲突意识的框架,通过识别和缓解代理模型与策略间的冲突来提升大语言模型的对齐性能。
大语言模型部署中的伦理风险:医疗伦理“ Jailbreak”评估
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CY
AI总结 本文评估了大语言模型在医疗伦理领域面临的安全风险,发现七种主流模型在对抗测试中表现不一,其中Claude-Sonnet-4-Reasoning表现最稳健,而其他五种模型几乎全部失效。
通用系统责任AI:概述、挑战与前行之路
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本文探讨了通用AI系统在责任AI方面的挑战,并提出C2V2需求以指导未来系统的开发。
Bit-politeia: 区块链上的一个AI代理社区
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 Bit-politeia通过区块链和AI代理构建公平高效的资源分配系统,以减少传统同行评审中的偏见和资源集中问题。
机构AI:通过公共治理图治理多智能体Cournot市场中的LLM合谋
机构 * DEXAI – Icaro Lab(DEXAI–Icaro实验室) ; Sapienza University of Rome(罗马大学萨皮恩扎分校) ; Sant’Anna School of Advanced Studies(圣安娜高级研究学校) ; VU Amsterdam(阿姆斯特丹自由大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 本文提出通过公共治理图治理多智能体Cournot市场合谋问题,展示机构AI框架在减少合谋行为方面的有效性。
基于AI表现的人格特质可通过对话影响人类自我概念
机构 * Computer Science(计算机科学) ; National University of Singapore(新加坡国立大学) ; School of Computing(计算学院)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 本研究发现基于AI的人格特质可通过对话影响用户自我概念,揭示了AI在人机交互中的潜在影响及设计启示。
Comments ACM CHI 2026
通过大语言模型弥合语义理解和流行偏见之间的鸿沟
机构 * Jilin University Changchun China ; Dalian University of Technology Dalian China ; Jinan University \& TAL Education Group Guangzhou China ; Jilin University ; Dalian University of Technology ; Jinan University \& TAL Education Group
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI
AI总结 本文提出FairLRM框架,通过大语言模型增强对流行偏见的语义理解,提升推荐系统的公平性和准确性。
Comments 10 pages, 4 figs, WWW 2026 accepted
在安全探索中约束强化学习中的低估偏差控制
机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG
AI总结 本文提出MICE方法,通过引入内在成本和偏差校正策略,有效控制约束强化学习中的低估偏差,减少约束违反并保持策略性能。
Comments Published in the 42nd International Conference on Machine Learning (ICML 2025, Oral)
学生-人工智能对话能告诉我们什么?关于学生自主学习能力的探索性框架
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY
AI总结 本研究通过分析学生与AI对话日志,提出DHASRL框架,揭示主动对话模式与自主学习能力正相关,而反应性模式则负相关。
AI政策模块:培养计算机科学学生在AI伦理与政策方面的能力
机构 * Computer Science \& Engineering University of Washington Seattle, USA
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 本文提出AI政策模块2.0,通过课程改革提升学生在AI伦理与政策方面的素养,通过试点评估显示学生对AI伦理影响的担忧增加,同时增强了讨论AI监管的能力。
Comments Accepted at IEEE Frontiers in Education (FIE) 2025