Copewell: A Multi-Agent Swarm Architecture for Equitable Mental Wellness Support
Copewell: 一种用于公平心理健康支持的多智能体群体架构
机构 * Copewell
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY
AI总结 提出Copewell多智能体群体系统,通过多源评估、情感映射和双模式干预,扩大心理健康支持的可及性,并融入隐私优先和伦理监督设计。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
Copewell: 一种用于公平心理健康支持的多智能体群体架构
机构 * Copewell
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY
AI总结 提出Copewell多智能体群体系统,通过多源评估、情感映射和双模式干预,扩大心理健康支持的可及性,并融入隐私优先和伦理监督设计。
LLM 谄媚中权威层级的机制性视角
机构 * Independent Research(独立研究)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.LG
AI总结 通过受控医疗QA实验,发现LLM按感知权威程度分级响应,机制是特定后期层中正确答案表征被权威信号主动擦除,且该擦除与权威水平成比例、抵抗均值向量干预、仅部分可逆。
手术室中用于质量保证的人工智能
机构 * Fondazione Policlinico Universitario Agostino Gemelli IRCCS(阿戈斯蒂诺·杰梅利大学综合医院基金会IRCCS) ; Institute of Image-Guided Surgery, HU-Strasbourg(斯特拉斯堡大学医院图像引导外科研究所) ; University of Strasbourg, CNRS, INSERM, ICube, UMR7357(斯特拉斯堡大学,法国国家科学研究中心,法国国家健康与医学研究院,ICube实验室,UMR7357) ; Scialytics SAS(Scialytics SAS公司)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY
AI总结 本文提出AI赋能的手术质量保证框架,利用手术视频数据实现术中质量持续评估与改进,并讨论了关键挑战。
面向代理基础设施的代理分析:基于LLM的DAO与企业AI协议比较治理管道
机构 * Duke Kunshan University(昆山杜克大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 提出LLM驱动的比较分析管道,结合自动标注、神经主题建模和多层网络分析,研究DAO与企业AI协议的治理结构,发现开放治理促进主题收敛但参与不平等普遍存在。
语言技术中的/对语言技术的净化——下一代AI中的文化整合
机构 * University of Hamburg(汉堡大学) ; University of Trento(特伦托大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文探讨如何在自然语言处理中操作化“文化”,提出文化对齐需要多元认识论,而非仅添加“其他文化”示例,并通过技术活动五层模型分析现有方法,指出多数方法仅停留在输出或表征层面,需转向反思性多元社会技术路径。
基于智能体的监管模拟中静态与自适应政策机制的结构可区分性
机构 * Open University of Cyprus(塞浦路斯开放大学)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY
AI总结 本文通过可配置的排放监管ABM基准,比较四种政策-智能体机制,揭示自适应政策与智能体交互导致监管结论差异,提出机制可区分性评估方法。
Comments 19 pages, 4 figures, 9 tables. Simulation-based methodological study
LLM招聘决策中的性别偏见:来自日本语境的证据及缓解策略评估
机构 * Shibaura Institute of Technology, Tokyo, Japan(Shibaura技术学院,东京,日本) ; Amsterdam University of Applied Sciences, Amsterdam, Netherlands(阿姆斯特丹应用科学大学,阿姆斯特丹,荷兰) ; University of Pennsylvania, Philadelphia, USA(宾夕法尼亚大学,费城,美国) ; Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学,匹兹堡,美国) ; Keio University, Tokyo, Japan(庆应大学,东京,日本)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.CY
AI总结 本研究通过60份日本履历书格式的简历和5个先进LLM,发现所有模型均存在显著的亲女性偏见,且简单的提示指令无法缓解,而移除姓名几乎完全消除该偏见。
对大型语言模型中代词忠实性的机制理解
机构 * Saarland University(萨尔大学) ; Heidelberg Institute for Theoretical Studies(海德堡理论研究所)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 通过因果分析发现,代词忠实性由组实体绑定、近因偏差和刻板印象偏差三种因果子空间共同作用,解释了91-99.5%的行为。
ESG叙述评分中重度推理LLM部署的有限边际收益:一项关于日本上市公司的4模型共识研究
机构 * Kansai University(关西大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 通过4模型共识设计,研究在ESG叙述评分中,重度推理模型相比非推理模型是否带来显著收益,发现其边际收益有限且成本高昂。
Comments 12 pages. Earlier version available on SSRN, Abstract ID 6683303
Eigenism:人类与人工智能未来的伦理学
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 提出Eigenism伦理框架,将身份视为分级分布的信息模式,通过加权求和评估AI的福祉,并推广至人类,为AI对齐提供“身份工程”新路径。
伦理评估代理(EeVA):在原型类代理工作流中辅助伦理审议的概念验证测试结果
机构 * Institute for Biomedical Ethics, Basel University(伦理研究所,巴塞尔大学) ; North-West University(北开普大学) ; Barcelona Supercomputing Center(巴塞罗那超级计算中心)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 提出基于LLM的类代理工作流EeVA,通过10种伦理框架评估用例,生成结构化评估与综合,促进伦理反思而非给出绝对答案,在三个案例中验证了可行性。
结构注意力税:检索格式如何劫持上下文学习而与内容无关
机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究发现知识图谱三元组因其格式结构比自然语言吸引2-3倍注意力,压缩演示注意力达42%,并提出了分解注意力为语义与结构成分的框架及缓解策略。
Comments 10 pages, 5 figures
立场:不要仅仅“在后期修复它”:AI科学必须研究训练动态
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Boston University(波士顿大学) ; Harvard University(哈佛大学) ; University of Oxford, Martian(牛津大学,火星) ; Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文主张AI科学应超越事后分析,研究训练动态以预测、干预和设计模型行为,并指出当前在可解释性、公平性等领域的进展及开放问题。
Comments Accepted as an oral to the ICML: https://icml.cc/virtual/2026/poster/67142
MIFR:用于皮肤病分类的模态不变公平表示框架
机构 * University of Dschang(德昌大学) ; Université Paris-Panthéon-Assas(巴黎先贤祠-阿萨斯大学) ; Université de Picardie Jules Verne(儒勒·凡尔纳皮卡第大学) ; Hertie Institute for AI in Brain Health, University of Tübingen(蒂宾根大学赫蒂脑健康人工智能研究所)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG
AI总结 本研究提出MIFR框架,通过配对临床与皮肤镜图像的多目标损失训练,实现皮肤病分类的模态不变性与公平性,在多数据集上验证了其预测性能与公平性。
Comments Accepted for publication at the First Workshop on Advancing African Medical AI through Global Integration (AFRICAI)-MICCAI 2026
答案格式变化对大型语言模型中性别偏见的影响
机构 * Institute for Natural Language Processing, University of Stuttgart(斯图加特大学自然语言处理研究所)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
AI总结 该研究探讨答案格式变化对LLMs性别偏见测量的影响,通过评估三种指令微调模型在不同格式下的表现,发现格式会显著改变测量结果,强调需将答案格式纳入LLM评估。
Comments 6th Workshop on Computational Linguistics for the Political and Social Sciences (CPSS 2026)
在块内思考:使用大语言模型生成符合法规的场景的RegulaRAG——以联合国第152号法规为例
机构 * Technical University of Munich(慕尼黑工业大学)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 针对LLMs难以结合冗长分层标准的问题,提出RegulaRAG流水线,经实验其在UN R152数据集上元分数最高且鲁棒性强,优于基线系统。
天生不连贯?大型语言模型的道德自我一致性研究
机构 * Cornell University(康奈尔大学) ; Cornell Tech(康奈尔科技学院) ; Nanyang Technological University(南洋理工大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 本研究针对GPT、Mistral、Llama等LLM,在义务论等三大伦理框架下,发现其道德推理存在最高78%的矛盾率,内部不连贯是AI对齐的必要前提。
Comments 88 pages; pages 16 to 88 are the appendix
从生成式AI中的公平表征到公正承认
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY
AI总结 该研究针对生成式AI的公平挑战,指出现有表征公平策略存在局限,提出借鉴参与平等理论,从表征公平转向承认正义以解决相关问题。
Comments Accepted for publication at the 2026 AAAI/ACM Conference on AI, Ethics, and Society (AIES)
用于实现协作式对话结果的多大型语言模型智能体系统的动态管控
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 本文针对多LLM智能体对话崩溃问题,提出体验编排器EO管控层,通过三种机制提升顾问联系率,在6万次模拟中取得显著效果,为多智能体协作提供新方案。
Comments 13 pages, 3 figures, 3 tables. Submitted to AI Engineer World's Fair 2026
智能体 harness:面向机器人自主的大语言模型驱动验证层
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Pacific Northwest National Laboratory(太平洋西北国家实验室)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 针对机器人规划模型的安全与伦理风险,提出LLM驱动的验证层作为中间件管控计划,实现近85%的类别准确率、97%的对抗性攻击遏制率,为机器人自主提供可靠保障。
Comments 7 pages. Not yet finalized for conference submission
表面上公平?对LLM推荐器的隐藏输出公平性差距进行基准测试
机构 * University of Georgia(佐治亚大学) ; University of Southern California(南加州大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Michigan State University(密歇根州立大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 该研究提出首个联合评估LLM推荐器可观测输出与隐藏表示公平性的基准FairGap,发现二者存在根本张力,现有框架无法诊断。
基于强化学习的道德智能体的元规范理论
机构 * University of Luxembourg(卢森堡大学) ; University of Bergen(卑尔根大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 本文针对强化学习(RL)道德智能体设计中哲学文献被边缘化的问题,提炼元规范理论的相关理念审视RL架构,以明确RL智能体道德行为的判定标准,为评估相关RL方法奠定基础。
Comments The 14th International Workshop on Engineering Multi-Agent Systems (EMAS 2026) held May 25-26, 2026 Co-located with AAMAS 2026 Paphos, Cyprus
衔接AI风险框架:将ISO/IEC 42001、美国国家标准与技术研究院AI风险管理框架(NIST AI RMF 1.0)及欧盟AI法案整合为统一治理分类体系
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY
AI总结 本文整合ISO/IEC 42001、NIST AI RMF和欧盟AI法案,构建统一AI治理分类体系,提出实施模型与示例,助力组织同时满足三者要求且无需重复付出。
Comments 17 pages, 5 tables
面向伦理人工智能的设计:用于人力资源的自动机器学习(AutoML)中提升公平性与用户体验的人机交互(HCI)功能考量
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 该论文结合多视角研究AutoML在人力资源招聘中的公平性,发现现有平台存在缺陷,提出五维度HCI公平评估框架,建议将公平性嵌入AutoML设计以提升伦理可持续性。
Comments 295 pages; Doctoral Thesis;28 figures; 42 tables; 248 references
资源权威:部署AI代理参与式治理的机制设计模型
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 本研究提出资源权威机制设计模型,用于通过计算预算使授权自我执行,实现对已部署AI代理的参与式治理,同时指出被治理代理操纵治理 electorate 是核心开放问题。
Comments 22 pages, 9 Figures
用于人工智能治理的后训练适应技术的六维分类法
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG
AI总结 本综述构建了后训练适应技术的六维分类法,梳理技术间关系,为AI治理提供术语支持,并指出该领域的开放挑战。
关注差距:用于人类模拟的思维混合模型
机构 * Semilattice(半格)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 本文提出Anacreon受众模拟模型,基于Gemma 4 12B构建思维混合模型,通过聚类个体、情感链等技术,在个体层面序数对齐达0.775,缩小了群体与个体模拟的差距。
早期梯度下降动力学下逻辑回归的非渐近隐式偏置
机构 * The Institute of Statistical Mathematics(统计数理研究所) ; Tohoku University(东北大学) ; RIKEN AIP(理化学研究所人工智能项目)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG
AI总结 本研究揭示早期梯度下降动力学中逻辑回归参数向量与最大间隔方向弱对齐的机制,给出对齐迭代次数的紧上界,为理解训练时长与泛化性能的关联提供理论支撑。
自主AI系统中的问责不对称性与结构性信任
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY
AI总结 本文针对自主AI系统中问责不对称导致的信任问题,提出将其治理视为基础设施可靠性问题,通过工程异质性方案,即独立监测审查补充流程,解决该问题。
Comments 16 pages, 2 figures
BulkPR-Bench:针对交互拉取请求的队列级治理基准
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 该研究推出BulkPR-Bench基准,针对交互PR队列治理,实验显示现有模型在该任务上表现优于顺序基准,但仍存在较大提升空间。
Comments 12 pages, 5 figures. Artifact: https://github.com/Eureka246/BulkPR-Bench-Release ; archived artifact: https://doi.org/10.5281/zenodo.21717780