AI Assurance in UK Defence: Challenges in Operationalising JSP 936
英国国防中的人工智能保证:JSP 936 操作化的挑战
机构 * Synoptix
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 本文通过结构化解释性审查,识别了英国国防中实施JSP 936进行AI保证的八大挑战,并指出其依赖未解决的技术、组织和保证问题。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
英国国防中的人工智能保证:JSP 936 操作化的挑战
机构 * Synoptix
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 本文通过结构化解释性审查,识别了英国国防中实施JSP 936进行AI保证的八大挑战,并指出其依赖未解决的技术、组织和保证问题。
角色设定会让LLM成为K-pop粉丝吗?基于LLM的在线演唱会观众智能体初步研究
机构 * Graduate School of Culture Technology, KAIST, Daejeon, South Korea(韩国成均馆大学文化科技研究生院) ; Department of Artificial Intelligence, Yonsei University, Seoul, South Korea(延世大学人工智能系)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 研究通过多智能体系统模拟K-pop演唱会实时粉丝聊天,发现角色设定能提升聊天质量和自然度,但未增强社交连接或情感反应,表明有意义的集体体验需更深层次对齐。
Comments Accepted at the ICML 2026 Workshop on Culture x AI: Evaluating AI as a Cultural Technology
管道中的弗兰肯斯坦:面部识别中的计算性知识灭绝
机构 * Universidade Estadual de Campinas(坎皮纳斯州立大学) ; Instituto da Hora(时间研究所)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY
AI总结 本文借鉴玛丽·雪莱的《弗兰肯斯坦》作为方法论框架,分析基于嵌入的面部识别如何通过检测、地标定位、对齐/正面化和嵌入等步骤,逐步将面部简化为数据,实施“计算性知识灭绝”,并论证废除主义作为规范性立场。
Comments Accepted to ACM FAccT 2026. Author's version. 17 pages, 2 figures
BioFirewall:面向智能体AI设计阶段生物安全筛查的基因组写入原生治理层
专题命中 AI治理与伦理 :prompt injection(abstract)
AI总结 针对智能体AI基因组编辑设计阶段的生物安全管控缺口,提出BioFirewall中间件,其在多维度筛查中表现优于大模型,能有效抵御攻击且假拒绝率低,已开源并附带可复现基准。
PPOM:用于基于CLIP的通用视觉-语言提示调优的补丁网格相位边缘化
机构 * Shanghai University(上海大学) ; University of Technology Sydney(悉尼科技大学)
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 本研究针对基于CLIP的视觉-语言提示调优对补丁网格对齐敏感的问题,提出无训练的PPOM算子,通过边缘化相位偏移提升宿主性能,无需重新训练。
推理如何塑造大语言模型生成代码中的社会偏见?
专题命中 AI治理与伦理 :trustworthy(abstract)
AI总结 该研究首次系统探究基于推理的代码生成中的社会偏见,发现推理可降低偏见但会影响代码质量,进而提出ProbeDebias框架,有效检测并缓解代码偏见,同时保持较高质量。
Comments ASE 2026
多智能体LLM辩论中偏向性共识的涌现
专题命中 AI治理与伦理 :safety(abstract)
AI总结 该研究针对多智能体LLM辩论中集体偏向性共识的涌现问题,提出物理启发的社会动力学分析框架,经实验验证其相变规律,发现智能体异质性可抑制该现象,且见解可推广至投资等现实决策任务。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). 23 pages, 12 figures
FairForensics:基于视觉-语言建模的通用公平深度伪造检测——表情感知与人口统计解析
机构 * Shenzhen University(深圳大学) ; Shandong Artificial Intelligence Institute(山东省人工智能研究院) ; Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院)) ; Tianjin University of Technology(天津理工大学)
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 本文构建人口统计平衡的深度伪造检测基准,提出FairForensics视觉-语言模型,通过表情感知与人口统计正则化实现通用公平检测,在基准上达到泛化与公平性的SOTA。
培养智能体工程师:AI时代的课程、协作与持续学习
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 针对AI时代软件与系统工程的转型需求,本文提出ACCEL框架,构建智能体工程师的教育架构,明确核心能力与实施路径,识别风险并主张开展系统性教育变革。
ParaASR:面向快速长上下文基于大语言模型的语音识别的多令牌预测
机构 * StepFun(阶跃星辰) ; NTU(南洋理工大学) ; PKU(北京大学) ; UNSW(新南威尔士大学) ; SJTU(上海交通大学) ; USTC(中国科学技术大学)
专题命中 AI治理与伦理 :safety(abstract)
AI总结 ParaASR是一款基于大语言模型的ASR系统,通过多令牌预测技术,在保持低错误率、低延迟的同时,支持32K长上下文及30分钟音频的快速转录,兼顾识别质量、速度与上下文长度。
Comments 14 pages, 3 figures, 4 tables
推理以规范:用于交通规则理解的思维链
机构 * CUHK-SZ, Shenzhen-FNii(香港中文大学(深圳),深圳高等金融研究院) ; HKUST(GZ)(香港科技大学(广州)) ; Tencent T Lab(腾讯T实验室)
专题命中 AI治理与伦理 :safety(abstract)
AI总结 针对交通规则理解这一自动驾驶关键挑战,提出为视觉语言模型配备思维链能力的框架,设计整理管道,采用两阶段训练方案,显著提升了可解释性和准确性,建立首个基于推理的自动驾驶框架。
Comments Technical Report
一种用于配电网中基于深度强化学习的电压调节的人机协作框架
专题命中 AI治理与伦理 :safety(abstract)
AI总结 针对分布式能源资源增加致配电网电压调节难的问题,提出人机协作强化学习框架。该框架结合SAC智能体与自适应拉格朗日约束机制,并融入人类指导模块,在特定环境实现。相比基线方法,显著降低电压违规严重性及功率损耗。
Comments 10 pages, 3 figures
用于检测引导的乳腺钼靶病变分类的区域基础视觉语言学习
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 针对乳腺钼靶病变分类,提出区域基础视觉语言学习方法,先通过区域-文本对比预训练对齐特征,引入多组件目标减轻偏差,再联合优化辅助病变检测头,实验表明该方法在多设置下性能优于相关方法。
PriEco-DRL:基于深度强化学习的电动公交生态驾驶与公交优先自适应信号联合优化
专题命中 AI治理与伦理 :safety(abstract)
AI总结 本文提出PriEco-DRL框架,运用深度强化学习将电动公交生态驾驶与公交优先自适应信号控制相结合,采用优先级加权最大压力控制器及结构化奖励,经集中训练和分散执行,实验表明其能降低电动公交能耗,实现能量-时间权衡。
卡尔达诺的伏尔泰治理:完整规范与研究计划
专题命中 AI治理与伦理 :safety(abstract)
AI总结 研究卡尔达诺的伏尔泰治理系统,给出其机制完整技术规范,涵盖架构、行动类型等;建立治理优化研究议程,含模拟平台设计等,提供初步结果如治理内核,助力推进区块链治理科学。
神谕者的策略:负责任的人工智能发布的博弈论框架
专题命中 AI治理与伦理 :safety(abstract)
AI总结 研究在人工智能模型能力提升背景下,负责任的人工智能发布决策问题。核心方法是将其视为双层斯塔克尔伯格博弈,通过承诺窗口设定双方能力。主要贡献是指出福利取决于能力差距,明确两用模型关键在于访问顺序而非部署阈值。
CoPersona: 面向鲁棒LLM个性化的协作人格图
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 针对用户历史稀疏和偏差导致的个性化脆弱问题,提出CoPersona框架,通过多面人格图从行为相似用户中借调信号,结合非参数检索与参数图推理的双分支架构,在多个领域和模型规模上超越强基线。
Comments Accepted at KDD '26. 12 pages, 5 figures, 8 tables
基于角色的多智能体模型用于生活实验室间气候适应讨论
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 提出一种模块化多层级智能体架构,整合基于动机的个体决策、社会影响网络和机构策略模块,以模拟气候治理中的复杂互动,支持情景探索。
Comments 4 pages, 1 figure, accepted as poster at the 21st annual Social Simulation Conference (SSC 2026)
探究LLM赋能的异议少数群体在权力不平衡群体决策中的支持:反驳与调解作为干预策略
专题命中 AI治理与伦理 :safety(abstract)
AI总结 本研究开发了LLM赋能的异议少数支持系统,通过AI生成的反驳或AI调解消息来关注少数观点,实验发现反驳增强满意度但调解增加参与却降低心理安全感,揭示了参与与心理安全之间的支持悖论。
Comments Accepted at CSCW 2026
验证门控的智能工业多机器人系统任务状态治理
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 AI治理与伦理 :safety(abstract)
AI总结 提出验证门控任务状态治理框架,通过同步任务森林与黑板状态,经确定性验证后原子提交,减少无效提交和冲突,提升工业多机器人系统安全与效率。
“一丝混乱与疯狂”:AI评估量表与评估改革工作
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 本研究通过越南和英国两所大学的焦点小组,探讨AI评估量表(AIAS)的实施经验,发现其能促进真实评估设计,但若脱离学习成果和学科背景可能沦为合规工具。
Comments V2: Corrections of errata, additional limitations
谁赢得冲突?音频大模型中文本偏差的机制可解释性
机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 本文通过机制分析揭示音频大模型中的文本主导偏差,发现文本路径主动抑制完整音频表征,并提出无训练干预方法back-patching以增强音频表征,缓解文本主导。
Comments Preprint
更快的代码,更深的债务?关于LLM辅助软件开发中技术债务及其早期迹象的多声部文献综述
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 通过104篇文献的多声部综述,发现LLM辅助开发放大传统技术债务(代码、设计、文档债务)并引入新债务(快速集成、提示、伦理、数据、来源债务),提出人机协同、提示工程等缓解策略,但缺乏标准化基准。
Comments Accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM), 2026
连接昼夜:基于协同提示与原型学习的无监督跨域重识别
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 提出无监督昼夜重识别框架,结合提示学习和原型表示学习,通过两阶段训练实现无标注跨域身份关联,性能媲美全监督方法。