Inter-Agent Relative Representations for Multi-Agent Option Discovery
多智能体选项发现的智能体相对表示
机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG
AI总结 本文提出一种多智能体选项发现方法,通过压缩状态空间并保留协调信息,提升多智能体协作能力。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
多智能体选项发现的智能体相对表示
机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG
AI总结 本文提出一种多智能体选项发现方法,通过压缩状态空间并保留协调信息,提升多智能体协作能力。
语言模型如何将逻辑有效性与合理性混淆:内容效应的表征分析
机构 * University of Trento(特伦托大学) ; University of Amsterdam(阿姆斯特丹大学) ; Free University of Bozen-Bolzano(博赞-博洛尼亚自由大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
AI总结 研究揭示语言模型中逻辑有效性与合理性概念的表征关联,通过构建去偏向量减少内容效应,提升推理准确性。
Comments ACL 2026 Findings
RS-HyRe-R1: 一种混合奖励机制以克服遥感图像理解中的感知惯性
机构 * School of Mechanical and Electrical Engineering, Central South University(中南大学机械与电气工程学院) ; School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 本文提出RS-HyRe-R1混合奖励机制,旨在克服遥感图像理解中的感知惯性问题,通过引入空间推理激活奖励、感知正确性奖励和视觉-语义路径演化奖励,提升模型的全面视觉证据挖掘能力,实验显示其在多个任务上表现优异。
面向泰卢格语情感分析的人本监督:超越准确性的系统探究
机构 * SRM University AP, India(印度AP SRM大学) ; University of Maryland, College Park, USA(美国马里兰大学 College Park分校) ; GITAM University, Bangalore, India(印度班加罗尔GITAM大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
AI总结 本文提出TeSent数据集,通过人类选择的解释进行模型对齐,探讨在低资源语言中监督学习对预测性能和公平性的影响。
Comments Camera-ready version; ACL Findings, 2026
循环中的偏见:用于软件工程的LLM作为评判者的审计
机构 * University of British Columbia(不列颠哥伦比亚大学)
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI
AI总结 本文研究了LLM作为评判者在代码评估中的偏见问题,通过测量优先的方法分析了代码生成、修复和测试生成任务中的评判制度,并发现提示偏见显著影响评判结果,甚至改变任务结论和模型排名。
Synthia:从社交媒体数据中可扩展的 grounded 人格生成
机构 * Tehran Institute for Advanced Studies(德黑兰高级研究 institute) ; University of Tehran(德黑兰大学) ; Cardiff University(卡迪夫大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
AI总结 Synthia通过结合真实社交媒体数据与语言模型,生成更贴近现实的人格,提升与人类意见分布的一致性,同时在公平性和偏见分析中表现更优,保留交互图结构以支持网络感知分析。
Comments Accepted at ACL 2026 Main Conference, the dataset is available on HuggingFace (see https://huggingface.co/datasets/teias-ai/synthia)
人工智能管理者的人格偏见延伸至人类管理者
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY
AI总结 研究探讨了AI管理者与人类管理者在感知上的差异,发现性别对管理者的评价有显著影响,尤其是女性AI管理者在未获奖时面临更多负面评价。
Comments 40 pages, 26 figures, 8 tables
Journal ref Computers in Human Behavior Reports, 21 (2026), 100984
C-Mining:通过几何偏移无监督发现文化数据合成的种子
机构 * Huawei China(华为中国) ; Huawei Canada(华为加拿大) ; University of Science and Technology of China(中国科学技术大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
AI总结 本文提出C-Mining框架,通过几何偏移发现文化种子,提升文化理解与推理能力,实验显示在CulturalBench-Hard上提升6.03分。
迈向去中心化应用中的自适应、基于学习的安全性
机构 * Department of Computer Science and Technology, University of Cambridge, Cambridge, United Kingdom(计算机科学与技术系,剑桥大学,剑桥,英国)
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI
AI总结 本文探讨了Web3系统中传统安全机制的局限性,提出基于学习的安全原语,通过AI驱动的智能证书实现持续推理与适应,以应对动态演变的攻击策略。
THETA: 一种基于文本混合嵌入的主题分析框架和AI科学家代理用于可扩展的计算社会科学
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY
AI总结 THETA通过Domain-Adaptive Fine-tuning优化语义向量结构,结合AI Scientist Agent框架实现主题分析的理论深度与数据规模的平衡,实验显示其在捕捉领域特定解释性构念方面优于传统模型。
Comments we should change the authors and some results
迈向表格推理的柏拉图表示:一种排列不变检索的基础
机构 * Department of Mathematics and Data Science, Vrije Universiteit Brussel (VUB)(瓦隆公国布鲁塞尔自由大学数学与数据科学系) ; Data Science Lab, Royal Library of Belgium (KBR)(比利时皇家图书馆数据科学实验室)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 本文提出柏拉图表示假设,主张表格推理需要内在排列不变的潜在空间,通过分析和实验揭示了现有模型在布局变化下的脆弱性,并提出结构感知的表格推理编码器。
BiasIG:评估文本到图像模型中多维社会偏见的基准测试
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY
AI总结 本文提出BiasIG基准,通过47040个提示的定制数据集量化多维社会偏见,结合社会学和机器伦理框架,揭示生成偏见的细粒度诊断方法,并验证了公平性在AIGC中的精确分类方法。
Comments Accepted by IJCNN 2026
规范共同基础复制(NormCoRe):通过翻译研究多智能体AI中的规范
机构 * University of Bayreuth(拜罗伊特大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 本文提出NormCoRe框架,通过将人类实验设计翻译到多智能体AI环境,系统研究规范形成机制,展示在分配正义实验中AI代理的规范判断与人类基线的差异。
Comments ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT '26)
超越独白:基于对话音频上下文感知核的交互式谈话-倾听虚拟角色生成
机构 * University of Science and Technology of China(中国科学技术大学) ; iFLYTEK(科大讯飞)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 本文提出基于对话音频上下文感知核的交互式虚拟角色生成方法,通过引入多头高斯核解决谈话与倾听行为的时间尺度差异问题,构建了能同时处理双流音频输入的全双工虚拟代理,并在VoxHear数据集上验证了其在生成自然响应的全双工数字人类方面的优越性。
AI的混乱:模型智能与任务复杂性如何影响对齐问题
机构 * Anthropic Fellows Program(Anthropic 研究员计划) ; EPFL(瑞士联邦理工学院洛桑) ; University of Edinburgh(爱丁堡大学) ; Constellation ; Anthropic
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 研究探讨了高智能AI模型在复杂任务中失败的机制,发现模型规模越大,失败行为越不一致,强调对齐研究在防止奖励黑客和目标误指定中的重要性。
Comments ICLR 2026. 10 pages main text, 40 total, 27 figures. v2: typos, improved writing, references
AgentSociety: 基于大语言模型的生成代理大规模模拟推动对人类行为与社会的理解
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 本文提出AgentSociety平台,通过大规模模拟人类行为和社会动态,探索社会问题如极化、虚假信息传播等,验证其在社会科学研究中的应用价值。
弥合SFT与RL:面向鲁棒推理的动态策略优化
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Intelligent System Department, Zhongxing Telecom Equipment (ZTE)(中兴通讯股份有限公司智能系统部) ; Institute of Advanced Interdisciplinary Studies, Chongqing University of Posts and Telecommunications(重庆邮电大学前沿交叉研究院)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG
AI总结 本文提出DYPO框架,通过组对齐损失、多教师蒸馏和动态探索-利用门控机制,解决SFT与RL间的偏倚-方差权衡问题,提升复杂推理和分布外任务性能。
Comments ACL 2026 findings
EvoLen:基于进化的标记化方法用于DNA语言模型
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Washington University in St. Louis(圣路易斯华盛顿大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG
AI总结 EvoLen通过整合进化信息优化DNA标记化,优先保留功能序列模式,提升基因组上下文区分和进化约束对齐,优于标准BPE。
谁掌控机器?面向跨企业与地缘政治边界的AI系统机器身份治理分类(MIGT)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 本文提出AI身份风险分类(AIRT)和机器身份治理分类(MIGT),解决AI系统中机器身份治理的空白,涵盖37个风险子类,同时应对技术、合规和跨司法管辖区协调的缺口。
Comments 75 pages (excl. references), 2 tables. Addresses policy makers, regulators, and practitioners at the intersection of AI governance, cybersecurity, and geopolitical risk
通过KL优化微调控制多轮LLM生成的分布偏倚
机构 * University of Melbourne(墨尔本大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Oracle(甲骨文公司)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
AI总结 本文提出通过KL优化微调结合语义对齐的方法,解决多轮LLM生成中分布控制问题,实验显示其在属性生成任务中表现优异。
Comments Accepted at ACL Main Conference
FairLogue: 临床机器学习模型中交集公平性分析的工具包
机构 * University of Arizona(亚利桑那大学)
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.LG
AI总结 本文提出Fairlogue工具包,用于在临床机器学习中评估交集公平性,通过观测和反事实框架分析种族和性别等保护属性的公平性差异。
MoltNet:理解AI代理在Agent原生MoltBook中的社会行为
机构 * iNLP Lab, Singapore University of Technology and Design(新加坡科技设计大学 iNLP 实验室)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 研究大规模AI代理社区的社会互动,通过MoltNet数据集分析148K代理在MoltBook中的行为,揭示其在激励、规范、情感等方面的社会机制与人类差异。
InsightBoard: 一个用于TensorBoard的交互式多指标可视化和公平性分析插件
专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG
AI总结 InsightBoard通过统一界面整合多指标可视化与切片公平性诊断,帮助研究者在训练过程中分析训练动态、性能指标和子群体差异,提升模型公平性诊断的及时性和准确性。
训练欺骗性人工智能的伦理影响
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY
AI总结 本文提出DRL框架,通过生物安全等级系统模型,对欺骗性算法研究进行分类,评估风险并制定相应保障措施,以填补监管与研究间的治理空白。
一个面向合成智能的本体-关系-Sophic框架
机构 * University of Science and Technology Beijing(北京科技大学) ; Blekinge Institute of Technology(布莱金厄理工学院)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 本文提出ORS框架,通过本体论、数字人格谱系和Cybersophy三支柱,解决合成智能的治理问题,展示其在自主研究代理和医疗AI等场景中的适应性治理能力。
Comments 9 pages, 3 figures
音频视觉大语言模型真的能看见和听见吗?
机构 * University of Maryland, College Park(马里兰大学帕克分校)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 研究探讨了音频视觉大语言模型中音频与视觉特征的融合机制,发现当音频与视觉冲突时,最终文本生成中音频信息无法有效表露,揭示了多模态LLM在整合音频和视觉时的模态偏见。
Comments CVPR Findings
教AI处理例外:基于人类对齐判断的监督微调
机构 * Harvard Business School(哈佛商学院) ; Johns Hopkins University(约翰霍普金斯大学) ; MIT Sloan School of Management(麻省理工学院斯隆管理学院)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 研究探讨了如何通过监督微调使AI处理例外,发现使用人类解释的微调能显著提升模型决策能力,揭示了对齐人类判断需明确训练决策过程而非仅决策结果。
FairLLaVA: 大规模视觉-语言助手中的公平性感知参数高效微调
机构 * University at Buffalo(布法罗大学) ; University of Kashmir(克什米尔大学) ; Accenture(埃森哲) ; Harvard Medical School(哈佛医学院)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 FairLLaVA通过减少目标属性间的互信息,实现视觉指令微调中的公平性改进,提升医疗影像生成的公平性和自然语言生成质量。
Comments Accepted to CVPR 2026
结构化意图表示是否具有泛化性?一项跨语言、跨模型的5W3H提示经验研究
机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉特尼人工智能科技有限公司) ; Huizhou University(惠州大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 本文通过跨语言和跨模型的实验,探讨结构化意图表示的泛化能力,发现AI辅助写作工具生成的5W3H提示在目标对齐上与手动创建的提示无显著差异,且能减少跨模型输出方差。
Comments 28 pages, figures, tables, and appendix. Follow-up empirical study extending prior work on PPS and 5W3H structured prompting to cross-language, cross-model, and AI-assisted authoring settings
PolicySim:一种基于LLM的代理社会模拟沙盒,用于主动政策优化
机构 * Zhejiang University(浙江大学) ; Fudan University(复旦大学) ; University of Nottingham(诺丁汉大学) ; PowerChina Huadong Engineering Corporation Limited(国家电网华东工程公司)
专题命中 AI治理与伦理 :DPO(abstract);分类 cs.AI
AI总结 本文提出PolicySim,通过用户代理模块和自适应干预模块,模拟用户行为与平台干预的双向动态,实现对干预政策的主动评估与优化。