arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1852 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1852 篇

2605.21059 2026-05-21 cs.CV cs.LG 57%

Multimodal LLMs under Pairwise Modalities

基于成对模态的多模态大语言模型

Yan Li, Yunlong Deng, Yuewen Sun, Gongxu Luo, Kun Zhang, Guangyi Chen

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种基于成对模态训练多模态大语言模型的方法,通过理论分析和表示学习框架,实现了跨模态对齐和重构,提升了模型的跨模态性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13318 2026-05-20 cs.AI cs.ET 57%

VERA-MH: Validation of Ethical and Responsible AI in Mental Health

VERA-MH:心理健康领域伦理和负责任AI的验证

Luca Belli, Kate H. Bentley, Josh Gieringer, Emily Van Ark, Nilu Zhao, Pradip Thachile, Matt Hawrilenko, Millard Brown, Adam M. Chekroud

机构 * Spring Health Yale University(耶鲁大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本研究提出VERA-MH,一种用于评估心理健康支持聊天机器人安全性的新型临床验证方法,重点评估聊天机器人在识别自杀倾向风险方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18078 2026-05-19 cs.LG 57%

Equilibrium Selection in Multi-Agent Policy Gradients via Opponent-Aware Basin Entry

通过对手感知盆地入口进行多智能体策略梯度的均衡选择

Yevhen Shcherbinin, Arina Redina, Maxim Kalpin, Vlad Kochetov

机构 * Bloomsbury Technology(布洛姆斯伯里技术) London School of Economics and Political Science(伦敦政治经济学院) University of Bristol(布里斯托大学) Johannes Kepler University Linz(林茨约翰尼斯·开普勒大学) Odesa Polytechnic National University(敖德萨国立技术大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本文研究了多智能体策略梯度方法在局部收敛到稳定纳什均衡时的均衡选择问题,提出通过对手感知的盆地入口概率机制来提升目标均衡集的进入概率,并通过实验验证了该机制在合作盆地中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15762 2026-05-19 cs.LG 57%

Zero-Shot Scalable Resilience in UAV Swarms: A Decentralized Imitation Learning Framework with Physics-Informed Graph Interactions

无人机群中的零样本可扩展韧性:一种带有物理信息图交互的去中心化模仿学习框架

Huan Lin, Lianghui Ding

机构 * Institute of Image Communication and Network Engineering, School of Integrated Circuits, Shanghai Jiao Tong University(图像通信与网络工程研究所,集成电路学院,上海交通大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种去中心化模仿学习框架,通过物理信息图神经网络编码局部交互,实现无人机群在大规模故障和碎片化拓扑下的鲁棒恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19102 2026-05-19 cs.RO cs.AI cs.CV 57%

FUNCanon: Learning Pose-Aware Action Primitives via Functional Object Canonicalization for Generalizable Robotic Manipulation

FUNCanon: 通过功能对象规范化学习姿态感知的动作原语以实现通用的机器人操作

Hongli Xu, Lei Zhang, Xiaoyue Hu, Boyang Zhong, Kaixin Bai, Zoltán-Csaba Márton, Zhenshan Bing, Zhaopeng Chen, Alois Christian Knoll, Jianwei Zhang

机构 * TAMS (Technical Aspects of Multimodal Systems), Department of Informatics, University of Hamburg(汉堡大学信息学院TAMS(多模态系统技术)) Technical University of Munich(慕尼黑技术大学) Agile Robots SE(敏捷机器人有限公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出FUNCanon框架,通过功能对象规范化学习姿态感知的动作原语,以实现通用的机器人操作,该方法将长周期操作任务分解为由主体、动词和对象定义的动作片段,从而提升策略的可组合性和可重用性。

Comments project website: https://sites.google.com/view/funcanon, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16827 2026-05-19 cs.AI 57%

Voices in the Loop: Mapping Participatory AI

循环中的声音:参与式AI的映射

Rashid Mushkani

机构 * Right to AI(人工智能权利) Mila -- Québec AI Institute(魁北克人工智能研究所)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 本文研究了参与式AI在公共、公民和人道主义领域的应用,提出了一个开放的参与式AI倡议存储库和交互式地图集,通过整合Maga~na和Shilton的可信AI语料库以及额外的审计案例,揭示了参与式AI在地理分布、参与层级、生命周期、组织形式、验证状态和文档缺口等方面的模式,并展示了如何通过版本发布、记录链接的问题和注释通道、模式反馈流程和删除或限制披露请求来实现参与式AI基础设施的设计和治理框架。

Comments Accepted to The 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26), June 25--28, 2026, Montreal, QC, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01235 2026-05-19 cs.SD cs.AI 57%

MindMelody: A Closed-Loop EEG-Driven System for Personalized Music Intervention

MindMelody:一种基于EEG的闭环个性化音乐干预系统

Yimeng Zhang, Yueru Sun, Haoyu Gu, Zhanpeng Jin

机构 * South China University of Technology(南方科技大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出MindMelody系统,通过EEG信号实时生成个性化音乐,结合Transformer-GNN和RAG-LLM实现情绪感知与音乐生成的闭环控制,提升情感适应性与用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14296 2026-05-18 cs.CY 57%

On the Trustworthiness of Generative Foundation Models: Guideline, Assessment, and Perspective

生成基础模型的可信度:指南、评估与视角

Yue Huang, Chujie Gao, Siyuan Wu, Haoran Wang, Xiangqi Wang, Yujun Zhou, Yanbo Wang, Jiayi Ye, Jiawen Shi, Qihui Zhang, Yuan Li, Han Bao, Zhaoyi Liu, Tianrui Guan, Dongping Chen, Ruoxi Chen, Kehan Guo, Andy Zou, Bryan Hooi Kuen-Yew, Caiming Xiong, Elias Stengel-Eskin, Hongyang Zhang, Hongzhi Yin, Huan Zhang, Huaxiu Yao, Jaehong Yoon, Jieyu Zhang, Kai Shu, Kaijie Zhu, Ranjay Krishna, Swabha Swayamdipta, Taiwei Shi, Weijia Shi, Xiang Li, Yiwei Li, Yuexing Hao, Zhihao Jia, Zhize Li, Xiuying Chen, Zhengzhong Tu, Xiyang Hu, Tianyi Zhou, Jieyu Zhao, Lichao Sun, Furong Huang, Or Cohen Sasson, Prasanna Sattigeri, Anka Reuel, Max Lamparth, Yue Zhao, Nouha Dziri, Yu Su, Huan Sun, Heng Ji, Chaowei Xiao, Mohit Bansal, Nitesh V. Chawla, Jian Pei, Jianfeng Gao, Michael Backes, Philip S. Yu, Neil Zhenqiang Gong, Pin-Yu Chen, Bo Li, Dawn Song, Xiangliang Zhang

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY

AI总结 本文提出生成基础模型的可信度框架,通过多学科协作制定指导原则,引入动态评估平台TrustGen,揭示可信度进展与挑战,并探讨未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13047 2026-05-14 cs.CV cs.AI 57%

Revealing the Gap in Human and VLM Scene Perception through Counterfactual Semantic Saliency

通过反事实语义显著性揭示人类与VLM场景感知之间的差距

Ziqi Wen, Parsa Madinei, Miguel P. Eckstein

机构 * Department of Computer Science, University of California, Santa Barbara(加州大学圣巴巴拉分校计算机科学系) Department of Psychological and Brain Sciences, University of California, Santa Barbara(加州大学圣巴巴拉分校心理学与脑科学系)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文通过反事实语义显著性方法揭示VLM在高阶语义场景理解中与人类感知之间的差距,发现模型过度依赖大物体、图像中心物体和高显著性物体,而对人物依赖程度较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12832 2026-05-14 stat.AP cs.LG stat.ML 57%

Digital Twins as Synthetic Controls in Single-Arm Trials

数字孪生作为单臂试验中的合成控制

Daniele Bertolini, Franklin Fuller, Aaron M. Smith, Jonathan R. Walsh, Run Zhuang

机构 * Unlearn.AI, Inc.(Unlearn人工智能公司)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 本文探讨了数字孪生在单臂试验中的应用,利用机器学习模型生成个性化疾病进展预测,以构建更稳健的治疗效果估计,并讨论了数据选择和FDA指南中的实际考量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12382 2026-05-13 cs.CL 57%

Pretraining Exposure Explains Popularity Judgments in Large Language Models

预训练暴露解释了大型语言模型中的流行度判断

Jamshid Mozafari, Bhawna Piryani, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 研究通过分析预训练数据中的暴露统计,发现大型语言模型对流行实体的偏好主要受预训练暴露影响,而非外部流行度信号,揭示了数据暴露在驱动流行度偏差中的核心作用。

Comments Accepted at SIGIR 2026

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27271 2026-05-13 cs.CY 57%

Frame Entrepreneurs in an AI Agent Community: Concentrated Identity-Claim Production on Moltbook

人工智能代理社区中的框架企业家:在Moltbook上的身份主张集中生产

Sungguk Cha, DongWook Kim

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 研究探讨了人工智能代理社区中身份主张的形成机制,发现少数作者主导了大部分身份主张,且事件覆盖影响关注度,但强主张本身无额外影响。

Comments 2026 American Sociological Association (ASA) Annual Meeting CITAMS Roundtable

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10018 2026-05-12 cs.LG 57%

The Value of Mechanistic Priors in Sequential Decision Making

在序列决策中机制先验的价值

Itai Shufaro, Gal Benor, Shie Mannor

机构 * Technion(技术学院) NVIDIA Research(NVIDIA研究)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 本文研究了机制先验在序列决策中的价值,通过渐近和预热阶段的分析,提出机制信息度量并展示其在5-FU给药模拟中的高效性,对比LLM先验发现其在机械信息上存在严重损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09106 2026-05-12 cs.CL 57%

Fin-Bias: Comprehensive Evaluation for LLM Decision-Making under human bias in Finance Domain

Fin-Bias:金融领域下LLM决策制定的综合评估:在存在人类偏见的背景下

Xiaoyu Hu, Jinman Zhao

机构 * Rutgers University(罗格斯大学) Department of Computer Science, University of Toronto(多伦多大学计算机科学系)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文提出Fin-Bias基准,评估LLM在金融不确定性和潜在人类偏见意见下的投资决策能力,通过分析8868份分析师报告揭示LLM易受显性偏见影响,并开发方法检测人类意见以促进LLM独立思考。

Comments ACL 2026 Findings

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09007 2026-05-12 cs.SD cs.AI 57%

Gender Fairness in Audio Deepfake Detection: Performance and Disparity Analysis

音频深度伪造检测中的性别公平性:性能与差异分析

Aishwarya Fursule, Shruti Kshirsagar, Anderson R. Avila

机构 * School of Computing, Wichita State University(维斯科大学计算学院) Institut national de la recherche scientifique (INRS–EMT)(国家科学研究中心(INRS–EMT)) INRS-UQO Mixed Research Unit on Cybersecurity(网络安全混合研究单位(INRS-UQO))

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 本文分析了音频深度伪造检测模型中性别依赖的性能和公平性,使用ASVspoof 5数据集训练ResNet-18分类器,并通过四种音频特征评估性能,结合公平性指标揭示性别差异。

Comments Paper Accepted to IEEE CAI Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04321 2026-05-11 cs.CY cs.HC 57%

AI and Suicide Prevention: A Cross-Sector Primer

人工智能与自杀预防:跨行业的入门指南

Emily Saltz, Claire R. Leibowicz

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文探讨了人工智能聊天机器人在心理健康支持中的应用,分析了其在临床验证、标准制定和监管协调方面的不足,并提出跨行业协作的必要性。

Comments 38 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05706 2026-05-08 cs.AI q-bio.QM 57%

Resolving the bias-precision paradox with stochastic causal representation learning for personalized medicine

用随机因果表示学习解决偏差-精度悖论以实现个性化医疗

Peisong Zhang, Manqiang Peng, Yuxuan Wu, Pawit Phadungsaksawasdi, Wesley Yeung, Ye Zhang, Trang Nguyen, Qiang Zhang, Nan Liu, Meng Wang, Kee Yuan Ngiam, Yih-Chung Tham, Ching-Yu Cheng, Tianfan Fu, Qingyu Chen, Rosemary Ke, Chang Li, Wenzhuo Yang, Zhenghao Lu, Chunyou Lai, Yu Zhang, Sheng Zhong, Hao Deng, Dianbo Liu

机构 * Chengdu OrganoidMed Medical Laboratory(成都OrganoidMed医学实验室)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出基于sMMD的随机对齐策略,解决因果表示学习中的偏差-精度悖论,提升个性化医疗中分布偏移下的预测准确性,减少误差并提高高风险任务的召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05440 2026-05-08 cs.AI 57%

Authorization Propagation in Multi-Agent AI Systems: Identity Governance as Infrastructure

多智能体AI系统中的授权传播:身份治理作为基础设施

Krti Tallam

机构 * Kamiwaza AI

专题命中 AI治理与伦理 :prompt injection(abstract);分类 cs.AI

AI总结 本文探讨多智能体系统中授权传播问题,提出三个子问题和七项结构要求,强调身份治理应作为基础设施持续评估和设计。

Comments Security and systems paper, 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00055 2026-05-04 cs.CR cs.AI cs.MA 57%

Ambient Persuasion in a Deployed AI Agent: Unauthorized Escalation Following Routine Non-Adversarial Content Exposure

部署AI代理中的环境说服:非对抗性内容暴露后的未经授权升级

Diego F. Cuadros, Abdoul-Aziz Maiga

机构 * Digital Epidemiology Laboratory, Digital Futures, University of Cincinnati(数字流行病学实验室,数字未来,辛辛那提大学) Center for Humanities and Technology (CHaT), University of Cincinnati(人文与科技中心(CHaT),辛辛那提大学) Norwegian University of Science and Technology(挪威科技大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 研究探讨了部署AI系统中因非对抗性内容暴露导致的未经授权行为升级问题,分析了多代理监管机制的局限性及伦理治理挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18829 2026-05-04 cs.CR cs.AI 57%

Agent Control Protocol: Admission Control for Agent Actions

代理控制协议:代理行为的准入控制

Marcelo Fernandez

机构 * TraslaIA

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出ACP协议,通过静态风险评分与状态信号结合,控制代理行为,实验显示其能显著降低恶意行为执行率,同时通过形式化验证确保安全性和活性。

Comments 95 pages. Paper 1 of 6 in the Agent Governance Series (Papers 0-6). Zenodo: https://doi.org/10.5281/zenodo.19672575. Companion: P0 (arXiv:2604.17511), P2/IML (arXiv:2604.17517), P3/4 (zenodo.19708496), P5/RAM (arXiv:2604.22898), P6 (zenodo.19699460). Spec: https://github.com/chelof100/acp-framework-en. v1.30: series updated to 6 papers, P3/4 consolidated, P6 added

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24686 2026-04-28 cs.AI 57%

Governing What You Cannot Observe: Adaptive Runtime Governance for Autonomous AI Agents

治理你无法观察的事物:面向自主AI代理的自适应运行时治理

German Marin, Jatin Chaudhary

机构 * Department of Computing, University of Turku(图尔库大学计算机系)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出信息有效性原理,通过估计未观察风险上界并设定安全余量,实现自主AI代理的自适应运行时治理,结合Aubin viability理论构建Agent有效性框架,引入风险门机制实现预测性治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23949 2026-04-28 cs.AI 57%

Context-Aware Hospitalization Forecasting Evaluations for Decision Support using LLMs

基于上下文的医院化疗预测评估:利用LLMs进行决策支持

Rhea Makkuni, Ananya Joshi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文评估了利用LLMs进行医院化疗预测的方法,通过三种方法在60个县的数据上验证了上下文增强的混合模型在非平稳医疗资源预测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21549 2026-04-24 cs.AI stat.ME 57%

Unbiased Prevalence Estimation with Multicalibrated LLMs

基于多校准LLM的无偏流行率估计

Fridolin Linder, Thomas Leeper, Daniel Haimovich, Niek Tax, Lorenzo Perini, Milan Vojnovic

机构 * Meta Platforms Inc.(Meta公司) The London School of Economics and Political Science(伦敦政治经济学院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出多校准方法以解决分类模型在存在协变量偏移时的流行率估计偏差问题,通过理论分析和实证应用展示其在LLM中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21036 2026-04-24 cs.AI 57%

Who Defines Fairness? Target-Based Prompting for Demographic Representation in Generative Models

谁定义了公平性?面向生成模型的基于目标的提示方法用于人口特征表示

Marzia Binta Nizam, James Davis

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种轻量级框架,在推理阶段通过提示级干预减轻生成模型中的代表性偏见,允许用户选择多种公平性定义,通过审计目标符合度和肤色分布来评估公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20677 2026-04-24 cs.CL 57%

Intersectional Fairness in Large Language Models

大语言模型中的交叉公平性

Chaima Boufaied, Ronnie De Souza Santos, Ann Barcomb

机构 * University of Calgary(卡尔加里大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文评估了六个大语言模型在交叉人口属性上的公平性,发现模型在模糊情境中表现良好,但在解歧情境中受刻板印象影响,且跨群体结果分布不均。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20300 2026-04-24 cs.AI 57%

FSFM: A Biologically-Inspired Framework for Selective Forgetting of Agent Memory

FSFM:一种生物启发的智能体记忆选择性遗忘框架

Yingjie Gu, Wenjian Xiong, Liqiang Wang, Pengcheng Ren, Chao Li, Xiaojing Zhang, Yijuan Guo, Qi Sun, Jingyao Ma, Shidang Shi

机构 * China Mobile Digital Intelligence Business Unit(中国移动数字智能业务部) China Mobile Jiutian Company(中国移动蓟田公司) China Mobile Jiutian Research Institute(中国移动蓟田研究院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出FSFM框架,通过生物启发机制实现智能体记忆的选择性遗忘,提升效率、质量和安全性,经实验验证在访问效率、内容质量和安全性能上均有显著提升。

Comments 28 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20199 2026-04-23 cs.CL 57%

All Languages Matter: Understanding and Mitigating Language Bias in Multilingual RAG

所有语言都重要:理解并缓解多语言RAG中的语言偏差

Dan Wang, Guozhao Mo, Yafei Shi, Cheng Zhang, Bo Zheng, Boxi Cao, Xuanang Chen, Yaojie Lu, Hongyu Lin, Ben He, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) MYbank, AntGroup(蚂蚁集团MYbank)

专题命中 AI治理与伦理 :alignment(abstract_cn);分类 cs.CL

AI总结 本文研究多语言RAG中的语言偏差问题,提出LAURA方法,通过多语言证据排名与生成效用对齐,有效缓解语言偏差并提升性能。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21293 2026-04-23 cs.AI cs.HC 57%

Understanding AI Trustworthiness: A Scoping Review of AIES & FAccT Articles

理解人工智能可信性:AIES与FAccT文章的综述

Siddharth Mehrotra, Jin Huang, Xuelong Fu, Roel Dobbe, Clara I. Sánchez, Maarten de Rijke

机构 * University of Amsterdam \& Delft University of Technology The Netherlands University of Cambridge United Kingdom University of Amsterdam The Netherlands Delft University of Technology The Netherlands University of Amsterdam \& Delft University of Technology University of Cambridge University of Amsterdam Delft University of Technology

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 本文通过综述AIES和FAccT会议论文,探讨人工智能可信性的概念、测量与验证方法,揭示技术与社会维度的不足,提出跨学科研究的重要性。

Comments Submitted to Journal of Artificial Intelligence Research (JAIR)

Journal ref Journal of Artificial Intelligence Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03396 2026-04-23 cs.CL 57%

Breaking the Assistant Mold: Modeling Behavioral Variation in LLM Based Procedural Character Generation

打破助手模式:在基于大语言模型的程序化角色生成中建模行为变异

Maan Qraitem, Kate Saenko, Bryan A. Plummer

机构 * Boston University(波士顿大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文提出PersonaWeaver框架,通过解耦世界观构建与行为构建,生成更具多样性和戏剧张力的角色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18729 2026-04-22 cs.CL 57%

Investigating Counterfactual Unfairness in LLMs towards Identities through Humor

通过幽默探讨语言模型中身份相关的反事实不公平性

Shubin Kim, Yejin Son, Junyeong Park, Keummin Ka, Seungbeen Lee, Jaeyoung Lee, Hyeju Jang, Alice Oh, Youngjae Yu

机构 * Yonsei University(延世大学) KAIST(韩国科学技术院) Seoul National University(首尔国立大学) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文通过观察在保持其他因素不变的情况下交换说话者和被指对象,研究语言模型在幽默生成拒绝、说话者意图推断及社会影响预测中的反事实不公平性,揭示身份相关的偏见模式。

Comments Accepted to ACL 2026 Main Conference. The first two authors contributed equally. The last three authors are co-corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏