arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-09-01 至 2026-09-01 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 9 篇

2607.02368 2026-09-01 stat.ML cs.AI cs.LG math.DG 版本更新 62%

Cultural Bias Without a Cultural Self:A Disassociation Study of LLM's Persona and Bias

LLM人格的双重性质:聚合倾向与框架依赖的几何结构

Yuan Yuan

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 通过心理测量问卷评估LLM人格时,发现人格表达包含聚合特征(大五人格分数)和几何特征(SPD流形)两种可分离成分,其中几何特征并非内在属性,而是框架依赖的协调模式,揭示了LLM人格的双重性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03211 2026-09-01 cs.CY cs.AI 版本更新 62%

Retrofitters, pragmatists and activists: Public interest litigation for accountable automated decision-making

改造者、实用主义者和活动家:为可问责的自动化决策而进行的公益诉讼

Henry L Fraser, Zahra Stardust

机构 * Queensland University of Technology, School of Law(昆士兰理工大学法学院) Centre for Automated Decision-Making and Society(自动化决策与社会研究中心) Queensland University of Technology, School of Communication(昆士兰理工大学传播学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨公益诉讼在澳大利亚促进AI和自动化决策问责中的作用,基于访谈分析策略与局限,强调制度安排对有效诉讼的关键性。

Comments Accepted version, Law and Society Review (forthcoming)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29306 2026-09-01 cs.CY 新提交 57%

The relationship between professional and general ethics in generative AI

生成式AI中职业伦理与一般伦理的关系

Omri Asscher, Mirco Musolesi

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文针对生成式AI领域一般伦理与职业伦理的冲突问题,提出二者层级关系与情境平衡的框架,可用于系统评估AI模型职业伦理,还给出干预调整方案,为相关研究提供基础。

Comments 26 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29206 2026-09-01 cs.AI 新提交 57%

Benevolent Bias in Multi-Turn Human-Agent Dialogue

多轮人机对话中的善意偏见

Qianqi Liu, Jin Huang, Fethiye Irmak Dogan, Hatice Gunes

机构 * University of Cambridge(剑桥大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本研究针对人机对话中隐藏在积极语气后的善意偏见,构建了标注语料库并测试两类检测器,发现现有安全检测器难识别善意偏见,LLM评判器易误判,需关注对待方式差异以实现公平监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30085 2026-09-01 cs.CL econ.GN 版本更新 57%

Tastes without distinction: silicon samples and the synthetic construction of tastes

非完全人类品味:LLM调查替代者的程式化杂食性

Xiangyu Ma, Mengmi Zhang, Shannon Ang, Minne Chen

机构 * Nanyang Technological University Singapore(新加坡南洋理工大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本研究使用多个大型语言模型生成大量调查替代者,发现其品味存在系统性正向偏差、丧失真实品味结构的复杂关系,且扭曲了品味与社会空间的关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08698 2026-09-01 cs.LG q-bio.GN 版本更新 57%

EvoLen: Evolution-Guided Tokenization for DNA Language Model

EvoLen:基于进化的标记化方法用于DNA语言模型

Nan Huang, Xiaoxiao Zhou, Junxia Cui, Mario Tapia-Pacheco, Tiffany Amariuta, Yang Li, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 EvoLen通过整合进化信息优化DNA标记化,优先保留功能序列模式,提升基因组上下文区分和进化约束对齐,优于标准BPE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16013 2026-09-01 cs.CL 版本更新 57%

Political Ideology Shifts in Large Language Models

大语言模型中的政治意识形态转变

Pietro Bernardelle, Stefano Civelli, Leon Fröhling, Riccardo Lunardi, Kevin Roitero, Gianluca Demartini

机构 * The University of Queensland(昆士兰大学) University of Udine(乌迪内大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 本研究以政治指南针测试为探针,发现大语言模型的意识形态可塑性随规模变化,显式启动会引发不同程度的意识形态转变,凸显评估其政治属性时需考虑交互因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30938 2026-09-01 cs.MA 新提交 50%

Evidence, Logic, and Compliance: Multi-Agent Structured Graph Reasoning with Expert Arbitration for Medical Referral

证据、逻辑与合规性:面向医疗转诊的专家仲裁多智能体结构化图推理

Qi Peng, Yi Cai, Jialin Cui, Tong Zhu, Yujuan Ding, Qingbao Huang, Tao Wang, Jiayuan Xie, Changmeng Zheng, Qing Li

专题命中 AI治理与伦理 :safety(abstract)

AI总结 该研究针对LLM用于医疗转诊的信息过载与非结构化协作问题,提出MASGR框架,通过多智能体结构化图推理及专家仲裁机制提升复杂医疗转诊的精准度,表现优于现有模型。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29590 2026-09-01 cs.CV 新提交 50%

Guardrail-Agnostic Societal Bias Evaluation in Large Vision-Language Models

强安全护栏下大型视觉语言模型的护栏无关社会偏见评估

Yusuke Hirota, Michael Ross Boone, Arun George Zachariah, Jibin Rajan Varghese, Yu-Chiang Frank Wang, Boyi Li, Ryo Hachiuma

机构 * NVIDIA(英伟达)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本研究针对强护栏LVLMs的偏见评估难题,提出解耦人物属性推断的评估方法,发现20款LVLMs均存在不当使用用户人口统计信息的偏见,且专有模型偏见低于开源模型。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏