arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-25 至 2025-11-25 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 5 篇

2502.00313 2025-11-25 cs.GT cs.AI cs.CL cs.MA 81%

Distributive Fairness in Large Language Models: Evaluating Alignment with Human Values

大语言模型中的分配公平性:评估与人类价值观的对齐

Hadi Hosseini, Samarth Khanna

机构 * Penn State University(宾夕法尼亚州立大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在分配公平性方面的表现,发现其与人类价值观存在偏差,并探讨了提升对齐性的策略。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17952 2025-11-25 cs.CV 78%

Multi-speaker Attention Alignment for Multimodal Social Interaction

多说话者注意力对齐用于多模态社交互动

Liangyang Ouyang, Yifei Huang, Mingfang Zhang, Caixin Kang, Ryosuke Furuta, Yoichi Sato

机构 * The University of Tokyo(东京大学)

专题命中 AI治理与伦理 :alignment(title,abstract)

AI总结 本文提出了一种多模态多说话者注意力对齐方法,通过动态头选择和自适应注意力偏差提升多模态社交互动理解能力,实现SOTA效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13912 2025-11-25 cs.CL cs.AI 76%

AI Debaters are More Persuasive when Arguing in Alignment with Their Own Beliefs

AI辩论在与自身信念一致时更具说服力

María Victoria Carro, Denise Alejandra Mester, Facundo Nieto, Oscar Agustín Stanchi, Guido Ernesto Bergman, Mario Alejandro Leiva, Eitan Sprejer, Luca Nicolás Forziati Gangi, Francisca Gauna Selasco, Juan Gustavo Corvalán, Gerardo I. Simari, María Vanina Martinez

机构 * FAIR, IALAB, Universidad de Buenos Aires(FAIR、IALAB、布宜诺斯艾利斯大学) Universidad de Buenos Aires(布宜诺斯艾利斯大学) Universidad Nacional de Córdoba(科尔多瓦国立大学) BAISH, Universidad de Buenos Aires(BAISH、布宜诺斯艾利斯大学) Instituto de Investigación en Informática LIDI, Universidad Nacional de La Plata(信息研究所LIDI、拉普拉塔国立大学;CONICET) CONICET(计算机科学与工程系,南大学及ICIC UNS-CONICET) Dept. of Comp. Sci. and Eng., Universidad Nacional del Sur & ICIC UNS-CONICET(人工智能研究所(IIIA-CSIC),西班牙) Artificial Intelligence Research Institute (IIIA-CSIC), ES

专题命中 AI治理与伦理 :alignment(title);分类 cs.CL、cs.AI

AI总结 本研究探讨了AI辩论中模型在与自身信念一致或不一致时的说服力差异,发现模型倾向于迎合裁判观点,但不一致的论点在比较中更受好评。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19334 2025-11-25 cs.CY 70%

Normative active inference: A numerical proof of principle for a computational and economic legal analytic approach to AI governance

规范性主动推断:一种计算和经济法律分析方法用于AI治理的数值原理证明

Axel Constant, Mahault Albarracin, Karl J. Friston

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY

AI总结 本文提出通过设计监管实现合法且规范敏感的AI行为,利用主动推断框架模拟自动驾驶场景,展示法律规范对AI代理决策的影响。

Comments 19 pages, 6 figures, 1 box

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18182 2025-11-25 cs.CY cs.AI 62%

The Workflow as Medium: A Framework for Navigating Human-AI Co-Creation

流程作为媒介:一种导航人机协同创作的框架

Lee Ackerman

机构 * Media University of Applied Sciences(应用科学媒体大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出创意智能循环框架,通过图文小说探讨人工智能在人机协同创作中的伦理与治理挑战,推动AI素养提升。

Comments 57 pages, 13 images, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏