arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-04 至 2026-02-04 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 5 篇

2602.02686 2026-02-04 cs.CL cs.AI cs.CR cs.LG 80%

Monotonicity as an Architectural Bias for Robust Language Models

单调性作为提升语言模型鲁棒性的架构偏倚

Patrick Cooper, Alireza Nadali, Ashutosh Trivedi, Alvaro Velasquez

机构 * Department of Computer Science, University of Colorado Boulder, Boulder, CO, USA(计算机科学系,科罗拉多大学波尔德分校,波尔德,科罗拉多州,美国)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过在Transformer模型中引入单调性约束,提升语言模型对对抗攻击的鲁棒性,同时保持预训练性能。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02545 2026-02-04 cs.LG cs.AI 76%

Beyond Alignment: Expanding Reasoning Capacity via Manifold-Reshaping Policy Optimization

超越对齐:通过流形重塑策略优化扩展推理能力

Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Yang Li

机构 * Baidu Inc.(百度公司) Peking University(北京大学)

专题命中 AI治理与伦理 :alignment(title);分类 cs.AI、cs.LG

AI总结 本文提出流形重塑策略优化方法,通过几何干预扩展LLM的推理能力,实验证明其在数学任务中优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02582 2026-02-04 cs.AI cs.CL cs.CY cs.IR cs.LG cs.SE 70%

Uncertainty and Fairness Awareness in LLM-Based Recommendation Systems

大语言模型推荐系统中的不确定性与公平性意识

Chandan Kumar Sah, Xiaoli Lian, Li Zhang, Tony Xu, Syed Shazaib Shah

机构 * Beihang University(北京航空航天大学) McGill University(麦吉尔大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文研究了大语言模型推荐系统中不确定性与公平性的影响,提出了一种新的评估方法并揭示了个性化与公平性之间的权衡。

Comments Accepted at the Second Conference of the International Association for Safe and Ethical Artificial Intelligence, IASEAI26, 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03334 2026-02-04 cs.CY 57%

The Personality Trap: How LLMs Embed Bias When Generating Human-Like Personas

人格陷阱:大语言模型在生成类人人格时嵌入偏见的方式

Jacopo Amidei, Gregorio Ferreira, Mario Muñoz Serrano, Rubén Nieto, Andreas Kaltenbrunner

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文研究了大语言模型在生成类人人格时嵌入WEIRD偏见的问题,揭示了LLMs在生成合成人口时可能带来的刻板印象和风险。

Comments 26 pages, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03155 2026-02-04 cs.HC 50%

Is It Possible to Make Chatbots Virtuous? Investigating a Virtue-Based Design Methodology Applied to LLMs

能否使聊天机器人变得有德性?探讨一种基于德性的设计方法应用于大语言模型

Matthew P. Lad, Louisa Conwill, Megan Levis Scheirer

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文探讨了基于德性的设计方法在大语言模型中的应用,通过伦理设计模式的编目和评估,提出了一种提升LLM伦理性的设计框架,并指出其在准确性和安全性方面的优势及潜在实施挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏