arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-16 至 2026-01-16 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 2 篇

2512.13142 2026-01-16 cs.AI cs.HC 85%

Can LLMs Understand What We Cannot Say? Measuring Multilevel Alignment Through Abortion Stigma Across Cognitive, Interpersonal, and Structural Levels

LLMs能否理解我们无法表达的内容?通过堕胎污名的多层级对齐进行测量

Anika Sharma, Malavika Mampally, Chidaksh Ravuru, Kandyce Brennan, Neil Gaikwad

机构 * Society-Centered AI Lab(以社会为中心的人工智能实验室) School of Nursing(护理学院)

专题命中 AI治理与伦理 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究发现LLMs在认知、人际和结构性层面对堕胎污名的理解不一致,缺乏对多维度心理构造的 coherent 理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10220 2026-01-16 cs.SE 50%

Agentic Pipelines in Embedded Software Engineering: Emerging Practices and Challenges

嵌入式软件工程中的代理流水线:新兴实践与挑战

Simin Sun, Miroslaw Staron

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文探讨嵌入式软件工程中生成式AI的整合挑战与实践,通过专家访谈揭示代理流水线的发展与可持续采用策略。

详情

展开后加载摘要…

URL PDF HTML 收藏