arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-01 至 2025-08-01 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 2 篇

2507.23373 2025-08-01 cs.CV 78%

Multi-Prompt Progressive Alignment for Multi-Source Unsupervised Domain Adaptation

Haoran Chen, Zexiao Wang, Haidong Cao, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学)

专题命中 AI治理与伦理 :alignment(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10073 2025-08-01 cs.CL cs.AI 66%

Cultural Bias in Large Language Models: Evaluating AI Agents through Moral Questionnaires

Simon Münker

机构 * Tier University(Tier大学)

专题命中 AI治理与伦理 :alignment(abstract,journal_ref);分类 cs.CL、cs.AI

Comments 15pages, 1 figure, 2 tables

Journal ref Proceedings of 0th Symposium on Moral and Legal AI Alignment of the IACAP/AISB Conference, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏