arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-07 至 2026-01-07 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 3 篇

2601.02858 2026-01-07 cs.CL 74%

To Generate or Discriminate? Methodological Considerations for Measuring Cultural Alignment in LLMs

是生成还是判别?衡量LLM文化契合度的方法论考虑

Saurabh Kumar Pandey, Sougata Saha, Monojit Choudhury

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学)

专题命中 AI治理与伦理 :alignment(title);分类 cs.CL

AI总结 本文通过反向社会人口提示方法探讨LLM文化契合度测量问题,发现真实行为表现优于模拟行为,但个体层面个性化存在局限。

Comments IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02749 2026-01-07 cs.AI 70%

The Path Ahead for Agentic AI: Challenges and Opportunities

代理AI的未来之路:挑战与机遇

Nadia Sibai, Yara Ahmed, Serry Sibaee, Sawsan AlHalawani, Adel Ammar, Wadii Boulila

机构 * Robotics and Internet-of-Things (RIOTU) Lab, Prince Sultan University, Riyadh, Saudi Arabia(机器人与物联网(RIOTU)实验室,普森大学,利雅得,沙特阿拉伯)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文探讨了代理AI从被动生成到自主行动的转变,分析了其技术挑战与核心方法,并提出了实现自主行为的关键研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03203 2026-01-07 cs.LG cs.AI cs.CY 67%

Counterfactual Fairness with Graph Uncertainty

基于图不确定性的反事实公平性

Davi Valério, Chrysoula Zerva, Mariana Pinto, Ricardo Santos, André Carreiro

机构 * Instituto Superior Técnico(里斯本技术高等学院) Instituto de Telecomunicações(电信研究所) Fraunhofer Portugal AICOS(弗劳恩霍夫葡萄牙AICOS研究所)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出CF-GU方法,通过整合因果图的不确定性,提升反事实公平性评估的鲁棒性和准确性。

Comments Peer reviewed pre-print. Presented at the BIAS 2025 Workshop at ECML PKDD

详情

展开后加载摘要…

URL PDF HTML 收藏