arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-05 至 2025-11-05 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 3 篇

2409.09586 2025-11-05 cs.HC cs.AI cs.CL 81%

ValueCompass: A Framework for Measuring Contextual Value Alignment Between Human and LLMs

Hua Shen, Tiffany Knearem, Reshmi Ghosh, Yu-Ju Yang, Nicholas Clark, Tanushree Mitra, Yun Huang

机构 * NYU Shanghai(纽约大学上海校区) New York University(纽约大学) University of Washington(华盛顿大学) MBZUAI Microsoft(微软) UIUC(伊利诺伊大学香槟分校)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15975 2025-11-05 cs.CR q-bio.BM 80%

Generative AI for Biosciences: Emerging Threats and Roadmap to Biosecurity

Zaixi Zhang, Souradip Chakraborty, Amrit Singh Bedi, Emilin Mathew, Varsha Saravanan, Le Cong, Alvaro Velasquez, Sheng Lin-Gibson, Megan Blewett, Dan Hendrycs, Alex John London, Ellen Zhong, Ben Raphael, Adji Bousso Dieng, Jian Ma, Eric Xing, Russ Altman, George Church, Mengdi Wang

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);jailbreak(abstract);AI safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25863 2025-11-05 cs.CR cs.AI 57%

AAGATE: A NIST AI RMF-Aligned Governance Platform for Agentic AI

Ken Huang, Kyriakos Rock Lambros, Jerry Huang, Yasir Mehmood, Hammad Atta, Joshua Beck, Vineeth Sai Narajala, Muhammad Zeeshan Baig, Muhammad Aziz Ul Haq, Nadeem Shahzad, Bhavya Gupta

机构 * RockCyber Kleiner Perkins Qorvex Consulting & Roshan Consulting SAS Institute OWASP Wentworth Institute of Higher Education & Machine Learning Professional Skylink Antenna Roshan Consulting & Robotic Process Automation Stanford University

专题命中 AI治理与伦理 :red teaming(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏