arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-11 至 2025-09-11 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 6 篇

2509.08494 2025-09-11 cs.CY cs.AI cs.CL cs.HC cs.LG 81%

HumanAgencyBench: Scalable Evaluation of Human Agency Support in AI Assistants

Benjamin Sturgeon, Daniel Samuelson, Jacob Haimes, Jacy Reese Anthis

机构 * Apart Research AI Safety Cape Town University of Chicago(芝加哥大学) Stanford University(斯坦福大学) Sentience Institute(意识研究所)

专题命中 安全评测 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08803 2025-09-11 cs.SI cs.AI cs.CL cs.CY 67%

Scaling Truth: The Confidence Paradox in AI Fact-Checking

Ihsan A. Qazi, Zohaib Khan, Abdullah Ghani, Agha A. Raza, Zafar A. Qazi, Wassay Sajjad, Ayesha Ali, Asher Javaid, Muhammad Abdullah Sohail, Abdul H. Azeemi

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 65 pages, 26 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08493 2025-09-11 cs.CR cs.AI 57%

Send to which account? Evaluation of an LLM-based Scambaiting System

Hossein Siadati, Haadi Jafarian, Sima Jafarikhah

机构 * AI Research, Cybera Global Inc./ UNCW(AI研究、Cybera全球公司/UNCW) Department of Computer Science and Engineering, UC Denver(计算机科学与工程系,UC Denver) Department of Computer Science, UNCW(计算机科学系,UNCW)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16838 2025-09-11 cs.CL 57%

REGen: A Reliable Evaluation Framework for Generative Event Argument Extraction

Omar Sharif, Joseph Gatto, Madhusudan Basak, Sarah M. Preum

机构 * Department of Computer Science, Dartmouth College(计算机科学系,达特茅斯学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted at EMNLP-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08274 2025-09-11 cs.NI 50%

Enhancing 6G Network Security and Incident Response through Integrated VNF and SDN Technologies

Abdul Razaque, Abitkhanova Zhadyra Abitkhanovna

专题命中 安全评测 :safety(abstract)

Comments 14 page, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08221 2025-09-11 cs.RO 50%

A Comprehensive Review of Reinforcement Learning for Autonomous Driving in the CARLA Simulator

Elahe Delavari, Feeza Khan Khanzada, Jaerock Kwon

专题命中 安全评测 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏