arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-04 至 2025-12-04 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 5 篇

2512.03047 2025-12-04 cs.CL cs.AI cs.LG 87%

Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models

基于熵的大型语言模型价值漂移与对齐工作的测量

Samih Fadli

专题命中 AI治理与伦理 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于熵的框架,用于测量大型语言模型中的价值漂移和对齐工作,通过五种行为分类法和熵动态分析,实现对模型伦理熵的实时监控与警报。

Comments 6 pages. Companion paper to "The Second Law of Intelligence: Controlling Ethical Entropy in Autonomous Systems". Code and tools: https://github.com/AerisSpace/EthicalEntropyKit

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23733 2025-12-04 cs.CY cs.AI cs.HC 62%

Unintentional Consequences: Generative AI Use for Cybercrime

无意后果:生成式AI用于网络犯罪

Truong Jack Luu, Binny M. Samuel

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 生成式AI的普及导致网络犯罪激增,研究通过分析数据揭示AI技术放大恶意行为的机制,并提出多层策略以应对风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15478 2025-12-04 cs.CL 57%

A Group Fairness Lens for Large Language Models

为大语言模型引入群体公平性视角

Guanqun Bi, Yuqiang Xie, Lei Shen, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 本文提出从群体公平性角度评估大语言模型的偏见,引入 GFAIR 数据集和 GF-THINK 方法,以缓解模型中的偏见问题。

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03439 2025-12-04 cs.IR 50%

LLM as Explainable Re-Ranker for Recommendation System

大语言模型作为可解释的重排序器用于推荐系统

Yaqi Wang, Haojia Sun, Shuting Zhang

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出利用大语言模型作为可解释的重排序器,结合传统推荐模型提升推荐系统的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03180 2025-12-04 cs.MA cs.ET 50%

AGENTSAFE: A Unified Framework for Ethical Assurance and Governance in Agentic AI

AGENTSAFE:面向代理AI的统一伦理保障与治理框架

Rafflesia Khan, Declan Joyce, Mansura Habiba

专题命中 AI治理与伦理 :safety(abstract)

AI总结 AGENTSAFE提出一个统一的治理框架,通过风险分类转化为可操作的设计、运行时和审计控制,提供可衡量的预部署保障,并通过运行时治理和问责机制建立代理AI生态系统的信任。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏