arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-16 至 2025-12-16 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 4 篇

2503.11950 2025-12-16 cs.CY cs.AI 81%

Privacy Ethics Alignment in AI: A Stakeholder-Centric Framework for Ethical AI

AI隐私伦理对齐:面向伦理AI的利害相关者中心框架

Ankur Barthwal, Molly Campbell, Ajay Kumar Shrestha

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 本研究提出PEA-AI模型,通过分析不同利害相关者群体的隐私需求,构建以透明度和数字素养为核心的AI隐私治理框架。

Comments Peer reviewed publication at 10.3390/systems13060455

Journal ref Systems 2025, 13, 455

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15693 2025-12-16 cs.LG cs.AI cs.CL 67%

Beyond Benchmarks: On The False Promise of AI Regulation

超越基准:关于人工智能监管的虚假承诺

Gabriel Stanovsky, Renana Keydar, Gadi Perl, Eliya Habba

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Faculty of Law and(法学院) Center of Digital Humanities(数字人文中心)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出不依赖基准的人工智能监管框架,强调人工智能可解释性挑战对现有监管体系的制约,并呼吁跨学科合作解决这一关键问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12652 2025-12-16 cs.AI cs.MA 57%

Value-Aware Multiagent Systems

具有价值意识的多智能体系统

Nardine Osman

机构 * Artificial Intelligence Research Institute (IIIA-CSIC)(人工智能研究 institute (IIIA-CSIC))

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种具有价值意识的多智能体系统框架,通过三个核心支柱实现价值对齐和行为可解释性,并展示了其在现实领域的应用。

Journal ref In Coordination, Organizations, Institutions, Norms, and Ethics for Governance of Multi-Agent Systems XVII. COINE 2024. LNCS, vol 15398. Springer, Cham (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12501 2025-12-16 cs.AI 57%

SafeGen: Embedding Ethical Safeguards in Text-to-Image Generation

SafeGen: 在文本到图像生成中嵌入伦理保障

Dang Phuong Nam, Nguyen Kieu, Pham Thanh Hieu

机构 * Posts and Telecommunications Institute of Technology(电信技术研究所)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 SafeGen通过整合BGE-M3和Hyper-SD,实现文本到图像生成中的伦理保障,有效过滤有害提示并生成高质量图像。

详情

展开后加载摘要…

URL PDF HTML 收藏