arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-31 至 2026-08-31 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 4 篇

2608.28228 2026-08-31 cs.AI cs.CY cs.HC 新提交 81%

Generative AI Alignment with Hinduism's Theological Plurality and Sacred Representation

结合印度教神学多元性与神圣表征的生成式AI对齐

Dipto Das, Arpita Kundu, Nusrat Jahan Mim, Shion Guha, Syed Ishtiaque Ahmed

机构 * University of Toronto(多伦多大学) Khulna University of Engineering & Technology(库尔纳工程技术大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 该研究以孟加拉国印度教用户的15次半结构化访谈为基础,探讨生成式AI在宗教领域的应用,指出其兼具便捷性与伦理隐患,提出生成式AI的宗教对齐需实现解释性对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13574 2026-08-31 cs.AI cs.MA 版本更新 70%

Agentao: A Policy-Governed Runtime Harness for Embeddable Tool-Using LLM Agents

Agentao:面向使用工具的大语言模型智能体的受管控本地优先运行时

Bo Jin, Qiang Jiao, Xin Tong

机构 * The Third Research Institute of the Ministry of Public Security(公安部第三研究所) Bureau of Science and Technology Information Ministry of Public Security of the People’s Republic of China(中华人民共和国公安部科技信息局) School of Information and Cyber Security People’s Public Security University of China(中国人民公安大学信息与网络安全学院)

专题命中 AI治理与伦理 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 针对工具使用型LLM智能体的安全管控需求,提出Agentao运行时,通过分层架构分离动作提案与授权执行,将权限等构建为显式抽象,提升智能体可管控性与可检查性。

Comments The code is publicly available at Github. We are conducting testing and analysis of this framework, and will provide experimental results and examples in future versions

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13673 2026-08-31 cs.CY 版本更新 57%

Comparing Apples to Oranges: A Taxonomy for Navigating the Global Landscape of AI Regulation

将苹果与橙子对比:AI监管全球格局梳理的分类体系

Sacha Alanoca, Shira Gur-Arieh, Tom Zick, Kevin Klyman

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文针对AI监管全球格局构建分类体系,梳理五大司法管辖区的AI监管规则,提供交互式可视化工具,以减少法律不确定性,助力全球协调的AI治理。

Comments 24 pages, 3 figures, FAccT '25

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05281 2026-08-31 cs.HC 版本更新 50%

Algorithmic Fairness Perceptions in the Global South: Evidence from Bangladesh on Ride-Sharing, Beauty Filters, and Large Language Models

全球南方的算法公平感知:来自孟加拉国关于网约车、美颜滤镜和大型语言模型的证据

Ahmed Abdal Shafi Rasel, Ahmed Mustafa Amlan, Tasmim Shajahan Mim

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 该研究通过对孟加拉国199名民众的双语调查,揭示了情境影响算法公平感知、对算法保护需求普遍、美颜滤镜损害自我形象、识别与阐明LLM文化偏见存在差异等四个关键模式,指出仅结果导向的公平指标存在局限。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏