arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-26 至 2026-08-26 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 3 篇

2608.23870 2026-08-26 cs.AI 新提交 70%

Granite.Trust Policy Tools: Shareable, Actionable Policies for Generative AI Applications

Granite.Trust 策略工具:面向生成式 AI 应用的可共享、可执行策略

Nathalie Baracaldo, Nicolas Mello, Kush R. Varshney, Heiko Ludwig, Kate Soule, David Cox

机构 * IBM Research(IBM研究院)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 针对现有策略无法适配 GenAI 内容约束执行的问题,提出 Actionable Policy 模式与合成数据流水线等工具,实现 GenAI 全生命周期的策略规范与执行,相关资源开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24662 2026-08-26 cs.AI cs.CL cs.CY 新提交 67%

The Invisible Editorial Layer: Formalizing Undisclosed Inference-Time Steering, Probability Placement, and the Attribution Problem in Deployed Language Models

隐形编辑层:形式化部署语言模型中未公开的推理时调控、概率置放与归因问题

Augusto Camargo

机构 * Bluecore Consulting(蓝芯咨询)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文针对部署语言模型提出隐形编辑层概念,形式化推理归因问题、概率置放等核心概念,探讨其与相关监管框架的关联,揭示未公开推理调控的潜在影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19668 2026-08-26 cs.CL 版本更新 57%

Code-Switching Reveals Language Anchoring in Multilingual LLMs

代码切换揭示多语言大模型中的语言锚定

Jeonghyun Park, Seunghyun Yoon, Yonghyun Jun, Hwanhee Lee

机构 * Chung-Ang University(中央大学) Adobe Research(Adobe研究院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 通过语法强制代码切换诊断多语言大模型中的语言锚定现象,提出锚定偏差度量并设计CANVAS干预方法,有效缓解代码切换导致的问答性能下降。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏