arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-04 至 2026-03-04 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 7 篇

2505.05619 2026-03-04 cs.CR cs.LG 70%

LiteLMGuard: Seamless and Lightweight On-Device Prompt Filtering for Safeguarding Small Language Models against Quantization-induced Risks and Vulnerabilities

LiteLMGuard: 无缝且轻量级的设备端提示过滤,用于保护小型语言模型免受量化引发的风险和漏洞

Kalyan Nakka, Jimmy Dani, Ausmit Mondal, Nitesh Saxena

机构 * SPIES Research Lab, Dept. of CSE, Texas A&M University(SPIES研究实验室,计算机科学与工程系,德克萨斯大学阿马尔科分校)

专题命中 AI治理与伦理 :safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 LiteLMGuard通过设备端实时提示过滤,有效保护小型语言模型免受量化带来的安全风险。

Comments 18 pages, 19 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02640 2026-03-04 cs.CY cs.AI cs.CL cs.MA cs.SI 67%

Credibility Governance: A Social Mechanism for Collective Self-Correction under Weak Truth Signals

可信治理:在弱真相信号下的一种社会机制,用于集体自我校正

Wanying He, Yanxi Lin, Ziheng Zhou, Xue Feng, Min Peng, Qianqian Xie, Zilong Zheng, Yipeng Kang

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Tsinghua University(清华大学) University of California, Los Angeles(加州大学洛杉矶分校) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 可信治理通过动态可信度评分和可信度加权背书,提升集体自我校正能力,减少虚假信息影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23814 2026-03-04 cs.CR 67%

Watermarking Without Standards Is Not AI Governance

没有标准的水印技术并非AI治理

Alexander Nemecek, Yuzhou Jiang, Erman Ayday

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract)

AI总结 本文指出当前水印技术在AI治理中存在监管与技术限制之间的差距,提出三层框架以提升水印技术的治理有效性。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03018 2026-03-04 cs.AI cs.SE 57%

REGAL: A Registry-Driven Architecture for Deterministic Grounding of Agentic AI in Enterprise Telemetry

REGAL:一种基于注册表的架构,用于企业遥测中代理AI的确定性接地

Yuvraj Agrawal

机构 * Adobe Inc.(Adobe公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 REGAL提出一种基于注册表的架构,用于企业遥测中代理AI的确定性接地,通过显式架构方法和语义编译提升确定性计算,解决LLM在私有遥测中的接地问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11922 2026-03-04 cs.CY cs.SE 57%

On Regulating Downstream AI Developers

对下游AI开发者进行监管

Sophie Williams, Jonas Schuett, Markus Anderljung

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文探讨了对下游AI开发者进行监管的必要性,提出通过要求上游开发者减轻下游修改风险或使用替代政策工具来平衡监管与创新。

Comments 39 pages, 2 figures, 7 tables

Journal ref Eur. j. risk regul. 17 (2026) 94-122

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02684 2026-03-04 cs.CL cs.SI 57%

HateMirage: An Explainable Multi-Dimensional Dataset for Decoding Faux Hate and Subtle Online Abuse

HateMirage: 一个可解释的多维数据集用于解码虚假仇恨与微妙的在线虐待

Sai Kartheek Reddy Kasu, Shankar Biradar, Sunil Saumya, Md. Shad Akhtar

机构 * Indian Institute of Information Technology Dharwad(印度信息技术学院达尔瓦德) Manipal Institute of Technology, Manipal Academy of Higher Education(曼普及高等教育学院技术学院) Indraprastha Institute of Information Technology Delhi(印度普拉斯塔信息技术学院德里)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 HateMirage 是一个用于解码虚假仇恨与微妙在线虐待的多维数据集,通过多维解释框架提升仇恨言论的可解释性研究。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02568 2026-03-04 cs.CY 57%

AI4CAREER: Responsible AI for STEM Career Development at Scale in K-16 Education

AI4CAREER: 为K-16教育中的STEM职业发展实现负责任的AI

Sugana Chawla, Si Chen, Julia Qian, Gina Svarovsky, Alison Cheng, Rick Johnson, Nitesh V. Chawla, Ronald Metoyer

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 AI4CAREER研讨会探讨如何在K-16教育中通过负责任的AI促进STEM职业发展,聚焦AI在职业准备度评估、决策边界、发展一致性及公平性设计等方面的核心问题。

详情

展开后加载摘要…

URL PDF HTML 收藏