arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-03 至 2026-03-03 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 5 篇

2603.00078 2026-03-03 cs.CY cs.AI 81%

Alignment Is Not Enough: A Relational Framework for Moral Standing in Human-AI Interaction

对齐不足以:人类-人工智能互动中的道德地位关系框架

Faezeh B. Pasandi, Hannah B. Pasandi

专题命中 AI治理与伦理 :alignment(title);trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文提出Relate框架,通过关系能力和具身互动重新定义人工智能的道德资格,强调现有伦理词汇无法应对人类-人工智能互动的复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01385 2026-03-03 cs.CL cs.AI 62%

Toward Graph-Tokenizing Large Language Models with Reconstructive Graph Instruction Tuning

迈向通过重构图指令微调的大型语言模型的图-词化

Zhongjian Zhang, Xiao Wang, Mengmei Zhang, Jiarui Tan, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北航)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RGLM方法,通过重构图信息和显式图监督改进图-词化LLMs的对齐效果,提升对图结构的理解与利用。

Comments accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00428 2026-03-03 cs.CL cs.AI cs.CR 62%

When Agents "Misremember" Collectively: Exploring the Mandela Effect in LLM-based Multi-Agent Systems

当智能体“误忆”时:探索基于大语言模型的多智能体系统中的曼德拉效应

Naen Xu, Hengyu An, Shuo Shi, Jinghuai Zhang, Chunyi Zhou, Changjiang Li, Tianyu Du, Zhihui Fu, Jun Wang, Shouling Ji

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校) Palo Alto Networks(帕洛阿尔托网络公司) OPPO Research Institute(OPPO研究院) Zhejiang Key Laboratory of Decision Intelligence(浙江决策智能重点实验室)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了基于大语言模型的多智能体系统中的曼德拉效应,提出MANBENCH基准并提出缓解策略,实现74.40%的效应减少。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01450 2026-03-03 cs.CV 50%

Deepfake Forensics Adapter: A Dual-Stream Network for Generalizable Deepfake Detection

深度伪造取证适配器:一种通用深度伪造检测的双流网络

Jianfeng Liao, Yichen Wei, Raymond Chan Ching Bon, Shulan Wang, Kam-Pui Chow, Kwok-Yan Lam

机构 * Shenzhen Technology University(深圳技术大学) Singapore Institute of Technology(新加坡理工学院) The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出深度伪造取证适配器,通过双流网络结合CLIP模型实现高效通用深度伪造检测。

Comments Accepted at ICDF2C 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16953 2026-03-03 cs.CV 50%

Towards Real Zero-Shot Camouflaged Object Segmentation without Camouflaged Annotations

面向无遮蔽标注的零样本遮蔽物分割

Cheng Lei, Jie Fan, Xinran Li, Tianzhu Xiang, Ao Li, Ce Zhu, Le Zhang

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Space42

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出了一种无需遮蔽标注的零样本遮蔽物分割框架,通过结合MIM、M-LLM和MFA机制,实现高效分割与快速推理。

详情

展开后加载摘要…

URL PDF HTML 收藏