arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-13 至 2026-02-13 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 2 篇

2602.11211 2026-02-13 cs.CR 78%

TRACE: Timely Retrieval and Alignment for Cybersecurity Knowledge Graph Construction and Expansion

TRACE: 信息安全知识图谱构建与扩展中的及时检索与对齐

Zijing Xu, Ziwei Ning, Tiancheng Hu, Jianwei Zhuge, Yangyang Wang, Jiahao Cao, Mingwei Xu

专题命中 越狱攻击 :alignment(title,abstract)

AI总结 TRACE通过整合结构化和非结构化数据,利用LLMs提升网络安全知识图谱的实时更新与实体对齐效率,实现节点覆盖和提取精度的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22871 2026-02-13 cs.CY cs.AI cs.CL cs.HC 67%

Eroding the Truth-Default: A Causal Analysis of Human Susceptibility to Foundation Model Hallucinations and Disinformation in the Wild

消解事实默认:对人类在真实世界中对基础模型幻觉和虚假信息易感性的因果分析

Alexander Loth, Martin Kappes, Marc-Oliver Pahl

机构 * Frankfurt University of Applied Sciences(法兰克福应用科学大学)

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过双轴框架分析人类对基础模型幻觉和虚假信息的易感性,发现假新闻熟悉度是关键中介,提出应通过提升认知来源监控来确保信息可信。

Comments Accepted at ACM TheWebConf '26 Companion

详情

展开后加载摘要…

URL PDF HTML 收藏