arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-19 至 2026-01-19 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 5 篇

2510.20075 2026-01-19 cs.AI cs.CL cs.CR cs.LG 75%

LLMs can hide text in other text of the same length

LLMs可通过相同长度的文本隐藏信息

Antonio Norelli, Michael Bronstein

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Calgacus协议,利用LLM在相同长度文本中隐藏信息,揭示了文本与意图脱钩的潜在风险,引发对AI安全和理解的深刻反思。

Comments 21 pages, main paper 9 pages. v5 contains an Italian translation of this paper by the author

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11199 2026-01-19 cs.CR cs.AI 57%

SD-RAG: A Prompt-Injection-Resilient Framework for Selective Disclosure in Retrieval-Augmented Generation

SD-RAG:一种抗提示注入的框架,用于检索增强生成中的选择性披露

Aiman Al Masoud, Marco Arazzi, Antonino Nocera

机构 * Department of Electrical, Computer and Biomedical Engineering(电气、计算机与生物医学工程系) University of Pavia(帕维亚大学)

专题命中 安全训练 :prompt injection(abstract);分类 cs.AI

AI总结 SD-RAG通过在检索阶段应用净化和披露控制,提升检索增强生成中的隐私保护和抗提示注入能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10911 2026-01-19 cs.LG 57%

Realistic Curriculum Reinforcement Learning for Autonomous and Sustainable Marine Vessel Navigation

现实课程强化学习用于自主可持续海洋船舶导航

Zhang Xiaocai, Xiao Zhe, Liang Maohan, Liu Tao, Li Haijiang, Zhang Wenbin

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出基于现实课程强化学习的框架,结合数据驱动的海洋模拟和机器学习预测模块,以实现自主且可持续的船舶导航。

Comments Present in The 40th Annual AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10835 2026-01-19 cs.CV cs.AI 57%

Can Vision-Language Models Understand Construction Workers? An Exploratory Study

视觉-语言模型能理解建筑工人吗?一项探索性研究

Hieu Bui, Nathaniel E. Chodosh, Arash Tavakoli

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Villanova University(维拉诺瓦大学) Department of Computing Sciences(计算科学系) Department of Civil and Environmental Engineering(土木与环境工程系)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究评估了三种视觉-语言模型在识别建筑工人行为和情绪方面的性能,发现GPT-4o表现最佳,但需进一步改进以提高实际应用可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09048 2026-01-19 q-bio.OT cs.AI 57%

Monitoring Deployed AI Systems in Health Care

在医疗领域监控已部署的AI系统

Timothy Keyes, Alison Callahan, Abby S. Pandya, Nerissa Ambers, Juan M. Banda, Miguel Fuentes, Carlene Lugtu, Pranav Masariya, Srikar Nallan, Connor O'Brien, Thomas Wang, Emily Alsentzer, Jonathan H. Chen, Dev Dash, Matthew A. Eisenberg, Patricia Garcia, Nikesh Kotecha, Anurang Revri, Michael A. Pfeffer, Nigam H. Shah, Sneha S. Jain

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种用于医疗领域已部署AI系统监控的框架,围绕系统完整性、性能和影响三个原则,提供监控计划的指导和实施挑战分析。

Comments 36 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏