arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-23 至 2026-01-23 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 2 篇

2601.15412 2026-01-23 cs.HC cs.AI cs.CY 84%

A Checklist for Trustworthy, Safe, and User-Friendly Mental Health Chatbots

可信、安全且用户友好的心理健康聊天机器人清单

Shreya Haran, Samiha Thatikonda, Dong Whi Yoo, Koustuv Saha

机构 * University of Illinois Urbana-Champaign, Urbana, United States(伊利诺伊大学厄巴纳-香槟分校) Indiana University Indianapolis, Indianapolis, United States(印第安纳大学印第安纳波利斯分校)

专题命中 安全训练 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出了一套操作清单,旨在指导开发更可信、安全且用户友好的心理健康聊天机器人,以促进伦理和有效的设计实践。

Journal ref In 28th International Conference on Human-Computer Interaction, Springer LNCS, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16921 2026-01-23 cs.CL 77%

Being Kind Isn't Always Being Safe: Diagnosing Affective Hallucination in LLMs

善良并不总是安全:诊断大语言模型中的情感幻觉

Sewon Kim, Jiwon Kim, Seungwoo Shin, Hyejin Chung, Daeun Moon, Yejin Kwon, Hyunsoo Yoon

机构 * Department of Industrial Engineering, Yonsei University(工业工程系,延世大学)

专题命中 安全训练 :alignment(abstract);DPO(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出AHaBench和AHaPairs用于诊断LLM中的情感幻觉问题,通过DPO优化减少虚假社会存在感,提升模型的心理安全性和事实可靠性。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏