Can You Trust an LLM with Your Life-Changing Decision? An Investigation into AI High-Stakes Responses
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG
机构 * Atil Samancioglu(独立研究者)
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI
机构 * AI \& GenAI Specialist Cloud GTM Google Mumbai, India ; AI Engineer, AI Services Google Cloud Consulting (GCC) Google Mumbai, India ; Industry Solutions Google Gurugram, India
专题命中 安全训练 :prompt injection(abstract);分类 cs.LG
Comments IEEE CAI 2025
专题命中 安全训练 :safety(abstract)
机构 * Delft University of Technology(代尔夫特理工大学)
专题命中 安全训练 :safety(abstract)
Comments Manuscript under review