arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-11 至 2025-12-11 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 4 篇

2409.10506 2025-12-11 cs.SE 78%

SmartC2Rust: Iterative, Feedback-Driven C-to-Rust Translation via Large Language Models for Safety and Equivalence

SmartC2Rust: 基于大语言模型的迭代反馈驱动C到Rust翻译用于安全性和等价性

Momoko Shiraishi, Yinzhi Cao, Takahiro Shinagawa

专题命中 安全训练 :safety(title,abstract)

AI总结 SmartC2Rust通过迭代反馈机制利用大语言模型实现C到Rust的翻译,提升内存安全性和语义等价性。

Journal ref ICSE '26: Proceedings of the 48th International Conference on Software Engineering, April 12-18, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09909 2025-12-11 cs.LG cs.AI 62%

STACHE: Local Black-Box Explanations for Reinforcement Learning Policies

STACHE:强化学习策略的局部黑盒解释

Andrew Elashkin, Orna Grumberg

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 STACHE提出一种用于生成强化学习策略局部黑盒解释的框架,通过鲁棒区域和最小反事实分析,揭示策略行为的演变过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09127 2025-12-11 cs.CL cs.AI 62%

Knowledge-Guided Large Language Model for Automatic Pediatric Dental Record Understanding and Safe Antibiotic Recommendation

基于知识引导的大型语言模型用于自动解析儿童牙科记录并安全推荐抗生素

Zihan Han, Junyan Ge, Caifeng Li

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出基于知识引导的大型语言模型,通过整合知识图谱、检索增强生成和多阶段安全验证,提升儿童牙科记录解析与安全抗生素推荐的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08952 2025-12-11 cs.LG cs.AI cs.HC cs.RO 62%

Learning When to Ask: Simulation-Trained Humanoids for Mental-Health Diagnosis

学习何时提问:为心理健康诊断训练的仿真 humanoid

Filippo Cenacchi, Deborah Richards, Longbing Cao

机构 * Macquarie University(麦考瑞大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于仿真的方法,通过训练人形机器人以更有效地进行心理健康诊断,利用反事实回放和安全学习循环提升对话节奏和关系建立。

详情

展开后加载摘要…

URL PDF HTML 收藏