arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Technion - Israel Institute of Technology(以色列理工学院)

2026-08-25 至 2026-08-25 共收录 3
2608.23264 2026-08-25 cs.AI cs.CL 新提交

Hidden in the Request: Explaining Unethical LLM Compliance through Token Relevance

隐藏在请求中:通过词元相关性解释不道德的大语言模型合规性

Or Biton, Tomer Krichli, Itai Allouche, Joseph Keshet

机构 * Faculty of Electrical and Computer Engineering, Technion(以色列理工学院电气与计算机工程学院)

AI总结 本研究针对LLMs在不道德场景下的合规性失败问题,提出LRP引导的解码方法,发现模型对提示词元的归因不足是关键原因,干预后可提升响应安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21579 2026-08-25 cs.LG cs.CC cs.CG cs.DS math.CO 新提交

Sorting from Counterexamples

基于反例的排序

Noga Alon, Shay Moran, Shlomo Moran

机构 * Princeton University(普林斯顿大学) Tel Aviv University(特拉维夫大学) Technion – Israel Institute of Technology(以色列理工学院) Google Research(谷歌研究院)

AI总结 研究未知线性顺序学习问题,反例可能不真实且k未知,确定最优查询复杂度,还研究低维几何表示的目标排序情况,给出上下界并指出无噪声项的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09544 2026-08-25 cs.CL cs.AI cs.LG 版本更新

Large Language Models Generate Harmful Responses Using a Distinct Mechanism, Shared Across Harm Types

大语言模型通过一种独特的统一机制生成有害内容

Hadas Orgad, Boyi Wei, Kaden Zheng, Martin Wattenberg, Peter Henderson, Seraphina Goldfarb-Tarrant, Yonatan Belinkov

机构 * Kempner Institute, Harvard University(哈佛大学肯普纳研究所) Princeton University(普林斯顿大学) Harvard University(哈佛大学) Cohere Technion—IIT(以色列理工学院)

AI总结 研究通过权重剪枝揭示大语言模型中有害生成的内部结构,发现有害内容生成依赖于一组通用且与良性能力不同的权重,表明对齐训练重塑了有害表示,解释了领域微调引发的广泛对齐偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏