arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

2025-11-21 至 2025-11-21 共收录 2
2503.12339 2025-11-21 cs.LG cs.AI

A Closer Look at Adversarial Suffix Learning for Jailbreaking LLMs: Augmented Adversarial Trigger Learning

深入研究对抗后缀学习用于劫持大语言模型:增强的对抗触发学习

Zhe Wang, Yanjun Qi

机构 * University of Virginia(弗吉尼亚大学)

AI总结 ATLA通过增强的对抗触发学习方法,高效生成劫持大语言模型的后缀并提取隐藏系统提示,实现高成功率和低查询消耗。

Comments the Association for Computational Linguistics: NAACL 2025

Journal ref https://aclanthology.org/2025.findings-naacl.394/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13246 2025-11-21 cs.CL cs.AI

Atomic Calibration of LLMs in Long-Form Generations

大语言模型在长文本生成中的原子校准

Caiqi Zhang, Ruihan Yang, Zhisong Zhang, Xinting Huang, Sen Yang, Dong Yu, Nigel Collier

机构 * University of Cambridge(剑桥大学) Fudan University(复旦大学) Tencent AI Lab(腾讯AI实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 本研究提出原子校准方法,用于改进大语言模型在长文本生成中的校准能力,揭示置信度方法与生成过程中置信度变化的关联。

Comments ACL 2025 KnowFM Oral / AACL-IJCNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏