arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-08-14 至 2026-08-14 共收录 2
2608.11698 2026-08-14 cs.LG cs.AI 版本更新

REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation

REOPD:面向在线策略蒸馏的可靠性自适应奖励外推

Yang Sun, Lichao Ma, Houyuan Qin, Yuxin Liu, Hanyang Lu, Yao Zhu, Pinlong Cai, Guohang Yan

机构 * Peking University(北京大学) Southwest Jiaotong University(西南交通大学) University of Science and Technology of China(中国科学技术大学) School of Computer Science and Technology,University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) University of Electronic Science and Technology of China(电子科技大学) School of Automation Engineering,University of Electronic Science and Technology of China(电子科技大学自动化工程学院) Renmin University of China(中国人民大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Autonomous Driving, Shanghai Artificial Intelligence Laboratory(上海人工智能实验室自动驾驶研究中心)

AI总结 本文提出面向在线策略蒸馏的可靠性自适应奖励外推框架REOPD,通过token级系数实现细粒度可靠性自适应,在多场景下优于基线方法,无需额外模型即可提升训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23496 2026-08-14 cs.AI cs.CR 版本更新

Do LLMs Know Their Vulnerable Scenarios?

大语言模型知道它们的脆弱场景吗?

Ziheng Peng, Huiqi Deng, Haoran Jing, Xuankun Rong, Jiahui Han, Xiting Wang, Na Zou, Xia Hu

机构 * Renmin University of China(中国人民大学) Xi’an Jiaotong University(西安交通大学) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 研究大语言模型在特定场景下的脆弱性,提出Concept2Scenario框架,通过实例化概念空间、归因拒绝抑制等步骤发现脆弱场景,在多模型和基准测试中验证,能提高攻击成功率、可迁移且组合效果优。

Comments 19 pages, 11 Figures, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏