arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-08-26 至 2026-08-26 共收录 5
2608.24275 2026-08-26 cs.AI cs.CL 新提交

RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards

RePolicy:用于智能体安全保障中安全策略调用的强化学习方法

Houcheng Jiang, Boxuan Zhang, Qiyong Zhong, Junfeng Fang, Xiang Wang, Xiangnan He

机构 * Zhejiang University(浙江大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

AI总结 针对现有智能体安全保障方法难以适应未见轨迹和变化策略上下文的问题,提出RePolicy方法,结合PolicyTraj-20K与带可验证奖励和策略上下文扰动的GRPO,在六个智能体安全基准上取得良好安全检测与策略调用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24005 2026-08-26 cs.AI 新提交

Incorporating Cognitive Load and Knowledge Transfer for Multi-Domain Knowledge Tracing

整合认知负荷与知识迁移的多领域知识追踪

Haotian Zhang, Shucun Wang, Jinze Wu, Liang Ding, Shuochen Liu, Zhenya Huang, Jing Sha, Shijin Wang, Qi Liu

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK AI Research(讯飞AI研究院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

AI总结 该研究针对多领域知识追踪场景,提出整合认知负荷与知识迁移的LT-MKT方法,利用LLMs构建多领域层次图并联合建模认知负荷与知识迁移,在真实数据集上实现了最优性能。

Comments Accepted as a CIKM 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23941 2026-08-26 cs.AI 新提交

More Rejective, Not More Discriminative: The Unit of Verification in Pre-Execution LLM Oversight

更多弃权(不执行),而非更强判别性:预执行大语言模型监督中的验证单元

Yuchen Han, Cheng Yan, Wuyang Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本研究针对预执行LLM监督的验证单元问题,提出双前缀框架,发现一或两个行动的短验证单元信息性最高,更长窗口会使监控器更倾向于弃权而非提升判别性。

Comments 37 pages, 20 figures, 32 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00728 2026-08-26 cs.CL 版本更新

From Empathy to Personalized Empathy: Adapting Empathetic Strategies to Individual Users

从共情到个性化共情:根据个体用户调整共情策略

Wuqiang Zheng, Chengbing Wang, Yilin Yang, Junyi Cheng, Jianfei Xiao, Hu Sun, Yi Xie, Yangyang Li, Wenjie Wang

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies(华为技术)

AI总结 针对大语言模型长期交互中忽略用户个性对共情策略影响的问题,提出个性化共情任务,构建PersonaEmp数据集和PereGRM奖励建模框架,实验证明其有效提升个性化共情能力。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07289 2026-08-26 cs.LG 版本更新

MolGA: Molecular Graph Adaptation with Pre-trained 2D Graph Encoder

MolGA:基于预训练2D图编码器的分子图适应

Xingtong Yu, Chang Zhou, Xinming Zhang, Yuan Fang

机构 * Singapore Management University(新加坡管理大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本研究提出MolGA,通过分子对齐策略与条件适应机制,将预训练2D图编码器适配至下游分子应用,经11个公开数据集验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏