arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

2026-08-24 至 2026-08-24 共收录 3
2608.21278 2026-08-24 cs.AI 新提交

CLEAR: Continuous Latent Adapter Routing for Utility-Preserving LLM Safety Alignment

CLEAR:用于保持效用的大语言模型安全对齐的连续潜在适配器路由

Chengxiao Wang, Enyi Jiang, Xiaojing Liao, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Siebel School of Computing and Data Science, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校西贝尔计算与数据科学学院) Computer Science, Stanford University(斯坦福大学计算机科学系)

AI总结 本研究提出CLEAR框架,通过轻量型隐藏状态门控控制安全低秩适配器的激活强度,在降低LLM有害输出的同时,减少了全局安全调优带来的效用损失,实现了安全与效用的更好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20771 2026-08-24 cs.AI 新提交

CAS: Conformalized Agentic Search via Adaptive Retrieval and Policy Weighting

CAS:通过自适应检索与策略加权实现的保形智能体搜索

Zixi Zhu, Jiayuan Su, Jian Zhang, Yu Lin, Hongwei Wang

机构 * Zhejiang University(浙江大学) ZJU-UIUC Institute, Zhejiang University(浙江大学ZJU-UIUC学院) Tencent Inc.(腾讯公司)

AI总结 本研究针对搜索智能体RL微调的可靠性问题,提出CAS框架,通过自适应检索与策略加权结合CP技术,提升推理准确率并减少冗余搜索,构建高可靠高效智能体范式。

Comments 21 pages, including figures, tables, and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20351 2026-08-24 cs.CL cs.CY cs.LG 新提交

Exploratory As-Analyzed No-Detection of Culturally-Marked Predicate-Triggered PII Amplification in a Synthetic-English RAG Probe: A Predicate-Resource-Confounded Audit

针对合成英语RAG探针中文化标记谓词触发的PII放大的分析性无检测探索:谓词资源混淆审计

Yanhang Li, Zhichao Fan, Zexin Zhuang

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南卫理公会大学)

AI总结 该研究通过对四种文化的合成英语PII语料库开展RAG系统审计,发现无刻板印象驱动的PII放大,因样本效力及探针混淆问题,仅报告无检测结果而非无效应证据。

详情

展开后加载摘要…

URL PDF HTML 收藏