arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-26 至 2026-08-26 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 2 篇

2603.14265 2026-08-26 cs.CL cs.MA 版本更新 70%

MedPriv-Bench: Benchmarking the Privacy-Utility Trade-off of Large Language Models in Medical Open-Ended Question Answering

MedPriv-Bench:医疗开放问答中大语言模型隐私-效用权衡的基准测试

Shaowei Guan, Yu Zhai, Hin Chi Kwok, Jiawei Du, Xinyu Feng, Jing Li, Harry Qin, Vivian Hui

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 MedPriv-Bench首次提出医疗开放问答中评估隐私保护与临床效用的基准,通过多代理人机协同流程生成敏感医疗情境,利用预训练RoBERTa-NLI模型量化数据泄露,揭示大语言模型在隐私与效用间的普遍权衡。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19435 2026-08-26 cs.GT cs.AI cs.CL 版本更新 62%

Ad Insertion in LLM-Generated Responses

在大语言模型生成响应中插入广告

Shengwei Xu, Zhaohua Chen, Xiaotie Deng, Zhiyi Huang, Grant Schoenebeck

机构 * University of Michigan(密歇根大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了解耦广告插入与响应生成、以及竞价与用户查询的框架,通过基于类型拍卖机制实现近最优的社会福利,同时提高计算效率和上下文一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏