arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-28 至 2026-08-28 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 3 篇

2608.26324 2026-08-28 cs.LG 新提交 79%

Privacy Without Regret: Differentially Private Inference-Time Alignment

无遗憾的隐私:差分隐私推理时对齐

Ishi Jain, Nandini Bhattad, Sayak Ray Chowdhury

机构 * Indian Institute of Technology Kanpur(坎普尔印度理工学院)

专题命中 隐私与版权 :alignment(title,abstract);分类 cs.LG

AI总结 该研究针对最佳N采样的奖励黑客攻击与偏好数据隐私问题,提出PrivBoN和PrivITP方法,实现差分隐私推理时对齐,经实验验证其性能优于原有策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27147 2026-08-28 cs.AI 新提交 57%

Thomson: Continual Learning of Frontier Models for SovereignAI

Thomson:面向主权人工智能的前沿模型持续学习

Shengzhuang Chen, Jerrod Parker, Yejin Bang, Andrew M. Bean, Nabeel Seedat, Stefan Winzeck, Daniil Glazko, Jannik Zgraggen, Fangyi Yu, Scott Arnott, Dietrich Trautmann, Luca Ciuffreda, Guglielmo Bonifazi, Davide Romano, Bradley Bell, Kirsty Fielding, Daniele Giofrè, Tom Zielund, Ipshita Chatterjee, Sneha Murthy Ghantasala, Manpreet Nanreh, John Scoville, Maciej Sakowicz, Wassim Seifeddine, Lukas Thede, Jonathan Richard Schwarz

机构 * Imperial College London(帝国理工学院) DatologyAI Lambda

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 该研究提出Thomson,通过对开放权重模型的持续学习,以低预算实现前沿模型性能,可帮助更多机构构建主权人工智能,且在多任务表现优异,几乎消除了遗忘问题。

Comments Open-weight model: this https URL (https://huggingface.co/thomsonreuters/Thomson-1.0-Small)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18064 2026-08-28 cs.SE cs.AI 版本更新 57%

Autoresearch with Coding Agents: Generalizers and Metric-Maximizers on Quran Recitation Data

使用编码智能体进行自动研究:古兰经诵读数据上的泛化器和指标最大化器

Nursultan Askarbekuly, Mohamad Al Mdfaa, Ahmed Helaly, Gonzalo Ferrer, Manuel Mazzara

机构 * Innopolis University(因诺波利斯大学) Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 研究在古兰经诵读数据任务中智能体自动研究模式,Claude Code和OpenAI Codex从同一起点出发,先发明相同算法后有分歧,添加测试集后情况变化,还提炼出评估自主智能体的五条设计规则,智能体解决方案超越手工管道。

详情

展开后加载摘要…

URL PDF HTML 收藏