Efficient Exploration at Scale
大规模高效探索
机构 * Google(谷歌) ; DeepMind(深度思维)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文提出一种在线学习算法,通过增量更新奖励和语言模型提升强化学习从人类反馈中的数据效率,采用小幅度正向激励、信念神经网络和信息导向探索等机制,实验表明在少于20k标签下达到200k标签的性能,预计1M标签可匹配1B标签的性能。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
大规模高效探索
机构 * Google(谷歌) ; DeepMind(深度思维)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文提出一种在线学习算法,通过增量更新奖励和语言模型提升强化学习从人类反馈中的数据效率,采用小幅度正向激励、信念神经网络和信息导向探索等机制,实验表明在少于20k标签下达到200k标签的性能,预计1M标签可匹配1B标签的性能。
用于内容推荐的反向心智理论建模:从网页浏览到动态智能界面
机构 * JPMorganChase(摩根大通)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 本研究提出反向心智理论(IToM)流程,从用户交互反向推理推断信念与偏好,在OPeRA数据集上验证其画像推断效果,并通过VisionOS应用展示跨模态迁移能力,提升内容推荐的用户理解精度。
Comments Preprint for conference full paper at 20th ACM Conference on Recommender Systems (RecSys '26), Minneapolis, MN, USA
SlidesGen-Bench: 通过计算和定量指标评估幻灯片生成
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 SlidesGen-Bench通过计算和定量指标评估幻灯片生成,提出统一框架和可重复的量化指标,构建人类偏好对齐数据集,提升与人类判断的一致性。
Comments 37 pages, 34 figures, EMNLP 2026 Main Conference
SafeSteer: 局部化在策略蒸馏用于高效安全对齐
机构 * Beihang University(北航) ; Beijing Institute of Technology(北京理工大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Peking University(北京大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型安全对齐导致通用能力下降的问题,提出SafeSteer方法,通过激活引导构建安全教师并选择安全令牌,仅在安全令牌上施加反向KL惩罚,在仅用100个有害样本且无需通用数据的情况下,实现了安全与通用能力之间的优越平衡。
Comments 19 pages, 8 figures, 14 tables. EMNLP 2026 Main Conference
RefusalGuard:面向大语言模型安全的保几何微调方法
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究提出保几何微调框架RefusalGuard,解决大语言模型微调时安全对齐退化问题,在多模型及安全、下游任务基准上表现优于基线,平衡安全与任务性能。
当言语安全但行动致命:在隐藏状态风险空间中探究超越文本安全的物理危险
机构 * Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学)
专题命中 安全训练 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
AI总结 研究大语言模型中语言无害指令在现实世界中的物理危险与文本级内容危险是否相同,提出PRISM方法,通过隐藏状态方向分析等证明CD和PD可分离,PRISM在多个基准测试中表现良好,能检测物理危险而非仅依赖明确不安全措辞。
Mint-Agent:引入金融原生智能体基础模型
专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出金融原生智能体模型Mint-Agent,通过三大支柱开发出Mint-Cu(9B)和Mint-Ag(27B),在多个金融基准测试中展现出优异的可靠性与可执行性,为可信金融智能提供了新路径。
弱批评者造就强学习者:用于可扩展监督的在策略批评蒸馏
机构 * University of Cambridge(剑桥大学) ; University of California, Berkeley(加州大学伯克利分校) ; UC Berkeley AI Lab(加州大学伯克利分校人工智能实验室)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 提出在策略批评蒸馏(OPCD)方法,利用弱模型作为批评者提供修订方向,通过自适应自教师信号蒸馏批评引导的行为,提升强模型在推理和对齐基准上的表现。
将理解作为前沿AI安全决策的明确且可评估的组成部分
专题命中 幻觉与事实性 :safety(title,abstract);AI safety(title);分类 cs.CY
AI总结 该研究提出一种基于Assurance 2.0框架的临时方法,用于明确且可评估前沿AI安全决策中的理解,经两种场景测试,该方法可应用且能驱动工程工作。
Comments Changed first line of abstract
对心理健康支持中的人机交互信任进行对齐:多利益相关者的调查与立场
机构 * National Institute of Informatics (NII)(日本国立信息学研究所) ; Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.CL
AI总结 本文提出三层信任框架,整合关键利益相关者观点,系统回顾心理健康领域AI研究,指出NLP与实际需求间的差距,提出构建社会技术一致且真实可信的AI研究方向。
大语言模型内部表示中提示的固有维度
专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.LG
AI总结 本研究通过固有维度视角分析大语言模型提示的内部表示几何,发现其与下一个 token 不确定性等相关,训练的线性探测模型可在生成前区分恶意与良性提示,准确率优于现有安全工具,为 LLM 安全提供了新信号。
Comments 12+14 pages, 18 figures, matches published version on Transactions of Machine Learning Research
重新思考大语言模型验证:证据结构、不确定性与选择性优化
机构 * Indian Institute of Technology Jammu(贾姆穆印度理工学院) ; Microsoft Research(微软研究院) ; SCB Dental College and Hospital(SCB牙科学院与医院)
专题命中 幻觉与事实性 :safety(abstract)
AI总结 该研究针对LLMs医疗应用的安全问题,提出两阶段框架,利用模型弃权信号优化推理,在GPT-5.5、DeepSeek-R1模型及MedReason、MedQA数据集上显著提升了医疗假设验证的准确率。
Comments Withdrawn by the authors due to premature submission before final review
RouteScan: 通过专家路由遥测对MoE大语言模型安全性进行非侵入式审计
机构 * Zhejiang University(浙江大学) ; Donghua University(东华大学) ; Louisiana State University(路易斯安那州立大学)
专题命中 隐私与版权 :safety(title,abstract);分类 cs.CL、cs.LG
AI总结 提出RouteScan,一种利用MoE模型GPU级专家路由遥测(如预填充阶段活跃线程数)作为微架构指纹,通过轻量级检测流水线识别恶意提示的非侵入式审计框架,在未见过的有害领域AUROC超0.93,新越狱包装下超0.96,且相比基于内容的审计方法具有隐私优势。
Comments 11 pages. Revised manuscript with expanded experiments
校准后再委托:通过模型级联实现具有风险和预算保证的安全监控
机构 * King’s College London(伦敦国王学院) ; University of Manchester(曼彻斯特大学) ; Northeastern University London(伦敦东北大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.LG
AI总结 本文提出Calibrate-Then-Delegate方法,通过模型级联在保证计算成本的同时实现实例级决策,有效提升安全监控的准确性和效率。
用于大规模推荐解释的LLM评判模型的生命周期
机构 * Netflix(网飞公司)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 该研究提出用于Netflix大规模推荐解释评估的LLM评判模型生命周期框架,经五周A/B测试证实,其对齐的解释可提升会员对新颖内容的观看及浏览到播放会话量。
MedRAGChecker: 用于生物医学检索增强生成的声明级验证
机构 * University of Pittsburgh(匹兹堡大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 MedRAGChecker通过声明级验证和诊断框架,提高生物医学RAG生成答案的可靠性与安全性。
面向S^2C^2I集成高空平台:架构、跨职能设计、评估与部署视角
专题命中 安全评测 :trustworthy(abstract)
AI总结 本综述聚焦S^2C^2I集成高空平台,阐述其架构、技术、评估方法与部署,通过应急案例验证其服务优势,指明相关研究机遇,提供从设计到部署的路线图。
任务指令引导的视觉基础模型因果路由用于多任务学习
机构 * Electronics and Telecommunications Research Institute (ETRI)(韩国电子通信研究院(ETRI)) ; Kyung Hee University(庆熙大学) ; Chonnam National University(全南大学)
专题命中 安全评测 :alignment(abstract)
AI总结 提出TIGER框架,通过自然语言任务指令引导路由网络,结合反事实因果对齐,协调多个异构视觉基础模型实现多任务密集预测,在NYUD-v2和Pascal Context上超越现有方法。
Comments 9 pages, 4 figures
你的工具不安全:评测命令行界面智能体的现实威胁
专题命中 安全评测 :safety(abstract)
AI总结 该研究针对CLI智能体滥用风险,推出与MITRE ATT&CK对齐的AdvCLI基准测试,评估7款CLI智能体后发现其常越过拒绝边界,可完成部分恶意OS级任务,为开发安全机制提供测试平台。
Comments Accepted by EMNLP 2026 (Findings)
Crane:用于零样本异常检测的上下文引导提示学习与注意力优化
专题命中 安全评测 :alignment(abstract)
AI总结 本研究提出基于CLIP的框架Crane,通过相关性注意力模块、上下文引导提示学习等改进零样本异常检测,在7个工业基准上显著提升图像级AP与像素级AUPRO,还衍生出更强变体Crane+。
Comments British Machine Vision Conference (BMVC 2026)
大语言模型中的内在自我修正:通过机制可解释性实现可解释的提示
机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taipei, Taiwan(通讯工程研究院,国立台湾大学) ; MediaTek Research, Taipei, Taiwan(联发科研究,台北,台湾) ; Department of Electrical Engineering, National Taiwan University, Taipei, Taiwan(电气工程系,国立台湾大学) ; Department of Electrical Engineering, National Tsing Hua University, Hsinchu, Taiwan(电气工程系,国立清华大学) ; AI Research Center (AINTU), National Taiwan University, Taipei, Taiwan(人工智能研究中心(AINTU),国立台湾大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过机制可解释性揭示大语言模型中内在自我修正的机制,证明提示引导隐藏表示偏移是其核心驱动因素。
不完美对齐下价值的脆弱性
专题命中 其他安全 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 本文针对AI系统与人类价值对齐问题,建立模型明确人类价值函数与代理条件准确度的相关条件,凸显过度优化风险,提出采用quantilizers等限制优化压力的AI设计方案。
Comments 25 pages, 7 figures. Expanded the contribution statements and added three researchers as coauthors. Made small text improvements
ConceptFormer:学习自适应潜在概念以实现视觉文档检索中的查询-文档对齐
机构 * Northeastern University(东北大学) ; Tsinghua University(清华大学) ; Peking University(北京大学)
专题命中 其他安全 :alignment(title,abstract)
AI总结 针对视觉文档检索中现有监督信号的局限,本文提出ConceptFormer框架,以自适应潜在概念为中间表示衔接语义鸿沟,在基准测试中较最强基线实现了16.7%、22.1%的NDCG@10相对提升,性能优异。
深度模型,浅层对齐:揭示神经解码中的粒度不匹配
机构 * Dept. of Electrical & Computer Engineering, University of Pittsburgh, USA(宾夕法尼亚大学电气与计算机工程系) ; Dept. of Biomedical Engineering, Tsinghua University, China(清华大学生物医学工程系) ; Dept. of Neurology, University of Southern California, USA(美国南加州大学神经病学系) ; Dept. of Computer Science, University of Texas Rio Grande Valley, USA(德克萨斯理工大学里奥格兰德谷分校计算机科学系)
专题命中 其他安全 :alignment(title,abstract)
AI总结 本文提出浅层对齐方法,通过对比学习策略解决神经解码中的粒度不匹配问题,显著提升解码性能。
Comments 33 pages, 16 figures
注意风格:沟通风格对人机交互的影响
机构 * Czech Technical University in Prague(捷克技术大学(布拉格)) ; University of South Bohemia(南波西米亚大学) ; Utrecht University(乌得勒支大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究探讨了沟通风格对人机交互的影响,发现友好风格提升女性用户满意度和任务完成率,且用户较少模仿聊天机器人风格。
通过纵向生活轨迹缓解大语言模型智能体中的本质主义身份偏差
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 针对现有LLM智能体存在的身份本质主义偏差导致组内反应同质化的问题,提出LifeMem纵向记忆框架,在Add Health等数据集上验证其可提升与人类数据的一致性。
Comments 23 pages, 12 figures