Exploring Re-inforcement Learning via Human Feedback under User Heterogeneity
通过用户异质性探索基于人类反馈的强化学习
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract)
AI总结 本研究通过聚类和个性化奖励模型处理用户异质性,提升强化学习模型的胜率。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
通过用户异质性探索基于人类反馈的强化学习
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract)
AI总结 本研究通过聚类和个性化奖励模型处理用户异质性,提升强化学习模型的胜率。
超越正确性:跨文化的主观写作偏好评估
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI
AI总结 本文提出WritingPreferenceBench数据集,发现基于序列的奖励模型在评估主观写作偏好时表现不佳,而生成奖励模型通过推理链达到更高准确率,揭示了当前RLHF方法在捕捉主观偏好方面的局限性。
通过主动安全推理增强模型对劫持的防御
机构 * School of Computing(计算学院) ; National University of Singapore(新加坡国立大学) ; School of Computer Science and Engineering(计算机科学与工程学院) ; Nanyang Technological University(南洋理工大学) ; Department of Computing(计算系) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出SCoT方法,通过主动安全推理提升模型对劫持的防御能力,有效减少对分布外问题和对抗操纵的易感性。
在电子商务目录中评估多模态大语言模型用于缺失模态补全
机构 * University of Glasgow(格拉斯哥大学) ; Telefónica Scientific Research(电信科研机构) ; National University of Singapore(新加坡国立大学) ; Shandong University(山东大学)
专题命中 安全训练 :alignment(abstract)
AI总结 本文研究了多模态大语言模型在电子商务目录中补全缺失模态的能力,通过MMPCBench基准测试发现MLLMs在细粒度对齐上存在不足,并探索了GRPO方法以提升补全效果。
LLMStinger: 使用强化学习微调的LLM进行LLM劫持
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.LG
AI总结 LLMStinger通过强化学习微调LLM,生成对抗性后缀以提高对有害问题的攻击成功率,显著优于现有方法。
Comments Accepted at AAAI 2025
在物理信息系统中保障AI代理:环境交互、深度伪造威胁及防御的综述
专题命中 越狱攻击 :safety(abstract);trustworthy(abstract)
AI总结 本文综述了物理信息系统中AI代理的安全威胁,重点分析了环境交互、深度伪造攻击及MCP漏洞,并提出基于SENTINEL框架的防御策略与挑战。
根据OWASP Top 10为LLM应用程序的框架对LLAMA模型安全性能进行基准测试
机构 * Texas A&M University(德克萨斯A&M大学)
专题命中 越狱攻击 :safety(abstract);分类 cs.LG
AI总结 本研究通过对比不同LLama模型的安全性能,发现小型专用模型在威胁检测上表现优于大型通用模型,并提供开源数据集支持AI安全研究。
量化保真度:一种基于决定性特征的方法用于比较合成与真实图像
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI
AI总结 本文提出决定性特征保真度(DFF)方法,用于评估合成与真实图像的保真度差异,通过分析决策证据一致性提升模拟器保真度。
帮助约翰尼理解隐私政策的LLMs
机构 * Center for Scalable Data Analytics and Artificial Intelligence (ScaDS.AI) Dresden/Leipzig, Leipzig University(可扩展数据分析与人工智能中心(ScaDS.AI)德累斯顿/莱比锡,莱比锡大学)
专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI
AI总结 PRISMe通过结合LLM的政策评估与交互式界面,帮助用户更有效地理解和参与隐私政策,同时揭示了设计和技术上的挑战。
Comments 21 pages, 3 figures, 3 tables, ACM CHI 2026
让我们进行BiFTA:用于视觉语言模型中细粒度文本-视觉对齐的双 refinement
机构 * School of Computing and Information Systems(计算机与信息系统学院) ; The University of Melbourne(墨尔本大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
AI总结 BiFTA通过视图和描述细化方法提升视觉语言模型中细粒度文本-视觉对齐的零样本性能。
Comments 25 pages
SAGES关键安全视角挑战:人工智能辅助手术质量评估的全球基准
机构 * University of Strasbourg(斯特拉斯堡大学) ; CNRS(法国国家科学研究中心) ; INSERM(法国国家医学研究院) ; ICube(ICube研究中心) ; UMR7357(法国国家科研机构(UMR7357)) ; Massachusetts General Hospital(麻省总医院) ; Harvard Medical School(哈佛医学院) ; University Hospital Cologne(科隆大学医院) ; Global College(全球学院) ; Shanghai Jiao Tong University(上海交通大学) ; Chang Gung Memorial Hospital(长庚纪念医院) ; A. Costa Hospital(A. Costa医院) ; Maggiore Hospital - AUSL Bologna(马吉奥医院 - 玛格丽特医院) ; Institute for Research against Digestive Cancer (IRCAD)(消化道癌症研究机构(IRCAD)) ; Lenox Hill Hospital(Lenox Hill医院) ; Northwell Health(Northwell健康系统) ; Albany Medical Center(阿尔巴尼医疗中心) ; German Cancer Research Center (DKFZ)(德国癌症研究中心(DKFZ)) ; Stanford University(斯坦福大学) ; MultiModal Learning Lab(多模态学习实验室) ; NAAMII ; University of Aberdeen(阿伯丁大学) ; Eindhoven University of Technology(埃因霍温理工大学) ; UCL Hawkes Institute(UCL Hawkes研究所) ; Dept of Computer Science, University College London(计算机科学系,伦敦大学学院) ; University Health Network(大学健康网络) ; Institute for Biomedical Informatics(生物医学信息研究所) ; Rovira i Virgili University(罗维拉-维吉里大学) ; Huazhong University of Science(华中科技大学) ; Hefei University of Technology(合肥工业大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Duke University(杜克大学)
专题命中 安全评测 :safety(title,abstract)
AI总结 SAGES关键安全视角挑战通过全球协作和AI技术,提升手术质量评估的性能和鲁棒性,推动临床应用。
Comments 21 pages, 10 figures
基于Transformer模型的多智能体轨迹预测中的无监督异常检测
机构 * Electrical Engineering and Computer Sciences(电气工程与计算机科学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG
AI总结 本文提出基于Transformer的多智能体轨迹预测无监督异常检测框架,通过预测残差和双评估方案识别安全关键场景,有效捕捉多智能体风险并提供可解释的风险类型。
C3Box: 基于CLIP的类增量学习工具箱
机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) ; National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 C3Box是一个基于CLIP的类增量学习工具箱,整合了多种CIL方法,提供统一框架和标准化流程,提升持续学习研究的可重复性和实用性。
Comments The code is available at https://github.com/LAMDA-CL/C3Box
AI标注协调:评估LLM验证器以提高学习分析中LLM标注的质量
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文通过评估LLM验证器提升学习分析中标注质量,提出灵活的协调框架和实证比较方法,展示验证在提高标注可靠性中的作用。
作为LLM社会推理的镜像:人格提示
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本研究探讨了人格提示对LLM社会推理的影响,发现其虽能提升分类效果,但会降低推理质量并加剧偏见。
Comments 9 Pages, EACL main
超越发散性创造:基于人类的大型语言模型创造力评估
机构 * University of Amsterdam(阿姆斯特丹大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出CDAT任务,基于人类创造力理论,评估LLMs在新颖性与适当性之间的平衡,发现较小模型更具创造力,而高级模型更注重适当性。
Comments Accepted to Findings of EACL 2026
GCL-OT:基于最优传输的图对比学习用于异质文本属性图
机构 * Yating Ren, Yikun Ban, Huobin Tan
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 GCL-OT通过最优传输和定制机制解决文本属性图中的异质性问题,提升结构-文本对齐效果。
Comments AAAI 2026
LEGO-Eval: 向通过工具增强合成3D具身环境的细粒度评估迈进
机构 * Yonsei University(延世大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 LEGO-Eval通过工具增强合成3D具身环境,提供细粒度评估框架和基准测试集,提升场景与指令对齐的准确性。
YNTP-100: 一个用于下一步令牌预测的基准,包含100人
机构 * Kyoto University(京都大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 YNTP-100是一个包含100人的多语言对话基准,用于评估个性化响应生成的对齐方法。
NurValues: 临床情境下大型语言模型护理价值观的现实评估
机构 * The Hong Kong Polytechnic University(香港理工大学) ; University of Copenhagen(哥本哈根大学) ; Tianjin University(天津大学) ; Tongji Hospital of Tongji Medical College of Huazhong University of Science and Technology(华中科技大学同济医学院同济医院) ; Beijing University of Chinese Medicine(北京中医药大学) ; Halmstad University(哈马尔大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 NurValues通过首个护理价值对齐基准,评估LLMs在临床情境中是否符合护理核心价值观,发现通用LLMs在公正维度表现最差。
Comments 39 pages, 9 figures, 24 tables
通过生成后记忆检索减少基于语言模型的SPARQL查询生成中的幻觉
机构 * Polytechnique Montréal(蒙特利尔理工学院) ; Mila - Quebec AI Institute(魁北克人工智能研究院) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 本文提出PGMR框架,通过生成后记忆检索减少语言模型生成SPARQL查询时的URI幻觉,提升查询准确性和系统鲁棒性。
NLPrompt: 噪声标签提示学习用于视觉-语言模型
机构 * ShanghaiTech University(上海科技大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; RIKEN Center for Advanced Intelligence Project(日本RIKEN高级智能项目中心) ; University of Technology Sydney(悉尼科技大学) ; University of Melbourne(墨尔本大学)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 NLPrompt通过结合PromptMAE和PromptOT,提升视觉-语言模型在噪声标签下的提示学习鲁棒性与精度。
跨AI架构的对话推理:一种多模型框架用于测试AI对齐策略
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI
AI总结 本文提出一种多模型框架,通过对话推理测试AI对齐策略,展示不同AI模型在处理复杂对齐框架时的表现及新兴见解。
Comments 23 pages, 5 tables, 5 appendices. Code and data: https://github.com/jgraycox-coa/vcw-multi-ai-dialogue
公平的 recourse 为所有:在反事实解释中确保个体和群体公平性
机构 * University of Applied Sciences and Arts of Southern Switzerland(瑞士南方应用科学与艺术大学) ; Università della Svizzera italiana(瑞士意大利大学)
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种基于强化学习的方法,生成同时满足个体和群体公平性的反事实解释,以提升XAI的公平性和透明度。
具有可调对齐角度的自驱动粒子集体行为
专题命中 其他安全 :alignment(title,abstract)
AI总结 本文提出了一种具有可调对齐角度的自驱动粒子模型,通过数值模拟发现其在特定参数范围内表现出反平行带等独特集体行为,揭示了多体相互作用对向列序的破坏作用。
Comments 7 pages, 5 figures
Journal ref Phys. Rev. E 113, 015411 (2026)
基于智能角度图的RIS辅助毫米波通信网络波束对齐
专题命中 其他安全 :alignment(title,abstract)
AI总结 本文提出基于智能角度图的波束对齐方法,利用Transformer模型实现高效波束对齐,无需扫描即可实现高精度通信性能。
Journal ref IEEE Transactions on Network Science and Engineering, 2026
在具有线性函数逼近的约束马尔可夫决策过程中的episode级安全强化学习的可证明效率
专题命中 其他安全 :safety(title);分类 cs.LG
AI总结 本文提出了一种在约束马尔可夫决策过程中的强化学习算法,实现episode级安全性和$\tilde{\mathcal{O}}(\sqrt{K})$的遗憾,同时具有多项式计算效率。
DaMO:一种数据高效的多模态协调器,用于视频LLM的时序推理
机构 * College of Artificial Intelligence, National Yang Ming Chiao Tung University(人工智能学院,阳明交通大学) ; Institute of Population Health Sciences, National Health Research Institutes(人口健康科学研究所,国家健康研究院) ; Department of Computer Science, National Yang Ming Chiao Tung University(计算机科学系,阳明交通大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 DaMO是一种专为视频LLM设计的数据高效多模态协调器,通过时序感知Fuseformer和四阶段训练范式提升时序推理能力,实现更精确的多模态理解。
CtrlCoT:用于可控推理的双粒度推理链压缩
机构 * Zhejiang University(浙江大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 CtrlCoT通过双粒度方法实现高效可控推理,结合语义抽象与标记级删除,提升推理效率和可靠性。
Comments 16 pages, 9 figures, 11 tables
物理引导的多模态Transformer是下一代气象科学的必要基础
机构 * School of Artificial Intelligence, Beijing University of Posts ; Huawei Noah's Ark Lab ; Department of Earth System Science, Tsinghua University ; College of Computing \& Data Science, Nanyang Technological University ; State Key Laboratory of Networking ; Switching Technology, Beijing University of Posts
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出通过物理引导的多模态Transformer构建下一代气象科学的统一范式,以提升模型的科学一致性和物理约束能力。
Comments Perspective article