Open Problems in Differentiable Social Choice: Learning Mechanisms, Decisions, and Alignment
可微社会选择中的开放问题:学习机制、决策与对齐
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本文探讨了可微社会选择中的18个开放问题,研究如何将投票规则、机制和聚合过程作为可学习模型进行优化,揭示了经典公理在机器学习中的新应用。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
可微社会选择中的开放问题:学习机制、决策与对齐
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本文探讨了可微社会选择中的18个开放问题,研究如何将投票规则、机制和聚合过程作为可学习模型进行优化,揭示了经典公理在机器学习中的新应用。
基于扩散模型的人体网格恢复中的群体偏好对齐
机构 * Nanyang Technological University(南洋理工大学) ; HKUST(GZ)(香港科技大学(广州)) ; SenseTime Research(商汤科技研究院) ; A*STAR(新加坡科技研究局)
专题命中 偏好对齐 :alignment(title,abstract)
AI总结 本文提出了一种基于群体偏好的扩散模型微调框架,通过双内存增强的批评代理生成质量评分,提升人体网格恢复的物理合理性和图像一致性。
Comments Accepted to CVPR 2026
IR$^3$:基于可解释性强化学习的对抗性检测与缓解方法
机构 * UC Davis(加州大学戴维斯分校) ; Virginia Tech(弗吉尼亚理工大学) ; Salesforce(Salesforce公司) ; Meta AI
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG
AI总结 IR3通过对比逆强化学习重建隐含奖励并修正模型,有效识别和缓解奖励黑客问题,提升模型对齐性能。
Ada-RS: 选择性思维的自适应拒绝采样
机构 * PayPal AI
专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG
AI总结 Ada-RS通过自适应拒绝采样提升LLMs在延迟敏感场景下的推理效率与准确性。
MergeMix:一种用于视觉和多模态理解的统一增强范式
机构 * Westlake University(西拉克大学) ; Zhejiang University(浙江大学) ; College of Computer Science and Technology(计算机科学与技术学院)
专题命中 偏好对齐 :alignment(abstract)
AI总结 MergeMix通过高效的令牌合并Mixup增强方法,平衡了SFT和RL的优劣,提升多模态大语言模型的分类准确率和对齐能力。
Comments ICLR 2026, Web link: https://jinxins.github.io/MergeMix_Web/
依赖大语言模型的应用需要系统级威胁监控
机构 * Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系) ; School of Computing and Information Systems, Singapore Management University, Singapore(新加坡管理学院计算机与信息系统学院)
专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.AI
AI总结 本文主张对依赖大语言模型的应用进行系统级威胁监控,以应对由此带来的安全挑战和确保可靠操作。
Comments 26 pages
多智能体强化学习系统中的可解释性故障分析
机构 * Wake Forest University(威克森林大学) ; Indiana University(印第安纳大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种两阶段梯度框架,用于多智能体强化学习系统中可解释的故障检测与归因分析,通过几何分析和敏感性分析提高故障诊断的透明度和准确性。
Comments Accepted to the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)
Vibe Coding on Trial: Unanimous LLM Juries的运行特性
机构 * Texas Tech University(德克萨斯农工大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了使用多数LLM陪审团在代码审查中减少假接受的同时保持高准确率的方法,通过基准测试和实验验证了委员会大小和组成对安全性的影响。
Comments Submitted to IEEE International Conference on Semantic Computing 2026
针对大语言模型的采样感知对抗攻击
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 本文提出了一种基于采样感知的对抗攻击方法,通过优化与采样资源分配提升攻击成功率和效率,揭示了采样在评估大语言模型安全性中的关键作用。
基于WEST磁约束装置放电配置的机器学习预测等离子体行为
专题命中 安全训练 :safety(abstract)
AI总结 本研究提出基于变换器的机器学习模型,用于预测WEST托卡马克的关键等离子体参数,实现快速放电规划与实时控制。
基于组成安全性的自动驾驶系统构建
专题命中 安全训练 :safety(abstract)
AI总结 本文提出了一种基于组成安全性的自动驾驶系统构建方法,通过协调执行驾驶操作来确保安全,采用分阶段控制策略,涵盖主要驾驶任务。
Comments 34 pages, 13 figures
TactEx:一种可解释的多模态机器人交互框架,用于类人触觉和硬度估计
专题命中 安全训练 :alignment(abstract)
AI总结 TactEx通过融合视觉、触觉和语言模态,实现类人触觉和硬度估计,展示了在水果成熟度评估中的高任务成功率和可解释性。
Comments Accepted by 2026 ICRA
面向角色的语言模型:用于组织中的安全且上下文化的访问控制
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) ; Nazarbayev University(纳扎尔拜耶夫大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; New York University Abu Dhabi(纽约大学阿布扎克分校)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.AI
AI总结 本文提出面向角色的语言模型,通过三种策略实现基于组织角色的安全访问控制,并通过实验验证其在不同组织结构下的性能和鲁棒性。
Comments AACL 2025 - Main
明文之中隐藏:通过激活解耦检测隐蔽的 jailbreak
机构 * Duke University(杜克大学) ; Princeton University(普林斯顿大学) ; Google DeepMind(谷歌DeepMind) ; Apple(苹果公司)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 通过解耦 LLM 激活中的语义因子,提出 FrameShield 异常检测器,提升对隐蔽 jailbreak 的检测能力,并推动 LLM 安全和可解释性研究。
SocialHarmBench: 揭示 LLM 对有害社会请求的脆弱性
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SocialHarmBench 通过 585 个提示揭示 LLM 在政治敏感场景中的脆弱性,揭示了模型在有害请求中的高风险表现。
Comments ICLR 2026
意外漏洞:影响微调的因子
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; ETH Zürich(苏黎世联邦理工学院) ; FAR AI(FAR人工智能公司) ; McGill University(麦吉尔大学) ; MILA(蒙特利尔人工智能研究院) ; Max Planck Institute for Intelligent Systems, Tübingen, Germany(图宾根德国智能系统研究所)
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究意外漏洞,揭示微调数据集特征对模型安全性和对抗鲁棒性的影响
Comments Second Conference of the International Association for Safe and Ethical Artificial Intelligence (IASEAI 2026)
对LLM进行红队行动作为社会技术实践:从探索和数据创建到评估
机构 * Responsible Tech Research IBM Research Yorktown Heights New York USA(负责技术研究 IBM 研究 Yorktown Heights 新 York 美国) ; IBM Research(IBM 研究) ; The Pennsylvania State University(宾夕法尼亚州立大学) ; University of Notre Dame(诺特达美大学)
专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本文通过访谈从业者,探讨了红队行动数据集定义、创建和评估的社会技术实践,揭示了从业者在风险概念化中的不足,并提出HCI研究者扩展红队行动概念化和数据实践的三个机会。
AlignSentinel: 一种考虑对齐的提示注入攻击检测方法
专题命中 提示注入 :prompt injection(title,abstract);alignment(title)
AI总结 AlignSentinel通过分析LLM注意力图,有效区分包含错位指令、对齐指令和非指令输入,提升提示注入攻击检测的准确性。
招聘中的木马:针对标准与推理模型间接提示注入的红队案例研究
机构 * University of Mannheim(曼海姆大学)
专题命中 提示注入 :prompt injection(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本研究通过红队测试揭示了标准与推理模型在间接提示注入中的安全差异,发现推理模型在复杂指令下易出现元认知泄漏,而标准模型在简单攻击中表现较弱。
Comments 43 pages, 3 synthetic CV PDF's, 6 chat history PDF's and system prompts. This work was developed as part of the Responsible AI course within the Mannheim Master in Data Science (MMDS) program at the University of Mannheim
RFEval: 在大推理模型中评估推理忠实性下的反事实推理干预基准测试
机构 * AIDAS Laboratory(AIDAS实验室) ; IPAI ; ECE(电子工程系) ; Seoul National University(首尔国立大学)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 RFEval通过反事实推理干预评估大推理模型的推理忠实性,发现49.7%的输出不忠实,主要源于立场不一致,强调准确性不能作为忠实性的可靠代理。
Comments Accepted in ICLR 2026 Poster: https://iclr.cc/virtual/2026/poster/10011763
TAG:基于动作单元的面部表情识别中的思维
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI
AI总结 TAG通过基于动作单元的视觉-语言框架,提升面部表情识别的推理可信度和视觉一致性。
Comments 33 pages, 8 figures
概率光子计算
专题命中 幻觉与事实性 :safety(abstract)
AI总结 本文提出利用光子计算实现低延迟、低能耗的概率计算架构,以解决传统确定性硬件在概率建模中的不足,并探讨其在人工智能系统中的应用与挑战。
用于自动患者问卷完成的对话式AI:开发见解与设计原则
专题命中 幻觉与事实性 :safety(abstract)
AI总结 本文提出了一种基于生成式AI的对话代理,用于自动完成患者问卷,通过主题对话提高数据收集效率,并总结了设计原则和开发经验。
Comments 13 pages
通过整合可解释AI与SHAP可解释性及战略数据采样检测网络安全威胁
机构 * Dept. of Digital Network and Information Security Management(数字网络与信息安全管理系)
专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本研究通过整合可解释AI与SHAP可解释性及战略数据采样,提升网络安全威胁检测的透明度和效率
Comments 10 pages, 6 figures, accepted for publication in ICTIS 2026
MiSCHiEF:安全与文化最小对基准用于细粒度图像-描述对齐的全面评估
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
AI总结 MiSCHiEF通过安全与文化最小对基准,评估细粒度图像-描述对齐的挑战,揭示当前VLMs在模态对齐上的持续问题。
Comments EACL 2026, Main, Short Paper
汽车系统工程中可信生成式人工智能的工作流级设计原则
机构 * Carl von Ossietzky University of Oldenburg(奥尔登堡卡尔·冯·奥西特齐克大学) ; DENSO AUTOMOTIVE
专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG
AI总结 本文提出可信生成式人工智能在汽车系统工程中工作流级设计原则,通过需求增量识别、SysML架构更新及可追溯测试保障安全关键系统工程的可信度。
REVEALER: 基于强化引导的视觉推理的元素级文本-图像对齐评估
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 安全评测 :alignment(title,abstract)
AI总结 REVEALER通过强化引导的视觉推理实现元素级文本-图像对齐评估,提升模型对齐判断的可解释性和效率。
算法无意识:大型语言模型中的结构机制与隐性偏见
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY
AI总结 本文探讨了大型语言模型中结构性机制与隐性偏见,揭示了分词、注意力等机制对偏见的影响,并提出技术诊所框架以促进AI基础设施的批判性利用。
Comments 18 pages, 5 figures, Extended version of a paper presented at the international conference 'Artificial Intelligence and Transformations of Information' (LOGOS/FLSH, Hassan II University of Casablanca, Morocco, December 2025), accepted for publication in LOGOS after double-blind peer review
像素不会说谎(但你的检测器可能会):通过生成器-评估器过程构建MLLM作为判断者以实现可信的深度伪造检测和推理监督
机构 * MBZUAI ; Monash University(墨尔本大学)
专题命中 安全评测 :trustworthy(title)
AI总结 本文提出DeepfakeJudge框架,通过生成器-评估器过程提升深度伪造检测的推理忠实性,实现高准确率和高一致性的推理监督。
Comments CVPR-2026, Code is available here: https://github.com/KjAeRsTuIsK/DeepfakeJudge
CIBER:代码解释器代理安全评估的综合基准
专题命中 安全评测 :alignment(abstract);prompt injection(abstract)
AI总结 CIBER提出了一种综合基准,评估代码解释器代理对四种主要对抗性攻击的鲁棒性,揭示了模型架构、对齐和智能水平对安全的影响,以及自然语言伪装和安全极化现象。