Triaging Threats to Specialized Guardrails
针对专用护栏的威胁分类
机构 * University of California, Davis(加州大学戴维斯分校)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 提出GuardZoo统一基准和RouteGuard路由专家框架,通过将对话分流至专用护栏,解决单一护栏在多种威胁域上的任务干扰问题,提升细粒度检测和泛化能力。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
针对专用护栏的威胁分类
机构 * University of California, Davis(加州大学戴维斯分校)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 提出GuardZoo统一基准和RouteGuard路由专家框架,通过将对话分流至专用护栏,解决单一护栏在多种威胁域上的任务干扰问题,提升细粒度检测和泛化能力。
DEBATE:用于评估角色扮演LLM代理中观点动态的大规模基准
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Google DeepMind(谷歌DeepMind) ; Stanford University(斯坦福大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 提出DEBATE基准,通过多轮公共消息和Likert量表信念数据,评估多代理角色扮演LLM模拟中观点动态的真实性,发现零样本设置下代理组过度收敛,而监督微调可改善立场对齐并减少组级收敛误差。
*-PLUIE:使用大语言模型改进评估的可个性化度量
机构 * Univ Rennes, CNRS, IRISA, EXPRESSION(里尔大学、法国国家科学研究中心、IRISA、EXPRESSION) ; Nantes Université, École Centrale Nantes, CNRS, LS2N, UMR 6004(南特大学、南特中央理工学院、法国国家科学研究中心、LS2N、UMR 6004) ; Univ Rennes, CNRS, IRISA, SOTERN(里尔大学、法国国家科学研究中心、IRISA、SOTERN) ; Univ of South Brittany, CNRS, IRISA, ARCHIMEDIA(布列塔尼南部大学、法国国家科学研究中心、IRISA、ARCHIMEDIA)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 提出*-PLUIE,一种基于困惑度的可个性化LLM评判度量,通过任务特定提示变体实现与人类判断的更强相关性,同时保持低计算成本。
Comments Accepted at *SEM 2026
多智能体团队阻碍专家发挥
机构 * stanford(斯坦福大学) ; apple(苹果公司) ; goizueta business school, emory(埃默里大学戈izueta商学院)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 研究自组织多智能体LLM团队在无约束协调下无法匹配专家性能,发现整合妥协行为是主要瓶颈,导致性能损失高达41.1%。
Comments Accepted at the International Conference on Machine Learning (ICML 2026)
通过项目反应理论诊断LLM作为评判者的可靠性
机构 * Department of Artificial Intelligence, Chung-Ang University, Seoul, Republic of Korea(Chung-Ang 大学人工智能系) ; Department of Industrial Engineering, Seoul National University, Seoul, Republic of Korea(首尔国立大学工业工程系)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出基于项目反应理论(IRT)的两阶段诊断框架,通过内在一致性和人类对齐两个维度评估LLM作为评判者的可靠性,并提供可解释的诊断信号。
Comments Accepted ICML 2026
从内部诊断到外部审计:一种VLM驱动的数据自由在线后门防御范式
机构 * The Chinese University of Hong Kong, Hong Kong(香港中文大学) ; Sun Yat-sen University, China(中山大学) ; Zhejiang University, China(浙江大学)
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 提出一种从内部诊断到外部语义审计的范式转变,利用通用视觉语言模型(VLM)作为外部语义门控,通过PRISM框架(原型精炼与统计监控检查)实现数据自由的在线后门防御,在17个数据集和11种攻击类型上达到最先进性能。
Comments 25 pages, 10 figures, 19 tables. To appear in the Proceedings of the 43 rd International Conference on Machine Learning (ICML '26)
从语言到视觉的反事实推理蒸馏:因果图引导的视频理解后训练
机构 * Rutgers University(新泽西罗格斯大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 针对视觉语言模型在反事实推理上的不足,提出CounterVQA基准和CFGPT后训练方法,通过从语言模态蒸馏反事实推理能力提升视频理解。
GPIC:用于视觉生成的大型许可图像数据集
机构 * Stanford University(斯坦福大学) ; Radical Numerics ; University of Michigan(密歇根大学) ; Salesforce Research(Salesforce研究)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 提出GPIC,一个约28万亿像素的大型许可图像数据集,包含1亿训练样本,通过最先进的视觉语言模型标注,用于视觉生成建模研究。
Comments 25 pages; Dataset: https://huggingface.co/datasets/stanford-vision-lab/giant-permissive-image-corpus; Project website: https://gpic.stanford.edu
ProjectionBench: 在渐进信息揭示下评估大语言模型的科学假设生成
机构 * Unreasonable Labs
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出ProjectionBench框架,通过渐进式信息揭示评估大语言模型在科学发现中的创新性和推理能力,实验表明GPT-5.4在最小上下文下仍保持0.7 F1分数与真实结论对齐。
Comments 19 pages, 4 figures
RL2ML: 从强化学习到最大似然的有限rollout替代目标
机构 * University of Southern California(南加州大学)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本文提出RL2ML系列有限rollout替代目标,具有闭式无偏梯度估计,连接标准强化学习、类最大似然训练及超越最大似然目标,并揭示群体级更新尺度相变,将剩余自由度转化为一维优化问题。
基于迭代式LLM的神经架构搜索的收敛理论:一个具有闭式代理可靠性的参数化交叉熵框架
机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室,CAIDAS与IFI,乌尔姆大学,德国)
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
AI总结 将迭代式LLM-NAS建模为参数化交叉熵方法,证明了收敛性、精英集概率几何收敛、增量生成有效性、MinHash-Jaccard去重防止模式崩溃以及代理可靠性闭式公式,并通过实验验证了理论预测。
Comments 14 pages, 2 figures, 2 tables. Submitted to NeurIPS 2026
DirectorBench: 通过个性化多智能体评估诊断长视频生成
机构 * ByteDance Inc.(字节跳动公司) ; City University of Hong Kong(香港城市大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 提出DirectorBench,一种基于多智能体的诊断基准,通过80个结构化元数据、7个用户画像和40个检查点标准,在脚本、视觉、音频、跨模态和稳定性五个维度上评估长视频生成,并定位瓶颈和用户偏好依赖。
NICE:一个基于理论的LLM社交智能诊断基准
机构 * Department of Psychology and Behavioral Sciences, Zhejiang University(浙江大学心理学与行为科学系) ; College of Artificial Intelligence, Zhejiang University(浙江大学人工智能学院) ; Human Machine Interaction Lab, Huawei Technologies Co., Ltd.(华为技术有限公司人机交互实验室) ; Zhejiang Key Laboratory of Neurocognitive Development and Mental Health(浙江省神经认知发展与心理健康重点实验室)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文通过构建基于社会理论的社交智能框架,提出诊断基准NICE,用于细粒度评估大语言模型在社交交互中的能力弱点。
超越数学与代码的可验证奖励:面向事实问答的轻量级语料库基础过程监督
机构 * University of Illinois Chicago(伊利诺伊大学香槟分校)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 提出CorVer,一种基于语料库共现统计的轻量级过程奖励方法,通过句子级信用分配和令牌级优势映射,在多个模型和基准上显著提升事实问答准确性且训练速度更快。
评估混合语码与印度语言中的跨语言知识一致性:基于IndiKLAR
机构 * Indian Institute of Science Education and Research(印度科学教育与研究学院) ; Microsoft Corporation(微软公司) ; UNSW Sydney(新南威尔士大学悉尼分校)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文通过构建IndiKLAR基准,评估大语言模型在英语、混合语码和印度本土语言上的知识召回一致性,发现混合语码输入能显著缩小与英语的性能差距,并识别出从本土语言到混合语码的“翻转点”。
Comments 23 pages
医疗视觉语言模型中的谄媚行为基准测试与缓解
机构 * MBZUAI ; Saarland University(萨尔兰大学) ; HKUST(GZ)(香港科技大学(广州)) ; KAUST(卡塔尔大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 针对医疗视觉语言模型中的谄媚问题,提出分层医疗视觉问答基准和VIPER策略,通过过滤非证据社会线索减少谄媚,提升模型鲁棒性。
Comments 19figures, 61pages. The first two authors contributed equally
FinGuard:检测LLM交互中的金融监管违规
机构 * Qwen DianJin Team, Alibaba Cloud Computing(阿里云计算Qwen金融团队) ; Tongyi Lab, Alibaba Group(阿里集团通义实验室) ; School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 针对金融领域LLM交互中的监管违规检测问题,提出基于监管文档的自动化管道,构建首个金融合规检测基准FinGuard-Bench,并训练FinGuard模型,在基准上显著优于现有方法。
SigmaMedStat: 用于ICU误报减少的时间信号建模
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 提出SigmaMedStat系统,通过将60秒记录分割为6个10秒块并提取连续小波变换尺度图,结合EfficientNet-B0编码器和两层LSTM网络进行时间建模,在PhysioNet/CinC Challenge 2015数据集上实现AUC 0.822,有效降低ICU误报。
Comments Code available at github.com/Arun-K-Ram/sigmamedstat
Paper Agents, Paper Gains: DeFi投资代理的实证分析
机构 * Pantera Capital(Pantera资本) ; Stanford University(斯坦福大学) ; IC3 ; Ava Labs(Ava实验室)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 通过分析1900多个AI加密项目、10个代表性代理和11个Solana代理金库,发现当前DeFi投资代理仍处于早期阶段,存在自主执行证据不足、代币持有者集体亏损、估值与基本面脱节等问题,并提出成熟度框架。
一种用于类型学控制词汇生成的模块化架构
机构 * Birla Institute of Technology and Science, Pilani(比拉理工学院,帕利尼)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 提出模块化框架,通过PHOIBLE音位库、可互换音系语法和Swadesh-Leipzig-Jakarta本体生成音系合理且类型学真实的词汇,实验表明概率语法优于确定性和随机基线。
ClinicBot:基于指南的临床聊天机器人,具有优先证据RAG和可验证引用
机构 * USC Information Sciences Institute(USC信息科学研究所)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 提出ClinicBot系统,通过结构化提取指南、按临床重要性排序证据和多智能体协作,生成准确、可验证的临床回答。
IntentScore: 面向计算机使用智能体的意图条件动作评估
机构 * George Washington University(乔治·华盛顿大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出IntentScore,一种基于计划感知的奖励模型,通过对比对齐和边际排序学习评估动作质量,在OSWorld上提升任务成功率6.9个百分点。
LUMINA:采用能量协调协议的多供应商乳腺X线摄影基准
机构 * Department of Radiology, Northwestern University(北western大学放射科) ; Department of Radiation Oncology, University of Health Sciences Prof. Dr. Cemil Tascioglu City Hospital(健康科学大学教授Dr. Cemil Tascioglu医院放射肿瘤科) ; Department of Radiology, Istanbul University(伊斯坦布尔大学放射科)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 为解决现有FFDM数据集规模小、标注少和供应商多样性不足的问题,提出LUMINA多供应商数据集及能量协调方法,通过前景像素对齐减少域偏移,在诊断、BI-RADS分类和密度估计任务上验证了模型性能提升。
Comments This paper was accepted to CVPR 2026
大型语言模型是否具有社会适应性?对比大型语言模型与人类的信念演化
机构 * Tsinghua University(清华大学) ; Department of Psychological and Cognitive Sciences(心理与认知科学系) ; College AI(人工智能学院) ; School of Management(管理学院) ; Fudan University(复旦大学) ; Stevens Institute of Technology(史蒂文斯理工学院) ; Northwestern University(西北大学) ; University of Oxford(牛津大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本研究提出基于社会心理学的仿真基准FairMindSim和信念-奖励对齐行为演化模型BREM,通过连续经济游戏对比人类与LLM的决策动态,发现中等能力模型表现出过度惩罚的刚性攻击性,而前沿模型随推理能力提升趋向人类式的克制与宽容。
Comments KDD 2026 Oral
验证决策:温暖度和用户特征如何塑造对信息搜索中对话代理的依赖
机构 * Amsterdam University of Applied Sciences(阿姆斯特丹应用科学大学) ; Leiden University(莱顿大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 研究通过混合实验发现,即使提供事实核查工具,用户仍过度依赖对话AI,验证行为主要由用户特征(如先验信任)驱动,而温暖对话风格通过增加对错误答案的认同间接影响依赖。
Comments Under review for Computers in Human Behavior
基于大语言模型的论证质量评估:一种成对Bradley-Terry方法
机构 * Centrum Wiskunde & Informatica, The Netherlands(荷兰代尔夫特理工大学) ; Vrije Universiteit Amsterdam, The Netherlands(荷兰阿姆斯特丹自由大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本研究利用12种开源大语言模型,通过成对比较和Bradley-Terry模型评估论证质量,发现Llama-70B与人类专家判断具有中等一致性(Cohen's κ=0.493),其他模型表现各异但互补。
MTAVG-Bench 2.0:诊断多说话人音视频生成中电影表现力的失败模式
机构 * Shanghai University(上海大学) ; Beijing Institute of Technology(北京理工大学) ; Shanghai Film Academy(上海电影学院) ; Tsinghua University(清华大学) ; Hefei University of Technology(合肥工业大学) ; Inkeverse Group Limited(Inkeverse集团有限公司) ; The University of Adelaide(阿德莱德大学) ; Beijing University of Technology(北京工业大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; OpenNLP Lab(OpenNLP实验室)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 针对多说话人音视频生成中电影表现力评估不足的问题,提出MTAVG-Bench 2.0基准,通过构建涵盖表演、叙事、氛围和视听语言的高层次失败分类体系及超过1万个问答实例,系统评估全模态大语言模型诊断复杂视听失败的能力。
Harness-Bench: 在真实智能体工作流中测量不同模型的框架效应
机构 * Peking University(北京大学) ; Qiyuan Tech(启元科技)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出Harness-Bench基准,通过106个沙盒离线任务评估不同模型与框架配置组合下的执行性能,发现智能体能力应归因于模型-框架配置而非基础模型。
Comments 16 pages, 4 figures, 11 tables. The first three authors contributed equally
超声基础模型在胎儿平面分类中的基准测试
机构 * 1 Radiology \& Biomedical Imaging, Yale School of Medicine, USA 2 Department of Biomedical Engineering, Yale University, USA
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 本研究对四种超声基础模型(USFM、MOFO、UltraSAM、FetalCLIP)在胎儿平面分类任务上进行基准测试,发现FetalCLIP在线性探测设置中表现最佳,而USFM在全微调设置中表现最佳,且预训练目标显著影响迁移性能。
基于信息论的心电图信号多模态表示学习
机构 * KU Leuven(库勒芬大学) ; University Hospitals Leuven(鲁文大学医院) ; MIT(麻省理工学院) ; DFKI(德国达姆施塔特研究所)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 提出MERIT框架,通过信息论视角结合掩码心电图建模与心电图-文本对比对齐,学习保留信号结构并整合临床语义的心电图表示,在分类、零样本和文本生成任务中取得一致提升。