Steer Model beyond Assistant: Controlling System Prompt Strength via Contrastive Decoding
超越助手的引导模型:通过对比解码控制系统提示强度
机构 * University of Cambridge(剑桥大学)
专题命中 提示注入 :alignment(abstract);分类 cs.CL
AI总结 通过对比解码控制系统提示强度,提升模型在复杂指令下的引导能力和准确性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
超越助手的引导模型:通过对比解码控制系统提示强度
机构 * University of Cambridge(剑桥大学)
专题命中 提示注入 :alignment(abstract);分类 cs.CL
AI总结 通过对比解码控制系统提示强度,提升模型在复杂指令下的引导能力和准确性。
语气至关重要:语言语气对VLMs幻觉影响的研究
机构 * Department of Computer Science and Technology, Kean University(计算机科学与技术系,凯恩大学) ; Department of Computer Science and Engineering, University of Notre Dame(计算机科学与工程系,圣母大学)
专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了提示语气对VLMs幻觉的影响,通过Ghost-100数据集发现幻觉率与提示强度非线性相关,揭示模型在处理结构性强制时的局限性。
Comments 10 pages, 6 figures, WACV Workshop
EpiCaR: 了解未知对提高大语言模型的推理能力至关重要
机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) ; Department of Rural Systems Engineering, Seoul National University(农村系统工程系,首尔国立大学) ; Department of Aerospace Engineering, Seoul National University(航空航天工程系,首尔国立大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 EpiCaR通过知识校准推理提升大语言模型的推理准确性和校准性,减少推理计算量。
标签具有人类价值观:主观任务的价值校准
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) ; Duke University(杜克大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 本文提出MC-STL框架,通过价值集群校准提升主观任务NLP系统的对齐性与性能。
在推断前扩展:通过提前层插值增强大语言模型的事实性
机构 * Sun Yat-Sen University(中山大学) ; Shenzhen MSU-BIT University(深圳MSU-BIT大学) ; The Hong Kong Polytechnic University(香港理工大学) ; UNSW, Sydney, NSW 2052, Australia(新南威尔士大学) ; Shenzhen Key Laboratory for High Performance Data Mining, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳高性能数据挖掘重点实验室,深圳先进技术研究院,中国科学院)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 本文提出PLI方法,通过提前层插值提升大语言模型的事实一致性,有效减少幻觉并优于现有方法。
释放原生推荐潜力:基于结构化术语标识符的LLM生成推荐
专题命中 幻觉与事实性 :alignment(abstract)
AI总结 本文提出GRLM框架,通过结构化术语标识符提升生成推荐系统的性能和通用性。
违规状态:多模态语言模型接口中的安全状态持续
专题命中 隐私与版权 :safety(title,abstract);分类 cs.AI、cs.CY
AI总结 研究发现多模态语言模型在面对版权拒绝后,会持续拒绝无关图像生成请求,揭示了会话级安全状态的持续性问题。
Comments 19 pages, 1 figure, 1 table
可控且受保护的生成内容创作多智能体框架:解决人工智能生成媒体中的版权和来源问题
机构 * National University of Sciences(国家科学与技术大学) ; Rensselaer Polytechnic Institute New York, United States(新泽西理工学院纽约分校)
专题命中 隐私与版权 :alignment(abstract);trustworthy(abstract);分类 cs.AI
AI总结 本文提出一种多智能体框架,通过集成水印和智能体角色解决生成内容的可控性和版权问题,提升语义对齐和水印恢复率。
Journal ref IEEE ICDM Visionary Innovation in Standards and Technology of GenAI 2025
MTMCS-Bench: 多轮对话中多模态大语言模型上下文安全性的评估
机构 * University of Notre Dame(诺丁汉大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Montreal(蒙特利尔大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 MTMCS-Bench评估多模态大语言模型在多轮对话中的上下文安全性,揭示了安全与效用之间的权衡及现有防护措施的不足。
Comments A benchmark of realistic images and multi-turn conversations that evaluates contextual safety in MLLMs under two complementary settings
事实性(误解)一致性在LLM短形式和长形式回答中的奇特案例
机构 * WüNLP, CAIDAS, University of Würzburg(乌尔姆大学) ; Data Science Group, University of Hamburg(汉堡大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出SLAQ框架,揭示LLM在短长形式回答中存在事实一致性问题,通过机制分析发现重叠内部结构与78%预测准确率,挑战现有评估实践。
Comments Code: https://github.com/WorldHellow/SLAQ/tree/main
超越完美分数:基于矛盾证明的可信机器学习证明
机构 * Old Dominion University(旧 Dominion 大学)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于矛盾证明的可信度测试方法,通过随机排列标签来评估模型是否依赖真实临床线索,从而提高机器学习在生物医学中的可信度和临床应用潜力。
Comments 13 pages, 6 figures
指导式自适应可靠性(PGAR):一种用于稳定和可信赖AI的行为元学习框架
机构 * Anshum Rankawat(独立研究者)
专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI、cs.LG
AI总结 PGAR通过引入监督父层提升AI的稳定性与可靠性,通过有界可靠性指数调节学习率,实现更稳健的优化与学习过程。
Comments 9 pages, 8 figures, 2 tables. Submitted to IEEE Transactions on Artificial Intelligence
迈向可信的皮肤科多模态大语言模型:一种基准和多模态评估器用于诊断叙述
机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Department of Dermatology, The First Affiliated Hospital, Shantou University Medical College(皮肤科,汕头大学医学院第一附属医院)
专题命中 安全评测 :trustworthy(title);alignment(abstract)
AI总结 本文提出DermBench和DermEval用于评估皮肤科多模态大语言模型的诊断叙述,通过结合基准和自动评估器,实现临床意义的可重复评估,验证模型性能与专家评分的一致性。
随机CHAOS:为何确定性推断会杀死,而分布性变化是人工认知的心跳
机构 * Raapid Lab, USA(美国Raapid实验室) ; Apple, USA(美国苹果公司) ; Google, USA(美国谷歌公司) ; Pragya Lab, BITS Pilani Goa, India(印度BITS Pilani Goa大学Pragya实验室)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本文主张随机CHAOS,认为确定性推断会压制LLM的不确定性建模和安全对齐,强调分布性变化对人工认知的重要性。
深度价值基准:衡量模型是泛化深度价值还是浅层偏好
机构 * University of Michigan Ann Arbor(密歇根大学安娜堡分校) ; New York University Shanghai(纽约大学上海)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 深度价值基准通过测试模型泛化深度价值还是浅层偏好,评估AI对齐的核心能力。
Comments NeurIPS 2025 (Spotlight)
关于3D大视觉-语言模型的对抗鲁棒性
机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)
专题命中 安全评测 :alignment(abstract);safety(abstract)
AI总结 本文研究了3D大视觉-语言模型的对抗鲁棒性,提出两种攻击策略评估其鲁棒性,发现其在无目标攻击下较脆弱,但在有目标攻击中更稳健。
Comments Under Review
MLB:面向临床应用的大型语言模型评估场景驱动基准
机构 * Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学) ; Health Information Center of Zhejiang Province(浙江省健康信息中心) ; Peking University(北京大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 MLB基准通过场景驱动的评估方法,评估大型语言模型在临床应用中的表现,揭示模型在结构化任务与患者交互场景间的性能差异。
Comments 11 pages, 4 figures, 5 tables
大规模多模态基准的判断模型
机构 * Department of Electrical and Computer Engineering, Viterbi School of Engineering, University of Southern California(电气与计算机工程系,维特比工程学院,南加州大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种多模态判断模型,用于评估多种任务,通过聚合多模态判断并生成诊断反馈,展示了其在多模态AI研究中的应用潜力。
基于英国航路空域的概率数字孪生:用于训练和评估空管AI代理
专题命中 安全评测 :safety(abstract);trustworthy(abstract)
AI总结 本文提出基于英国航路空域的概率数字孪生,用于训练和评估空管AI代理,通过结合历史与实时数据及概率模型,提供高保真虚拟环境以支持AI代理的开发与评估。
大型语言模型的决策是否忠实于其语言自信度?
机构 * University of Southern California(南加州大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG
AI总结 研究发现大型语言模型在高惩罚条件下缺乏战略决策能力,其语言自信度与实际决策不一致,影响AI系统的可信度。
通过条件期望方法解释机器学习预测模型
机构 * ITI, Universitat Politècnica de València(ITI,瓦伦西亚理工大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本文提出MUCE方法,通过多变量条件期望捕捉预测变化,结合稳定性与不确定性指标,提升模型局部可解释性与可信度。
Comments 24 pages, 15 figures. Silvia Ruiz-España and Laura Arnal contributed equally to this work
陷入噪声中:推理模型在上下文干扰中的失败
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出RARE方法,通过激励识别噪声中的有用信息,提升模型在上下文干扰下的鲁棒性,揭示增加计算量反而导致噪声环境下性能下降的反比例趋势。
Comments Preprint
利用孪生网络增强二进制编码的犯罪关联分析
专题命中 安全评测 :safety(abstract);分类 cs.CY、cs.LG
AI总结 本文提出利用孪生网络增强二进制编码的犯罪关联分析,通过学习潜在表示和整合地理时间特征,提升关联准确性并提供可解释的见解。
Comments AAAI 2026, 7 pages, 4 figures
以部署为中心的基础设施即代码生成:通过LLM赋能的DevOps模拟实现失败、学习、细化和成功
机构 * Australian National University Canberra Australia ; New York University \& Columbia University USA ; Nanyang Technological University Singapore ; Australian National University Australia ; Australian National University ; New York University \& Columbia University ; Nanyang Technological University
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出IaCGen框架,通过迭代反馈机制提升IaC模板的部署性,实验表明其在10次迭代内可使模板部署成功率提升至91.6%,并进一步通过人工反馈将性能提升至90%以上。
Comments Accepted by FSE 2026
医疗多模态大语言模型的视点临床意图理解能力基准测试
机构 * Shenzhen University(深圳大学) ; Stanford University(斯坦福大学) ; City University of Hong Kong(香港城市大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出MedGaze-Bench,首个评估医疗多模态大语言模型视点临床意图理解能力的基准测试,通过三维意图框架和陷阱QA机制,揭示现有模型在手术、急救和诊断任务中对意图理解的不足。
Comments 16 pages, 4 figures
BayesRAG: 基于概率互证的多模态检索增强生成
机构 * University of Science and Technology of China(中国科学技术大学) ; Unisound AI Technology Co.Ltd(Unisound AI技术有限公司) ; MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 BayesRAG通过概率互证机制提升多模态检索增强生成的性能,有效解决异构模态的隔离问题。
Comments 17 pages, 8 figures
面向中文方言的全面语义语音嵌入
机构 * Tencent AI Labs(腾讯AI实验室) ; Tencent(腾讯)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出通过仅使用ASR数据训练语音编码器,实现中文方言与普通话的跨方言语义对齐,并在新基准测试中展示了语音到语音检索和ASR性能的突破。
MemTrust:面向统一AI内存系统的零信任架构
机构 * Independent Researcher(独立研究者) ; Supermem AI Inc.(Supermem AI公司)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 MemTrust提出了一种五层零信任架构,旨在实现AI内存系统的本地等效安全性和高效协作能力,通过TEE保护和跨应用共享协议提升系统可信度。
Comments 18 pages, 5 figures
SketchJudge: 一种用于用多模态大语言模型评分手绘图的诊断基准
机构 * School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 SketchJudge是一个用于评估多模态大语言模型在评分手绘图任务中诊断能力的基准,通过1015份手绘学生回答验证了当前视觉-语言对齐在符号和嘈杂环境中的脆弱性。
Comments 8 pages for the main text (excluding references and the limitations section); 37 pages in total including appendices
干预效率与扰动验证框架:在拉索莫恩效应下考虑容量的临床模型选择
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
AI总结 本文提出干预效率与扰动验证框架,用于在资源约束下稳健选择临床模型,解决拉索莫恩效应下的模型选择问题。
Comments Accepted to the Workshop on Navigating Model Uncertainty and the Rashomon Effect: From Theory and Tools to Applications and Impact (AAAI 2026)