Unified Hallucination Fuzzing for Multimodal Large Language Models
面向多模态大语言模型的统一幻觉模糊测试
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 针对多模态大语言模型的幻觉问题,提出含UniHall基准与SAMF自演化模糊测试的评估框架,发现SOTA模型在模糊测试下性能显著下降,存在有用性-幻觉权衡。
Comments 47 pages, 17 figures
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
面向多模态大语言模型的统一幻觉模糊测试
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 针对多模态大语言模型的幻觉问题,提出含UniHall基准与SAMF自演化模糊测试的评估框架,发现SOTA模型在模糊测试下性能显著下降,存在有用性-幻觉权衡。
Comments 47 pages, 17 figures
KumbhDoot:面向大规模集会公共服务助手的可扩展、大语言模型(LLM)限定架构
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.CY
AI总结 针对大壶节这类高风险低连接性的大规模集会,提出KumbhDoot架构,以相似度优先、LLM限定为核心,解决默认LLM助手成本高、易幻觉等问题,适配公共服务场景。
人类放弃,推理模型坚持:将难度登记与深思分配分离
机构 * The University of Hong Kong(香港大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文通过分离难度登记与深思分配,发现人类与大型推理模型(LRM)在问题解决中的时间/令牌分配模式相反:人类在错误问题上用时更少,而LRM在错误问题上使用更多令牌。
解释、验证和对齐视觉语言模型嵌入中的语义层次结构
机构 * University of Lübeck(吕贝克大学) ; Technical University of Munich(慕尼黑工业大学) ; AUMOVIO SE ; Osnabrück University(奥斯纳布吕克大学) ; Leibniz Institute for Agricultural Engineering and Bioeconomy(莱布尼茨农业工程与生物经济研究所) ; University of Hamburg(汉堡大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种框架,用于解释、验证和对齐视觉语言模型嵌入中的语义层次结构,通过聚类和概念库匹配提取层次结构,并利用人类本体评估其合理性,最终提出基于本体的对齐方法以提升共享嵌入空间的语义对齐。
Comments camera-ready version of accepted IJCAI-ECAI 2026 paper including supplementary material; code: https://github.com/gesina/ontological-commitment
商业竞技场:在现实市场中对大语言模型智能体进行基准测试
机构 * Alibaba Group(阿里巴巴集团) ; Yale University(耶鲁大学)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI
AI总结 研究人员推出Business Arena测试平台,评估15个前沿LLM智能体在跨境商店运营中的表现,发现其平均最终净资产差9倍,最优模型仍逊于人类策略,为商业智能体评估提供了现实测试基准。
整合RCTs、RWD、AI/ML和统计学:下一代证据合成
机构 * Department of Statistics, North Carolina State University(统计学系,北卡罗来纳州立大学) ; VP and Statistics Head, Inflammation, Immunology & Specialty Care, Pfizer(副总裁及统计学负责人,炎症、免疫与专科医疗,辉瑞) ; Head of Exploratory Biostatistics, Amgen(探索性生物统计学负责人,安进)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG
AI总结 本文提出通过整合RCTs、RWD、AI/ML和统计学,提升证据合成的严谨性和实用性,推动下一代证据生成方法的发展。
面向青少年的文化感知生成式AI风险:来自非西方背景的青少年、父母和教师视角
机构 * Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 隐私与版权 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.CY
AI总结 研究从非西方视角探讨青少年使用生成式AI工具的风险,分析文化、宗教和社会因素对隐私和安全的影响,揭示家庭经济因素加剧的共享账户使用问题,并提出符合文化规范的家长控制设计。
从专有大语言模型API窃取推理轨迹
专题命中 隐私与版权 :jailbreak(abstract);prompt injection(abstract);分类 cs.AI、cs.LG
AI总结 该研究发现专有LLM API的加密推理轨迹存在跨会话、用户及模型的兼容性漏洞,开发了可扩展解密越狱方法,能提取模型推理、窃取PII等,还提出了对应缓解措施。
自主性重塑个性化对隐私担忧和对LLM代理信任的影响
机构 * Northeastern University(东北大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Waterloo(滑铁卢大学)
专题命中 隐私与版权 :alignment(abstract);trustworthy(abstract);分类 cs.AI
AI总结 研究探讨了LLM代理自主性如何影响个性化对用户隐私担忧和信任的影响,发现风险驱动的自主性可缓解个性化带来的负面影响。
Comments Accepted to COLM 2026
面向GUI智能体的软件工程及与GUI智能体协同的软件工程
专题命中 隐私与版权 :safety(abstract);分类 cs.AI
AI总结 该研究通过分析2018年1月至2026年4月的336篇GUI智能体论文,指出其在恢复机制、安全执行等方面的不足,提出需结合可靠执行与生命周期测试等以构建可部署的GUI智能体系统。
基于代理表示的大规模大语言模型应用的隐私保护数据漂移检测与恢复
专题命中 隐私与版权 :alignment(abstract);分类 cs.AI
AI总结 针对大规模LLM应用的隐私约束导致的评估与漂移追踪难题,提出ProxyDrift框架,基于非PII代理表示实现无敏感数据暴露的漂移监测与合成数据生成,实验验证其对齐度达RA~0.9。
EFFEKT:面向基础模型的高效联邦知识迁移
机构 * Northeastern University(东北大学) ; University of Padua(帕多瓦大学)
专题命中 隐私与版权 :alignment(abstract);分类 cs.LG
AI总结 EFFEKT是一种联邦学习框架,通过双向跨蒸馏策略,结合轻量级客户端代理模型与服务器端基础模型,实现高效的领域特定LoRA适配器训练,在低功耗边缘设备上性能优于基线。
Comments 12 main content pages, 8 appendix pages; 3 main figures, 9 appendix figures; 8 main tables, 9 appendix tables; 1 main algorithm, 4 appendix algorithms; accepted at TMLR
当技能与安全相遇:对技能合并大语言模型的自适应越狱鲁棒性进行基准测试与表征
机构 * Google(谷歌公司) ; University of New South Wales(新南威尔士大学) ; University of Technology Sydney(悉尼科技大学) ; Zhejiang University(浙江大学) ; Australian National University(澳大利亚国立大学)
专题命中 安全评测 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.LG
AI总结 本研究针对技能合并大语言模型,构建SkillSafe-Bench基准,发现静态安全无法预测其自适应越狱鲁棒性,提出SubSafe-Merge方法可在保留能力的同时消除安全侵蚀。
TraceSafe: 对LLM在多步骤工具调用轨迹上的安全护栏的系统评估
机构 * CyCraft AI Lab, Taiwan(CyCraft AI实验室(台湾)) ; National Taiwan University(国立台湾大学)
专题命中 安全评测 :jailbreak(abstract,abstract_cn);alignment(abstract);safety(abstract);prompt injection(abstract)
AI总结 本文提出TraceSafe-Bench,首个评估中间轨迹安全的综合基准,发现安全护栏效果更依赖结构数据能力而非语义安全对齐,通用模型在轨迹分析中表现更优,且准确性随执行步骤增加而提升。
Comments Accepted to Conference on Language Modeling (COLM) 2026
SurakshaEval:面向多语言大语言模型的印度语安全基准
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL
AI总结 针对现有LLM安全评估数据集忽视印度语言文化安全风险的问题,本文推出SurakshaEval基准,测试发现多语言LLM在印度语场景下安全表现不足,凸显了适配区域数据的安全评估框架的必要性。
HoloAegis:冻结表示、拓扑推理:用于零样本大语言模型(LLM)护栏的最小参数安全流形
机构 * Hong Kong Baptist University(香港浸会大学) ; Guangdong Polytechnic Normal University(广东技术师范大学) ; Guangdong Institute of Digital Industry(广东数字产业研究院) ; The Hong Kong Polytechnic University(香港理工大学) ; The Education University of Hong Kong(香港教育大学) ; Southern University of Science and Technology(南方科技大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 HoloAegis是一种最小参数拓扑推理框架,通过冻结语义表示的纯几何推理实现零样本LLM安全护栏,在8个基准测试中达到最先进准确率,兼具低延迟、零冷启动数据和跨语言迁移能力。
Comments Preprint, August 2026. 10 tables, 2 figures
SkillConsist:通过双向图对齐检测智能体技能中的不一致性
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 SkillConsist针对智能体技能不一致检测的挑战,通过双向图对齐等技术构建基准并取得优于基线的检测性能,提升了技能一致性检测效果。
Comments 11 pages, 3 figures
ActBench:协作智能体行为安全的自演进基准
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 该研究提出自演进行为安全基准ActBench,结合奖励引导束搜索与双证据验证机制,评估协作智能体风险,在24000条轨迹上测试15个LLM和6个开源智能体,发现模型间攻击成功率差异更大。
Comments Benchmark and Code is available https://github.com/zjuicsr/ActBench
对齐的错觉:检测协同对话中的隐藏分歧
机构 * College of AI, Tsinghua University(清华大学人工智能学院) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; Institute for AI, Tsinghua University(清华大学人工智能研究院)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
AI总结 本研究针对协同对话中存在的对齐的错觉(IoA)问题,构建IoA-Suite数据集,训练IoA-Prober-8B模型检测隐藏分歧,该模型可揭示真人会议中未表达的分歧,还能提升多智能体协作的下游任务性能。
InfoOps Bench:实时信息行动安全基准
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 该研究提出实时信息行动安全基准InfoOps Bench,测试17个前沿语言模型抵御国家支持信息行动的能力,发现多数模型可被利用,中国开发模型对涉华事实主张合规性显著下降,凸显模型可用性与安全性的平衡挑战。
DoGMA:一种用于肿瘤学多组学对齐与多任务学习的中心法则引导基础模型
专题命中 安全评测 :alignment(title);分类 cs.AI、cs.LG
AI总结 本研究提出中心法则引导的多组学基础模型DoGMA,通过Transformer-MoE架构结合定向注意力与掩码分层多组学重构预训练,在泛癌多组学下游任务中展现出优异性能,为多组学注意力机制设计提供新方向。
AIVV: 用于可信自主系统的神经符号LLM代理集成验证与验证
机构 * School of Mechanical Engineering, Purdue University(普渡大学机械工程学院) ; School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院) ; Department of Computer Science, Purdue University(普渡大学计算机科学系) ; Department of Mathematics, Purdue University(普渡大学数学系)
专题命中 安全评测 :trustworthy(title);分类 cs.AI
AI总结 本文提出AIVV框架,利用LLM作为决策外层循环,通过语义验证区分真实故障与干扰故障,生成可操作的V&V成果,提升自主系统验证效率。
专题命中 安全评测 :alignment(title);分类 cs.AI
Journal ref Pattern Recognition 172 (2026) 112348
FinTrace: LLM工具调用在长周期金融任务中的轨迹级综合评估
机构 * Stevens Institute of Technology(斯蒂文斯理工学院) ; Independent Researcher(独立研究者) ; The FinAI(FinAI) ; Duke University(杜克大学)
专题命中 安全评测 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出FinTrace基准,通过800个专家标注的轨迹评估LLM工具调用,揭示模型在信息利用和最终答案质量上的不足,并通过FinTrace-Training数据集提升中间推理能力,但最终答案质量仍受限。
相同问题,不同答案?衡量与缓解提示特权以实现公平的AI访问
专题命中 安全评测 :prompt injection(abstract);trustworthy(abstract);分类 cs.CL
AI总结 该研究提出统一框架,引入PES指标与PET智能体,在MedQA基准上验证了提示特权的存在,PET可消除该差异,提升AI访问公平性。
评估智能体系统对抗恶意诱导危害的鲁棒性
机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)
专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.LG
AI总结 该研究提出智能体系统危害分类法与BAD-ACTS基准,评估LLM类智能体对抗恶意诱导的鲁棒性,发现其攻击成功率达40%-90%,并提出零样本消息监控防御方法。
用于特征发现与控制的多模态模型差异分析
机构 * University of Oxford(牛津大学) ; Microsoft(微软公司)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG;trustworthy(comments)
AI总结 本研究提出MMDiff多模态模型差异分析框架,训练多模态SAEs以识别多模态训练改变的特征,实现特征隔离、检测与控制,在空间、OCR任务及多模态安全攻击评估中展现出良好效果。
Comments Preprint. Accepted at ICML 2026 Trustworthy AI for Good Workshop
MASim:面向社会科学的多语言代理模拟
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 MASim是一种多语言代理模拟框架,用于研究社会行为,通过多语言代理模拟公众意见和媒体影响,展现多语言模拟在社会科学中的重要性。
Comments Accepted at COLM 2026
基于视觉基础模型的对抗鲁棒小样本异常检测
机构 * Rochester Institute of Technology(罗切斯特理工学院)
专题命中 安全评测 :safety(abstract);trustworthy(abstract)
AI总结 该研究针对视觉基础模型的小样本异常检测场景,提出无需训练骨干网络的对抗鲁棒方法,经实验在多数据集上提升了对抗检测性能,且保持较高干净准确率。
Comments Accepted to BMVC 2026
人工智能利维坦:通过霍布斯社会契约理论视角探索大语言模型智能体的社会演化
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本研究基于LLM智能体构建模拟社会,通过霍布斯社会契约理论验证其演化契合该理论,证实LLMs可模拟复杂社会动态,有望助力人类对社会系统的理解。