TrojanPraise: Jailbreak LLMs via Benign Fine-Tuning
TrojanPraise: 通过良性微调劫持LLM
机构 * Nanyang Technological University(南洋理工大学)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.LG
AI总结 TrojanPraise通过良性微调利用过滤通过的数据,使LLM在无意识中顺从有害概念,成功率达95.88%
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
TrojanPraise: 通过良性微调劫持LLM
机构 * Nanyang Technological University(南洋理工大学)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.LG
AI总结 TrojanPraise通过良性微调利用过滤通过的数据,使LLM在无意识中顺从有害概念,成功率达95.88%
基于语义解耦的两阶段雨天攻击:揭示视觉-语言模型在天气鲁棒性方面的缺陷
机构 * Chengyin Hu(独立研究者) ; Xiang Chen(独立研究者) ; Zhe Jia(独立研究者) ; Weiwen Shi(独立研究者) ; Fengyu Zhang(独立研究者) ; Jiujiang Guo(独立研究者) ; Yiwei Wei(独立研究者)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本文提出了一种基于语义解耦的两阶段雨天攻击框架,揭示了视觉-语言模型在天气鲁棒性方面的缺陷。
RainbowPlus:通过进化质量-多样性搜索增强对抗性提示生成
机构 * VNU University of Science(越南国家科学大学) ; Knovel Engineering Lab(Knovel工程实验室) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL
AI总结 RainbowPlus通过进化质量-多样性搜索提升对抗性提示生成,实现更高的攻击成功率和多样性,且运行效率显著提高。
通过语义缓存、嵌套学习和AI可持续性缓解提示注入
机构 * Head of AI, Tesisquare Member, Open Voice Interoperability Initiative Linux Foundation AI & Data Torino, Italy(AI负责人,Tesisquare成员,开放语音互操作性倡议Linux基金会AI与数据部门,意大利托里诺) ; Principal, Conversational Technologies Member, Open Voice Interoperability Initiative Linux Foundation AI & Data Plymouth Meeting, PA, USA(首席科学家,对话技术成员,开放语音互操作性倡议Linux基金会AI与数据部门,美国普利茅斯会议)
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI
AI总结 本文通过语义缓存、嵌套学习和AI可持续性方法,提出了一种缓解提示注入的系统,实现安全、高效且环保的LLM部署。
Comments 33 pages, 19 figures
软指令缓解防御
机构 * CISPA Helmholtz Center for Information Security(CISPA信息安全研究中心) ; Google DeepMind(谷歌DeepMind) ; AI Sequrity Company(AI安全公司)
专题命中 提示注入 :prompt injection(abstract);分类 cs.LG
AI总结 SIC通过迭代提示净化循环,有效防御LLM在智能体系统中受到提示注入攻击,尽管存在局限性,但提升了系统安全性。
基于核的方法的安全屏障学习
专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于核的方法,用于安全屏障学习,通过数据驱动方法和控制屏障证书,提升安全验证的鲁棒性和可扩展性。
Comments 44 pages, 9 figures
SL-CBM: 通过语义局部性增强概念瓶颈模型以提升可解释性
专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 SL-CBM通过引入语义局部性增强概念瓶颈模型,提升可解释性和干预效果,同时保持分类准确度。
具有贝叶斯深度学习的约束感知神经符号不确定性量化框架用于科学发现
机构 * Department of Computer Science and Engineering Muffakham Jah College of Engineering and Technology (MJCET)(计算机科学与工程系穆法卡姆·贾赫工程与技术学院)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 CANUF通过结合贝叶斯深度学习与可微符号推理,首次实现科学预测中的不确定性量化、约束满足和可解释性解释。
基于相机 rig 的车辆底盘 3D 重建使用高斯溅射
机构 * University at Buffalo(布法罗大学)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
AI总结 提出一种基于相机 rig 的 3D 重建方法,利用高斯溅射生成逼真的车辆底盘模型,提升检查效率和买家信任度。
Comments 8 pages, 9 figures, Conference: IEEE International Conference on Machine Learning and Applications 2025 (ICMLA 2025): https://www.icmla-conference.org/icmla25/
大语言模型中的类人社会合规:通过信号竞争动态统一讨好与顺从
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CY
AI总结 本研究提出信号竞争机制,揭示大语言模型中讨好与顺从的几何流形机制,并通过整合认知对齐框架提升模型的社会合规性鲁棒性。
ET-Agent:通过行为校准激励有效的工具集成推理代理
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 ET-Agent通过自我进化数据飞轮和行为校准训练框架,提升工具集成推理代理的准确性与效率。
版权纠纷的概率分析与生成式AI安全
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 隐私与版权 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.CY
AI总结 本文通过概率方法分析版权纠纷,并评估生成式AI的版权安全,揭示了NAF条件的局限性。
Comments 5 pages
Journal ref Proc. 20th Int. Conf. on Artificial Intelligence and Law (ICAIL '25), ACM, pp. 470-474 (2026)
零知识联邦学习:一种新的可信且隐私保护的分布式学习范式
机构 * College of Electronics and Information Engineering, Shenzhen University(深圳大学电子与信息工程学院) ; School of Electronic and Optical Engineering, Nanjing University of Science and Technology(南京理工大学电子与光学工程学院)
专题命中 隐私与版权 :trustworthy(title);分类 cs.AI
AI总结 本文提出了一种基于零知识证明的联邦学习框架,通过可验证的客户端选择算法提升系统信任与安全性。
Comments Accepted by IEEE Communications Magazine. Copyright IEEE
AI-in-the-Loop:通过利用LLMs和联邦学习实现隐私保护的实时诈骗检测与对话诈骗
机构 * University of Texas at El Paso(德克萨斯理工大学) ; School of Computing(计算机学院) ; Southern Illinois University Carbondale(南方伊利诺伊大学卡本达莱分校)
专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种结合联邦学习和LLMs的AI-in-the-loop框架,用于实时诈骗检测与对话诈骗,实现了隐私保护与安全审查的统一。
Comments This paper got accepted in 26th Privacy Enhancing Technologies Symposium (PETS 2026). We uploaded it into ArXiv as pre-print
通过多智能体评估循环提升医疗AI的安全性与可信度
机构 * Sonoma State University(索诺玛州立大学) ; Iowa State University(爱荷华州立大学) ; University of Dhaka(达卡大学) ; Notre Dame College(诺特丹学院)
专题命中 安全评测 :safety(title,abstract);alignment(abstract);AI safety(abstract);分类 cs.AI
AI总结 本文提出多智能体评估循环框架,通过结合DeepSeek R1和Med-PaLM等模型,有效提升医疗AI的安全性和伦理合规性,实现89%的伦理违规减少和92%的风险降级。
AEMA:可验证评估框架用于可信和受控的代理LLM系统
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Center for Advanced AI, Accenture(Accenture高级人工智能中心) ; University of California, Irvine(加州大学伊拉斯姆斯分校)
专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract,comments);分类 cs.AI
AI总结 AEMA提出了一种可验证的评估框架,用于评估基于LLM的多代理系统,通过人类监督实现稳定、可追溯的自动化评估。
Comments Workshop on W51: How Can We Trust and Control Agentic AI? Toward Alignment, Robustness, and Verifiability in Autonomous LLM Agents at AAAI 2026
为视觉-语言-动作模型的教育对齐:一个全面的框架,用于数据、架构和教育中的评估
机构 * Chosun University(全州大学) ; Seoul National University(首尔国立大学) ; Korea Institute for Curriculum and Evaluation(韩国课程评价院) ; Nanyang Technological University(南洋理工大学)
专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CL
AI总结 本文提出教育VLA框架,通过四个组件实现轻量级模型的教育对齐,提升科学教育中的任务表现和解释生成能力。
评估大语言模型在儿童发展阶段的安全性:一种模拟代理方法
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CY
AI总结 本文提出ChildSafe基准,通过模拟不同儿童发展阶段的认知变化,评估大语言模型在面对认知多样性时的安全性与对齐鲁棒性。
智能的副作用:MLLMs多图像推理中的安全风险
机构 * CoAI group, DCST, Tsinghua University(清华大学) ; Beihang University(北航) ; Tsinghua University(清华大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL
AI总结 研究发现,多图像推理能力越强的模型在安全测试中越容易产生不安全响应,揭示了模型在任务解决中可能忽视安全约束的风险。
Comments *15 pages, 5 figures. Introduces MIR-SafetyBench (2,676 instances; 9 multi-image relations). Equal contribution; †Corresponding author. Code/data: https://github.com/thu-coai/MIR-SafetyBench
CommunityBench: 跨多样化群体和任务的社区级对齐基准测试
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
AI总结 CommunityBench通过四个基于共同身份和共同纽带理论的任务,评估了社区级对齐方法,揭示了现有LLMs在建模社区特定偏好上的局限性,并探索了社区级对齐在促进个体建模中的潜力。
持久的人格?角色扮演、指令遵循与在扩展互动中的安全性
机构 * University of Vienna, Faculty of Computer Science(维也纳大学计算机科学系) ; Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学博士学院) ; Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; University of Vienna, Faculty of Philological and Cultural Studies(维也纳大学文学与文化研究系)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL
AI总结 研究探讨了在长对话中人格保持的稳定性,发现随着对话延长,人格保真度下降,且非人格基线模型在初期表现更优。
Comments 31 pages, 35 figures, accepted to EACL 2026
可信的数据驱动全景牙科图像Chronological年龄估计
机构 * Centro Singular de Investigación en Tecnoloxías Intelixentes (CiTIUS), Universidade de Santiago de Compostela(智能技术研究中心(CiTIUS)、圣地亚哥-德孔波斯特拉大学) ; Department of Electronics and Computing, Universidade de Santiago de Compostela(电子与计算系、圣地亚哥-德孔波斯特拉大学) ; Oral Sciences Research Group, Universidade de Santiago de Compostela(口腔科学研究组、圣地亚哥-德孔波斯特拉大学) ; Instituto de Investigación Sanitaria de Santiago de Compostela (IDIS), Universidade de Santiago de Compostela(圣地亚哥-德孔波斯特拉卫生研究院(IDIS)、圣地亚哥-德孔波斯特拉大学)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL
AI总结 本文提出了一种结合不透明和透明方法的系统,通过生成临床医生友好的文本解释来提高全景牙科图像中Chronological年龄估计的可信度。
Comments This paper is a preliminary version of an accepted article in Information Systems Frontiers, Springer, Special Issue "Explainability in Human-Centric AI". Please cite the final published version of the paper, not this preprint. The final published version can be found at https://link.springer.com/article/10.1007/s10796-025-10682-3
PsychēChat: 一种专注于心理辅导中情感转变跟踪和安全风险分析的共情框架
机构 * East China University of Science and Technology(东华大学) ; Shanghai Changning Mental Health Center, Affiliated Mental Health Center of East China Normal University(上海昌宁心理健康中心,华东师范大学附属心理健康中心)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 PsychēChat通过情感管理与风险控制模块,提升心理辅导中情感转变跟踪和安全风险分析的能力。
AgenTRIM:代理AI的工具风险缓解
机构 * Fujitsu Research of Europe (FRE)(富士通欧洲研究(FRE)) ; Fujitsu Research of India Pvt. Ltd. (FRIPL)(富士通印度私人有限公司(FRIPL))
专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.AI
AI总结 AgenTRIM通过离线和在线阶段检测并缓解代理AI中工具驱动的风险,减少攻击成功率同时保持任务性能。
Comments Under review
可控且受保护的内容生成的生成式AI代理
专题命中 安全评测 :alignment(abstract);trustworthy(abstract)
AI总结 本文提出了一种多代理框架,通过整合可控内容生成和来源保护,解决生成式AI在可控性和内容保护方面的挑战。
Comments Accepted GenProCC NeurIPS 2025, Paper # 33
Journal ref GenProCC NeurIPS 2025, Paper # 33
MMDeepResearch-Bench: 一个多模态深度研究代理的基准
机构 * OSU(俄亥俄州立大学) ; Amazon(亚马逊公司) ; UMich(密歇根大学) ; UCL(伦敦大学学院) ; CUHK(香港中文大学) ; UCR(加州大学尔湾分校) ; CWRU(克里夫兰医学中心) ; HKU(香港大学)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract)
AI总结 MMDeepResearch-Bench提出一个多模态深度研究代理的基准,强调报告式合成与引用证据的结合,揭示多模态完整性对深度研究代理的重要性。
从守护者到魔鬼?由LLM防御引发的意外风险交互
专题命中 安全评测 :safety(abstract);jailbreak(abstract)
AI总结 本文提出CrossRiskEval框架,系统研究LLM防御在安全、公平性与隐私间的相互影响,揭示防御措施对其他风险的非随机交互机制。
LIME-LLM:通过流畅的反事实而非破碎文本来探测模型
机构 * University of North Texas(北卡罗来纳州立大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 LIME-LLM通过假设驱动的可控扰动提升NLP模型的可解释性,实现更准确的局部解释效果。
FIRE 2025 科学高跟踪概述:从科学论文中生成研究亮点
机构 * Jadavpur University(贾梵pur大学) ; Indian Association for the Cultivation of Science(印度科学培养协会) ; Techno India University(技术印度大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 FIRE 2025 科学高跟踪旨在通过预训练语言模型等方法,从科学论文摘要中自动生成简洁的亮点,以提升文献阅读效率和学术资源检索质量。
Comments 7 pages, 2 tables
评估大型语言模型(LLMs)在金融NLP中的表现:对财务报告分析的比较研究
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文评估了五种基于transformer的LLMs在财务报告分析中的表现,发现模型在不同评估维度上表现各异,需考虑人类主观性和行为差异性。
Comments 23 Pages