SDA: Steering-Driven Distribution Alignment for Open LLMs without Fine-Tuning
SDA:无微调的开放语言模型分布对齐框架
专题命中 偏好对齐 :alignment(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI
AI总结 SDA 提出了一种无需微调的开源 LLMs 分布对齐框架,通过用户指令动态调整输出概率,提升模型与人类意图的一致性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
SDA:无微调的开放语言模型分布对齐框架
专题命中 偏好对齐 :alignment(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI
AI总结 SDA 提出了一种无需微调的开源 LLMs 分布对齐框架,通过用户指令动态调整输出概率,提升模型与人类意图的一致性。
基于偏好对齐是否总是提升基于大语言模型的翻译质量的最佳选项?一项实证分析
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL
AI总结 本研究通过实证分析探讨了基于偏好的对齐在提升大语言模型翻译质量中的效果,发现CPO在高质量数据上表现优异,但可能在下游度量上存在不稳定性,同时基础模型生成翻译的表现与多个外部系统相当且更一致。
TB 或 TB:基于覆盖率的直接偏好优化用于 Verilog 刺激生成
机构 * Core AI Department(核心人工智能部门) ; Cognichip Inc(认知芯片公司)
专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG
AI总结 TB or not TB通过覆盖率驱动的直接偏好优化,提升Verilog刺激生成的覆盖率和效率。
CoTKR: 基于链式推理的增强型知识重写用于复杂知识图谱问答
机构 * Southeast University(东南大学) ; Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University) Ministry of Education(新一代人工智能技术及其交叉应用国家重点实验室) ; China Mobile Research Institute(中国移动研究院) ; Monash University(墨尔本大学) ; University of Manchester(曼彻斯特大学) ; University of Edinburgh(爱丁堡大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 CoTKR通过链式推理增强知识重写方法,提升复杂知识图谱问答性能。
利用强化学习优化操作配方以实现化学过程的安全可控
机构 * TU Dortmund University(图卢兹大学)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 本文提出利用强化学习优化操作配方,结合专家知识提升化学过程控制的安全性和可解释性,通过仿真验证其性能优势。
Comments 16 pages, 3 figures, Part of the workshop 'Machine Learning for Chemistry and Chemical Engineering (ML4CCE)' at the ECML24 conference: Link: https://ml4cce-ecml.com/
通过语义漂移分析检测大语言模型中的休眠代理
机构 * School of Computer Science, University of Windsor(计算机科学学院,温莎大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 通过语义漂移分析与canary基线比较,实现大语言模型中休眠代理的实时检测,准确率达92.5%。
Comments 7 pages, 3 figures, 1 table
Q-MLLM:向量量化用于鲁棒多模态大语言模型安全
机构 * Singapore Management University(新加坡管理大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 Q-MLLM通过两级向量量化提升多模态大语言模型的安全性,有效防御对抗性攻击并保持模型实用性。
Comments Accepted by NDSS 2026
具身AI的肖申克救赎:理解与评估间接环境劫持
机构 * Xidian University(西安电子科技大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Ant Group(蚂蚁集团)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CY
AI总结 本文提出了一种新型的间接环境劫持攻击,通过环境注入的恶意提示劫持具身AI,并设计了自动攻击生成和基准评估框架,评估结果显示其在多个任务场景中表现优异。
为生存,我必须背叛:通过博弈论场景进行大语言模型的劫持攻击
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; East China Normal University(华东师范大学) ; Flexera(Flexera公司) ; Zhejiang University(浙江大学) ; Xidian University(西安电子科技大学) ; Xi’an Jiaotong University(西安交通大学) ; Institute of Deep Perception Technology, JITRI(JITRI深度感知技术研究所)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出一种基于博弈论的可扩展黑盒劫持框架GTA,通过重塑LLM目标以提高攻击成功率,实现在多种场景下的高ASR表现。
Comments 20 pages
多面攻击:揭示配备防御机制的视觉语言模型中的跨模型漏洞
专题命中 越狱攻击 :alignment(abstract);safety(abstract)
AI总结 多面攻击揭示了配备防御机制的视觉语言模型中的跨模型安全漏洞,通过注意力转移攻击和轻量级转移增强算法,实现了58.5%的成功率。
Comments AAAI 2026 Oral
保护AI代理免受提示注入攻击
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI
AI总结 本文提出了一种多层防御框架,通过评估RAG系统中的提示注入风险,将攻击成功率降低至8.7%,同时保持高任务性能。
诊断人工智能手术决策支持中的幻觉风险:一种用于序列验证的连续框架
机构 * Orthopaedic Centre, The University of Hong Kong - Shenzhen Hospital(香港大学深圳医院骨科中心) ; Translational Medicine Centre, The University of Hong Kong - Shenzhen Hospital(香港大学深圳医院转化医学中心) ; Department of Orthopaedics & Traumatology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院骨科与创伤外科部)
专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG
AI总结 本文提出了一种用于评估人工智能手术决策支持系统幻觉风险的连续框架,通过多维度测试揭示模型在复杂性下的脆弱性,并强调了增强推理能力的必要性。
LightDefense: 一种基于不确定性驱动的轻量级对抗劫持防御方法通过移位词分布
专题命中 幻觉与事实性 :safety(abstract);jailbreak(abstract);分类 cs.CY
AI总结 LightDefense通过调整词元分布和利用模型不确定性,提供了一种轻量级的对抗劫持防御方法,有效提升LLM的安全性同时保持对正常查询的有用性。
大语言模型在长文本生成中的原子校准
机构 * University of Cambridge(剑桥大学) ; Fudan University(复旦大学) ; Tencent AI Lab(腾讯AI实验室) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出原子校准方法,用于改进大语言模型在长文本生成中的校准能力,揭示置信度方法与生成过程中置信度变化的关联。
Comments ACL 2025 KnowFM Oral / AACL-IJCNLP 2025
超越生成式AI:用于临床预测、反事实和规划的世界模型
机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫莫德·本·扎伊德人工智能大学)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
AI总结 本文探讨了世界模型在医疗领域中的应用,旨在通过预测动态、反事实评估和规划提升临床决策的可靠性。
Comments 2 Figures, 1 Table
思考、忠实与稳定:减轻大语言模型幻觉的方法
机构 * Stanford University(斯坦福大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本研究提出一种通过强化学习策略减少大语言模型幻觉的方法,通过置信度对齐和熵激增信号提升推理的连贯性和准确性。
Comments Originally released June 5, 2025
通用模型在医学图像分割中的应用:一项调查与与任务特定方法的性能比较
专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI
AI总结 本文调查了通用模型在医学图像分割中的应用,对比了通用模型与任务特定方法的性能,探讨了其在监管、隐私、预算及临床转化等方面面临的挑战。
Comments 132 pages, 26 figures, 23 tables. Andrea Moglia and Matteo Leccardi are equally contributing authors
Journal ref Moglia A, et al.Generalist models in medical image segmentation: A survey and performance comparison with task-specific approaches. Inf Fus 2026 https://www.sciencedirect.com/science/article/pii/S156625352500781X
可信AI在代理湖仓中的实现:从并发到治理
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI
AI总结 本文提出Bauplan设计,通过事务机制实现湖仓中的数据和计算隔离,解决代理工作流的可信性问题,并提供自修复管道的实现。
Comments AAAI26, pre-print of paper accepted at the Trustworthy Agentic AI Workshop
用AI和6G提升交通安全性:延迟需求与实时威胁检测
专题命中 安全评测 :safety(title,abstract)
AI总结 本文提出基于6G和AI的交通安全框架,通过实时威胁检测和低延迟通信提升交通安全性。
Comments Sumbitted/Accepted ICINT 2025 (PrePrint)
MACIE:多智能体因果智能解释器用于集体行为理解
机构 * AI-WEINBERG, AI Experts, Tel Aviv, Israel(AI-WEINBERG,AI专家,特拉维夫,以色列)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
AI总结 MACIE通过结合因果模型和反事实分析,为多智能体强化学习提供全面的因果解释,解决集体行为归因、涌现智能量化和可操作解释问题。
人工智能感知系统开发中的数据标注质量问题
专题命中 安全评测 :safety(abstract);trustworthy(abstract)
AI总结 本研究通过多组织案例研究,提出了一种涵盖完整性、准确性和一致性的18种标注错误类型分类法,为人工智能感知系统开发中的数据标注质量提供了共享词汇、诊断工具和可操作指导。
基于相关性的特征归因可解释人工智能
机构 * Department of Informatics, University of Oslo, Norway(奥斯陆大学信息学院)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 ExCIR通过相关性感知的归因方法,提供高效、一致且可扩展的可解释人工智能解决方案。
Comments Accepted, 2026 International Conference on Advances in Artificial Intelligence and Machine Learning (AAIML 2026)
基于第一性原理的风险评估框架及IEEE P3396标准
机构 * Chair, IEEE Artificial Intelligence Standards Committee (AISC) ; Institute of Astrophysics ; Space Sciences, University of Lisbon, Portugal ; Vice Chair, IEEE Artificial Intelligence Standards Committee University of New Haven ; Florida Gulf Coast University, United States ; State Academy of Applied Sciences, Ciechanow, Poland
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY
AI总结 本文提出基于第一性原理的生成式AI风险评估框架,通过信息分类系统识别不同风险类型并归责于相关方,旨在提升AI治理的严谨性与责任性。
Comments 8 pages with 3 tables. This manuscript is prepared for publication by the Institute of Electrical and Electronics Engineers, Standards Association (IEEE-SA), Sponsor Committee - Artificial Intelligence Standards Committee (C/AISC) as a White Paper of Working Group p3396 at https://standards.ieee.org/ieee/3396/11379/
Journal ref 2025 IEEE Conference on Artificial Intelligence (CAI), pp. 1588-1595, 2025
ESGBench:用于企业可持续发展报告中可解释ESG问答的基准
机构 * BNY ; FedEx
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 ESGBench是一个用于评估企业可持续发展报告中可解释ESG问答系统性能的基准,通过领域相关问题和人工整理答案来评估模型推理能力,揭示了事实一致性、可追溯性和领域对齐等关键挑战。
Comments Workshop paper accepted at AI4DF 2025 (part of ACM ICAIF 2025). 3 pages including tables and figures
基于概念的XAI有时不够精确:人们能否区分泛化与误表?
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 研究探讨了人们在基于概念的XAI中区分泛化与误表的能力,发现人们更敏感于相关特征的不精确性,而非泛化不相关特征的不精确性。
大语言模型能读取环境吗?一个多模态基准用于评估多当事人社交互动中的欺骗
机构 * The University of Tokyo(东京大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL
AI总结 本文提出多模态互动欺骗评估任务,通过新颖数据集评估多种MLLMs的欺骗检测能力,揭示其在多模态社交线索处理上的不足,并提出SoCoT和DSEM模块提升性能。
可解释性引导的负责任情感文本合成数据生成框架
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
AI总结 本文提出一种基于SHAP的可解释性引导框架,用于生成情感文本的合成数据,提升少数情绪类别的分类性能,同时揭示合成文本在词汇丰富性和表达复杂性上的局限性。
Journal ref Association for the Advancement of Artificial Intelligence (2026). Shaping Responsible Synthetic Data in the Era of Foundation Models
AquaSentinel:下一代集成传感器网络的AI系统,通过协作MoE-LLM代理架构实现城市地下供水管道异常检测
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 AquaSentinel通过协作MoE-LLM代理架构实现城市地下供水管道异常检测,结合物理信息和稀疏传感技术,以低成本实现高精度的实时监测。
Comments 7 pages, 1 figure, 2 tables, Accepted to the 40th AAAI Conference on Artificial Intelligence (AAAI 2026), IAAI Deployed Applications Track
利用大语言和视觉-语言模型进行施工工地自动危险检测
机构 * University of Houston Cullen College of Engineering Department of Civil and Environmental Engineering(德克萨斯大学休斯顿分校库伦工程学院土木与环境工程系)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本研究利用大语言和视觉-语言模型,通过分析文本和图像数据,提高施工工地的安全隐患检测效率。
Comments Master thesis, University of Houton
CAIRe:通过检索增强评估进行图像文化归因
机构 * BITS Pilani(比斯·皮兰大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 CAIRe通过检索增强评估方法,评估图像在不同文化标签下的相关性,有效衡量文化偏见,提升跨文化公平性。
Comments Preprint, under review