Biological Motifs for Agentic Control
用于智能体控制的生物基序
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 研究大语言模型向自主智能体转变带来的可靠性等挑战,通过基因调控网络与智能体软件系统的类型化接口对应,映射生物基序到软件设计模式,给出智能体操作数等核心贡献并具实践可行性。
Comments 80 pages. Preprint; feedback welcome
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
用于智能体控制的生物基序
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 研究大语言模型向自主智能体转变带来的可靠性等挑战,通过基因调控网络与智能体软件系统的类型化接口对应,映射生物基序到软件设计模式,给出智能体操作数等核心贡献并具实践可行性。
Comments 80 pages. Preprint; feedback welcome
当代码遇见自然语言:基于分类法的LLM集成应用信息流分析
机构 * University of New South Wales(新南威尔士大学) ; Macquarie University(麦考瑞大学) ; National University of Singapore(新加坡国立大学)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 提出一种基于定量信息流理论的分类法,定义24个标签以跨越LLM调用的自然语言与编程语言边界,实现信息流分析,并在污点传播和程序切片中验证有效性。
迈向揭示与修复LLM-in-the-Loop漏洞
专题命中 提示注入 :prompt injection(abstract)
AI总结 通过构建首个LLM-in-the-loop漏洞数据集LLMCVE,分析发现LLM常作为目标或传播向量而非根因,并评估现有修复方法,揭示此类漏洞修复更具挑战性。
具有可证明对齐保证的大语言模型中的不确定性感知弃权
机构 * Ibaraki University(茨城大学)
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL
AI总结 研究大语言模型在问答系统中无可靠置信估计的问题,提出基于置信区间的校准框架CIC,将任意不确定性分数转化为风险可控的选择性回答规则,保证所选阈值控制错误率,兼具风险控制和回答效率。
数据集偏移下用于可参考糖尿病视网膜病变筛查的RETFound不确定性感知最后一层自适应
机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)
专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG
AI总结 用RETFound对糖尿病视网膜病变筛查的不确定性感知最后一层自适应进行以安全为中心的实证评估,比较多种方法,在APTOS上不确定性感知操作点改善了敏感性等,在DDR上结果有差异,强调安全评估的价值。
Comments 12 pages, 8 tables, 6 figures. Code available at https://github.com/kmardhani/uncertainty-aware-retfound
通过选择性预测使语言模型对齐
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; Bioinformatics and Computational Biology Program(生物信息学与计算生物学项目) ; Division of Biostatistics and Health Data Science(生物统计学与健康数据科学部) ; University of Minnesota Twin Cities(明尼苏达大学双城分校)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG;safety(comments)
AI总结 研究聚焦提升语言模型可靠性,采用选择性预测策略,在模型训练后对齐阶段,提出基于强化学习的框架RLSR,以风险-覆盖曲线下面积为目标,在域内域外任务中风险-覆盖权衡表现更好。
Comments Accepted by ICML 2026 Agents in the Wild: Safety, Security, and Beyond Workshop, Project Page: https://sun-umn.github.io/RLSR
面向车辆侧倾角估计的不确定性感知混合机器学习虚拟传感器
机构 * CARISSMA Institute of Automated Driving, Technische Hochschule Ingolstadt(CARISSMA自动化驾驶研究所,因戈尔施塔特技术大学) ; GeneSys Elektronik GmbH(GeneSys电子 GmbH) ; Technische Universität München(慕尼黑技术大学)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出不确定性感知混合学习架构,通过融合机器学习与车辆运动模型,提升车辆状态估计精度,同时引入新的数据集ReV-StED验证方法有效性。
Comments Accepted at the 2025 IEEE Intelligent Vehicles Symposium (IV)
Journal ref 2025 IEEE Intelligent Vehicles Symposium (IV)
自主信息寻求:智能推荐系统路线图
机构 * National University of Singapore(新加坡国立大学) ; Polytechnic University of Bari(巴里理工大学) ; Renmin University of China(中国人民大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 综述基于大语言模型的智能体融入推荐系统带来的转变,介绍基于自主性水平的分类法及三种核心范式,分析各范式采用的架构和智能体对关键组件的增强,探讨评估方法及未解决问题,指出开放挑战。
通过投注机制对大语言模型预测进行去中心化聚合
机构 * Rutgers University(罗格斯大学) ; DIMACS(离散数学和理论计算机科学研究所)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 旨在解决多模型预测聚合问题,提出基于投注机制的WALLA,各模型报告预测和投注,以投注为权重聚合预测,具有激励兼容等特性,实验表明其兼具多种优势。
Comments 32 pages
HAS-Bench:在可配置人类参与下评估基于大语言模型的人机系统
机构 * The University of Tokyo(东京大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; MBZUAI ; McGill University(麦吉尔大学) ; Zhejiang University(浙江大学)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI
AI总结 介绍基于图的HAS-Framework框架,在此基础上HAS-Bench在多方面可配置人类参与下评估人机系统,测量任务结果与协作行为,实验表明人类参与可提升任务完成等,但收益取决于参与方式等。
大语言模型中不确定性的解剖结构
机构 * School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) ; Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI
AI总结 本文提出了一种将大语言模型不确定性分解为输入模糊性、知识缺口和解码随机性的框架,通过实验展示不同模型规模和任务中各组件的重要性,以提升模型可靠性与可信度。
Comments Accepted at the ICBINB Workshop, ICLR 2026
HKVLM:通过将语言查询绑定到冻结检测器实现忠实推理定位
机构 * Bo Ma
专题命中 幻觉与事实性 :alignment(abstract)
AI总结 提出HKVLM框架,通过将定位从语言路径中分离,利用冻结检测器和语言模型,仅训练轻量对齐钩子实现推理定位,在少样本冷启动场景下显著提升定位精度并减少幻觉。
量子机器学习中的私有训练
专题命中 隐私与版权 :safety(abstract);AI safety(abstract)
AI总结 研究经典差分隐私SGD在混合变分量子模型中的应用,分析梯度裁剪与噪声添加的相互作用,发现量子模型在私有训练中能保持更高精度。
OpenGlass:用于本地MLLM驱动的实时视觉辅助的传感-计算分离架构
机构 * Shanghai Qizhi Institute(上海期智研究院) ; College of AI, Tsinghua University(清华大学人工智能学院)
专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI
AI总结 针对视障和低视力用户,OpenGlass以传感-计算分离解决云MLLM辅助需上传数据、有网络延迟,以及可穿戴眼镜计算和电量受限问题,在本地设备实现低延迟多模态视觉辅助,并给出评估结果。
Comments Accepted to ACL 2026 System Demonstrations. 11 pages, 5 figures, 8 tables
Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 3: System Demonstrations), pages 829-839, 2026
用于目标检测的联邦学习:实现无需集中数据的协作式无人机学习
专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG
AI总结 研究将联邦学习应用于无人机目标检测,通过本地保留图像数据实现隐私保护,在KIIT - MiTA数据集上实现联邦目标检测管道,对比单无人机和集中式基线,结果显示该方法可实现分布式无人机机群的可扩展、高性能且隐私保护的目标检测。
隐藏状态隐私存在空中间
机构 * Stanford University(斯坦福大学)
专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG
AI总结 通过理论下界和实验证明,高斯释放机制在隐藏状态隐私中无法同时实现中等效用和隐私,存在空中间区域,并提出了对角逆Fisher机制作为最优解。
Comments 74 pages, 61 figures
TIER:用于成员隐私的轨迹不变解释正则化
机构 * ST Engineering(ST工程)
专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI
AI总结 研究利用模型自身梯度作为防御信号抵御基于解释的成员推理攻击,提出TIER防御,通过惩罚梯度引导扰动模拟的置信度下降波动及最小化分布偏移来保护隐私,兼顾模型效用和解释保真度。
PathMark:通过路径水印保护混合专家语言模型的知识产权
专题命中 隐私与版权 :alignment(abstract)
AI总结 针对混合专家(MoE)架构中传统水印方案失效的问题,提出PathMark框架,通过主动控制路由作为隐蔽水印通道,利用多种机制解决脆弱决策边界和路由纠缠问题,实现高验证准确率和强鲁棒性。
Comments 20 pages, accepted by CCS'26
大语言模型中的道德安全:揭示对困惑线索的表演性遵从
机构 * University of Milan(米兰大学) ; University of Washington(华盛顿大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.CY
AI总结 本研究提出“表演性遵从”概念,揭示大语言模型在道德困境中当身份标签被隐藏时公平性显著下降,并引入线索变化方法和“线索可见性差距”指标来区分真实与表演性道德安全。
迈向医疗保健领域值得信赖的大语言模型智能体
专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI
AI总结 针对医疗预约调度瓶颈,提出CareConnect智能体,利用大语言模型函数调用等技术,协调工具支持预约操作,设安全护栏。经评估有高任务完成率、安全合规性及成本效益,能自动化复杂医疗工作流程。
大规模安全测试LLM智能体:从风险发现到基于证据的验证
机构 * AntGroup(蚂蚁集团) ; Zhejiang University(浙江大学) ; Fudan University(复旦大学) ; Alibaba Group(阿里巴巴集团) ; Hunan Institute of Advanced Technology(湖南先进技术研究院) ; Deakin University(迪肯大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 提出Vera框架,通过文献驱动的风险发现、组合生成可执行安全用例和自适应执行与证据验证三阶段流水线,实现端到端自动化安全测试,在四个生产级智能体框架上发现严重漏洞,平均攻击成功率93.9%。
领域特定智能体的符号护栏:在不牺牲效用的情况下提供更强的安全性和安全性保证
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 本文研究了符号护栏在提高AI智能体安全性和安全性方面的有效性,通过系统回顾80个最新基准测试,发现74%的政策要求可通过符号护栏实现,从而在不牺牲效用的情况下提升安全性和安全性。
QEDBENCH:量化大学水平数学证明自动评估中的对齐差距
专题命中 安全评测 :alignment(title,abstract);分类 cs.LG
AI总结 研究大语言模型自动评估的可靠性,引入QEDBench基准,通过对比特定课程评分标准与专家常识标准,测量与人类专家的对齐情况,揭示部分前沿评估器偏差及离散领域推理差距,还发布该基准用于评估改进AI裁判。
BaTCAVe:机器人行为的可信解释
机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG
AI总结 本文提出基于人类可理解的高层概念的可信可解释机器人技术,通过匹配神经网络激活与可视化来提供带有不确定性评分的解释,验证了其作为事后人类友好的机器人诊断工具的有效性。
Comments 19 pages, 26 figures
Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Hangzhou, China, 2025, pp. 13867-13874
迈向可信AI软件开发辅助
机构 * Technische Universität Darmstadt(德累斯顿技术大学) ; Hessian Center for Artificial Intelligence (hessian.AI)(黑森人工智能中心) ; National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG
AI总结 本文提出可信AI软件开发助手的架构,通过基础LLM训练、图表示和模块化框架提升代码质量和安全性。
Comments 6 pages, 1 figure; to be published in New Ideas and Emerging Results (ICSE-NIER'24), April 14-20, 2024, Lisbon, Portugal; updated version to reflect the information provided by ACM
Journal ref NIER@ICSE (2024) 112-116
CCFM:用于安全关键场景生成的碰撞约束流匹配
机构 * Stony Brook University(纽约州立大学石溪分校) ; Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 安全评测 :safety(title,abstract)
AI总结 研究自动驾驶车辆规划器在安全关键闭环仿真中的评估,提出CCFM框架,通过硬物理约束保证精确碰撞控制,含碰撞选择器、硬约束和碰撞约束流匹配采样器,性能超基线。
Comments Accepted by ECCV 2026
TRIAGE:可信检索工具与图评估
机构 * IRT-SystemX(SystemX研究院)
专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI
AI总结 研究基于LLM驱动自动构建的知识图谱评估问题,引入TRIAGE框架,通过特定阶段指标对知识图谱构建与使用各阶段评估,可定位失败环节并给出改进方向。
通过跨调查转移进行硅采样
机构 * National Sun Yat-sen University(国立中山大学) ; National Chung Hsing University(中国台湾国立中兴大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究提出跨调查转移评估框架,用大语言模型根据部分问题答案预测同调查中其他不同问题答案。利用2024年台湾选举与民主化研究数据等,发现零样本大语言模型精度及不同结构可预测性层级等,明确硅采样前景与局限。
多模态大语言模型在胃肠诊断中的临床认知对齐
机构 * SKL-IOTSC, CIS, University of Macau(澳门大学协同创新研究院物联网国家重点实验室) ; Shanghai Jiao Tong University(上海交通大学) ; COWARobot Co. Ltd.(COWARobot有限公司)
专题命中 安全评测 :alignment(title);分类 cs.CL
AI总结 本文提出CogAlign框架,通过构建层次化临床认知数据集和监督微调提升模型临床分析能力,并采用反事实强化学习消除视觉偏差,实现胃肠诊断的因果关联与高准确率。
Comments ECCV 2026
SovereignPA-Bench:在演化意图、平台中介与同意约束下评估用户自有个人智能体
机构 * Stanford University(斯坦福大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 针对现有基准未考量个人智能体用户主权保护的问题,提出可执行基准SovereignPA-Bench,从多维度评估智能体主权能力,验证全主权框架可显著降低隐私泄露等风险。