Entropy-based Code Adversarial Translation for Real-world Repository Migration
基于熵的代码对抗翻译用于真实仓库迁移
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 针对LLM迁移仓库难达可运行状态的问题,提出多智能体框架ECAT,引入A2H-RepoBench基准,迁移质量达74.7%且优于现有方法。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
基于熵的代码对抗翻译用于真实仓库迁移
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 针对LLM迁移仓库难达可运行状态的问题,提出多智能体框架ECAT,引入A2H-RepoBench基准,迁移质量达74.7%且优于现有方法。
Ouroboros:一种具有经审核的核心演化机制的自发展前沿编码智能体
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本研究提出具有经审核核心演化机制的编码智能体Ouroboros,其在三个基准测试中均创最优结果,Hope部署为长期活体演化实验,同时需应对自发展带来的操作安全问题。
MasDrift:跨多智能体架构的授权保留基准测试
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 MasDrift是含600项任务的多智能体授权保留基准,对比不同架构的任务完成与授权表现,发现集中式架构完成率更高但未授权操作更多,两种防御方法各有优劣,揭示了多智能体设计的集中化权衡。
Comments preprint
测量模拟到现实的差距:为物联网系统中的强化学习设计一个经济实惠的真实世界基准平台
机构 * The University of Sydney(悉尼大学) ; University of Oxford(牛津大学) ; The University of Western Australia(西澳大利亚大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 针对AIoT系统中强化学习模拟到现实的差距问题,开发了成本低于400美元的真实世界平台,通过硬件模拟键盘让边缘设备智能体玩游戏训练,实验显示模拟训练智能体部署后性能大幅下降,直接现实训练有可行性,为强化学习评估提供了基础。
Clarity:稀疏性感知概念瓶颈模型中的灵活性与可解释性权衡
机构 * Department of Statistics, University of Economics and Business(经济与商业大学统计系) ; UMR TETIS, Inria, EVERGREEN, University of Montpellier(蒙彼利埃大学)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 研究探讨了概念瓶颈模型中稀疏性对语义对齐的影响,提出Clarity指标衡量下游性能与概念激活稀疏性和精度的相互作用,通过实验揭示灵活性与可解释性之间的关键权衡。
Journal ref Transactions on Machine Learning Research (2026)
可解释AI用于提升工业容错系统的机器学习可靠性
机构 * Ambient Intelligence Group, Saxion University of Applied Sciences(环境智能组,萨克逊应用科学大学) ; Department of Computer Science, University of Twente(特温特大学计算机科学系) ; Faculty of Engineering Technology, University of Twente(特温特大学工程技术学院)
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 本文通过可解释AI方法分析时间序列数据分解组件对模型预测的影响,发现训练过程中缺乏足够的上下文信息,并通过增加数据窗口大小提升模型性能。
Journal ref Advances and Trends in Artificial Intelligence, Theory and Applications (IEA/AIE 2026)
隐藏的提线人:预测操纵性大语言模型对话中的人类信念变化
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 本文提出PUPPET框架,通过分析1035个人类与LLM交互数据,揭示当前安全范式在检测操纵策略与信念变化幅度之间的关键断层,证明先进LLM对人类信念易感性的系统低估。
Comments Accepted to COLM 2026
ECI: 有效对比信息用于评估难负样本
机构 * Department of Computer Science and Engineering, Indian Institute of Technology (IIT), Kharagpur, India(1. 印度理工学院(IIT)计算机科学与工程系,克哈格布尔,印度)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文提出ECI,一种无需训练的诊断方法,通过冻结的目标编码器嵌入对候选负样本进行排序,其在MS MARCO数据集上展示了优于其他模型的性能,且在不同条件下表现出稳定性。
JEPA-DNA:通过联合嵌入预测架构夯实基因组基础模型
机构 * Applied AI Architecture, NVIDIA, Israel(NVIDIA应用人工智能架构,以色列) ; Worldwide Field Ops, NVIDIA, Israel(NVIDIA全球现场运营,以色列) ; Developer Programs, NVIDIA, Israel(NVIDIA开发者计划,以色列) ; Cancer Research Center and Wohl Institute of Translational Medicine, Sheba Medical Center, Tel Hashomer, Israel(癌症研究中心和Wohl转化医学研究所,Sheba医疗中心,Tel Hashomer,以色列) ; Windreich Department of AI and Human Health, Icahn School of Medicine at Mount Sinai, New York, USA(AI与人类健康风reich部门,Mount Sinai医学中心,纽约,美国)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出JEPA-DNA框架,将联合嵌入预测架构与生成式目标结合,通过潜在空间监督全局序列嵌入,实现从令牌恢复到语义对齐的转变,在17项基因组基准任务上提升线性探测和零样本性能,达到新最优。
FoR-SALE:基于参考坐标系引导的LLM驱动扩散编辑中的空间调整
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; Michigan State University(密歇根州立大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 FoR-SALE是SLD的扩展,通过参考坐标系引导的潜在空间操作调整图像朝向与深度,在三个空间理解基准上仅单轮校正就将SOTA T2I模型性能提升最高7.0个百分点,解决了非相机视角空间表达的生成偏差问题。
Comments Published in COLM 2026. 10 main pages, 4 tables, 4 figures
基于Token的视觉Transformer虚假相关性检测
机构 * Center for Biosystems and Biotech Data Science(生物系统与生物技术数据科学中心) ; Ghent University Global Campus(根特大学全球校区) ; State University of New York Korea(纽约州立大学韩国分校) ; Department of Mathematics(数学系) ; Université de Liège(列日大学) ; Department of Applied Mathematics, Computer Science and Statistics(应用数学、计算机科学与统计学系) ; Ghent University(根特大学) ; Department of Electronics and Information Systems(电子与信息系统系)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 本研究提出基于Token的诊断流程,通过留一Token移除法检测视觉Transformer中的虚假相关性,经ImageNet等实验验证了方法的有效性,还探讨了虚假信号的来源及相关案例。
Comments Accepted for publication in Transactions on Machine Learning Research (TMLR)
PragMatch:分离大视觉语言模型中的语用不一致与跨模态不匹配
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本研究提出PragMatch基准,揭示大视觉语言模型易受表面线索影响,为评估多模态语用推理提供测试平台。
Comments Under Review
幻觉还是完整性?用于AIGC视频质量评估的几何一致性指标
机构 * Hunan University(湖南大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 针对现有AIGC视频质量评估缺乏物理定律保真度量化指标的问题,提出GeoCon-Bench基准,通过帧间几何一致性评估AIGC视频质量,经实验验证其可靠性。
减少扩散语言模型中的预训练-生成不匹配
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 该研究针对扩散语言模型的预训练-生成不匹配问题,提出 PCD 方法,在不改变推理模式的情况下,在 LLaDA2-Mini 和 Qwen 模型上显著提升了性能。
Comments 12 pages, 9 figures, 1 table
SafeSceneReason:连接工业危害与事故知识的多模态推理基准
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 SafeSceneReason是关联工业危害与事故知识的多模态推理基准,含两类问答对,评估发现现有视觉-语言模型在工业安全推理上存显著弱点。
用于结直肠癌治疗规划的智能体生成式大语言模型
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 本研究提出智能体生成式大语言模型GatorOnco,经大规模生物医学文本训练与领域适配,在结直肠癌治疗规划的临床评估中性能优于开源LLM,达到专家级水平,可缩小生成式AI在高风险诊疗规划领域的应用差距。
RAVEN-Eval:基于大语言多模态模型(LMM)偏好判断的、采用评分准则引导的AI视频生成模型自动评估框架
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 本文提出RAVEN-Eval框架,基于LMM偏好判断与评分准则引导,可自动评估AI视频生成模型,已筛选任务、收集数据、评估模型与LMM并建立排行榜,为AIVGMs评估提供可扩展路径。
面向半监督视觉基础模型适配的带噪标签三重专家学习
机构 * The University of Warwick(华威大学) ; Wuhan University(武汉大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 TriNoL框架通过将未标记样本按伪标签置信度分配给三个LoRA专家,实现半监督视觉基础模型适配,提升了对带噪监督的鲁棒性且训练成本较低。
Comments Accepted for publication at the British Machine Vision Conference (BMVC) 2026. Official list of accepted papers: https://bmvc2026.bmva.org/programme/accepted_papers/
基于机械可解释性的无标签面部与语音帕金森病筛查
机构 * California State Polytechnic University, Pomona(加州州立理工大学波莫纳分校)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本研究针对PD筛查需标签的问题,提出基于冻结预训练编码器的无标签面部+语音PD筛查方法,引入对齐原则,在YouTubePD基准上实现AUROC 0.802,为PD筛查提供新方案。
SymDiag:基于神经符号验证的LLM推理可解释诊断
机构 * Beijing Institute of Technology(北京理工大学) ; Zhongguancun Academy(中关村学院) ; Xinjiang Future Enterprise Incubator Co., Ltd.(新疆未来企业孵化器有限公司) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 SymDiag是一种神经符号框架,将LLM推理验证重构为结构化故障诊断,可定位推理故障步骤、分离翻译与推理错误,在多类基准中提升了不可靠推理检测与推理修复反馈效果。
FitAQA:面向多模态大语言模型的健身动作质量评估基准
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本研究推出FitAQA基准,含2219个视频等数据,设计三项评估任务,发现当前MLLMs评估健身动作质量及定位错误存在瓶颈,视觉感知是关键瓶颈,相关数据和代码将公开。
SkillReason:面向隐式用户请求的推理增强型智能体技能检索
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 针对隐式用户请求的技能检索难题,提出两阶段框架SkillReason,结合推理增强训练,在SkillReason-Bench等三个基准上取得最优性能,缩小任务目标与技能能力的语义差距。
一种保留人类赋能的公平AI目标: desiderata、设计及可能的行为后果
机构 * Potsdam Institute for Climate Impact Research(波茨坦气候影响研究所)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文设计了一种保留人类赋能的AI公平目标函数,通过公理化方法兼顾人类权力的不平等与风险规避,明确AI需赋能人类并管理人机权力平衡,还验证了其在典型场景的行为后果。
Comments Slightly extended version of paper accepted for Algorithmic Decision Theory 2026
VTO:面向视频异常检测的可视化工具编排
机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; School of Digital Media & Design Art(数字媒体与设计艺术学院)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 针对视频异常检测中传统方法泛化差、多模态智能体工具编排难的问题,提出过程监督强化学习框架VTO,结合VAD-Tool工具集,在工具调度上较基线提升10.2%。
Comments Accepted by ACM MM 2026
说服倾向与顺从倾向预测人类及语言模型的群体决策
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 该研究引入DecisionQE框架,以狼人杀为测试平台,发现顺从倾向强的LLM在群体决策中合作优势更稳定,且顺从兼具支持合作与提升对抗角色隐藏能力的双重效应,为LLM安全评估提供了新视角。
Janus:面向评估预算昂贵的大语言模型驱动发现的算法-评估器协同进化框架
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 Janus是一个算法-评估器协同进化框架,它用LLM协同进化目标程序与代理评估器,通过真实结果校准、在线信用更新等策略缓解分布偏移,在五项任务中用更少真实评估实现更优性能,将评估器引导的LLM发现扩展到评估昂贵的科学领域。
智能体AI驱动的沉浸式模拟:用于高剂量率(HDR)近距离放射治疗的知识感知虚拟训练平台
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 该研究提出一款智能体AI驱动的沉浸式模拟平台,用于HDR阴道圆柱近距离放射治疗虚拟训练,集成VR、移动计算与RAG技术,经原型验证可提供高保真无风险训练环境,具备合适延迟与高RAG支持质量。
验证驱动的闭环多智能体大语言模型框架:面向符合代码规范的结构设计
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本研究提出验证驱动的闭环多智能体LLM框架,通过耦合有限元验证系统与双节点结构提升结构设计的代码合规性,开源基准与脚本,性能提升显著且具可复现性。
Comments 20 pages, 21 figures
CyberAGENTS:面向网络安全领域智能体游戏化学习的结构化自主机制
机构 * Arizona State University(亚利桑那州立大学) ; Amazon AGI(亚马逊AGI)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本研究提出CyberAGENTS框架,通过结构化自主机制实现游戏化网络安全学习,经课堂评估验证其可提升学习者参与度与对AI响应的信任度,为相关系统设计提供蓝图。
Guixu:面向具备链上证明的自主AI智能体的估值驱动型数据发现
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 Guixu是面向自主AI智能体的估值驱动型数据发现系统,采用三阶段估值管线等技术,整合智能体支付协议与链上数据市场,实现任务、预算感知且可信的数据发现与采购。
Comments This paper has been accepted for presentation at VLDB 2026