Trustworthy scientific inference with generative models
可信的生成模型科学推断
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG
AI总结 FreB通过提供可解释的诊断和有效性保证,实现可信的科学推断,尤其在直接似然评估不可行的领域。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
可信的生成模型科学推断
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG
AI总结 FreB通过提供可解释的诊断和有效性保证,实现可信的科学推断,尤其在直接似然评估不可行的领域。
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
Comments Accepted at ACL 2024 Findings (35 pages, 7 figures, 16 tables)
人工智能前沿的孤儿风险:不同的安全与合规框架揭示了AI公司如何选择其优先处理的风险
专题命中 安全评测 :safety(title,abstract);分类 cs.CY
AI总结 本文对比四家前沿AI公司2023-2026年的安全合规文件,识别出其风险选择的四个筛选标准,提出“安全差异”概念,揭示了孤儿风险的成因及轻量应对工具。
Comments 21 pages, 40 references. Also available on SSRN: https://dx.doi.org/10.2139/ssrn.7068898
大语言模型能否解释飞行安全事件?一种先验引导的基于语义大语言模型的方法
机构 * College of Computer Science, Chongqing University(重庆大学计算机学院) ; Sichuan Flight Engineering Technology Research Center, Civil Aviation Flight University of China(中国民航飞行学院四川飞行工程技术研究中心) ; School of Statistics and Data Science, Shanghai University of International Business and Economics(上海对外经贸大学统计与数据科学学院)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 本研究针对飞行安全事件解释难题,提出FlightLLM方法,结合特征工程、语义离散化、CatBoost先验引导及对比小样本学习等技术,在704个A320飞行样本上实现了良好分类与合理事件原因解释。
Comments 14 pages, 6 figures, submitted to IEEE Transactions on Intelligent Transportation Systems
HarnessRisk:面向生命周期的智能体管控安全基准
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 研究提出面向生命周期的智能体管控安全基准HarnessRisk,含128个沙箱案例,评估多模型与管控配置的安全表现,发现管控配置阶段最易受攻击,明确风险识别未必带来安全行动,凸显多维度评估智能体安全的必要性。
Comments Project Page: https://baiyajing.github.io/harness-risk/
表示签名与LLM交易智能体中的风险反馈对齐
机构 * Virginia Tech(弗吉尼亚理工大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.LG
AI总结 通过TradeArena测试平台研究LLM交易智能体在金融决策中的行为对齐与表示动态,发现故障前表示签名(规划嵌入漂移、流形有效秩收缩)并验证风险反馈作为外部对齐信号的有效性。
大语言模型在文化禁忌安全方面的“知识-行为差距”
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机与人工智能学院) ; Huawei(华为)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL
AI总结 针对大语言模型文化禁忌安全评估的现有基准存在不足,本文推出首个公开基准CulShield,发现先进LLMs存在“知识-行为差距”,且语言语境变化会影响其文化禁忌安全。
从安全文档到安全知识支持:面向医疗器械的基于证据的大语言模型框架
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 针对现有LLM在医疗器械安全工程中源链接等支持不足的问题,本文提出基于证据的LLM框架,用于安全知识支持,不做安全判定,还给出对应评估策略。
Comments ISSRE 2026, AISQ, 8 pages
ActBench:协作智能体行为安全的自演进基准
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 该研究提出自演进行为安全基准ActBench,结合奖励引导束搜索与双证据验证机制,评估协作智能体风险,在24000条轨迹上测试15个LLM和6个开源智能体,发现模型间攻击成功率差异更大。
Comments Benchmark and Code is available https://github.com/zjuicsr/ActBench
对齐的错觉:检测协同对话中的隐藏分歧
机构 * College of AI, Tsinghua University(清华大学人工智能学院) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; Institute for AI, Tsinghua University(清华大学人工智能研究院)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
AI总结 本研究针对协同对话中存在的对齐的错觉(IoA)问题,构建IoA-Suite数据集,训练IoA-Prober-8B模型检测隐藏分歧,该模型可揭示真人会议中未表达的分歧,还能提升多智能体协作的下游任务性能。
InfoOps Bench:实时信息行动安全基准
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 该研究提出实时信息行动安全基准InfoOps Bench,测试17个前沿语言模型抵御国家支持信息行动的能力,发现多数模型可被利用,中国开发模型对涉华事实主张合规性显著下降,凸显模型可用性与安全性的平衡挑战。
面向隐空间生成的表征驱动型内窥镜视觉嵌入对齐
机构 * Eindhoven University of Technology(埃因霍温理工大学) ; Amsterdam University Medical Centers(阿姆斯特丹大学医学中心) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
AI总结 本研究针对内窥镜生成模型的领域差距与计算成本问题,提出REVEAL模型,基于500万帧内窥镜数据训练,在多任务中性能优于同类模型,为临床智能工具开发提供基础。
Comments Accepted at the DCA-MI Workshop (ECCV 2026)
HarnessSafe:评估智能体框架中持久载体的安全性
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 HarnessSafe基准含7类持久载体的328个可执行案例,通过追踪攻击链的多阶段评估,揭示智能体框架中安全遏制效果的载体特异性及框架-模型配置的重要性。
Comments 21 pages, 3 figures. Preprint
VESTA: 一种全自动的LLM智能体场景生成与安全评估框架
机构 * BrainCog AI Lab, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所类脑人工智能实验室) ; Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院) ; Beijing Key Laboratory of Safe AI and Superalignment(北京市安全人工智能与超级对齐重点实验室) ; School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) ; Long-term AI(长期人工智能)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 提出VESTA框架,基于五个风险维度自动生成1072个可执行场景,评估12个LLM智能体在任务执行中的行为安全风险,平均攻击成功率达47.1%。
可信代理网络:在代理网络中,信任必须被内置,而非事后添加
机构 * University of Southern California(南加州大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Stanford University(斯坦福大学)
专题命中 安全评测 :trustworthy(title);alignment(abstract);分类 cs.AI
AI总结 本文探讨了在代理网络中信任必须被内置而非事后添加的问题,提出了一个综合的概念框架,通过四个设计支柱来建立代理网络中的信任。
Comments Accepted at SIGKDD 2026 Blue Sky Ideas Track
Align-RAG:TSFM上下文学习的全部需求在于对齐
机构 * Stanford University(斯坦福大学) ; Amazon(亚马逊公司)
专题命中 安全评测 :alignment(title,abstract);分类 cs.LG
AI总结 提出无需训练的Align-RAG方法,通过闭式对齐检索窗口,在冻结TSFM上提升检索增强预测性能,证明冻结TSFM可动态整合检索结果,闭式对齐可作为默认基线。
从运动到安全:多模态大语言模型(MLLM)主动风险推理基准测试
机构 * School of Information, Renmin University of China(中国人民大学信息学院)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL
AI总结 该研究构建了运动主动风险推理基准SPRINT,评估发现当前MLLM危险感知率高但原因识别率低,仅具备表层主动安全能力,缺乏稳定的基于原因的早期预警。
Comments Preprints
CoPlan:一种基于角色可争议论证图的可信协同智能照护规划界面
机构 * University of New Brunswick(新不伦瑞克大学) ; National Research Council Canada(加拿大国家研究委员会) ; Thompson Rivers University(汤普森河大学) ; ISB Corporation(ISB公司) ; University of Northern British Columbia(北英属哥伦比亚大学)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI
AI总结 本研究提出CoPlan界面,通过多智能体工作流结合协同智能与可争议性,实现人机协同照护规划,保留人类自主性与临床问责制,已在就地养老场景中验证其有效性。
Comments Accepted at the 2026 International Conference on Next Generation AI Systems (NGEN-AI 2026)
NSF-HRPT:神经语义场结合分层风险感知树的安全关键场景评估方法
机构 * Zhejiang University(浙江大学) ; Beihang University(北京航空航天大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 该研究提出NSF-HRPT框架,结合神经语义场与分层风险感知树,引入Sim2Real策略,实现单目视觉输入下安全关键场景的高效风险评估,在合成与现实数据集上均取得优异性能。
Comments 13 pages, 5 figures
ADMITBench:用于评估工业LLM咨询建议可采纳性的安全管控参考框架
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 本研究提出ADMITBench框架,用于评估工业LLM咨询建议的可采纳性,该框架采用带版本的安全管控评估契约,0.1.0版本为公开参考实现,面向技术与研究评估。
评估药物安全推理中对患者信息的反事实敏感性
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 本研究推出MedPIC-Bench基准,评估不同LLM在药物安全推理中对患者信息的反事实敏感性,发现所有模型在反事实问题上表现更差,医学专用LLM的反事实表现落后于通用LLM,凸显静态准确性的评估局限性。
VLAFlow:通过协同训练和未来潜在对齐的视觉-语言-动作模型统一训练框架
机构 * Li Auto Inc.(理想汽车) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
AI总结 提出VLAFlow统一框架,比较四种训练范式,发现语言监督保持视觉-语言泛化,未来潜在对齐改进状态转换建模,两者结合实现最佳迁移性能。
HomeSafeBench:面向自由探索式家庭安全检查的具身视觉-语言模型基准
机构 * Beijing Institute of Technology(北京理工大学) ; Beihang University(北京航空航天大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL
AI总结 研究针对家庭安全隐患检查需求构建HomeSafeBench基准,提出CueBack数据构建方法,微调4B规模VLM使分布外测试集F1值显著提升,缩小了与人类检查员的性能差距。
Comments Preprint
利用人工智能在稀疏数据条件下进行细粒度食品安全风险预测
机构 * Zhejiang University(浙江大学) ; Rutgers University(罗格斯大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 该研究提出基于Transformer的框架,整合多类数据与Wilson区间预训练,在稀疏数据下细粒度预测城市食品安全风险,实验及浙江实地测试显示其性能优于基线,可提升检测率与检查资源分配效率。
HetGPS:面向电动汽车充电的、带物理锚定自适应安全机制的可扩展图多智能体强化学习
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 该研究提出HetGPS混合图控制框架,结合学习图风险与物理锚定校正,实现可扩展的电动汽车充电多智能体协调,降低电压违规率并提升离网成功率,模型规模与车队无关且可跨系统零样本迁移。
从船舶轨迹到安全关键性遭遇场景:一种生成式AI框架用于自主船舶数字测试
专题命中 安全评测 :safety(title,abstract);分类 cs.LG
AI总结 本文提出一种数据驱动框架,将大规模AIS轨迹转化为结构化安全关键性遭遇场景,结合生成轨迹建模与自动化遭遇配对,提升场景生成的可扩展性与真实性。
Comments 19 pages
ProbGuard:基于概率的运行时监控用于LLM代理安全
机构 * Singapore Management University(新加坡管理大学) ; Xi'an Jiaotong University(西安交通大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 ProbGuard通过概率风险预测主动监控LLM代理安全,利用离散时间马尔可夫链建模行为动态,提前预警潜在危险,提升安全性和任务完成率。
Comments Accepted by the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL
Comments Accepted by ISSTA 2025
Journal ref Proceedings of the ACM on Software Engineering, Vol. 2, ISSTA, pp. 2136-2157, 2025
MMLDSum-LLM:结合视觉对齐与关键词感知的多模态长文档摘要方法
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
AI总结 针对多模态长文档摘要的关键信息遗漏与跨模态幻觉问题,提出结合视觉对齐与关键词感知的两阶段训练框架MMLDSum-LLM,在自研基准MMLDSum-Bench上验证了其性能优势。
耦合精馏基准上的安全门控智能体监督控制:工况图、可审计门与协同设计发现
专题命中 安全评测 :safety(title,abstract);分类 cs.LG
AI总结 该研究针对耦合精馏基准,提出基于规则的分叉孪生反事实安全门控机制,结合DeepSeek-V4-Flash等模型,在目标获取、扰动抑制等任务上优于基准方法,可有效遏制有害操作。
Comments 31 pages, 8 figures. Code and data: https://github.com/cgncro-cyber/IndustrialAI. Sole author; independent research