arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-18 至 2025-12-18 共收录 12 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 12 篇

2512.15617 2025-12-18 cs.CL cs.AI 81%

Evaluating Metrics for Safety with LLM-as-Judges

用LLM作为裁判评估安全度的指标

Kester Clegg, Richard Hawkins, Ibrahim Habli, Tom Lawton

机构 * Centre for Assuring Autonomy, University of York(自主性保障中心、约克大学) Bradford Royal Infirmary(布拉德福德皇家医院)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过加权指标和置信度阈值来提升LLM作为裁判在关键信息流中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15538 2025-12-18 cs.AI cs.MA 79%

TrafficGamer: Reliable and Flexible Traffic Simulation for Safety-Critical Scenarios with Game-Theoretic Oracles

TrafficGamer: 用于安全关键场景的可靠且灵活的交通仿真方法,基于博弈论 oracle

Guanren Qiao, Guorui Quan, Jiawei Yu, Shujun Jia, Guiliang Liu

机构 * School of Data Science, the Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) University of Manchester(曼彻斯特大学) Shenyang MXNavi Co.,Ltd.(沈阳MXNavi有限公司)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 TrafficGamer通过将道路驾驶视为多智能体游戏,实现安全关键场景的可靠且灵活的交通仿真,利用博弈论方法提高仿真保真度和均衡捕捉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09603 2025-12-18 cs.CV 78%

Do MLLMs Exhibit Human-like Perceptual Behaviors? HVSBench: A Benchmark for MLLM Alignment with Human Perceptual Behavior

多模态大语言模型是否表现出类人感知行为?HVSBench:一个用于多模态大语言模型对齐人类视觉行为的基准测试

Jiaying Lin, Shuquan Ye, Dan Xu, Wanli Ouyang, Rynson W. H. Lau

专题命中 安全评测 :alignment(title,abstract)

AI总结 HVSBench通过测试多模态大语言模型与人类视觉行为的对齐性,揭示了其在感知任务上的显著差距,并强调了开发更符合人类认知的AI的重要性。

Comments Project page: https://jiaying.link/HVSBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15033 2025-12-18 cs.AI 70%

Beyond Accuracy: A Geometric Stability Analysis of Large Language Models in Chess Evaluation

超越准确性:大型语言模型在国际象棋评估中的几何稳定性分析

Xidan Song, Weiqi Wang, Ruifeng Cao, Qingya Hu

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出几何稳定性框架,用于评估大型语言模型在国际象棋评估中的几何推理能力,揭示了模型在几何变换下的稳定性差异及性能悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14712 2025-12-18 cs.LG cs.AI cs.CL cs.CV cs.CY 70%

SepsisSuite: Beyond Risk Stratification -- A Comparative Analysis of Deep Fusion vs. Expert Stacking for Prescriptive Sepsis AI

SepsisSuite: 超越风险分层 -- 深度融合与专家堆叠的比较分析用于处方性脓毒症AI

Ryan Cartularo

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 SepsisSuite通过深度融合与专家堆叠对比,提出SepsisLateFusion架构,实现预测临床发作前4小时的AUC 0.915,并提升抗生素选择性能。

Comments 7 Pages, 4 Tables, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01899 2025-12-18 cs.LG cs.AI cs.HC 62%

Multimodal Foundation Models for Early Disease Detection

多模态基础模型用于早期疾病检测

Md Talha Mohsin, Ismail Abdulrashid

机构 * The University of Tulsa(塔尔萨大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种多模态基础模型,通过整合电子病历、医学影像、基因组学和可穿戴传感器数据,提升早期疾病检测的准确性和鲁棒性。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15466 2025-12-18 cs.SE cs.AI 57%

On Assessing the Relevance of Code Reviews Authored by Generative Models

基于生成模型的代码审查相关性的评估

Robert Heumüller, Frank Ortmeier

机构 * Otto von Guericke University Magdeburg, Germany(奥托·冯·格里克大学马格德堡)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出多主观排名方法,评估生成模型在代码审查中的表现,发现其生成评论质量优于人类,但需警惕潜在风险。

Comments Replication Package: https://github.com/robert-heumueller-ovgu/repl-generative-review-relevance

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15008 2025-12-18 cs.LG 57%

Stock Pattern Assistant (SPA): A Deterministic and Explainable Framework for Structural Price Run Extraction and Event Correlation in Equity Markets

股票模式助手(SPA):一种确定性和可解释性的框架,用于在权益市场中提取结构性价格运行和事件关联

Sandeep Neela

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 SPA是一种用于提取结构性价格运行和事件关联的确定性框架,通过可解释的方法提供透明的历史价格结构分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13734 2025-12-18 cs.CL 57%

GAPS: A Clinically Grounded, Automated Benchmark for Evaluating AI Clinicians

GAPS: 一种基于临床的自动化评估基准,用于评估AI临床医生

Xiuyuan Chen, Tao Sun, Dexin Su, Ailing Yu, Junwei Liu, Zhe Chen, Gangzeng Jin, Xin Wang, Jingnan Liu, Hansong Xiao, Hualei Zhou, Dongjie Tao, Chunxiao Guo, Minghui Yang, Yuan Xia, Jing Zhao, Qianrui Fan, Yanyun Wang, Shuai Zhen, Kezhong Chen, Jun Wang, Zewen Sun, Heng Zhao, Tian Guan, Shaodong Wang, Geyun Chang, Jiaming Deng, Hongchengcheng Chen, Kexin Feng, Ruzhen Li, Jiayi Geng, Changtai Zhao, Jun Wang, Guihu Lin, Peihao Li, Liqi Liu, Peng Wei, Jian Wang, Jinjie Gu, Ping Wang, Fan Yang

机构 * Department of Thoracic Surgery(胸外科部门) Thoracic Oncology Institute(胸外科肿瘤研究所) Research Unit of Intelligence Diagnosis and Treatment in Early Non-small Cell Lung Cancer(早期非小细胞肺癌智能诊断与治疗研究单元) Institute of Advanced Clinical Medicine(先进临床医学研究所) Beijing Key Laboratory of Innovative Application of Big Data in Lung Cancer(肺癌大数据创新应用北京市重点实验室) Ant Group(蚂蚁集团) School of Software and Microelectronics(软件与微电子学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 GAPS提出了一种基于临床的自动化评估基准,用于评估AI临床医生系统,通过多维评估框架解决现有基准的不足,揭示了AI在临床实践中的关键失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05788 2025-12-18 eess.SY cs.SY 50%

Task-Specific Trust Evaluation for Multi-Hop Collaborator Selection via GNN-Aided Distributed Agentic AI

基于图神经网络的多跳协作者选择任务特定信任评估

Botao Zhu, Xianbin Wang, Dusit Niyato

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出基于图神经网络的分布式代理人工智能框架,用于多跳协作者选择中的任务特定信任评估,通过整合设备可信度评估结果,实现隐私保护的任务路径规划。

Journal ref IEEE Journal on Selected Areas in Communications, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15148 2025-12-18 cs.SE 50%

Aligning Academia with Industry: An Empirical Study of Industrial Needs and Academic Capabilities in AI-Driven Software Engineering

将学术与产业对齐:一项关于工业需求和学术能力的AI驱动软件工程实证研究

Hang Yu, Yuzhou Lai, Li Zhang, Xiaoli Lian, Fang Liu, Yanrui Dong, Ting Zhang, Zhi Jin, David Lo

专题命中 安全评测 :alignment(abstract)

AI总结 本文通过分析学术研究与工业需求的差距,揭示AI驱动软件工程中的关键挑战,旨在引导未来研究更贴近实际应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14755 2025-12-18 cs.CV 50%

SkyCap: Bitemporal VHR Optical-SAR Quartets for Amplitude Change Detection and Foundation-Model Evaluation

SkyCap:双时间维高分辨率光学-合成孔径雷达四元组用于幅度变化检测和基础模型评估

Paul Weinmann, Ferdinand Schenck, Martin Šiklar

机构 * LiveEO GmbH(LiveEO公司)

专题命中 安全评测 :alignment(abstract)

AI总结 SkyCap通过光学-雷达数据集和标签转移,首次评估了高分辨率SAR幅度变化检测中的基础模型性能。

Comments 8 pages, 0 figures. Accepted at Advances in Representation Learning for Earth Observation (REO) at EurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏