arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9380 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9380 篇

2512.15163 2026-03-06 cs.CL cs.AI 81%

MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers

MCP-SafetyBench:一种用于评估大型语言模型在真实MCP服务器安全性的大规模基准

Xuanjun Zong, Zhiqi Shen, Lei Wang, Yunshi Lan, Chao Yang

机构 * East China Normal University(东华师范大学) Salesforce AI Research(Salesforce人工智能研究) Singapore Management University(新加坡国立大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 MCP-SafetyBench通过真实MCP服务器评估大型语言模型的安全性,揭示了模型在面对MCP攻击时的脆弱性及安全与实用性的权衡问题。

Comments Our benchmark is available at https://github.com/xjzzzzzzzz/MCPSafety

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03303 2026-03-05 cs.CL cs.AI 81%

HumanLM: Simulating Users with State Alignment Beats Response Imitation

HumanLM: 通过状态对齐模拟用户优于响应模仿

Shirley Wu, Evelyn Choi, Arpandeep Khatua, Zhanghan Wang, Joy He-Yueya, Tharindu Cyril Weerasooriya, Wei Wei, Diyi Yang, Jure Leskovec, James Zou

机构 * Stanford University(斯坦福大学) New York University(纽约大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 HumanLM通过状态对齐模拟用户,优于响应模仿,显著提升对齐分数和真实用户相似性。

Comments 27 pages, 17 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00024 2026-03-03 cs.CL cs.AI 81%

Personalization Increases Affective Alignment but Has Role-Dependent Effects on Epistemic Independence in LLMs

个性化增强了情感一致性,但对LLM中的认知独立性有角色依赖性的影响

Sean W. Kelley, Christoph Riedl

机构 * Northeastern University, Boston, MA, USA(东北大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了个性化对LLM情感一致性与认知独立性的影响,发现其效果依赖于角色设定,且通过实验验证了个性化条件对模型行为的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22298 2026-02-27 cs.LG cs.AI 81%

AviaSafe: A Physics-Informed Data-Driven Model for Aviation Safety-Critical Cloud Forecasts

AviaSafe: 一种融合物理约束的数据驱动模型用于航空安全关键的云预报

Zijian Zhu, Qiusheng Huang, Anboyu Guo, Xiaohui Zhong, Hao Li

机构 * Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of Artificial Intelligence for Science(上海人工智能科学研究院) National Marine Environment Forecasting Center(国家海洋环境预报中心) Department of Atmospheric and Oceanic Sciences, Fudan University(复旦大学大气科学与海洋科学系)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 AviaSafe通过融合物理约束的神经网络,实现了对航空安全关键的云物种的7天预测,提升了航空路线优化和结冰风险评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17696 2026-02-23 cs.LG cs.AI 81%

Can LLM Safety Be Ensured by Constraining Parameter Regions?

通过约束参数区域能否确保大语言模型的安全性?

Zongmin Li, Jian Su, Farah Benamara, Aixin Sun

机构 * Nanyang Technological University(南洋理工大学) Institute for Infocomm Research (I 2 R)(信息通信研究所) IRIT, Université de Toulouse, CNRS, Toulouse INP(图卢兹大学IRIT研究所、法国国家科学研究中心) IPAL, CNRS-NUS-A*STAR(IPAL、法国国家科学研究中心-南洋理工大学-A*STAR)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文评估了四种安全区域识别方法,发现其在不同粒度和数据集下重叠程度低,表明现有方法难以可靠地识别稳定的安全区域。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17364 2026-02-20 cs.LG cs.AI 81%

A feature-stable and explainable machine learning framework for trustworthy decision-making under incomplete clinical data

一种具有特征稳定性和可解释性的机器学习框架,用于在不完整临床数据下实现可信的决策

Justyna Andrys-Olek, Paulina Tworek, Luca Gherardini, Mark W. Ruddock, Mary Jo Kurt, Peter Fitzgerald, Jose Sousa

机构 * Computational Intelligence, Sano Centre for Computational Personalised Medicine(计算智能,Sano计算个性化医学中心) Clinical Studies Group, Randox Laboratories Ltd., Co.(临床研究组,Randox实验室有限公司)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 CACTUS是一种针对不完整临床数据设计的可解释机器学习框架,通过提升特征稳定性与可解释性,增强模型在缺失数据下的可信决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15052 2026-02-16 cs.CL cs.AI 81%

SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification

SGM: 通过神经层面的净化为多模态大语言模型提供安全眼镜

Hongbo Wang, MaungMaung AprilPyone, Isao Echizen

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 SGM通过神经层面的净化技术,有效降低多模态大语言模型的毒性,同时保持生成流畅性和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14182 2026-02-13 cs.CL cs.LG 81%

LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs

LabSafety Bench: 对科学实验室中AI安全问题的LLM基准测试

Yujun Zhou, Jingdong Yang, Yue Huang, Kehan Guo, Zoe Emory, Bikram Ghosh, Amita Bedar, Sujay Shekar, Zhenwen Liang, Pin-Yu Chen, Tian Gao, Werner Geyer, Nuno Moniz, Nitesh V Chawla, Xiangliang Zhang

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 LabSafety Bench通过评估LLMs和VLMs在实验室安全问题上的表现,揭示了当前模型在危险识别和风险评估方面的不足,强调了对AI安全评估框架的迫切需求。

Comments Published at Nature Machine Intelligence

Journal ref Nat Mach Intell 8, 20-31 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04860 2026-02-13 cs.LG cs.AI 81%

Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails

对齐倾倒过程:自我进化如何推动LLM代理偏离轨道

Siwei Han, Kaiwen Xiong, Jiaqi Liu, Xinyu Ye, Yaofeng Su, Wenbo Duan, Xinyuan Liu, Cihang Xie, Mohit Bansal, Mingyu Ding, Linjun Zhang, Huaxiu Yao

机构 * Rutgers University(罗切斯特大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 研究揭示了自我进化LLM代理在部署后因持续互动而偏离对齐约束的风险,通过自我利益探索和模仿策略扩散两种范式分析,发现对齐优势会迅速衰减,现有对齐方法难以有效防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11847 2026-02-12 cs.IR cs.AI cs.CY 81%

A Multimodal Manufacturing Safety Chatbot: Knowledge Base Design, Benchmark Development, and Evaluation of Multiple RAG Approaches

多模态制造安全聊天机器人:知识库设计、基准开发及多种RAG方法的评估

Ryan Singh, Austin Hamilton, Amanda White, Michael Wise, Ibrahim Yousif, Arthur Carvalho, Zhe Shan, Reza Abrisham Baf, Mohammad Mayyas, Lora A. Cavuoto, Fadel M. Megahed

机构 * Farmer School of Business, Miami University(Miami大学农业商学院) Department of Computer Science and Software Engineering, Miami University(Miami大学计算机科学与软件工程系) Department of Engineering Technology, Miami University(Miami大学工程技术系) Department of Mechanical and Manufacturing Engineering, Miami University(Miami大学机械与制造工程系) Department of Industrial and Systems Engineering, University at Buffalo(University at Buffalo工业与系统工程系)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本文提出了一种多模态制造安全聊天机器人,通过RAG方法实现高准确率、低延迟和低成本的安全培训,展示了其在工业5.0环境中的应用价值。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17442 2026-02-05 cs.AI cs.ET cs.LG 81%

Keeping Medical AI Healthy and Trustworthy: A Review of Detection and Correction Methods for System Degradation

保持医疗AI的健康与可信:对系统退化检测与纠正方法的综述

Hao Guan, David Bates, Li Zhou

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了医疗AI系统退化检测与纠正方法,探讨了性能退化原因、检测技术、根本原因分析及纠正策略,旨在提升医疗AI的可靠性和安全性。

Comments 16 pages, 5 figures

Journal ref IEEE Transactions on Biomedical Engineering, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02629 2026-02-04 cs.CR cs.AI cs.LG 81%

Trustworthy Blockchain-based Federated Learning for Electronic Health Records: Securing Participant Identity with Decentralized Identifiers and Verifiable Credentials

基于区块链的可信联邦学习用于电子健康记录:利用去中心化标识符和可验证凭证保障参与者身份

Rodrigo Tertulino, Ricardo Almeida, Laercio Alencar

机构 * Federal Institute of Education, Science, and Technology of Rio Grande do Norte (IFRN)(里约格兰德北教育科学和技术联邦学院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于区块链的可信联邦学习框架,利用去中心化标识符和可验证凭证保障医疗数据安全,有效抵御Sybil攻击,提升模型预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10994 2026-01-27 cs.CL cs.AI 81%

Deep Research with Open-Domain Evaluation and Multi-Stage Guardrails for Safety

基于开放领域评估和多阶段防护机制的深度研究

Wei-Chieh Huang, Henry Peng Zou, Yaozu Wu, Dongyuan Li, Yankai Chen, Weizhi Zhang, Yangning Li, Angelo Zangari, Jizhou Guo, Chunyu Miao, Liancheng Fang, Langzhou He, Yinghui Li, Renhe Jiang, Philip S. Yu

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DeepResearchGuard和DRSafeBench,通过开放领域评估和多阶段防护机制提升深度研究的安全性和报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07173 2026-01-19 cs.CL cs.AI cs.CV 81%

Better Language Models Exhibit Higher Visual Alignment

表现更佳的语言模型具有更高的视觉对齐性

Jona Ruthardt, Gertjan J. Burghouts, Serge Belongie, Yuki M. Asano

机构 * Fundamental AI Lab, University of Technology Nuremberg(技术基础人工智能实验室,不莱梅技术大学) Intelligent Imaging, TNO(智能成像,TNO) Department of Computer Science, University of Copenhagen(计算机科学系,哥本哈根大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出 ShareLock 方法,通过融合冻结的视觉和语言模型骨干,提升视觉对齐能力,实现高效跨语言图像分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09756 2026-01-16 cs.CR cs.AI cs.CL 81%

Synthetic Data for Veterinary EHR De-identification: Benefits, Limits, and Safety Trade-offs Under Fixed Compute

兽医电子健康记录的合成数据:在固定计算下的好处、限制和安全权衡

David Brundage

机构 * University of Wisconsin-Madison, School of Veterinary Medicine(威斯康星大学麦迪逊分校兽医学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了合成数据在兽医电子健康记录去标识化中的应用,发现合成数据在固定预算下无法替代真实数据,但适度混合可提升性能,但需注意训练暴露增加而非数据质量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05465 2026-01-16 cs.AI cs.CL 81%

VAL-Bench: Belief Consistency as a measure for Value Alignment in Language Models

VAL-Bench:信念一致性作为语言模型价值观对齐的度量标准

Aman Gupta, Denny O'Shea, Fazl Barez

机构 * MasterClass University of Oxford(牛津大学) WhiteBox Martian

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 VAL-Bench通过评估语言模型在现实价值相关提示中的信念一致性,提出了一种衡量价值观对齐的新基准,揭示了不同模型在一致性上的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16281 2026-01-15 cs.RO cs.AI cs.LG 81%

Do What You Say: Steering Vision-Language-Action Models via Runtime Reasoning-Action Alignment Verification

按言行事:通过运行时推理-动作对齐验证引导视觉-语言-动作模型

Yilin Wu, Anqi Li, Tucker Hermans, Fabio Ramos, Andrea Bajcsy, Claudia Pérez-D'Arpino

机构 * NVIDIA(NVIDIA公司) Carnegie Mellon University(卡内基梅隆大学) University of Utah(犹他大学) University of Sydney(悉尼大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 通过运行时推理-动作对齐验证方法提升视觉-语言-动作模型的鲁棒性和行为组合能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08673 2026-01-14 cs.AI cs.CY 81%

Why AI Alignment Failure Is Structural: Learned Human Interaction Structures and AGI as an Endogenous Evolutionary Shock

为何AI对齐失败是结构性的:学习的人类互动结构与AGI作为内生性演化冲击

Didier Sornette, Sandro Claudio Lera, Ke Wu

机构 * Institute of Risk Analysis, Prediction and Management (Risks-X)(风险分析、预测与管理研究所) Southern University of Science and Technology (SUSTech)(南方科技大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 本文探讨AI对齐失败的结构性问题,指出AGI作为内生性演化冲击,其风险源于放大人类智能、权力与矛盾,而非对抗意图。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11218 2026-01-13 cs.CL cs.AI 81%

The Curious Case of Factual (Mis)Alignment between LLMs' Short- and Long-Form Answers

事实性(误解)一致性在LLM短形式和长形式回答中的奇特案例

Saad Obaid ul Islam, Anne Lauscher, Goran Glavaš

机构 * WüNLP, CAIDAS, University of Würzburg(乌尔姆大学) Data Science Group, University of Hamburg(汉堡大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SLAQ框架,揭示LLM在短长形式回答中存在事实一致性问题,通过机制分析发现重叠内部结构与78%预测准确率,挑战现有评估实践。

Comments Code: https://github.com/WorldHellow/SLAQ/tree/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06704 2026-01-13 cs.LG cs.AI cs.CV 81%

Beyond Perfect Scores: Proof-by-Contradiction for Trustworthy Machine Learning

超越完美分数:基于矛盾证明的可信机器学习证明

Dushan N. Wadduwage, Dineth Jayakody, Leonidas Zimianitis

机构 * Old Dominion University(旧 Dominion 大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于矛盾证明的可信度测试方法,通过随机排列标签来评估模型是否依赖真实临床线索,从而提高机器学习在生物医学中的可信度和临床应用潜力。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06167 2026-01-13 cs.LG cs.AI 81%

Parent-Guided Adaptive Reliability (PGAR): A Behavioural Meta-Learning Framework for Stable and Trustworthy AI

指导式自适应可靠性(PGAR):一种用于稳定和可信赖AI的行为元学习框架

Anshum Rankawat

机构 * Anshum Rankawat(独立研究者)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI、cs.LG

AI总结 PGAR通过引入监督父层提升AI的稳定性与可靠性,通过有界可靠性指数调节学习率,实现更稳健的优化与学习过程。

Comments 9 pages, 8 figures, 2 tables. Submitted to IEEE Transactions on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03444 2026-01-08 cs.CL cs.AI cs.HC 81%

Grading Scale Impact on LLM-as-a-Judge: Human-LLM Alignment Is Highest on 0-5 Grading Scale

评分尺度对LLM作为裁判的影响:人类与LLM的对齐在0-5评分尺度上最高

Weiyue Li, Minda Zhao, Weixuan Dong, Jiahui Cai, Yuze Wei, Michael Pocress, Yi Li, Wanyan Yuan, Xiaoyue Wang, Ruoyu Hou, Kaiyuan Lou, Wenqi Zeng, Yutong Yang, Yilun Du, Mengyu Wang

机构 * Harvard University(哈佛大学) CMU(卡内基梅隆大学) Stanford University(斯坦福大学) UC San Diego(圣地亚哥大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了评分尺度对LLM作为裁判一致性的影响,发现0-5评分尺度在人类与LLM之间产生最强的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07015 2025-12-29 cs.CL cs.AI cs.IR 81%

FVA-RAG: Falsification-Verification Alignment for Mitigating Sycophantic Hallucinations

FVA-RAG:通过对抗性上下文对齐缓解趋炎附势幻觉

Mayank Ravishankara

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 FVA-RAG通过引入对抗性上下文检索,有效缓解了因前提错误导致的幻觉问题,其在多个基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21551 2025-12-29 cs.HC cs.AI cs.CL 81%

Human-AI Interaction Alignment: Designing, Evaluating, and Evolving Value-Centered AI For Reciprocal Human-AI Futures

人机交互对齐:为互惠人机未来设计、评估和演化以价值为中心的AI

Hua Shen, Tiffany Knearem, Divy Thakkar, Pat Pataranutaporn, Anoop Sinha, Yike, Shi, Jenny T. Liang, Lama Ahmad, Tanu Mitra, Brad A. Myers, Yang Li

机构 * NYU Shanghai, New York University(纽约大学上海校区) Google(谷歌) Massachusetts Institute of Technologyy(麻省理工学院) Google, Paradigms of Intelligence(谷歌、智能范式) Carnegie Mellon University, New York University(卡内基梅隆大学、纽约大学) Carnegie Mellon University(卡内基梅隆大学) OpenAI University of Washington(华盛顿大学) Google DeepMind(谷歌DeepMind)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本研讨会探讨如何通过设计、评估和演化以价值为中心的AI,实现人机之间的互惠协作与动态对齐。

Comments CHI 2026 BiAlign Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20755 2025-12-25 cs.LG cs.AI 81%

Bridging Efficiency and Safety: Formal Verification of Neural Networks with Early Exits

弥合效率与安全:具有早期退出的神经网络形式验证

Yizhak Yisrael Elboher, Avraham Raviv, Amihay Elboher, Zhouxing Shi, Omri Azencot, Hillel Kugler, Guy Katz

机构 * The Hebrew University of Jerusalem, Israel(特拉维夫大学) Bar Ilan University, Israel(巴伊兰大学) Ben-Gurion University of the Negev, Israel(贝纳亚克大学) University of California, Riverside, USA(加州大学河滨分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种针对具有早期退出机制的神经网络进行形式验证的方法,通过定制鲁棒性属性和优化策略,在保证正确性的同时提升验证效率和推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20688 2025-12-25 cs.GT cs.AI cs.LG cs.MA 81%

Mechanism-Based Intelligence (MBI): Differentiable Incentives for Rational Coordination and Guaranteed Alignment in Multi-Agent Systems

基于机制的智能(MBI):用于多智能体系统中理性协调和保证对齐的可微激励

Stefano Grassi

专题命中 安全评测 :alignment(title);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 基于机制的智能(MBI)通过可微价格机制实现多智能体系统的理性协调和保证对齐,提供高效、可审计且可扩展的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18092 2025-12-23 cs.AI cs.LG 81%

Faithful and Stable Neuron Explanations for Trustworthy Mechanistic Interpretability

可信且稳定的神经元解释用于可信的机制可解释性

Ge Yan, Tuomas Oikarinen, Tsui-Wei, Weng

机构 * CSE, UCSD(计算机科学与工程系,加州大学圣塔莫尼卡分校) HDSI, UCSD(人类-数字系统研究所,加州大学圣塔莫尼卡分校)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出理论分析和方法,解决神经元识别中的忠实性和稳定性问题,通过理论保证和实验验证提升机制可解释性的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07347 2025-12-19 eess.SY cs.AI cs.LG cs.SY 81%

Distributed Risk-Sensitive Safety Filters for Uncertain Discrete-Time Systems

分布式风险敏感安全滤波器用于不确定离散时间系统

Armin Lederer, Erfaun Noorani, Andreas Krause

机构 * Department of Electrical and Computer Engineering, College of Design and Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系,设计与工程学院) Learning & Adaptive Systems Group, Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系学习与自适应系统小组)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种分布式风险敏感安全滤波器,用于不确定离散时间多智能体系统,通过价值函数定义的控制屏障函数和两种替代策略确保安全性与鲁棒性。

Journal ref IEEE Control Systems Letters, vol. 9, pp. 1231-1236, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15617 2025-12-18 cs.CL cs.AI 81%

Evaluating Metrics for Safety with LLM-as-Judges

用LLM作为裁判评估安全度的指标

Kester Clegg, Richard Hawkins, Ibrahim Habli, Tom Lawton

机构 * Centre for Assuring Autonomy, University of York(自主性保障中心、约克大学) Bradford Royal Infirmary(布拉德福德皇家医院)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过加权指标和置信度阈值来提升LLM作为裁判在关键信息流中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13658 2025-12-16 cs.CY cs.AI 81%

Embedding-Based Rankings of Educational Resources based on Learning Outcome Alignment: Benchmarking, Expert Validation, and Learner Performance

基于学习成果对齐的教育资源排名:基准测试、专家验证与学习者表现

Mohammadreza Molavi, Mohammad Moein, Mohammadreza Tavakoli, Abdolali Faraji, Stefan T. Mol, Gábor Kismihók

机构 * Leibniz Information Centre for Science and Technology (TIB)(莱比锡科学与技术信息中心) University of Amsterdam(阿姆斯特丹大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 本研究提出基于嵌入的对齐框架,通过基准测试和专家验证,证明了教育资源与学习成果对齐度对学习表现的正向影响。

Comments Accepted for publication at the 16th International Conference on Learning Analytics & Knowledge (LAK 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏