arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2506.11023 2025-12-22 cs.AI cs.SE 57%

OntoGSN: An Ontology-Based Framework for Semantic Management and Extension of Assurance Cases

OntoGSN:基于本体的保障案例语义管理和扩展框架

Tomas Bueno Momcilovic, Barbara Gallina, Ingmar Kessler, Jule Hendricks, Dian Balta

机构 * fortiss research institute(fortiss研究机构) Mälardalen University(马尔默达伦大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 OntoGSN通过本体和中间件实现保障案例的语义管理和扩展,提供知识表示和查询功能,并在对抗鲁棒性保障中展示实用性。

Comments Submitted to the ESWC 2026 Resources track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17387 2025-12-22 cs.SE cs.CL 57%

CIFE: Code Instruction-Following Evaluation

CIFE:代码指令遵循评估

Sravani Gunnu, Shanmukha Guttula, Hima Patel

机构 * IIT Bombay(印度班加罗尔理工学院) IBM Research India(IBM印度研究)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 CIFE评估了1000个Python任务的代码生成模型,通过13类约束测试,揭示了模型在遵循开发者要求方面的不足,提出C2A分数衡量正确性与约束遵循性。

Comments 20 pages, 22 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15282 2025-12-22 cs.AI 57%

Realist and Pluralist Conceptions of Intelligence and Their Implications on AI Research

现实主义与多元主义对智能的观念及其对人工智能研究的影响

Ninell Oldenburg, Ruchira Dhar, Anders Søgaard

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文探讨了智能的现实主义与多元主义观念对人工智能研究的影响,指出不同观念导致方法、解释和风险评估的根本差异。

Comments The 40th Annual AAAI Conference on Artificial Intelligence, 8 pages (excl. references), 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20494 2025-12-22 cs.LG cs.MM 57%

Multimodal Representation Learning and Fusion

多模态表示学习与融合

Qihang Jin, Enze Ge, Yuhang Xie, Hongying Luo, Junhao Song, Ziqian Bi, Chia Xin Liang, Jibin Guan, Joe Yeong, Xinyuan Song, Junfeng Hao

机构 * AI Agent Lab, Vokram Group, United Kingdom(AI代理实验室,Vokram集团,英国) University of Bologna, Italy(博洛尼亚大学,意大利) University of Minnesota, United States(明尼苏达大学,美国) Singapore General Hospital, Singapore(新加坡中央医院,新加坡) Emory University, United States(埃默里大学,美国)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 多模态学习通过融合多种数据模态提升AI系统的理解和决策能力,旨在解决数据格式差异、输入缺失及对抗攻击等问题,推动计算机视觉、自然语言处理等领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16750 2025-12-19 cs.HC cs.AI 57%

Plausibility as Failure: How LLMs and Humans Co-Construct Epistemic Error

可能性作为失败:大语言模型与人类如何共同构建知识错误

Claudia Vale Oliveira, Nelson Zagalo, Filipe Silva, Anabela Brandao, Syeda Faryal Hussain Khurrum, Joaquim Santos

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本研究探讨了大语言模型与人类在知识错误中的共同构建过程,发现人类判断受模型生成可能性和解释快捷方式影响,导致错误被误判为可信。

Comments 19 pages, 2 tables, 77 references, 6 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04133 2025-12-19 cs.AI 57%

TRiSM for Agentic AI: A Review of Trust, Risk, and Security Management in LLM-based Agentic Multi-Agent Systems

TRiSM 用于代理 AI:对基于 LLM 的代理多代理系统中信任、风险和安全管理的综述

Shaina Raza, Ranjan Sapkota, Manoj Karkee, Christos Emmanouilidis

机构 * Vector Institute, Toronto, Canada(向量研究所) Cornell University, USA(康奈尔大学) University of Groningen, Netherlands(格罗宁根大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文综述了基于 LLM 的代理多代理系统中信任、风险和安全管理的框架与方法,提出新的评估指标并探讨了安全与隐私增强策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14902 2025-12-19 cs.CY cs.SE 57%

How frontier AI companies could implement an internal audit function

前沿AI公司如何实施内部审计功能

Francesca Gomez, Adam Buick, Leah Ferentinos, Haelee Kim, Elley Lee

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 本文探讨了前沿AI公司如何通过专门设计的内部审计功能来加强安全治理,补充外部评估并提供更高信心的风险控制保证。

Comments Colors updated on table 2 for clarity

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21557 2025-12-19 cs.CL 57%

Generation-Time vs. Post-hoc Citation: A Holistic Evaluation of LLM Attribution

生成时间与事后引用:对大语言模型归属的全面评估

Yash Saxena, Raviteja Bommireddy, Ankur Padia, Manas Gaur

机构 * UMBC(美国马里兰大学伯克利分校) IIITDM(印度印度理工学院迪瓦德分校)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文评估了生成时间引用与事后引用在大语言模型归属中的性能差异,发现P-Cite在覆盖和正确性上表现更优,而G-Cite更适用于精度要求高的场景。

Comments NeurIPS 2025 LLM Evaluation Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15466 2025-12-18 cs.SE cs.AI 57%

On Assessing the Relevance of Code Reviews Authored by Generative Models

基于生成模型的代码审查相关性的评估

Robert Heumüller, Frank Ortmeier

机构 * Otto von Guericke University Magdeburg, Germany(奥托·冯·格里克大学马格德堡)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出多主观排名方法,评估生成模型在代码审查中的表现,发现其生成评论质量优于人类,但需警惕潜在风险。

Comments Replication Package: https://github.com/robert-heumueller-ovgu/repl-generative-review-relevance

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15008 2025-12-18 cs.LG 57%

Stock Pattern Assistant (SPA): A Deterministic and Explainable Framework for Structural Price Run Extraction and Event Correlation in Equity Markets

股票模式助手(SPA):一种确定性和可解释性的框架,用于在权益市场中提取结构性价格运行和事件关联

Sandeep Neela

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 SPA是一种用于提取结构性价格运行和事件关联的确定性框架,通过可解释的方法提供透明的历史价格结构分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13734 2025-12-18 cs.CL 57%

GAPS: A Clinically Grounded, Automated Benchmark for Evaluating AI Clinicians

GAPS: 一种基于临床的自动化评估基准,用于评估AI临床医生

Xiuyuan Chen, Tao Sun, Dexin Su, Ailing Yu, Junwei Liu, Zhe Chen, Gangzeng Jin, Xin Wang, Jingnan Liu, Hansong Xiao, Hualei Zhou, Dongjie Tao, Chunxiao Guo, Minghui Yang, Yuan Xia, Jing Zhao, Qianrui Fan, Yanyun Wang, Shuai Zhen, Kezhong Chen, Jun Wang, Zewen Sun, Heng Zhao, Tian Guan, Shaodong Wang, Geyun Chang, Jiaming Deng, Hongchengcheng Chen, Kexin Feng, Ruzhen Li, Jiayi Geng, Changtai Zhao, Jun Wang, Guihu Lin, Peihao Li, Liqi Liu, Peng Wei, Jian Wang, Jinjie Gu, Ping Wang, Fan Yang

机构 * Department of Thoracic Surgery(胸外科部门) Thoracic Oncology Institute(胸外科肿瘤研究所) Research Unit of Intelligence Diagnosis and Treatment in Early Non-small Cell Lung Cancer(早期非小细胞肺癌智能诊断与治疗研究单元) Institute of Advanced Clinical Medicine(先进临床医学研究所) Beijing Key Laboratory of Innovative Application of Big Data in Lung Cancer(肺癌大数据创新应用北京市重点实验室) Ant Group(蚂蚁集团) School of Software and Microelectronics(软件与微电子学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 GAPS提出了一种基于临床的自动化评估基准,用于评估AI临床医生系统,通过多维评估框架解决现有基准的不足,揭示了AI在临床实践中的关键失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08743 2025-12-17 cs.AI cs.MA 57%

Single-Agent Scaling Fails Multi-Agent Intelligence: Towards Foundation Models with Native Multi-Agent Intelligence

单智能体扩展无法实现多智能体智能:迈向具有原生多智能体智能的基础模型

Shuyue Hu, Haoyang Yan, Yiqun Zhang, Yang Chen, Dongzhan Zhou, Lei Bai

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文指出单智能体扩展无法实现多智能体智能,提出构建具有原生多智能体智能的基础模型的关键方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17399 2025-12-17 cs.CL 57%

DIWALI: Diversity and Inclusivity aWare cuLture specific Items for India: Dataset and Assessment of LLMs for Cultural Text Adaptation in Indian Context

DIWALI:多样性与包容性-aware的文化特定项目用于印度:数据集和对LLM进行文化文本适应的评估

Pramit Sahoo, Maharaj Brahma, Maunendra Sankar Desarkar

机构 * Natural Language and Information Processing Lab (NLIP) Indian Institute of Technology Hyderabad(自然语言与信息处理实验室(NLIP)印度理工学院海得拉巴)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 DIWALI数据集通过17个文化维度的8,000个文化概念,评估LLM在印度文化文本适应中的文化意识与一致性。

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13337 2025-12-16 cs.LG 57%

FROC: A Unified Framework with Risk-Optimized Control for Machine Unlearning in LLMs

FROC:一种用于大语言模型机器去学习的统一框架,具有风险优化控制

Si Qi Goh, Yongsen Zheng, Ziyao Liu, Sami Hormi, Kwok-Yan Lam

机构 * Digital Trust Centre, Nanyang Technological University, Singapore(南洋理工大学数字信任中心) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 FROC提出了一种用于大语言模型机器去学习的统一框架,通过风险优化控制机制,实现对去学习过程的风险管理和效用平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18375 2025-12-16 cs.AI 57%

Progressive Localisation in Localist LLMs

局部化LLM中的渐进式局部化

Joachim Diederich

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种渐进式局部化方法,通过自适应语义块划分和陡峭多项式调度,在保持性能的同时提升LLM的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03888 2025-12-16 cs.CL 57%

False Sense of Security: Why Probing-based Malicious Input Detection Fails to Generalize

虚假的安全感:基于探测的恶意输入检测为何无法泛化

Cheng Wang, Zeming Wei, Qin Liu, Muhao Chen

机构 * National University of Singapore(新加坡国立大学) Peking University(北京大学) University of California, Davis(加州大学戴维斯分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 研究指出基于探测的恶意输入检测方法因学习表面模式而非语义有害性,导致无法泛化,需重新设计模型和评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12443 2025-12-16 cs.AI cs.SE 57%

AI Transparency Atlas: Framework, Scoring, and Real-Time Model Card Evaluation Pipeline

AI透明度地图:框架、评分与实时模型卡片评估流程

Akhmadillo Mamirov, Faiaz Azmain, Hanyu Wang

机构 * Department of Computer Science, The College of Wooster, Wooster, OH, USA(计算机科学系,沃斯特学院,沃斯特,OH,USA) Robert F. Wagner Graduate School of Public Service, New York University, New York, NY, USA(罗伯特·F·瓦格纳公共事务研究生学院,纽约大学,纽约,NY,USA)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出AI透明度框架和实时评估流程,评估50个模型发现前沿实验室合规率约80%,而多数供应商低于60%,安全关键领域存在显著缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12923 2025-12-16 cs.AI cs.MA 57%

The Traitors: Deception and Trust in Multi-Agent Language Model Simulations

背叛者:多智能体语言模型模拟中的欺骗与信任

Pedro M. P. Curvo

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 The Traitors通过多智能体模拟研究LLM在社交互动中的欺骗与信任问题,揭示先进模型在欺骗能力与检测能力上的不对称性。

Comments 9 main pages, 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12128 2025-12-16 cs.CV cs.AI 57%

A Benchmark Dataset for Spatially Aligned Road Damage Assessment in Small Uncrewed Aerial Systems Disaster Imagery

用于小无人 aerial 系统灾害影像中空间对齐道路损坏评估的基准数据集

Thomas Manzini, Priyankari Perali, Raisa Karnik, Robin R. Murphy

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一个用于小无人 aerial 系统灾害影像中道路损坏评估的基准数据集,并通过空间对齐技术提升模型性能。

Comments 11 pages, 6 figures, 6 tables. To appear AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11984 2025-12-16 cs.SE cs.AI 57%

Evidence-Driven Decision Support for AI Model Selection in Research Software Engineering

基于证据的AI模型选择决策支持:研究软件工程中的AI模型选择

Alireza Joonbakhsh, Alireza Rostami, AmirMohammad Kamalinia, Ali Nazeri, Farshad Khunjush, Bedir Tekinerdogan, Siamak Farshidi

机构 * organization= Department of Computer Science Engineering, Shiraz University , city= Shiraz , country= Iran organization= Wageningen University \& Research , city= Wageningen , country= The Netherlands

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出ModelSelect框架,通过多准则决策方法支持AI模型选择,提升科研软件决策的透明性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11805 2025-12-16 cs.CY 57%

AI Integration In ERP Evaluation Across Trends and Architectures

人工智能在ERP评估中的整合:跨趋势与架构

Monu Sharma

专题命中 安全评测 :alignment(abstract);分类 cs.CY

AI总结 本文提出了一种理论模型,将AI赋能的ERP性能评估指标与预测智能和自适应自动化相结合,以改进AI整合ERP的评估方法。

Comments 9 pages, 2 Figures. Journal of Information Systems Engineering and Management,2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11544 2025-12-15 cs.AI 57%

AI-MASLD Metabolic Dysfunction and Information Steatosis of Large Language Models in Unstructured Clinical Narratives

AI-MASLD 大语言模型在无结构临床叙述中的代谢功能障碍与信息脂肪变

Yuan Shen, Xiaojun Wu, Linghua Yu

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究首次实证表明大语言模型在处理临床信息时表现出类似代谢功能障碍的特征,提出AI-MASLD概念,强调需在人类监督下使用LLMs作为辅助工具。

Comments 47 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11437 2025-12-15 cs.CL 57%

CLINIC: Evaluating Multilingual Trustworthiness in Language Models for Healthcare

CLINIC:评估语言模型在医疗领域的多语言可信度

Akash Ghosh, Srivarshinee Sridhar, Raghav Kaushik Ravi, Muhsin Muhsin, Sriparna Saha, Chirag Agarwal

机构 * Indian Institute of Technology Patna(印度理工学院帕纳布分校) IGIMS, Patna(帕纳布IGIMS) University of Virginia(弗吉尼亚大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 CLINIC提出一个多语言基准,评估语言模型在医疗领域的可信度,揭示其在事实准确性、公平性和隐私保护方面的不足。

Comments 49 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11323 2025-12-15 cs.AI 57%

CAPTURE: A Benchmark and Evaluation for LVLMs in CAPTCHA Resolving

CAPTURE:一个用于LVLM在CAPTCHA解决中的基准和评估

Jianyi Zhang, Ziyin Zhou, Xu Ji, Shizhao Liu, Zhangchi Zhao

机构 * Beijing Electric Science and Technology Institute(北京电子科技研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 CAPTURE是一个专为LVLM设计的CAPTCHA基准,涵盖4种主要类型和25种子类型,旨在全面评估LVLM在解决CAPTCHA任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16979 2025-12-15 cs.CV cs.AI 57%

The Finer the Better: Towards Granular-aware Open-set Domain Generalization

更细的更好:面向粒度感知的开集域泛化

Yunyun Wang, Zheng Duan, Xinyue Liao, Ke-Jia Chen, Songcan Chen

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 SeeCLIP通过细粒度语义增强解决开集域泛化中的结构风险与开放空间风险困境,提升模型对难区分未知类别的判别能力。

Comments 9 pages,3 figures,aaai2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26898 2025-12-15 cs.LG 57%

Integrating Ontologies with Large Language Models for Enhanced Control Systems in Chemical Engineering

将本体与大语言模型结合以增强化工工程中的控制系统

Crystal Su, Kuai Yu, Jingrui Zhang, Mingyuan Shao, Daniel Bauer

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出结合本体的LLM框架,用于增强化工工程控制系统,通过结构化知识与生成推理结合,提升过程控制和安全分析的可解释性和可靠性。

Comments This paper is withdrawn due to issues with attribution and citation accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10968 2025-12-15 cs.CL cs.SD eess.AS 57%

Benchmarking Automatic Speech Recognition Models for African Languages

对非洲语言自动语音识别模型的基准测试

Alvin Nahabwe, Sulaiman Kagumire, Denis Musinguzi, Bruno Beijuka, Jonah Mubuuke Kyagaba, Peter Nabende, Andrew Katumba, Joyce Nakatumba-Nabende

机构 * Makerere University Centre for Artificial Intelligence(Makerere大学人工智能中心) Marconi Lab(Marconi实验室) Department of Information Systems(信息系统系) Department of Electrical Engineering(电气工程系) Department of Computer Science(计算机科学系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究对四种最先进的ASR模型在13种非洲语言上进行基准测试,揭示不同模型在不同资源条件下的表现差异及优化策略。

Comments 19 pages, 8 figures, Deep Learning Indiba, Proceedings of Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10624 2025-12-12 cs.CL 57%

AgriGPT-Omni: A Unified Speech-Vision-Text Framework for Multilingual Agricultural Intelligence

AgriGPT-Omni: 一种统一的语音-视觉-文本框架用于多语言农业智能

Bo Yang, Lanfei Feng, Yunkui Chen, Yu Zhang, Jianyu Zhang, Xiao Xu, Nueraili Aierken, Shijian Li

机构 * Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 AgriGPT-Omni提出了一种统一的语音-视觉-文本框架,通过数据合成、多阶段训练和三模态基准,提升多语言农业智能的性能和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10403 2025-12-12 cs.SD cs.CL 57%

BRACE: A Benchmark for Robust Audio Caption Quality Evaluation

BRACE:一种用于鲁棒音频描述质量评估的基准

Tianyu Guo, Hongyu Chen, Hao Liang, Meiyi Qiang, Bohan Zeng, Linzhuang Sun, Bin Cui, Wentao Zhang

机构 * Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 BRACE基准用于评估参考自由环境下音频描述质量,揭示CLAP模型和LALM的局限性,推动未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08844 2025-12-12 cs.CY 57%

A Methodology for Quantitative AI Risk Modeling

一种量化AI风险建模的方法论

Malcolm Murray, Steve Barrett, Henry Papadatos, Otter Quarks, Matt Smith, Alejandro Tlaie Boria, Chloé Touzet, Siméon Campos

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 本文提出了一种整合情景构建与定量风险估算的方法论,用于量化AI风险,通过六个步骤系统性地建模潜在危害,并通过实际应用验证其有效性。

Comments The only changes in v2 are some updates to a few arXiv URLs in the references

详情

展开后加载摘要…

URL PDF HTML 收藏