arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9346 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9346 篇

2509.12476 2025-09-19 cs.CL 70%

Audited Reasoning Refinement: Fine-Tuning Language Models via LLM-Guided Step-Wise Evaluation and Correction

Sumanta Bhattacharyya, Sara Riazi, Pedram Rooshenas

专题命中 安全评测 :alignment(abstract);DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11507 2025-09-16 cs.AI 70%

MedicalOS: An LLM Agent based Operating System for Digital Healthcare

Jared Zhu, Junde Wu

机构 * University of Oxford(牛津大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09686 2025-09-16 cs.IR cs.AI 70%

GeoGPT-RAG Technical Report

Fei Huang, Fan Wu, Zeqing Zhang, Qihao Wang, Long Zhang, Grant Michael Boquet, Hongyang Chen

机构 * GeoGPT Team(GeoGPT团队) Zhejiang Lab(浙江实验室)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

Comments 19 pages, 10 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05199 2025-09-08 cs.CL 70%

Triadic Fusion of Cognitive, Functional, and Causal Dimensions for Explainable LLMs: The TAXAL Framework

David Herrera-Poyatos, Carlos Peláez-González, Cristina Zuheros, Virilo Tejedor, Rosana Montes, Francisco Herrera

机构 * Department of Computer Science and Artificial Intelligence(计算机科学与人工智能系) Andalusian Institute of Data Science and Computational Intelligence(安达卢西亚数据科学与计算智能研究所) University of Granada(格拉纳达大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

Comments 27 pages, 9 tables and 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04979 2025-09-08 cs.AI 70%

Internet 3.0: Architecture for a Web-of-Agents with it's Algorithm for Ranking Agents

Rajesh Tembarai Krishnamachari, Srividya Rajesh

机构 * NYU(纽约大学) Independent Researcher(独立研究者)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20986 2025-09-08 cs.CY econ.TH 70%

MAD Chairs: A new tool to evaluate AI

Chris Santos-Lang

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CY

Comments 17 pages, 1 figure, reproduced with permission from Springer Nature from Coordination, Organizations, Institutions, Norms, and Ethics for Governance of Multi-Agent Systems XVIII (COINE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12100 2025-09-04 cs.CR cs.AI 70%

LLM Embedding-based Attribution (LEA): Quantifying Source Contributions to Generative Model's Response for Vulnerability Analysis

Reza Fayyazi, Michael Zuzak, Shanchieh Jay Yang

机构 * Rochester Institute of Technology(罗切斯特技术学院) Gonzaga University(戈兹加大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13923 2025-09-03 cs.CL 70%

Why Not Transform Chat Large Language Models to Non-English?

Xiang Geng, Ming Zhu, Jiahuan Li, Zhejian Lai, Wei Zou, Shuaijie She, Jiaxin Guo, Xiaofeng Zhao, Yinglu Li, Yuang Li, Chang Su, Yanqing Zhao, Xinglin Lyu, Min Zhang, Jiajun Chen, Hao Yang, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, Nanjing 210023, China(新型软件技术国家重点实验室,南京大学,南京) Translation Services Center, Huawei Inc., Beijing 100085, China(翻译服务部,华为公司,北京)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-025-50646-z}

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20108 2025-09-03 cs.LG cs.IT math.IT stat.ML 70%

Graded Transformers

Tony Shaska

机构 * Department of Mathematics Statistics, Oakland University, Rochester, MI 48309

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20776 2025-08-29 cs.CV cs.AI 70%

Safer Skin Lesion Classification with Global Class Activation Probability Map Evaluation and SafeML

Kuniko Paxton, Koorosh Aslansefat, Amila Akagić, Dhavalkumar Thakker, Yiannis Papadopoulos

机构 * School of Computer Science, University of Hull(赫尔大学计算机科学学院) Faculty of Electrical Engineering, University of Sarajevo(萨拉热窝大学电气工程学院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20737 2025-08-29 cs.SE cs.AI 70%

Rethinking Testing for LLM Applications: Characteristics, Challenges, and a Lightweight Interaction Protocol

Wei Ma, Yixiao Yang, Qiang Hu, Shi Ying, Zhi Jin, Bo Du, Zhenchang Xing, Tianlin Li, Junjie Shi, Yang Liu, Linxiao Jiang

机构 * Singapore Management University Singapore Capital Normal University Beijing China Tianjin University Tianjin China Wuhan University China CSIRO's Data61 \& Australian National University Australia Nanyang Technological University Singapore Singapore Management University Capital Normal University Tianjin University Wuhan University CSIRO's Data61 \& Australian National University Nanyang Technological University

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18076 2025-08-29 cs.CL 70%

Neither Valid nor Reliable? Investigating the Use of LLMs as Judges

Khaoula Chehbouni, Mohammed Haddou, Jackie Chi Kit Cheung, Golnoosh Farnadi

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克AI研究所) Statistics Canada(加拿大统计局)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

Comments Prepared for conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16850 2025-08-26 cs.AI 70%

RADAR: A Reasoning-Guided Attribution Framework for Explainable Visual Data Analysis

Anku Rani, Aparna Garimella, Apoorv Saxena, Balaji Vasan Srinivasan, Paul Pu Liang

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14925 2025-08-22 cs.CR cs.LG 70%

MCPTox: A Benchmark for Tool Poisoning Attack on Real-World MCP Servers

Zhiqiang Wang, Yichao Gao, Yanting Wang, Suyuan Liu, Haifeng Sun, Haoran Cheng, Guanquan Shi, Haohua Du, Xiangyang Li

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06225 2025-08-19 cs.AI 70%

Overconfidence in LLM-as-a-Judge: Diagnosis and Confidence-Driven Solution

Zailong Tian, Zhuoheng Han, Yanzhe Chen, Haozhe Xu, Xi Yang, Richeng Xuan, Houfeng Wang, Lizi Liao

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11647 2025-08-19 cs.LO cs.AI 70%

Categorical Construction of Logically Verifiable Neural Architectures

Logan Nye

机构 * Carnegie Mellon University School of Computer Science(卡内基梅隆大学计算机科学学院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10146 2025-08-15 cs.AI 70%

Agentic AI Frameworks: Architectures, Protocols, and Design Challenges

Hana Derouiche, Zaki Brahmi, Haithem Mazeni

机构 * University of Kairouan(卡鲁安大学) SMART Lab, University of Tunis(图纳大学SMART实验室) University of Sousse(索斯大学) Riadi Lab, Compus Manouba(曼努巴大学里亚迪实验室) University of Jandouba(贾杜巴大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14097 2025-07-21 cs.AI cs.CV 70%

Generative AI-Driven High-Fidelity Human Motion Simulation

Hari Iyer, Neel Macwan, Atharva Jitendra Hude, Heejin Jeong, Shenghan Guo

机构 * The Polytechnic School, Ira A. Fulton Schools of Engineering, Arizona State University(亚利桑那州立大学工程学院Polytechnic学院) School of Manufacturing Systems and Networks, Ira A. Fulton Schools of Engineering, Arizona State University(亚利桑那州立大学工程学院制造系统与网络学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09588 2025-07-15 cs.AI 70%

eSapiens: A Platform for Secure and Auditable Retrieval-Augmented Generation

Isaac Shi, Zeyuan Li, Fan Liu, Wenli Wang, Lewei He, Yang Yang, Tianyu Shi

机构 * eSapiens Team(eSapiens团队)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02986 2025-07-09 cs.CL 70%

GAF-Guard: An Agentic Framework for Risk Management and Governance in Large Language Models

Seshu Tirupathi, Dhaval Salwala, Elizabeth Daly, Inge Vejsbjerg

机构 * IBM Research Europe(IBM欧洲研究院)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22270 2025-07-01 cs.CY 70%

Public Service Algorithm: towards a transparent, explainable, and scalable content curation for news content based on editorial values

Ahmad Mel, Sebastien Noir

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CY

Journal ref IAMCR 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04043 2025-06-05 cs.CL cs.AI cs.CY cs.HC cs.LG 70%

Think Like a Person Before Responding: A Multi-Faceted Evaluation of Persona-Guided LLMs for Countering Hate

Mikel K. Ngueajio, Flor Miriam Plaza-del-Arco, Yi-Ling Chung, Danda B. Rawat, Amanda Cercas Curry

机构 * Howard University(霍华德大学) LIACS, Leiden University(莱顿大学LIACS) Genaios(基因奥斯) CENTAI Institute(CENTAI研究院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Accepted at ACL WOAH 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07071 2025-06-03 cs.AI 70%

Value Compass Benchmarks: A Platform for Fundamental and Validated Evaluation of LLMs Values

Jing Yao, Xiaoyuan Yi, Shitong Duan, Jindong Wang, Yuzhuo Bai, Muhua Huang, Peng Zhang, Tun Lu, Zhicheng Dou, Maosong Sun, Xing Xie

机构 * Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学) Tsinghua University(清华大学) The University of Chicago(芝加哥大学) Renmin University of China(中国人民大学) William & Mary(威廉与玛丽大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23559 2025-05-30 cs.AI 70%

SafeScientist: Toward Risk-Aware Scientific Discoveries by LLM Agents

Kunlun Zhu, Jiaxun Zhang, Ziheng Qi, Nuoxing Shang, Zijia Liu, Peixuan Han, Yue Su, Haofei Yu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21741 2025-05-29 cs.MA cs.CY cs.IR 70%

AI-Supported Platform for System Monitoring and Decision-Making in Nuclear Waste Management with Large Language Models

Dongjune Chang, Sola Kim, Young Soo Park

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CY

Journal ref Proceedings of the WM2025 Conference, March 9-13, 2025, Phoenix, Arizona, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19690 2025-05-27 cs.AI 70%

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models

Baihui Zheng, Boren Zheng, Kerui Cao, Yingshui Tan, Zhendong Liu, Weixun Wang, Jiaheng Liu, Jian Yang, Wenbo Su, Xiaoyong Zhu, Bo Zheng, Kaifu Zhang

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12798 2025-05-20 cs.AI 70%

BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language Models

Yige Li, Hanxun Huang, Yunhan Zhao, Xingjun Ma, Jun Sun

机构 * Singapore Management University(新加坡管理大学) The University of Melbourne(墨尔本大学) Fudan University(复旦大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13365 2025-05-01 cs.CY 70%

Generative AI and the problem of existential risk

Lynette Webb

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CY

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15579 2025-04-29 cs.CV cs.CL 70%

An Explainable Biomedical Foundation Model via Large-Scale Concept-Enhanced Vision-Language Pre-training

Yuxiang Nie, Sunan He, Yequan Bie, Yihui Wang, Zhixuan Chen, Shu Yang, Zhiyuan Cai, Hongmei Wang, Xi Wang, Luyang Luo, Mingxiang Wu, Xian Wu, Ronald Cheong Kin Chan, Yuk Ming Lau, Yefeng Zheng, Pranav Rajpurkar, Hao Chen

机构 * Shenzhen People’s Hospital(深圳人民医院) The Chinese University of Hong Kong(香港中文大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09593 2025-04-18 cs.CR cs.LG 70%

ControlNET: A Firewall for RAG-based LLM System

Hongwei Yao, Haoran Shi, Yidou Chen, Yixin Jiang, Cong Wang, Zhan Qin

专题命中 安全评测 :prompt injection(abstract);harmlessness(abstract);分类 cs.LG

Comments Project Page: https://ai.zjuicsr.cn/firewall

详情

展开后加载摘要…

URL PDF HTML 收藏