arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-23 至 2025-09-23 共收录 26 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 26 篇

2509.16332 2025-09-23 cs.AI cs.CL 84%

Psychometric Personality Shaping Modulates Capabilities and Safety in Language Models

Stephen Fitz, Peter Romero, Steven Basart, Sipeng Chen, Jose Hernandez-Orallo

机构 * Keio University(keio大学) Universitat Politècnica de València(巴塞罗那理工大学) Center for AI Safety(人工智能安全中心) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17276 2025-09-23 cs.CL cs.AI cs.LG 82%

Probabilistic Token Alignment for Large Language Model Fusion

Runjia Zeng, James Chenhao Liang, Cheng Han, Zhiwen Cao, Jiahao Liu, Xiaojun Quan, Yingjie Victor Chen, Lifu Huang, Tong Geng, Qifan Wang, Dongfang Liu

机构 * Rochester Institute of Technology(罗切斯特理工学院) U.S. Naval Research Laboratory(美国海军研究实验室) University of Missouri-Kansas City(密苏里大学-Kansas城分校) Adobe(Adobe公司) Meituan(美团) Sun Yat-sen University(孙中山大学) Purdue University(普渡大学) UC Davis(加州大学戴维斯分校) University of Rochester(罗切斯特大学) Rice University(莱斯大学) Meta AI

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13742 2025-09-23 cs.LG cs.AI math.OC 81%

Search-Optimized Quantization in Biomedical Ontology Alignment

Oussama Bouaggad, Natalia Grabar

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

Comments Accepted for publication in Frontiers in Artificial Intelligence - Medicine and Public Health (Original Research)

Journal ref Front. Artif. Intell. 8:1662984 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16394 2025-09-23 cs.CL cs.AI cs.HC 81%

Evaluating Behavioral Alignment in Conflict Dialogue: A Multi-Dimensional Comparison of LLM Agents and Humans

Deuksin Kwon, Kaleen Shrestha, Bin Han, Elena Hayoung Lee, Gale Lucas

机构 * University of Southern California(南加州大学) USC for Institute of Creative Technologies(南加州大学创意技术研究所)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16686 2025-09-23 cs.CL 79%

NILE: Internal Consistency Alignment in Large Language Models

Minda Hu, Qiyuan Zhang, Yufei Wang, Bowei He, Hongru Wang, Jingyan Zhou, Liangyou Li, Yasheng Wang, Chen Ma, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University of Edinburgh(爱丁堡大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments This work has been accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17938 2025-09-23 cs.CL 77%

D-REX: A Benchmark for Detecting Deceptive Reasoning in Large Language Models

Satyapriya Krishna, Andy Zou, Rahul Gupta, Eliot Krzysztof Jones, Nick Winter, Dan Hendrycks, J. Zico Kolter, Matt Fredrikson, Spyros Matsoukas

机构 * Amazon Nova Responsible AI(亚马逊Nova负责任的人工智能) Center for AI Safety(人工智能安全中心) CMU(卡内基梅隆大学) Gray Swan AI(灰天鹅人工智能)

专题命中 安全评测 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17559 2025-09-23 cs.CL 74%

Specification-Aware Machine Translation and Evaluation for Purpose Alignment

Yoko Kayano, Saku Sugawara

机构 * The Graduate University for Advanced Studies (SOKENDAI)(高级研究大学(SOKENDAI)) National Institute of Informatics(信息研究所)

专题命中 安全评测 :alignment(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18172 2025-09-23 cs.CL cs.AI 73%

Unmasking Deceptive Visuals: Benchmarking Multimodal Large Language Models on Misleading Chart Question Answering

Zixin Chen, Sicheng Song, Kashun Shum, Yanna Lin, Rui Sheng, Weiqi Wang, Huamin Qu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

Comments 34 pages in total, EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17353 2025-09-23 cs.AI eess.IV physics.med-ph 70%

Medical AI Consensus: A Multi-Agent Framework for Radiology Report Generation and Evaluation

Ahmed T. Elboardy, Ghada Khoriba, Essam A. Rashed

机构 * Graduate School of Information Science, University of Hyogo(京都大学垣田学园信息科学研究生院) Center for Informatics Science, School of Information Technology and Computer Science, Nile University(尼罗大学信息科学中心)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

Comments NeurIPS2025 Workshop: Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10369 2025-09-23 cs.AR cs.AI cs.LG cs.PL 62%

SymRTLO: Enhancing RTL Code Optimization with LLMs and Neuron-Inspired Symbolic Reasoning

Yiting Wang, Wanghao Ye, Ping Guo, Yexiao He, Ziyao Wang, Bowei Tian, Shwai He, Guoheng Sun, Zheyu Shen, Sihan Chen, Ankur Srivastava, Qingfu Zhang, Gang Qu, Ang Li

机构 * University of Maryland, College Park(马里兰大学科帕克分校) City University of Hong Kong(香港城市大学) University of Southern California(南加州大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16072 2025-09-23 cs.AI cs.CL 62%

InMind: Evaluating LLMs in Capturing and Applying Individual Human Reasoning Styles

Zizhen Li, Chuanhao Li, Yibin Wang, Qi Chen, Diping Song, Yukang Feng, Jianwen Sun, Jiaxin Ai, Fanrui Zhang, Mingzhu Sun, Kaipeng Zhang

机构 * Nankai University(南开大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Johns Hopkins University(约翰霍普金斯大学) Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10571 2025-09-23 cs.AI cs.CL 62%

Agentic AI with Orchestrator-Agent Trust: A Modular Visual Classification Framework with Trust-Aware Orchestration and RAG-Based Reasoning

Konstantinos I. Roumeliotis, Ranjan Sapkota, Manoj Karkee, Nikolaos D. Tselikas

机构 * University of the Peloponnese, Department of Informatics and Telecommunications(希腊皮埃蒙特大学信息与电信系) Cornell University, Department of Biological and Environmental Engineering(康奈尔大学生物与环境工程系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00137 2025-09-23 cs.CL cs.IR cs.LG 62%

LaMP-QA: A Benchmark for Personalized Long-form Question Answering

Alireza Salemi, Hamed Zamani

机构 * Center for Intelligent Information Retrieval(智能信息检索中心) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15108 2025-09-23 cs.CL cs.AI cs.HC 62%

A Risk Ontology for Evaluating AI-Powered Psychotherapy Virtual Agents

Ian Steenstra, Timothy W. Bickmore

机构 * Northeastern University(东北大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments This is a preprint version of the paper accepted to IVA'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20383 2025-09-23 cs.LG cs.CL 62%

Why Are Web AI Agents More Vulnerable Than Standalone LLMs? A Security Analysis

Jeffrey Yang Fan Chiang, Seungjae Lee, Jia-Bin Huang, Furong Huang, Yizheng Chen

机构 * University of Maryland(马里兰大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

Comments Project website: http://vulnerable-ai-agents.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14498 2025-09-23 cs.CL 57%

LLaSA: A Sensor-Aware LLM for Natural Language Reasoning of Human Activity from IMU Data

Sheikh Asif Imran, Mohammad Nur Hossain Khan, Subrata Biswas, Bashima Islam

机构 * Worcester Polytechnic Institute(沃斯特理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17249 2025-09-23 cs.CL 57%

Extending Automatic Machine Translation Evaluation to Book-Length Documents

Kuang-Da Wang, Shuoyang Ding, Chao-Han Huck Yang, Ping-Chun Hsieh, Wen-Chih Peng, Vitaly Lavrukhin, Boris Ginsburg

机构 * National Yang Ming Chiao Tung University(国家阳明交通大学) NVIDIA

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted for EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17343 2025-09-23 cs.SE cs.AI 57%

Agentic AI for Software: thoughts from Software Engineering community

Abhik Roychoudhury

机构 * NUS(国立新加坡大学) SonarSource SA

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11023 2025-09-23 cs.LG 57%

Informed, but Not Always Improved: Challenging the Benefit of Background Knowledge in GNNs

Kutalmış Coşkun, Ivo Kavisanczki, Amin Mirzaei, Tom Siegl, Bjarne C. Hiller, Stefan Lüdtke, Martin Becker

机构 * University of Rostock(罗斯托克大学) University of Rostock, University of Marburg(罗斯托克大学、马堡大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments 10 pages, 7 figures, added repo link

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01830 2025-09-23 cs.CL 57%

From Language to Cognition: How LLMs Outgrow the Human Language Network

Badr AlKhamissi, Greta Tuckute, Yingtian Tang, Taha Binhuraib, Antoine Bosselut, Martin Schrimpf

机构 * EPFL(苏黎世联邦理工学院) MIT(麻省理工学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments EMNLP 2025. Project Page at https://language-to-cognition.epfl.ch

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01609 2025-09-23 cs.CL 57%

Adaptive Distraction: Probing LLM Contextual Robustness with Automated Tree Search

Yanbo Wang, Zixiang Xu, Yue Huang, Chujie Gao, Siyuan Wu, Jiayi Ye, Pin-Yu Chen, Xiuying Chen, Xiangliang Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎伊德大学人工智能学院) University of Notre Dame(诺特丹大学) IBM Research(IBM研究院)

专题命中 安全评测 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16543 2025-09-23 cs.CL 57%

ChemOrch: Empowering LLMs with Chemical Intelligence via Synthetic Instructions

Yue Huang, Zhengzhe Jiang, Xiaonan Luo, Kehan Guo, Haomin Zhuang, Yujun Zhou, Zhengqing Yuan, Xiaoqi Sun, Jules Schleinitz, Yanbo Wang, Shuhao Zhang, Mihir Surve, Nitesh V Chawla, Olaf Wiest, Xiangliang Zhang

机构 * Department of Computer Science and Engineering, University of Notre Dame(诺丁汉大学计算机科学与工程系) MIT(麻省理工学院) CalTech(加州理工学院) MBZUAI(穆斯林人工智能研究所) CMU(卡内基梅隆大学) Department of Chemistry & Biochemistry, University of Notre Dame(诺丁汉大学化学与生物化学系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16275 2025-09-23 cs.CR cs.AI cs.SE 57%

SecureFixAgent: A Hybrid LLM Agent for Automated Python Static Vulnerability Repair

Jugal Gajjar, Kamalasankari Subramaniakuppusamy, Relsy Puthal, Kaustik Ranaware

机构 * Computer Science Department(计算机科学系) Applied Economics Department(应用经济学系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 6 pages, 3 figures, 4 tables, 1 algorithm, accepted in the Robustness and Security of Large Language Models (ROSE-LLM) special session at ICMLA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16268 2025-09-23 cs.SE cs.AI 57%

Digging Into the Internal: Causality-Based Analysis of LLM Function Calling

Zhenlan Ji, Daoyuan Wu, Wenxuan Wang, Pingchuan Ma, Shuai Wang, Lei Ma

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18831 2025-09-23 cs.CL 57%

Measuring Risk of Bias in Biomedical Reports: The RoBBR Benchmark

Jianyou Wang, Weili Cao, Longtian Bao, Youze Zheng, Gil Pasternak, Kaicheng Wang, Xiaoyue Wang, Ramamohan Paturi, Leon Bergen

机构 * Laboratory for Emerging Intelligence(新兴智能实验室) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Published at EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16736 2025-09-23 cs.MA cs.CR 50%

Towards Transparent and Incentive-Compatible Collaboration in Decentralized LLM Multi-Agent Systems: A Blockchain-Driven Approach

Minfeng Qi, Tianqing Zhu, Lefeng Zhang, Ningran Li, Wanlei Zhou

专题命中 安全评测 :trustworthy(abstract)

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏