arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-24 至 2025-10-24 共收录 24 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 24 篇

2509.25271 2025-10-24 cs.AI cs.CV cs.LG cs.MA 81%

RADAR: A Risk-Aware Dynamic Multi-Agent Framework for LLM Safety Evaluation via Role-Specialized Collaboration

Xiuyuan Chen, Jian Zhao, Yuchen Yuan, Tianle Zhang, Huilin Zhou, Zheng Zhu, Ping Hu, Linghe Kong, Chi Zhang, Weiran Huang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) University of Science and Technology of China(中国科学技术大学) GigaAI School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15086 2025-10-24 cs.CL 79%

Is Safety Standard Same for Everyone? User-Specific Safety Evaluation of Large Language Models

Yeonjun In, Wonjoong Kim, Kanghoon Yoon, Sungchul Kim, Mehrab Tanjim, Sangwu Park, Kibum Kim, Chanyoung Park

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20099 2025-10-24 cs.AI cs.CE cs.CL 73%

AI PB: A Grounded Generative Agent for Personalized Investment Insights

Daewoo Park, Suho Park, Inseok Hong, Hanwool Lee, Junkyu Park, Sangjun Lee, Jeongman An, Hyunbin Loh

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20188 2025-10-24 cs.AI 70%

TRUST: A Decentralized Framework for Auditing Large Language Model Reasoning

Morris Yu-Chao Huang, Zhen Tan, Mohan Zhang, Pingzhi Li, Zhuo Zhang, Tianlong Chen

专题命中 安全评测 :harmlessness(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20612 2025-10-24 cs.CY cs.AI cs.CR cs.LG econ.GN q-fin.EC 67%

Black Box Absorption: LLMs Undermining Innovative Ideas

Wenjun Cao

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20039 2025-10-24 cs.HC cs.AI cs.CL cs.CY 67%

Beyond One-Way Influence: Bidirectional Opinion Dynamics in Multi-Turn Human-LLM Interactions

Yuyang Jiang, Longjie Guo, Yuchen Wu, Aylin Caliskan, Tanu Mitra, Hua Shen

机构 * University of Chicago(芝加哥大学) New York University(纽约大学) University of Washington(华盛顿大学) New York University Shanghai(纽约大学上海)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20611 2025-10-24 cs.LG cs.AI 62%

PSO-XAI: A PSO-Enhanced Explainable AI Framework for Reliable Breast Cancer Detection

Mirza Raquib, Niloy Das, Farida Siddiqi Prity, Arafath Al Fahim, Saydul Akbar Murad, Mohammad Amzad Hossain, MD Jiabul Hoque, Mohammad Ali Moni

机构 * Department of Information and Communication Engineering, Noakhali Science and Technology University(信息与通信工程系,诺阿克利科学与技术大学) Department of Computer Science & Engineering, Netrokona University(计算机科学与工程系,纳特罗克纳大学) Department of Computer and Communication Engineering, International Islamic University Chittagong(计算机与通信工程系,国际伊斯兰大学查塔格ONG) Department of Mechatronics and Industrial Engineering, Chittagong University of Engineering and Technology(机电与工业工程系,查塔格ONG工程与技术大学) School of Computing Sciences and Computer Engineering, University of Southern Mississippi(计算科学与计算机工程学院,密西西比州立大学) AI & Digital Health Technology, Artificial Intelligence and Cyber Futures Institute, Charles Sturt University(人工智能与数字健康技术,人工智能与网络未来研究院,查尔斯·斯图尔特大学) AI & Digital Health Technology, Rural Health Research Institute, Charles Sturt University(人工智能与数字健康技术,农村健康研究学院,查尔斯·斯图尔特大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20270 2025-10-24 cs.LG cs.CL 62%

ImpossibleBench: Measuring LLMs' Propensity of Exploiting Test Cases

Ziqian Zhong, Aditi Raghunathan, Nicholas Carlini

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20211 2025-10-24 cs.SE cs.AI cs.LG 62%

Automated Cloud Infrastructure-as-Code Reconciliation with AI Agents

Zhenning Yang, Hui Guan, Victor Nicolet, Brandon Paulsen, Joey Dodds, Daniel Kroening, Ang Chen

机构 * University of Michigan(密歇根大学) Amazon Web Services(亚马逊网络服务)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20193 2025-10-24 cs.IR cs.CL cs.CV cs.LG 62%

Multimedia-Aware Question Answering: A Review of Retrieval and Cross-Modal Reasoning Architectures

Rahul Raja, Arpita Vats

机构 * Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

Comments In Proceedings of the 2nd ACM Workshop in AI-powered Question and Answering Systems (AIQAM '25), October 27-28, 2025, Dublin, Ireland. ACM, New York, NY, USA, 8 pages. https://doi.org/10.1145/3746274.3760393

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11824 2025-10-24 cs.MA cs.AI cs.LG 62%

Empirical Study on Robustness and Resilience in Cooperative Multi-Agent Reinforcement Learning

Simin Li, Zihao Mao, Hanxiao Li, Zonglei Jing, Zhuohang bian, Jun Guo, Li Wang, Zhuoran Han, Ruixiao Xu, Xin Yu, Chengdong Ma, Yuqing Ma, Bo An, Yaodong Yang, Weifeng Lv, Xianglong Liu

机构 * State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) Beihang University(北京航空航天大学) Zhongguancun Laboratory(中关村实验室) Institute of Artificial Intelligence, Peking University(北京大学人工智能研究院) Institute of data space, Hefei Comprehensive National Science Center(合肥综合国家科学中心数据空间研究院) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments 44 pages, 16 figures, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07142 2025-10-24 cs.CL cs.AI cs.DL 62%

Toward Purpose-oriented Topic Model Evaluation enabled by Large Language Models

Zhiyin Tan, Jennifer D'Souza

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted for publication in International Journal on Digital Libraries (IJDL)

Journal ref International Journal on Digital Libraries, vol. 26, no. 4, pp. 23, December 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11261 2025-10-24 cs.AI cs.CL 62%

Sycophancy in Vision-Language Models: A Systematic Analysis and an Inference-Time Mitigation Framework

Yunpu Zhao, Rui Zhang, Junbin Xiao, Changxin Ke, Ruibo Hou, Yifan Hao, Ling Li

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(处理器国家重点实验室,中国科学院计算技术研究所) Department of Computer Science, National University of Singapore(计算机科学系,新加坡国立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Intelligent Software Research Center, Institute of Software, Chinese Academy of Sciences(软件智能研究中心,中国科学院软件研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Journal ref Neurocomputing, Volume 659, 2026, 131217

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19866 2025-10-24 cs.CL cs.AI 62%

An Evaluation of the Pedagogical Soundness and Usability of AI-Generated Lesson Plans Across Different Models and Prompt Frameworks in High-School Physics

Xincheng Liu

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 20 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20612 2025-10-24 cs.CV cs.CL cs.LG 62%

Roboflow100-VL: A Multi-Domain Object Detection Benchmark for Vision-Language Models

Peter Robicheaux, Matvei Popov, Anish Madan, Isaac Robinson, Joseph Nelson, Deva Ramanan, Neehar Peri

机构 * Roboflow Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

Comments The first two authors contributed equally. This work has been accepted to the Neural Information Processing Systems (NeurIPS) 2025 Datasets & Benchmark Track. Project Page: https://rf100-vl.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20699 2025-10-24 q-fin.CP cs.AI 57%

Fusing Narrative Semantics for Financial Volatility Forecasting

Yaxuan Kong, Yoontae Hwang, Marcus Kaiser, Chris Vryonides, Roel Oomen, Stefan Zohren

机构 * University of Oxford(牛津大学) Pusan National University(釜山国立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments The 6th ACM International Conference on AI in Finance (ICAIF 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20337 2025-10-24 cs.AI 57%

Collateral Damage Assessment Model for AI System Target Engagement in Military Operations

Clara Maathuis, Kasper Cools

机构 * Open University of the Netherlands(荷兰开放大学) Royal Military Academy, Belgium(比利时皇家军事学院) Vrije Universiteit Brussel, Belgium(比利时自由大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments Accepted at MILCOM 2025 WS07

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11145 2025-10-24 cs.CL cs.PL 57%

Text2Mem: A Unified Memory Operation Language for Memory Operating System

Yi Wang, Lihai Yang, Boyu Chen, Gongyi Zou, Kerun Xu, Bo Tang, Feiyu Xiong, Siheng Chen, Zhiyu Li

机构 * MemTensor (Shanghai) Technology(MemTensor(上海)技术有限公司) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments 12 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02464 2025-10-24 cs.CL 57%

SpecEval: Evaluating Model Adherence to Behavior Specifications

Ahmed Ahmed, Kevin Klyman, Yi Zeng, Sanmi Koyejo, Percy Liang

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) The Bradley Department of Electrical and Computer Engineering, Virginia Tech(电气与计算机工程系,弗吉尼亚理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20352 2025-10-24 cs.CL 57%

RMTBench: Benchmarking LLMs Through Multi-Turn User-Centric Role-Playing

Hao Xiang, Tianyi Tang, Yang Su, Bowen Yu, An Yang, Fei Huang, Yichang Zhang, Yaojie Lu, Hongyu Lin, Xianpei Han, Jingren Zhou, Junyang Lin, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19271 2025-10-24 cs.SE cs.AI cs.PL 57%

Fine-Tuning Multilingual Language Models for Code Review: An Empirical Study on Industrial C# Projects

Igli Begolli, Meltem Aksoy, Daniel Neider

机构 * Technical University Dortmund, Lovion GmbH(图鲁尼大学,洛维昂公司) Security\ Alliance Ruhr, Technical University Dortmund(安全联盟鲁尔,图鲁尼大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16247 2025-10-24 cs.CV cs.LG 57%

OpenMIBOOD: Open Medical Imaging Benchmarks for Out-Of-Distribution Detection

Max Gutbrod, David Rauber, Danilo Weber Nunes, Christoph Palm

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments Updated results for NNGuide and ViM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19836 2025-10-24 cs.AI cs.SY eess.SY 57%

Benchmarking Reasoning Reliability in Artificial Intelligence Models for Energy-System Analysis

Eliseo Curcio

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20284 2025-10-24 cs.CV 50%

Knowledge-Informed Neural Network for Complex-Valued SAR Image Recognition

Haodong Yang, Zhongling Huang, Shaojie Guo, Zhe Zhang, Gong Cheng, Junwei Han

机构 * School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院) School of Artificial Intelligence, Chongqing University of Posts and Telecommunications(重庆邮电大学人工智能学院) Aerospace Information Technology University(航天信息大学) Suzhou Aerospace Information Research Institute(苏州航天信息研究所) National Key Laboratory of Microwave Imaging(微波成像国家重点实验室) Aerospace Information Research Institute, CAS(中国科学院航天信息研究所) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子、电气与通信工程学院)

专题命中 安全评测 :trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏