arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-18 至 2025-09-18 共收录 17 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 17 篇

2509.13339 2025-09-18 cs.AI 89%

Position: AI Safety Must Embrace an Antifragile Perspective

Ming Jin, Hyunin Lee

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI

Journal ref Proceedings of the 42nd International Conference on Machine Learning, Vancouver, Canada. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18325 2025-09-18 cs.AI cs.LG 84%

Understanding and Mitigating Overrefusal in LLMs from an Unveiling Perspective of Safety Decision Boundary

Licheng Pan, Yongqi Tong, Xin Zhang, Xiaolu Zhang, Jun Zhou, Zhixuan Chu

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) Language and Machine Intelligence Department, Ant Group(蚂蚁集团语言与机器智能部门)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08380 2025-09-18 cs.AI cs.LG 81%

Co-Investigator AI: The Rise of Agentic AI for Smarter, Trustworthy AML Compliance Narratives

Prathamesh Vasudeo Naik, Naresh Kumar Dintakurthi, Zhanghao Hu, Yue Wang, Robby Qiu

专题命中 安全评测 :trustworthy(title);alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13569 2025-09-18 cs.CL 79%

Overview of Dialog System Evaluation Track: Dimensionality, Language, Culture and Safety at DSTC 12

John Mendonça, Lining Zhang, Rahul Mallidi, Alon Lavie, Isabel Trancoso, Luis Fernando D'Haro, João Sedoc

机构 * INESC-ID Instituto Superior Técnico - University of Lisbon(理工学院 - 里斯本大学) Department of Technology, Operations, and Statistics, New York University(技术、运营与统计系,纽约大学) Speech Technology and Machine Learning Group - Universidad Politécnica de Madrid(语音技术与机器学习小组 - 马德里理工大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments DSTC12 Track 1 Overview Paper. https://chateval.org/dstc12

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19546 2025-09-18 cs.CL cs.AI 79%

Language Models Identify Ambiguities and Exploit Loopholes

Jio Choi, Mohit Bansal, Elias Stengel-Eskin

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 camera-ready; Code: https://github.com/esteng/ambiguous-loophole-exploitation

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15871 2025-09-18 cs.CY cs.AI cs.CL 75%

A Comprehensive Survey on the Trustworthiness of Large Language Models in Healthcare

Manar Aljohani, Jun Hou, Sindhura Kommu, Xuan Wang

机构 * Virginia Tech(维吉尼亚理工大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17514 2025-09-18 cs.AI 74%

TAI Scan Tool: A RAG-Based Tool With Minimalistic Input for Trustworthy AI Self-Assessment

Athanasios Davvetas, Xenia Ziouvelou, Ypatia Dami, Alexios Kaponis, Konstantina Giouvanopoulou, Michael Papademas

专题命中 安全评测 :trustworthy(title);分类 cs.AI

Comments 9 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23804 2025-09-18 cs.CL cs.AI cs.LG 67%

Calibrating LLMs for Text-to-SQL Parsing by Leveraging Sub-clause Frequencies

Terrance Liu, Shuyi Wang, Daniel Preotiuc-Pietro, Yash Chandarana, Chirag Gupta

机构 * Carnegie Mellon University(卡内基梅隆大学) Bloomberg(彭博)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10970 2025-09-18 cs.LG cs.AI 62%

The Psychogenic Machine: Simulating AI Psychosis, Delusion Reinforcement and Harm Enablement in Large Language Models

Joshua Au Yeung, Jacopo Dalmasso, Luca Foschini, Richard JB Dobson, Zeljko Kraljevic

机构 * King’s College Hospital(国王学院医院) Nuraxi AI Dev and Doc: AI for Healthcare(Nuraxi AI 人工智能医疗) Sage Bionetworks(Sage 生物网络) University College London(伦敦大学学院) King’s College London(国王学院伦敦)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13680 2025-09-18 cs.SE cs.AI 57%

Prompt Stability in Code LLMs: Measuring Sensitivity across Emotion- and Personality-Driven Variations

Wei Ma, Yixiao Yang, Jingquan Ge, Xiaofei Xie, Lingxiao Jiang

机构 * Singapore Management University(新加坡国立大学) Capital Normal University(首都师范大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13369 2025-09-18 eess.SY cs.CY cs.HC cs.SY 57%

Right-to-Override for Critical Urban Control Systems: A Deliberative Audit Method for Buildings, Power, and Transport

Rashid Mushkani

专题命中 安全评测 :safety(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08364 2025-09-18 cs.AI 57%

Learning Like Humans: Advancing LLM Reasoning Capabilities via Adaptive Difficulty Curriculum Learning and Expert-Guided Self-Reformulation

Enci Zhang, Xingang Yan, Wei Lin, Tianxiang Zhang, Qianchun Lu

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments 14 pages, 3 figs

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17671 2025-09-18 cs.MA cs.AI 57%

ComfyGPT: A Self-Optimizing Multi-Agent System for Comprehensive ComfyUI Workflow Generation

Oucheng Huang, Yuhang Ma, Zeng Zhao, Mingrui Wu, Jiayi Ji, Rongsheng Zhang, Zhipeng Hu, Xiaoshuai Sun, Rongrong Ji

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15022 2025-09-18 cs.CL 57%

Mind the Style Gap: Meta-Evaluation of Style and Attribute Transfer Metrics

Amalie Brogaard Pauli, Isabelle Augenstein, Ira Assent

机构 * Department of Computer Science, Aarhus University, Denmark(计算机科学系,奥胡斯大学) Department of Computer Science, University of Copenhagen, Denmark(计算机科学系,哥本哈根大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted at EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13731 2025-09-18 cs.RO 50%

Reinforcement Learning for Robotic Insertion of Flexible Cables in Industrial Settings

Jeongwoo Park, Seabin Lee, Changmin Park, Wonjong Lee, Changjoo Nam

机构 * Dept. of Electronic Engineering, Sogang University(电子工程系,成均馆大学) Dept. of Artificial Intelligence, Sogang University(人工智能系,成均馆大学)

专题命中 安全评测 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13629 2025-09-18 cs.CV 50%

SAMIR, an efficient registration framework via robust feature learning from SAM

Yue He, Min Liu, Qinghao Liu, Jiazheng Wang, Yaonan Wang, Hang Zhang, Xiang Chen

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10426 2025-09-18 cs.RO cs.MA 50%

DECAMP: Towards Scene-Consistent Multi-Agent Motion Prediction with Disentangled Context-Aware Pre-Training

Jianxin Shi, Zengqi Peng, Xiaolong Chen, Tianyu Wo, Jun Ma

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (GZ)(香港科技大学(广州)机器人与自主系统方向) Division of Emerging Interdisciplinary Areas, The Hong Kong University of Science and Technology(香港科技大学新兴交叉领域研究所)

专题命中 安全评测 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏