arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-18 至 2025-11-18 共收录 95 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2508.21669 2025-11-18 cs.CR 78%

Cybersecurity AI: Hacking the AI Hackers via Prompt Injection

Víctor Mayoral-Vilches, Per Mannermaa Rynning

专题命中 提示注入 :prompt injection(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与事实性 8 篇

2511.13290 2025-11-18 cs.AI cs.CL cs.CY 82%

Dropouts in Confidence: Moral Uncertainty in Human-LLM Alignment

Jea Kwon, Luiz Felipe Vecchietti, Sungwon Park, Meeyoung Cha

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00091 2025-11-18 cs.AI cs.CL 81%

Ensemble Debates with Local Large Language Models for AI Alignment

Ephraiem Sarabamoun

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments The manuscript is being withdrawn to incorporate additional revisions and improvements

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12661 2025-11-18 cs.CL 70%

Reason-KE++: Aligning the Process, Not Just the Outcome, for Faithful LLM Knowledge Editing

Yuchen Wu, Liang Ding, Li Shen, Dacheng Tao

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Sydney(悉尼大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05810 2025-11-18 cs.AI cs.CL cs.LG 67%

DiagnoLLM: A Hybrid Bayesian Neural Language Framework for Interpretable Disease Diagnosis

Bowen Xu, Xinyue Zeng, Jiazhen Hu, Tuo Wang, Adithya Kulkarni

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01956 2025-11-18 cs.LG cs.CY stat.ML 62%

EXAGREE: Mitigating Explanation Disagreement with Stakeholder-Aligned Models

Sichao Li, Tommy Liu, Quanling Deng, Amanda S. Barnard

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12579 2025-11-18 cs.AI 57%

Enhancing Conversational Recommender Systems with Tree-Structured Knowledge and Pretrained Language Models

Yongwen Ren, Chao Wang, Peng Du, Chuan Qin, Dazhong Shen, Hui Xiong

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04832 2025-11-18 cs.CL 57%

Joint Evaluation of Answer and Reasoning Consistency for Hallucination Detection in Large Reasoning Models

Changyue Wang, Weihang Su, Qingyao Ai, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Quan Cheng Laboratory(泉城实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11984 2025-11-18 cs.CV 50%

From Classification to Cross-Modal Understanding: Leveraging Vision-Language Models for Fine-Grained Renal Pathology

Zhenhao Guo, Rachit Saluja, Tianyuan Yao, Quan Liu, Junchao Zhu, Haibo Wang, Daniel Reisenbüchler, Yuankai Huo, Benjamin Liechty, David J. Pisapia, Kenji Ikemura, Steven Salvatoree, Surya Seshane, Mert R. Sabuncu, Yihe Yang, Ruining Deng

机构 * New York University(纽约大学) Cornell Tech(康奈尔科技) Vanderbilt University(范德比大学) Carnegie Mellon University(卡内基梅隆大学) University of Regensburg(莱茵河畔大学) Weill Cornell Medicine(韦尔·科恩医学中心) Northwell Health(北well健康)

专题命中 幻觉与事实性 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 隐私与版权 4 篇

2506.05925 2025-11-18 cs.CY cs.AI 73%

Small Models, Big Support: A Local LLM Framework for Educator-Centric Content Creation and Assessment with RAG and CAG

Zarreen Reza, Alexander Mazur, Michael T. Dugdale, Robin Ray-Chaudhuri

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13373 2025-11-18 cs.LG cs.AI 62%

A Novel Hierarchical Integration Method for Efficient Model Merging in Medical LLMs

Prakrit Timilsina, Anuj Nepal, Rajan Kadel, Robin Doss

机构 * Deakin Cyber Research(德肯网络研究) Innovation Centre Deakin University / Universal Higher Education Melbourne, Australia(德肯大学创新中心/通用高等教育墨尔本,澳大利亚) School of IT(信息科技学院) Engineering Melbourne Institute of Technology Melbourne, Australia(工程墨尔本技术学院墨尔本,澳大利亚) Innovation Centre Deakin University Geelong, Australia(德肯大学创新中心吉朗,澳大利亚)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11591 2025-11-18 cs.AI cs.CL 62%

LLM-Generated Negative News Headlines Dataset: Creation and Benchmarking Against Real Journalism

Olusola Babalola, Bolanle Ojokoh, Olutayo Boyinbode

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI

Comments 50 pages, 19 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09862 2025-11-18 cs.LG 57%

RadarLLM: Empowering Large Language Models to Understand Human Motion from Millimeter-Wave Point Cloud Sequence

Zengyuan Lai, Jiarui Yang, Songpengcheng Xia, Lizhou Lin, Lan Sun, Renwen Wang, Jianran Liu, Qi Wu, Ling Pei

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

Comments Accepted by AAAI 2026 (extended version with supplementary materials)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 安全评测 31 篇

2502.12659 2025-11-18 cs.CY cs.AI 84%

The Hidden Risks of Large Reasoning Models: A Safety Assessment of R1

Kaiwen Zhou, Chengzhi Liu, Xuandong Zhao, Shreedhar Jangam, Jayanth Srinivasa, Gaowen Liu, Dawn Song, Xin Eric Wang

机构 * UC Santa Cruz(加州大学圣克ruz分校) UC Santa Barbara(加州大学圣芭芭拉分校) UC Berkeley(加州大学伯克利分校) Cisco Research(思科研究)

专题命中 安全评测 :safety(title,abstract);prompt injection(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03138 2025-11-18 cs.AI 83%

DeepKnown-Guard: A Proprietary Model-Based Safety Response Framework for AI Agents

Qi Li, Jianjun Xu, Pingtao Wei, Jiu Li, Peiqiang Zhao, Jiwei Shi, Xuan Zhang, Yanhui Yang, Xiaodong Hui, Peng Xu, Wenqin Shao

机构 * Beijing Caizhi Tech(北京彩智科技)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12155 2025-11-18 cs.LG 83%

Rethinking Deep Alignment Through The Lens Of Incomplete Learning

Thong Bach, Dung Nguyen, Thao Minh Le, Truyen Tran

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.LG

Comments AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12668 2025-11-18 cs.CR cs.AI cs.LG 79%

AI Bill of Materials and Beyond: Systematizing Security Assurance through the AI Risk Scanning (AIRS) Framework

Samuel Nathanson, Alexander Lee, Catherine Chen Kieffer, Jared Junkin, Jessica Ye, Amir Saeed, Melanie Lockhart, Russ Fink, Elisha Peterson, Lanier Watkins

机构 * Johns Hopkins University Applied Physics Laboratory (APL)(约翰霍普金斯大学应用物理实验室)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

Comments 13 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01668 2025-11-18 cs.AI 74%

Hybrid Retrieval-Augmented Generation Agent for Trustworthy Legal Question Answering in Judicial Forensics

Yueqing Xi, Yifan Bai, Huasen Luo, Weiliang Wen, Hui Liu, Haoliang Li

机构 * Department of Electronic Engineering, City University of Hong Kong(DongGuan)(香港城市大学(东莞)电子工程系) Department of Electronic Engineering, City University of Hong Kong(香港城市大学电子工程系)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12014 2025-11-18 cs.CL cs.HC 74%

CURE: Cultural Understanding and Reasoning Evaluation - A Framework for "Thick" Culture Alignment Evaluation in LLMs

Truong Vo, Sanmi Koyejo

专题命中 安全评测 :alignment(title);分类 cs.CL

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11759 2025-11-18 cs.CR cs.AI cs.CY 73%

Can AI Models be Jailbroken to Phish Elderly Victims? An End-to-End Evaluation

Fred Heiding, Simon Lermen

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24796 2025-11-18 cs.CY cs.AI 73%

Mutual Wanting in Human--AI Interaction: Empirical Evidence from Large-Scale Analysis of GPT Model Transitions

HaoYang Shang, Xuan Liu

机构 * BreathingCORE

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13670 2025-11-18 cs.HC cs.AI 70%

Person-AI Bidirectional Fit - A Proof-Of-Concept Case Study Of Augmented Human-Ai Symbiosis In Management Decision-Making Process

Agnieszka Bieńkowska, Jacek Małecki, Alexander Mathiesen-Ohman, Katarzyna Tworek

机构 * Department of Management Systems and Organizational Development, Faculty of Management, Wrocław University of Science and Technology(管理系统与组织发展系,管理学院,沃林大学科学与技术学院) Department of Mathematics, Faculty of Mathematics, Wrocław University of Science and Technology(数学系,数学学院,沃林大学科学与技术学院) AMOTHO Research Institute, Vallsjön 20, 780 00 Rörbäcksnäs, Sweden(AMOTHO研究所)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

Comments 30 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13381 2025-11-18 cs.CL 70%

Can Large Language Models Function as Qualified Pediatricians? A Systematic Evaluation in Real-World Clinical Contexts

Siyu Zhu, Mouxiao Bian, Yue Xie, Yongyu Tang, Zhikang Yu, Tianbin Li, Pengcheng Chen, Bing Han, Jie Xu, Xiaoyan Dong

机构 * Shanghai Children’s Hospital, School of Medicine,Shanghai Jiao Tong University(上海儿童医学中心,上海交通大学医学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai University of Traditional Chinese Medicine(上海中医药大学) University of Washington(华盛顿大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15621 2025-11-18 cs.SE 67%

DSCodeBench: A Realistic Benchmark for Data Science Code Generation

Shuyin Ouyang, Dong Huang, Jingwen Guo, Zeyu Sun, Qihao Zhu, Jie M. Zhang

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08824 2025-11-18 cs.RO cs.AI cs.CL cs.CY 67%

LLM-Driven Robots Risk Enacting Discrimination, Violence, and Unlawful Actions

Andrew Hundt, Rumaisa Azeem, Masoumeh Mansouri, Martim Brandão

机构 * Carnegie Mellon University(卡内基梅隆大学) King’s College London(伦敦国王学院) University of Birmingham(伯明翰大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Published in International Journal of Social Robotics (2025). 49 pages (65 with references and appendix), 27 Figures, 8 Tables. Andrew Hundt and Rumaisa Azeem are equal contribution co-first authors. The positions of the two co-first authors were swapped from arxiv version 1 with the written consent of all four authors. The Version of Record is available via DOI: 10.1007/s12369-025-01301-x

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13712 2025-11-18 cs.LG cs.AI 62%

From Black Box to Insight: Explainable AI for Extreme Event Preparedness

Kiana Vu, İsmet Selçuk Özer, Phung Lai, Zheng Wu, Thilanka Munasinghe, Jennifer Wei

机构 * Department of Cybersecurity University at Albany, SUNY Albany, NY, USA Dept. of Atmospheric \& Environmental Sciences University at Albany, SUNY Albany, NY, USA Lally School of Management Rensselaer Polytechnic Institute Albany, NY, USA Goddard Space Flight Center NASA Greenbelt, MD, USA

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04688 2025-11-18 cs.CL cs.LG 62%

Evaluating LLMs' Reasoning Over Ordered Procedural Steps

Adrita Anika, Md Messal Monem Miah

机构 * Amazon(亚马逊公司) Texas A&M University(德克萨斯A&M大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

Comments Accepted to IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11691 2025-11-18 cs.LG cs.AI cs.SD 62%

Beyond saliency: enhancing explanation of speech emotion recognition with expert-referenced acoustic cues

Seham Nasr, Zhao Ren, David Johnson

机构 * Center for Cognitive Interaction Technology (CITEC), Bielefeld University, Germany(认知交互技术中心(CITEC),比勒菲尔德大学,德国) Cognitive Systems Lab, University of Bremen, Germany(认知系统实验室,不莱梅大学,德国)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11597 2025-11-18 cs.AI cs.CL 62%

CLINB: A Climate Intelligence Benchmark for Foundational Models

Michelle Chen Huebscher, Katharine Mach, Aleksandar Stanić, Markus Leippold, Ben Gaiarin, Zeke Hausfather, Elisa Rawat, Erich Fischer, Massimiliano Ciaramita, Joeri Rogelj, Christian Buck, Lierni Sestorain Saralegui, Reto Knutti

机构 * University of Miami(迈阿密大学) University of Zurich(苏黎世大学) Stripe(Stripe公司) ETH Zurich(苏黎世联邦理工学院) Imperial College London(伦敦帝国理工学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments Questions, system prompt and model judge prompts available here: https://www.kaggle.com/datasets/deepmind/clinb-questions

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11583 2025-11-18 cs.LG cs.AI cs.IR 62%

Parallel and Multi-Stage Knowledge Graph Retrieval for Behaviorally Aligned Financial Asset Recommendations

Fernando Spadea, Oshani Seneviratne

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 3 figures, RAGE-KG 2025

详情

展开后加载摘要…

URL PDF HTML 收藏