arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-03 至 2025-09-03 共收录 26 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 26 篇

2509.01444 2025-09-03 cs.CY 88%

Strata-Sword: A Hierarchical Safety Evaluation towards LLMs based on Reasoning Complexity of Jailbreak Instructions

Shiji Zhao, Ranjie Duan, Jiexi Liu, Xiaojun Jia, Fengxiang Wang, Cheng Wei, Ruoxi Cheng, Yong Xie, Chang Liu, Qing Guo, Jialing Tao, Hui Xue, Xingxing Wei

专题命中 安全评测 :safety(title,abstract);jailbreak(title,abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01166 2025-09-03 cs.CL cs.AI 81%

Enhancing Large Language Model for Knowledge Graph Completion via Structure-Aware Alignment-Tuning

Yu Liu, Yanan Cao, Xixun Lin, Yanmin Shang, Shi Wang, Shirui Pan

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Griffith University(格里菲斯大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025, Main, Long Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11419 2025-09-03 cs.CL 79%

InsBank: Evolving Instruction Subset for Ongoing Alignment

Jiayi Shi, Yiwei Li, Shaoxiong Feng, Peiwen Yuan, Xinglin Wang, Yueqi Zhang, Chuyi Tan, Boyuan Pan, Huan Ren, Yao Hu, Kan Li

机构 * School of Computer Science, Beijing Institute of Technology(计算机科学学院,北京理工大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16427 2025-09-03 cs.AI 79%

HAICOSYSTEM: An Ecosystem for Sandboxing Safety Risks in Human-AI Interactions

Xuhui Zhou, Hyunwoo Kim, Faeze Brahman, Liwei Jiang, Hao Zhu, Ximing Lu, Frank Xu, Bill Yuchen Lin, Yejin Choi, Niloofar Mireshghallah, Ronan Le Bras, Maarten Sap

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Allen Institute for AI(人工智能研究院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments Both the second and third authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10610 2025-09-03 cs.RO cs.SY eess.SY 78%

Safety-Critical Human-Machine Shared Driving for Vehicle Collision Avoidance based on Hamilton-Jacobi reachability

Shiyue Zhao, Junzhi Zhang, Rui Zhou, Neda Masoud, Jianxiong Li, Helai Huang, Shijie Zhao

专题命中 安全评测 :safety(title,abstract)

Comments 36 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24671 2025-09-03 cs.CL cs.AI 76%

Multiple LLM Agents Debate for Equitable Cultural Alignment

Dayeon Ki, Rachel Rudinger, Tianyi Zhou, Marine Carpuat

机构 * University of Maryland(马里兰大学)

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

Comments ACL 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01209 2025-09-03 cs.CV 71%

Measuring Image-Relation Alignment: Reference-Free Evaluation of VLMs and Synthetic Pre-training for Open-Vocabulary Scene Graph Generation

Maëlic Neau, Zoe Falomir, Cédric Buche, Akihiro Sugimoto

机构 * Computing Science Department, Umeå University(乌梅大学计算科学系) CNRS IRL 2010 CROSSING(法国CNRS IRL 2010 CROSSING) IMT Atlantique(IMT阿蒂昂大学) National Institute of Informatics(日本信息机构)

专题命中 安全评测 :alignment(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13923 2025-09-03 cs.CL 70%

Why Not Transform Chat Large Language Models to Non-English?

Xiang Geng, Ming Zhu, Jiahuan Li, Zhejian Lai, Wei Zou, Shuaijie She, Jiaxin Guo, Xiaofeng Zhao, Yinglu Li, Yuang Li, Chang Su, Yanqing Zhao, Xinglin Lyu, Min Zhang, Jiajun Chen, Hao Yang, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, Nanjing 210023, China(新型软件技术国家重点实验室,南京大学,南京) Translation Services Center, Huawei Inc., Beijing 100085, China(翻译服务部,华为公司,北京)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-025-50646-z}

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20108 2025-09-03 cs.LG cs.IT math.IT stat.ML 70%

Graded Transformers

Tony Shaska

机构 * Department of Mathematics Statistics, Oakland University, Rochester, MI 48309

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00806 2025-09-03 cs.CL cs.AI cs.LG 67%

CaresAI at BioCreative IX Track 1 -- LLM for Biomedical QA

Reem Abdel-Salam, Mary Adewunmi, Modinat A. Abayomi

机构 * Cairo University, Faculty of Engineering, Computer Engineering Department(开罗大学工程学院计算机工程系) Menzies School of Health Research, Charles Darwin University, NT, Australia(梅恩兹健康研究学院,查尔斯达尔文大学,澳大利亚NT) Department of Biology, Boston College, Massachusetts, USA(生物学系,波士顿学院,马萨诸塞州,美国) Peoples' Friendship University of Russia (RUDN University)(俄罗斯人民友谊大学(RUDN大学)) Joint Institute for Nuclear Research(联合核研究中心) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Skövde(斯德哥尔摩大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Proceedings of the BioCreative IX Challenge and Workshop (BC9): Large Language Models for Clinical and Biomedical NLP at the International Joint Conference on Artificial Intelligence (IJCAI), Montreal, Canada, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02350 2025-09-03 cs.CL cs.AI 62%

Implicit Reasoning in Large Language Models: A Comprehensive Survey

Jindong Li, Yali Fu, Li Fan, Jiahong Liu, Yao Shu, Chengwei Qin, Menglin Yang, Irwin King, Rex Ying

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Jilin University(吉林大学) The Chinese University of Hong Kong(香港中文大学) Yale University(耶鲁大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00414 2025-09-03 cs.CL cs.AI cs.IR 62%

MedSEBA: Synthesizing Evidence-Based Answers Grounded in Evolving Medical Literature

Juraj Vladika, Florian Matthes

机构 * Technical University of Munich Department of Computer Science(慕尼黑技术大学计算机科学系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments Accepted to CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07407 2025-09-03 cs.AI cs.CL cs.MA 62%

A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems

Jinyuan Fang, Yanwen Peng, Xi Zhang, Yingxu Wang, Xinhao Yi, Guibin Zhang, Yi Xu, Bin Wu, Siwei Liu, Zihao Li, Zhaochun Ren, Nikos Aletras, Xi Wang, Han Zhou, Zaiqiao Meng

机构 * University of Glasgow(格拉斯哥大学) University of Sheffield(谢菲尔德大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) National University of Singapore(新加坡国家大学) University of Cambridge(剑桥大学) University College London(伦敦大学学院) University of Aberdeen(阿伯丁大学) Leiden University(莱顿大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments Github Repo: https://github.com/EvoAgentX/Awesome-Self-Evolving-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09318 2025-09-03 cs.CL cs.AI 62%

Benchmarking LLMs for Mimicking Child-Caregiver Language in Interaction

Jing Liu, Abdellah Fourtassi

机构 * ENS, PSL Research University, EHESS, CNRS, France(巴黎社会科学高等学院、巴黎综合理工研究大学、高等社会科学研究院、法国国家科学研究中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18190 2025-09-03 cs.AI cs.DB cs.IR 57%

ST-Raptor: LLM-Powered Semi-Structured Table Question Answering

Zirui Tang, Boyu Niu, Xuanhe Zhou, Boxiu Li, Wei Zhou, Jiannan Wang, Guoliang Li, Xinyi Zhang, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Simon Fraser University(西蒙弗雷泽大学) Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Extension of our SIGMOD 2026 paper. Please refer to source code available at: https://github.com/weAIDB/ST-Raptor

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09889 2025-09-03 cs.AI 57%

Profile-Aware Maneuvering: A Dynamic Multi-Agent System for Robust GAIA Problem Solving by AWorld

Zhitian Xie, Qintong Wu, Chengyue Yu, Chenyi Zhuang, Jinjie Gu

机构 * AWorld Team, Inclusion AI(Inclusion AI团队)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20435 2025-09-03 cs.CY 57%

Assessing the Sustainability and Trustworthiness of Federated Learning Models

Chao Feng, Alberto Huertas Celdran, Pedro Miguel Sanchez Sanchez, Lynn Zumtaugwald, Gerome Bovet, Burkhard Stiller

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00936 2025-09-03 cs.AI 57%

UrbanInsight: A Distributed Edge Computing Framework with LLM-Powered Data Filtering for Smart City Digital Twins

Kishor Datta Gupta, Md Manjurul Ahsan, Mohd Ariful Haque, Roy George, Azmine Toushik Wasi

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00425 2025-09-03 cs.CL 57%

The Gold Medals in an Empty Room: Diagnosing Metalinguistic Reasoning in LLMs with Camlang

Fenghua Liu, Yulong Chen, Yixuan Liu, Zhujun Jin, Solomon Tsai, Ming Zhong

机构 * University of Cambridge(剑桥大学) University of Oxford(牛津大学) UIUC(伊利诺伊大学香槟分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00029 2025-09-03 cs.SD cs.AI cs.MM eess.AS 57%

From Sound to Sight: Towards AI-authored Music Videos

Leo Vitasovic, Stella Graßhof, Agnes Mercedes Kloft, Ville V. Lehtola, Martin Cunneen, Justyna Starostka, Glenn McGarry, Kun Li, Sami S. Brandt

机构 * IT University of Copenhagen(哥本哈根IT大学) Aalto University(艾尔沃斯大学) University of Twente(特文特大学) University of Limerick(利默里克大学) University of Nottingham(诺丁汉大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments 1st Workshop on Generative AI for Storytelling (AISTORY), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00010 2025-09-03 physics.ao-ph cs.LG 57%

CERA: A Framework for Improved Generalization of Machine Learning Models to Changed Climates

Shuchang Liu, Paul A. O'Gorman

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06794 2025-09-03 cs.CV cs.CL 57%

Does Acceleration Cause Hidden Instability in Vision Language Models? Uncovering Instance-Level Divergence Through a Large-Scale Empirical Study

Yizheng Sun, Hao Li, Chang Xu, Hongpeng Zhou, Chenghua Lin, Riza Batista-Navarro, Jingyuan Sun

机构 * University of Manchester(曼彻斯特大学) Microsoft Research(微软研究院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02540 2025-09-03 eess.SP 50%

LLM-Enhanced Space-Air-Ground-Sea Integrated Networks

Halvin Yang, Sangarapillai Lambotharan, Mahsa Derakhshani, Lajos Hanzo

专题命中 安全评测 :trustworthy(abstract)

Comments 6 figures, 7 pages, magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02150 2025-09-03 cs.SE 50%

Txt2Sce: Scenario Generation for Autonomous Driving System Testing Based on Textual Reports

Pin Ji, Yang Feng, Zongtai Li, Xiangchi Zhou, Jia Liu, Jun Sun, Zhihong Zhao

专题命中 安全评测 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01460 2025-09-03 cs.HC 50%

Dissecting Atomic Facts: Visual Analytics for Improving Fact Annotations in Language Model Evaluation

Manuel Schmidt, Daniel A. Keim, Frederik L. Dennig

专题命中 安全评测 :alignment(abstract)

Comments 2 pages text plus poster, 2 figures, LaTeX

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00751 2025-09-03 cs.CV 50%

EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions

Dinh-Khoi Vo, Van-Loc Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南国家大学科学学院)

专题命中 安全评测 :alignment(abstract)

Comments ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏