arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-30 至 2025-09-30 共收录 26 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 26 篇

2509.25086 2025-09-30 cs.CL 86%

Towards Trustworthy Lexical Simplification: Exploring Safety and Efficiency with Small LLMs

Akio Hayakawa, Stefan Bott, Horacio Saggion

机构 * Department of Engineering, Universitat Pompeu Fabra(工程系,庞培法布拉大学)

专题命中 安全评测 :safety(title,abstract);trustworthy(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12482 2025-09-30 cs.AI 83%

Tiered Agentic Oversight: A Hierarchical Multi-Agent System for Healthcare Safety

Yubin Kim, Hyewon Jeong, Chanwoo Park, Eugene Park, Haipeng Zhang, Xin Liu, Hyeonhoon Lee, Daniel McDuff, Marzyeh Ghassemi, Cynthia Breazeal, Samir Tulebaev, Hae Won Park

机构 * Massachusetts Institute of Technology(麻省理工学院) Google Research(谷歌研究) Harvard Medical School(哈佛医学院) Seoul National University Hospital(首尔国立大学医院)

专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23783 2025-09-30 cs.AI 79%

Falcon: A Cross-Modal Evaluation Dataset for Comprehensive Safety Perception

Qi Xue, Minrui Jiang, Runjia Zhang, Xiurui Xie, Pei Ke, Guisong Liu

机构 * Laboratory of Intelligent Collaborative Computing University of Electronic Science and Technology of China(智能协同计算实验室 电子科技大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23760 2025-09-30 cs.CV 78%

UniAlignment: Semantic Alignment for Unified Image Generation, Understanding, Manipulation and Perception

Xinyang Song, Libin Wang, Weining Wang, Shaozhen Liu, Dandan Zheng, Jingdong Chen, Qi Li, Zhenan Sun

机构 * Ant Group(蚂蚁集团)

专题命中 安全评测 :alignment(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21943 2025-09-30 cs.AI cs.LG 73%

Outlier Detection in Plantar Pressure: Human-Centered Comparison of Statistical Parametric Mapping and Explainable Machine Learning

Carlo Dindorf, Jonas Dully, Steven Simon, Dennis Perchthaler, Stephan Becker, Hannah Ehmann, Kjell Heitmann, Bernd Stetter, Christian Diers, Michael Fröhlich

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13068 2025-09-30 cs.CL cs.AI 73%

Accuracy is Not Agreement: Expert-Aligned Evaluation of Crash Narrative Classification Models

Sudesh Ramesh Bhagat, Ibne Farabi Shihab, Anuj Sharma

机构 * Institute for Transportation(交通研究所) Iowa State University(爱荷华州立大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Journal ref 2025 IEEE 28th International Conference on Intelligent Transportation

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22376 2025-09-30 cs.LG cs.AI cs.CL cs.CV 67%

Rare-to-Frequent: Unlocking Compositional Generation Power of Diffusion Models on Rare Concepts with LLM Guidance

Dongmin Park, Sebin Kim, Taehong Moon, Minkyu Kim, Kangwook Lee, Jaewoong Cho

机构 * KRAFTON Seoul National University(首尔国立大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14279 2025-09-30 cs.CL cs.CY cs.LG 67%

GRILE: A Benchmark for Grammar Reasoning and Explanation in Romanian LLMs

Adrian-Marius Dumitran, Alexandra-Mihaela Danila, Angela-Liliana Dumitran

机构 * University of Bucharest Faculty of Mathematics and Computer Science(布加勒斯大学数学与计算机科学学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.CY、cs.LG

Comments Accepted as long paper @RANLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24389 2025-09-30 cs.CL cs.AI 62%

LLaDA-MoE: A Sparse MoE Diffusion Language Model

Fengqi Zhu, Zebin You, Yipeng Xing, Zenan Huang, Lin Liu, Yihong Zhuang, Guoshan Lu, Kangyu Wang, Xudong Wang, Lanning Wei, Hongrui Guo, Jiaqi Hu, Wentao Ye, Tieyuan Chen, Chenchen Li, Chengfu Tang, Haibo Feng, Jun Hu, Jun Zhou, Xiaolu Zhang, Zhenzhong Lan, Junbo Zhao, Da Zheng, Chongxuan Li, Jianguo Li, Ji-Rong Wen

机构 * Renmin University of China(中国人民大学) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13359 2025-09-30 cs.CY cs.AI 62%

Evaluating undergraduate mathematics examinations in the era of generative AI: a curriculum-level case study

Benjamin J. Walker, Nikoleta Kalaydzhieva, Beatriz Navarro Lameda, Ruth A. Reynolds

机构 * Department of Mathematics(数学系) University College London(伦敦大学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15524 2025-09-30 cs.CL cs.AI 62%

IPBench: Benchmarking the Knowledge of Large Language Models in Intellectual Property

Qiyao Wang, Guhong Chen, Hongbo Wang, Huaren Liu, Minghui Zhu, Zhifei Qin, Linwei Li, Yilin Yue, Shiqiang Wang, Jiayan Li, Yihang Wu, Ziqiang Liu, Longze Chen, Run Luo, Liyang Fan, Jiaming Li, Lei Zhang, Kan Xu, Chengming Li, Hamid Alinejad-Rokny, Shiwen Ni, Yuan Lin, Min Yang

机构 * Shenzhen Key Laboratory for High Performance Data Mining, Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences, China(深圳高性能数据挖掘重点实验室,深圳先进技术研究院,中国科学院,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国) Dalian University of Technology, China(大连理工大学,中国) School of Biomedical Engineering, UNSW Sydney, Australia(生物医学工程学院,新南威尔士大学悉尼分校,澳大利亚) Shenzhen MSU-BIT University, China(深圳MSU-BIT大学,中国) Shenzhen University of Advanced Technology, China(深圳大学先进技术学院,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 71 pages, 75 figures, 53 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23695 2025-09-30 cs.LG cs.AI 62%

Estimating Time Series Foundation Model Transferability via In-Context Learning

Qingren Yao, Ming Jin, Chengqi Zhang, Chao-Han Huck Yang, Jun Qi, Shirui Pan

机构 * Griffith University(格里菲斯大学) Hong Kong Baptist University(香港 Baptist 大学) The Hong Kong Polytechnic University(香港理工大学) NVIDIA Research(NVIDIA 研究)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22799 2025-09-30 cs.CV cs.AI cs.CL 62%

VideoScore2: Think before You Score in Generative Video Evaluation

Xuan He, Dongfu Jiang, Ping Nie, Minghao Liu, Zhengxuan Jiang, Mingyi Su, Wentao Ma, Junru Lin, Chun Ye, Yi Lu, Keming Wu, Benjamin Schneider, Quy Duc Do, Zhuofeng Li, Yiming Jia, Yuxuan Zhang, Guo Cheng, Haozhe Wang, Wangchunshu Zhou, Qunshu Lin, Yuanxing Zhang, Ge Zhang, Wenhao Huang, Wenhu Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Waterloo(滑铁卢大学) Independent(独立) M-A-P University of Toronto(多伦多大学) Zhejiang University(浙江大学) Abaka AI

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22715 2025-09-30 cs.CL cs.AI 62%

TRUEBench: Can LLM Response Meet Real-world Constraints as Productivity Assistant?

Jiho Park, Jongyoon Song, Minjin Choi, Kyuho Heo, Taehun Huh, Ji Won Kim

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04153 2025-09-30 cs.CL cs.AI 62%

UltraIF: Advancing Instruction Following from the Wild

Kaikai An, Li Sheng, Ganqu Cui, Shuzheng Si, Ning Ding, Yu Cheng, Baobao Chang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24816 2025-09-30 cs.CL 57%

KnowGuard: Knowledge-Driven Abstention for Multi-Round Clinical Reasoning

Xilin Dang, Kexin Chen, Xiaorui Su, Ayush Noori, Iñaki Arango, Lucas Vittor, Xinyi Long, Yuyang Du, Marinka Zitnik, Pheng Ann Heng

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24443 2025-09-30 cs.AI cs.ET cs.SE 57%

A Systematic Review of Digital Twin-Driven Predictive Maintenance in Industrial Engineering: Taxonomy, Architectural Elements, and Future Research Directions

Leila Ismail, Abdelmoneim Abdelmoti, Arkaprabha Basu, Aymen Dia Eddine Berini, Mohammad Naouss

机构 * Intelligent Distributed Computing and Systems (INDUCE) Lab, Department of Computer Science and Software Engineering, College of Information Technology, United Arab Emirates University, Al-Ain, United Arab Emirates, Emirates Center for Mobility Research, United Arab Emirates University, Al-Ain, United Arab Emirates(智能分布式计算与系统实验室,计算机科学与软件工程系,信息科技学院,阿联酋大学,阿恩,阿联酋,移动性研究中心,阿联酋大学,阿恩,阿联酋) Department of Architectural Engineering, College of Engineering, United Arab Emirates University, Al-Ain, United Arab Emirates(建筑工程系,工程学院,阿联酋大学,阿恩,阿联酋) Department of Information Systems and Security, College of Information Technology, United Arab Emirates University, Al-Ain, United Arab Emirates(信息系统与安全系,信息科技学院,阿联酋大学,阿恩,阿联酋) Department of Computer and Network Engineering, United Arab Emirates University, Al-Ain, United Arab Emirates(计算机与网络工程系,阿联酋大学,阿恩,阿联酋)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24127 2025-09-30 cs.AI cs.DB 57%

Transparent, Evaluable, and Accessible Data Agents: A Proof-of-Concept Framework

Nooshin Bahador

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22582 2025-09-30 cs.CL 57%

Fine-Grained Detection of Context-Grounded Hallucinations Using LLMs

Yehonatan Peisakhovsky, Zorik Gekhman, Yosi Mass, Liat Ein-Dor, Roi Reichart

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03418 2025-09-30 cs.CL 57%

Which Words Matter Most in Zero-Shot Prompts?

Nikta Gohari Sadr, Sangmitra Madhusudan, Hassan Sajjad, Ali Emami

机构 * Brock University(布罗克大学) Dalhousie University(达尔豪斯大学) Emory University(埃默里大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments 8 pages (excluding references)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23757 2025-09-30 cs.AI cs.CV 57%

Transparent Visual Reasoning via Object-Centric Agent Collaboration

Benjamin Teoh, Ben Glocker, Francesca Toni, Avinash Kori

机构 * Imperial College London, UK(伦敦帝国学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22834 2025-09-30 cs.NI cs.AI 57%

Bridging Language Models and Formal Methods for Intent-Driven Optical Network Design

Anis Bekri, Amar Abane, Abdella Battou, Saddek Bensalem

机构 * National Institute of Standards and Technology(美国国家标准技术研究院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments Accepted at AICCSA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21143 2025-09-30 cs.RO cs.CL 57%

Automotive-ENV: Benchmarking Multimodal Agents in Vehicle Interface Systems

Junfeng Yan, Biao Wu, Meng Fang, Ling Chen

机构 * Australian Artificial Intelligence Institute(澳大利亚人工智能研究所) University of Liverpool(利物浦大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments 10 pages, 5 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10036 2025-09-30 cs.CL 57%

DataPuzzle: Breaking Free from the Hallucinated Promise of LLMs in Data Analysis

Zhengxuan Zhang, Zhuowen Liang, Yin Wu, Teng Lin, Yuyu Luo, Nan Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23991 2025-09-30 cs.CV 50%

RPG360: Robust 360 Depth Estimation with Perspective Foundation Models and Graph Optimization

Dongki Jung, Jaehoon Choi, Yonghan Lee, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学 College Park 分校)

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23251 2025-09-30 cs.MM cs.SD 50%

XGC-AVis: Towards Audio-Visual Content Understanding with a Multi-Agent Collaborative System

Yuqin Cao, Xiongkuo Min, Yixuan Gao, Wei Sun, Zicheng Zhang, Jinliang Han, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏