arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-30 至 2025-09-30 共收录 101 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 26 篇

2508.14279 2025-09-30 cs.CL cs.CY cs.LG 67%

GRILE: A Benchmark for Grammar Reasoning and Explanation in Romanian LLMs

Adrian-Marius Dumitran, Alexandra-Mihaela Danila, Angela-Liliana Dumitran

机构 * University of Bucharest Faculty of Mathematics and Computer Science(布加勒斯大学数学与计算机科学学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.CY、cs.LG

Comments Accepted as long paper @RANLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24389 2025-09-30 cs.CL cs.AI 62%

LLaDA-MoE: A Sparse MoE Diffusion Language Model

Fengqi Zhu, Zebin You, Yipeng Xing, Zenan Huang, Lin Liu, Yihong Zhuang, Guoshan Lu, Kangyu Wang, Xudong Wang, Lanning Wei, Hongrui Guo, Jiaqi Hu, Wentao Ye, Tieyuan Chen, Chenchen Li, Chengfu Tang, Haibo Feng, Jun Hu, Jun Zhou, Xiaolu Zhang, Zhenzhong Lan, Junbo Zhao, Da Zheng, Chongxuan Li, Jianguo Li, Ji-Rong Wen

机构 * Renmin University of China(中国人民大学) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13359 2025-09-30 cs.CY cs.AI 62%

Evaluating undergraduate mathematics examinations in the era of generative AI: a curriculum-level case study

Benjamin J. Walker, Nikoleta Kalaydzhieva, Beatriz Navarro Lameda, Ruth A. Reynolds

机构 * Department of Mathematics(数学系) University College London(伦敦大学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15524 2025-09-30 cs.CL cs.AI 62%

IPBench: Benchmarking the Knowledge of Large Language Models in Intellectual Property

Qiyao Wang, Guhong Chen, Hongbo Wang, Huaren Liu, Minghui Zhu, Zhifei Qin, Linwei Li, Yilin Yue, Shiqiang Wang, Jiayan Li, Yihang Wu, Ziqiang Liu, Longze Chen, Run Luo, Liyang Fan, Jiaming Li, Lei Zhang, Kan Xu, Chengming Li, Hamid Alinejad-Rokny, Shiwen Ni, Yuan Lin, Min Yang

机构 * Shenzhen Key Laboratory for High Performance Data Mining, Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences, China(深圳高性能数据挖掘重点实验室,深圳先进技术研究院,中国科学院,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国) Dalian University of Technology, China(大连理工大学,中国) School of Biomedical Engineering, UNSW Sydney, Australia(生物医学工程学院,新南威尔士大学悉尼分校,澳大利亚) Shenzhen MSU-BIT University, China(深圳MSU-BIT大学,中国) Shenzhen University of Advanced Technology, China(深圳大学先进技术学院,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 71 pages, 75 figures, 53 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23695 2025-09-30 cs.LG cs.AI 62%

Estimating Time Series Foundation Model Transferability via In-Context Learning

Qingren Yao, Ming Jin, Chengqi Zhang, Chao-Han Huck Yang, Jun Qi, Shirui Pan

机构 * Griffith University(格里菲斯大学) Hong Kong Baptist University(香港 Baptist 大学) The Hong Kong Polytechnic University(香港理工大学) NVIDIA Research(NVIDIA 研究)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22799 2025-09-30 cs.CV cs.AI cs.CL 62%

VideoScore2: Think before You Score in Generative Video Evaluation

Xuan He, Dongfu Jiang, Ping Nie, Minghao Liu, Zhengxuan Jiang, Mingyi Su, Wentao Ma, Junru Lin, Chun Ye, Yi Lu, Keming Wu, Benjamin Schneider, Quy Duc Do, Zhuofeng Li, Yiming Jia, Yuxuan Zhang, Guo Cheng, Haozhe Wang, Wangchunshu Zhou, Qunshu Lin, Yuanxing Zhang, Ge Zhang, Wenhao Huang, Wenhu Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Waterloo(滑铁卢大学) Independent(独立) M-A-P University of Toronto(多伦多大学) Zhejiang University(浙江大学) Abaka AI

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22715 2025-09-30 cs.CL cs.AI 62%

TRUEBench: Can LLM Response Meet Real-world Constraints as Productivity Assistant?

Jiho Park, Jongyoon Song, Minjin Choi, Kyuho Heo, Taehun Huh, Ji Won Kim

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04153 2025-09-30 cs.CL cs.AI 62%

UltraIF: Advancing Instruction Following from the Wild

Kaikai An, Li Sheng, Ganqu Cui, Shuzheng Si, Ning Ding, Yu Cheng, Baobao Chang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24816 2025-09-30 cs.CL 57%

KnowGuard: Knowledge-Driven Abstention for Multi-Round Clinical Reasoning

Xilin Dang, Kexin Chen, Xiaorui Su, Ayush Noori, Iñaki Arango, Lucas Vittor, Xinyi Long, Yuyang Du, Marinka Zitnik, Pheng Ann Heng

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24443 2025-09-30 cs.AI cs.ET cs.SE 57%

A Systematic Review of Digital Twin-Driven Predictive Maintenance in Industrial Engineering: Taxonomy, Architectural Elements, and Future Research Directions

Leila Ismail, Abdelmoneim Abdelmoti, Arkaprabha Basu, Aymen Dia Eddine Berini, Mohammad Naouss

机构 * Intelligent Distributed Computing and Systems (INDUCE) Lab, Department of Computer Science and Software Engineering, College of Information Technology, United Arab Emirates University, Al-Ain, United Arab Emirates, Emirates Center for Mobility Research, United Arab Emirates University, Al-Ain, United Arab Emirates(智能分布式计算与系统实验室,计算机科学与软件工程系,信息科技学院,阿联酋大学,阿恩,阿联酋,移动性研究中心,阿联酋大学,阿恩,阿联酋) Department of Architectural Engineering, College of Engineering, United Arab Emirates University, Al-Ain, United Arab Emirates(建筑工程系,工程学院,阿联酋大学,阿恩,阿联酋) Department of Information Systems and Security, College of Information Technology, United Arab Emirates University, Al-Ain, United Arab Emirates(信息系统与安全系,信息科技学院,阿联酋大学,阿恩,阿联酋) Department of Computer and Network Engineering, United Arab Emirates University, Al-Ain, United Arab Emirates(计算机与网络工程系,阿联酋大学,阿恩,阿联酋)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24127 2025-09-30 cs.AI cs.DB 57%

Transparent, Evaluable, and Accessible Data Agents: A Proof-of-Concept Framework

Nooshin Bahador

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22582 2025-09-30 cs.CL 57%

Fine-Grained Detection of Context-Grounded Hallucinations Using LLMs

Yehonatan Peisakhovsky, Zorik Gekhman, Yosi Mass, Liat Ein-Dor, Roi Reichart

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03418 2025-09-30 cs.CL 57%

Which Words Matter Most in Zero-Shot Prompts?

Nikta Gohari Sadr, Sangmitra Madhusudan, Hassan Sajjad, Ali Emami

机构 * Brock University(布罗克大学) Dalhousie University(达尔豪斯大学) Emory University(埃默里大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments 8 pages (excluding references)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23757 2025-09-30 cs.AI cs.CV 57%

Transparent Visual Reasoning via Object-Centric Agent Collaboration

Benjamin Teoh, Ben Glocker, Francesca Toni, Avinash Kori

机构 * Imperial College London, UK(伦敦帝国学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22834 2025-09-30 cs.NI cs.AI 57%

Bridging Language Models and Formal Methods for Intent-Driven Optical Network Design

Anis Bekri, Amar Abane, Abdella Battou, Saddek Bensalem

机构 * National Institute of Standards and Technology(美国国家标准技术研究院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments Accepted at AICCSA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21143 2025-09-30 cs.RO cs.CL 57%

Automotive-ENV: Benchmarking Multimodal Agents in Vehicle Interface Systems

Junfeng Yan, Biao Wu, Meng Fang, Ling Chen

机构 * Australian Artificial Intelligence Institute(澳大利亚人工智能研究所) University of Liverpool(利物浦大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments 10 pages, 5 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10036 2025-09-30 cs.CL 57%

DataPuzzle: Breaking Free from the Hallucinated Promise of LLMs in Data Analysis

Zhengxuan Zhang, Zhuowen Liang, Yin Wu, Teng Lin, Yuyu Luo, Nan Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23991 2025-09-30 cs.CV 50%

RPG360: Robust 360 Depth Estimation with Perspective Foundation Models and Graph Optimization

Dongki Jung, Jaehoon Choi, Yonghan Lee, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学 College Park 分校)

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23251 2025-09-30 cs.MM cs.SD 50%

XGC-AVis: Towards Audio-Visual Content Understanding with a Multi-Agent Collaborative System

Yuqin Cao, Xiongkuo Min, Yixuan Gao, Wei Sun, Zicheng Zhang, Jinliang Han, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 3 篇

2406.09264 2025-09-30 cs.HC cs.AI cs.CL 81%

Position: Towards Bidirectional Human-AI Alignment

Hua Shen, Tiffany Knearem, Reshmi Ghosh, Kenan Alkiek, Kundan Krishna, Yachuan Liu, Ziqiao Ma, Savvas Petridis, Yi-Hao Peng, Li Qiwei, Sushrita Rakshit, Chenglei Si, Yutong Xie, Jeffrey P. Bigham, Frank Bentley, Joyce Chai, Zachary Lipton, Qiaozhu Mei, Rada Mihalcea, Michael Terry, Diyi Yang, Meredith Ringel Morris, Paul Resnick, David Jurgens

机构 * NYU Shanghai, New York University(纽约大学上海研究院,纽约大学) MBZUAI(穆桑大学人工智能研究所) Microsoft(微软公司) University of Michigan(密歇根大学) Apple(苹果公司) Google(谷歌公司) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2025 Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22709 2025-09-30 cs.CY cs.SY eess.SY 70%

Trust and Transparency in AI: Industry Voices on Data, Ethics, and Compliance

Louise McCormack, Diletta Huyskes, Dave Lewis, Malika Bendechache

专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13758 2025-09-30 cs.CY 57%

Towards Evaluting Fake Reasoning Bias in Language Models

Qian Wang, Zhenheng Tang, Zhanzhi Lou, Nuo Chen, Wenxuan Wang, Bingsheng He

专题命中 AI治理与伦理 :DPO(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 19 篇

2505.11939 2025-09-30 eess.SP cs.AI cs.LG 81%

Fine-grained Contrastive Learning for ECG-Report Alignment with Waveform Enhancement

Haitao Li, Che Liu, Zhengyao Ding, Ziyi Liu, Wenqi Shao, Zhengxing Huang

机构 * Zhejiang University(浙江大学) Imperial College London(伦敦帝国学院) Transtek Medical Electronics Co., Ltd(Transtek医疗电子有限公司) Shanghai AI Lab(上海AI实验室)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22697 2025-09-30 cs.CV cs.AI cs.LG 81%

Learning Hyperspectral Images with Curated Text Prompts for Efficient Multimodal Alignment

Abhiroop Chatterjee, Susmita Ghosh

机构 * Jadavpur University(贾瓦帕尔大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

Comments Accepted at the IEEE/CVF International Conference on Computer Vision (ICCV 2025), Workshop on Curated Data for Efficient Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24338 2025-09-30 cs.CL 79%

AlignX: Advancing Multilingual Large Language Models with Multilingual Representation Alignment

Mengyu Bu, Shaolei Zhang, Zhongjun He, Hua Wu, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(智能信息处理重点实验室,计算技术研究所,中国科学院) Key Laboratory of AI Safety, Chinese Academy of Sciences(人工智能安全重点实验室,中国科学院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Baidu Inc.(百度公司)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Main Conference. The code will be available at https://github.com/ictnlp/AlignX

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22503 2025-09-30 cs.RO cs.AI cs.MA 79%

Communication-Efficient Desire Alignment for Embodied Agent-Human Adaptation

Yuanfei Wang, Xinju Huang, Fangwei Zhong, Yaodong Yang, Yizhou Wang, Yuanpei Chen, Hao Dong

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15548 2025-09-30 cs.SD 71%

Versatile Symbolic Music-for-Music Modeling via Function Alignment

Junyan Jiang, Daniel Chin, Liwei Lin, Xuanjie Liu, Gus Xia

专题命中 其他安全 :alignment(title)

Journal ref The 26th conference of the International Society for Music Information Retrieval (ISMIR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15182 2025-09-30 cs.CL cs.AI cs.LG 67%

ReflAct: World-Grounded Decision Making in LLM Agents via Goal-State Reflection

Jeonghye Kim, Sojeong Rhee, Minbeom Kim, Dohyung Kim, Sangmook Lee, Youngchul Sung, Kyomin Jung

机构 * KAIST(韩国科学技术院) Seoul National University(首尔国立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24216 2025-09-30 cs.CL cs.CY 62%

MoVa: Towards Generalizable Classification of Human Morals and Values

Ziyu Chen, Junfei Sun, Chenxi Li, Tuan Dung Nguyen, Jing Yao, Xiaoyuan Yi, Xing Xie, Chenhao Tan, Lexing Xie

机构 * The Australian National University(澳大利亚国立大学) University of Chicago(芝加哥大学) University of Pennsylvania(宾夕法尼亚大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.CY

Comments 9 pages, 10 figures and tables, EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11425 2025-09-30 cs.SD cs.AI cs.CL eess.AS 62%

FuseCodec: Semantic-Contextual Fusion and Supervision for Neural Codecs

Md Mubtasim Ahasan, Rafat Hasan Khan, Tasnim Mohiuddin, Aman Chadha, Tariq Iqbal, M Ashraful Amin, Amin Ahsan Ali, Md Mofijul Islam, A K M Mahbubur Rahman

机构 * Center for Computational & Data Sciences, Independent University, Bangladesh(计算与数据科学中心,独立大学,孟加拉国) Amazon GenAI(亚马逊生成人工智能) Qatar Computing Research Institute(卡塔尔计算研究所) University of Virginia(弗吉尼亚大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏