arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9346 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9346 篇

2510.00706 2025-10-02 cs.AI cs.IR cs.LG 62%

AttentionDep: Domain-Aware Attention for Explainable Depression Severity Assessment

Yusif Ibrahimov, Tarique Anwar, Tommy Yuan, Turan Mutallimov, Elgun Hasanov

机构 * Department of Computer Science, University of York(约克大学计算机科学系) French-Azerbaijani University under Azerbaijan State Oil and Industry University(阿塞拜疆国家石油和工业大学下的法阿大学) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院) Department of Engineering, University of Aberdeen(阿伯丁大学工程系) École Polytechnique, Institut Polytechnique de Paris(巴黎理工学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00288 2025-10-02 cs.CL cs.AI 62%

o-MEGA: Optimized Methods for Explanation Generation and Analysis

Ľuboš Kriš, Jaroslav Kopčan, Qiwei Peng, Andrej Ridzik, Marcel Veselý, Martin Tamajka

机构 * Kempelen Institute of Intelligent Technologies(基姆佩尔智能技术研究所) University of Copenhagen(哥本哈根大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22646 2025-10-02 cs.CV cs.AI cs.CL 62%

Learning Human-Perceived Fakeness in AI-Generated Videos via Multimodal LLMs

Xingyu Fu, Siyi Liu, Yinuo Xu, Pan Lu, Guangqiuse Hu, Tianbo Yang, Taran Anantasagar, Christopher Shen, Yikai Mao, Yuanzhe Liu, Keyush Shah, Chung Un Lee, Yejin Choi, James Zou, Dan Roth, Chris Callison-Burch

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments Project Page: https://deeptracereward.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26417 2025-10-01 cs.AI cs.LG 62%

OntoAligner Meets Knowledge Graph Embedding Aligners

Hamed Babaei Giglou, Jennifer D'Souza, Sören Auer, Mahsa Sanaei

机构 * TIB -- Leibniz Information Centre for Science and Technology(莱比锡信息科学与技术研究中心) University of Tabriz(塔布里兹大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments 10 pages of main content, 3 page references, 3 figures. Accepted to Ontology Matching Workshop at ISWC

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22048 2025-10-01 cs.CL cs.LG 62%

ThinkEdit: Interpretable Weight Editing to Mitigate Overly Short Thinking in Reasoning Models

Chung-En Sun, Ge Yan, Tsui-Wei Weng

机构 * UCSD CSE(加州大学圣地亚哥分校计算机科学系) UCSD HDSI(加州大学圣地亚哥分校人类发展与应用科学学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

Comments Accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11843 2025-10-01 cs.CL cs.AI 62%

Preemptive Detection and Correction of Misaligned Actions in LLM Agents

Haishuo Fang, Xiaodan Zhu, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab, Department of Computer Science, TU Darmstadt(图宾根大学计算机科学系) National Research Center for Applied Cybersecurity ATHENE, Germany(德国应用网络安全国家研究中心ATHENE) Department of Electrical and Computer Engineering & Ingenuity Labs Research Institute, Queen’s University, Canada(加拿大女王大学电气与计算机工程系及创新实验室研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24389 2025-09-30 cs.CL cs.AI 62%

LLaDA-MoE: A Sparse MoE Diffusion Language Model

Fengqi Zhu, Zebin You, Yipeng Xing, Zenan Huang, Lin Liu, Yihong Zhuang, Guoshan Lu, Kangyu Wang, Xudong Wang, Lanning Wei, Hongrui Guo, Jiaqi Hu, Wentao Ye, Tieyuan Chen, Chenchen Li, Chengfu Tang, Haibo Feng, Jun Hu, Jun Zhou, Xiaolu Zhang, Zhenzhong Lan, Junbo Zhao, Da Zheng, Chongxuan Li, Jianguo Li, Ji-Rong Wen

机构 * Renmin University of China(中国人民大学) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13359 2025-09-30 cs.CY cs.AI 62%

Evaluating undergraduate mathematics examinations in the era of generative AI: a curriculum-level case study

Benjamin J. Walker, Nikoleta Kalaydzhieva, Beatriz Navarro Lameda, Ruth A. Reynolds

机构 * Department of Mathematics(数学系) University College London(伦敦大学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15524 2025-09-30 cs.CL cs.AI 62%

IPBench: Benchmarking the Knowledge of Large Language Models in Intellectual Property

Qiyao Wang, Guhong Chen, Hongbo Wang, Huaren Liu, Minghui Zhu, Zhifei Qin, Linwei Li, Yilin Yue, Shiqiang Wang, Jiayan Li, Yihang Wu, Ziqiang Liu, Longze Chen, Run Luo, Liyang Fan, Jiaming Li, Lei Zhang, Kan Xu, Chengming Li, Hamid Alinejad-Rokny, Shiwen Ni, Yuan Lin, Min Yang

机构 * Shenzhen Key Laboratory for High Performance Data Mining, Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences, China(深圳高性能数据挖掘重点实验室,深圳先进技术研究院,中国科学院,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国) Dalian University of Technology, China(大连理工大学,中国) School of Biomedical Engineering, UNSW Sydney, Australia(生物医学工程学院,新南威尔士大学悉尼分校,澳大利亚) Shenzhen MSU-BIT University, China(深圳MSU-BIT大学,中国) Shenzhen University of Advanced Technology, China(深圳大学先进技术学院,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 71 pages, 75 figures, 53 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23695 2025-09-30 cs.LG cs.AI 62%

Estimating Time Series Foundation Model Transferability via In-Context Learning

Qingren Yao, Ming Jin, Chengqi Zhang, Chao-Han Huck Yang, Jun Qi, Shirui Pan

机构 * Griffith University(格里菲斯大学) Hong Kong Baptist University(香港 Baptist 大学) The Hong Kong Polytechnic University(香港理工大学) NVIDIA Research(NVIDIA 研究)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22799 2025-09-30 cs.CV cs.AI cs.CL 62%

VideoScore2: Think before You Score in Generative Video Evaluation

Xuan He, Dongfu Jiang, Ping Nie, Minghao Liu, Zhengxuan Jiang, Mingyi Su, Wentao Ma, Junru Lin, Chun Ye, Yi Lu, Keming Wu, Benjamin Schneider, Quy Duc Do, Zhuofeng Li, Yiming Jia, Yuxuan Zhang, Guo Cheng, Haozhe Wang, Wangchunshu Zhou, Qunshu Lin, Yuanxing Zhang, Ge Zhang, Wenhao Huang, Wenhu Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Waterloo(滑铁卢大学) Independent(独立) M-A-P University of Toronto(多伦多大学) Zhejiang University(浙江大学) Abaka AI

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22715 2025-09-30 cs.CL cs.AI 62%

TRUEBench: Can LLM Response Meet Real-world Constraints as Productivity Assistant?

Jiho Park, Jongyoon Song, Minjin Choi, Kyuho Heo, Taehun Huh, Ji Won Kim

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04153 2025-09-30 cs.CL cs.AI 62%

UltraIF: Advancing Instruction Following from the Wild

Kaikai An, Li Sheng, Ganqu Cui, Shuzheng Si, Ning Ding, Yu Cheng, Baobao Chang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21579 2025-09-29 cs.LG cs.CL 62%

Leveraging Big Data Frameworks for Spam Detection in Amazon Reviews

Mst Eshita Khatun, Halima Akter, Tasnimul Rehan, Toufiq Ahmed

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

Comments Accepted & presented at THE 16th INTERNATIONAL IEEE CONFERENCE ON COMPUTING, COMMUNICATION AND NETWORKING TECHNOLOGIES (ICCCNT) 2025

Journal ref THE 16th INTERNATIONAL IEEE CONFERENCE ON COMPUTING, COMMUNICATION AND NETWORKING TECHNOLOGIES (ICCCNT) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21117 2025-09-29 cs.AI cs.CL 62%

TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them

Yidong Wang, Yunze Song, Tingyuan Zhu, Xuanwang Zhang, Zhuohao Yu, Hao Chen, Chiyu Song, Qiufeng Wang, Cunxiang Wang, Zhen Wu, Xinyu Dai, Yue Zhang, Wei Ye, Shikun Zhang

机构 * Peking University(北京大学) National University of Singapore(新加坡国立大学) Institute of Science Tokyo(东京科学研究院) Nanjing University(南京大学) Westlake University(西湖大学) Southeast University(东南大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments 22 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15253 2025-09-29 cs.CL cs.AI 62%

Conflict-Aware Soft Prompting for Retrieval-Augmented Generation

Eunseong Choi, June Park, Hyeri Lee, Jongwuk Lee

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025; 15 pages; 5 figures, 11 tables; Code available at https://github.com/eunseongc/CARE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21287 2025-09-26 cs.CL cs.AI 62%

DisCoCLIP: A Distributional Compositional Tensor Network Encoder for Vision-Language Understanding

Kin Ian Lo, Hala Hawashin, Mina Abbaszadeh, Tilen Limback-Stokin, Hadi Wazni, Mehrnoosh Sadrzadeh

机构 * University College London(伦敦大学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21054 2025-09-26 cs.AI cs.CL 62%

Disagreements in Reasoning: How a Model's Thinking Process Dictates Persuasion in Multi-Agent Systems

Haodong Zhao, Jidong Li, Zhaomin Wu, Tianjie Ju, Zhuosheng Zhang, Bingsheng He, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) National University of Singapore(新加坡国立大学) Inner Mongolia Research Institute, Shanghai Jiao Tong University(上海交通大学内蒙古研究院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20520 2025-09-26 cs.AI cs.DC cs.LG 62%

Adaptive Approach to Enhance Machine Learning Scheduling Algorithms During Runtime Using Reinforcement Learning in Metascheduling Applications

Samer Alshaer, Ala Khalifeh, Roman Obermaisser

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments 18 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20378 2025-09-26 cs.CL cs.AI 62%

Beyond Global Emotion: Fine-Grained Emotional Speech Synthesis with Dynamic Word-Level Modulation

Sirui Wang, Andong Chen, Tiejun Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11771 2025-09-26 cs.CL cs.AI 62%

The Validation Gap: A Mechanistic Analysis of How Language Models Compute Arithmetic but Fail to Validate It

Leonardo Bertolazzi, Philipp Mondorf, Barbara Plank, Raffaella Bernardi

机构 * DISI, University of Trento(特伦托大学DISI中心) MaiNLP, Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心) Free University of Bozen-Bolzano, Italy(博兹纳自由大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 Main, 38 pages, 33 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23745 2025-09-25 cs.CV cs.AI cs.LG 62%

To Trust Or Not To Trust Your Vision-Language Model's Prediction

Hao Dong, Moru Liu, Jian Liang, Eleni Chatzi, Olga Fink

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18221 2025-09-24 cs.AI cs.LG 62%

Multimodal Health Risk Prediction System for Chronic Diseases via Vision-Language Fusion and Large Language Models

Dingxin Lu, Shurui Wu, Xinyi Huang

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10369 2025-09-23 cs.AR cs.AI cs.LG cs.PL 62%

SymRTLO: Enhancing RTL Code Optimization with LLMs and Neuron-Inspired Symbolic Reasoning

Yiting Wang, Wanghao Ye, Ping Guo, Yexiao He, Ziyao Wang, Bowei Tian, Shwai He, Guoheng Sun, Zheyu Shen, Sihan Chen, Ankur Srivastava, Qingfu Zhang, Gang Qu, Ang Li

机构 * University of Maryland, College Park(马里兰大学科帕克分校) City University of Hong Kong(香港城市大学) University of Southern California(南加州大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16072 2025-09-23 cs.AI cs.CL 62%

InMind: Evaluating LLMs in Capturing and Applying Individual Human Reasoning Styles

Zizhen Li, Chuanhao Li, Yibin Wang, Qi Chen, Diping Song, Yukang Feng, Jianwen Sun, Jiaxin Ai, Fanrui Zhang, Mingzhu Sun, Kaipeng Zhang

机构 * Nankai University(南开大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Johns Hopkins University(约翰霍普金斯大学) Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10571 2025-09-23 cs.AI cs.CL 62%

Agentic AI with Orchestrator-Agent Trust: A Modular Visual Classification Framework with Trust-Aware Orchestration and RAG-Based Reasoning

Konstantinos I. Roumeliotis, Ranjan Sapkota, Manoj Karkee, Nikolaos D. Tselikas

机构 * University of the Peloponnese, Department of Informatics and Telecommunications(希腊皮埃蒙特大学信息与电信系) Cornell University, Department of Biological and Environmental Engineering(康奈尔大学生物与环境工程系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00137 2025-09-23 cs.CL cs.IR cs.LG 62%

LaMP-QA: A Benchmark for Personalized Long-form Question Answering

Alireza Salemi, Hamed Zamani

机构 * Center for Intelligent Information Retrieval(智能信息检索中心) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15108 2025-09-23 cs.CL cs.AI cs.HC 62%

A Risk Ontology for Evaluating AI-Powered Psychotherapy Virtual Agents

Ian Steenstra, Timothy W. Bickmore

机构 * Northeastern University(东北大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments This is a preprint version of the paper accepted to IVA'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20383 2025-09-23 cs.LG cs.CL 62%

Why Are Web AI Agents More Vulnerable Than Standalone LLMs? A Security Analysis

Jeffrey Yang Fan Chiang, Seungjae Lee, Jia-Bin Huang, Furong Huang, Yizheng Chen

机构 * University of Maryland(马里兰大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

Comments Project website: http://vulnerable-ai-agents.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16188 2025-09-22 cs.CL cs.AI 62%

CultureScope: A Dimensional Lens for Probing Cultural Understanding in LLMs

Jinghao Zhang, Sihang Jiang, Shiwei Guo, Shisong Chen, Yanghua Xiao, Hongwei Feng, Jiaqing Liang, Minggui HE, Shimin Tao, Hongxia Ma

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏