arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9378 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9378 篇

2502.11736 2025-05-27 cs.CL cs.AI 62%

ReviewEval: An Evaluation Framework for AI-Generated Reviews

Madhav Krishan Garg, Tejash Prasad, Tanmay Singhal, Chhavi Kirtani, Murari Mandal, Dhruv Kumar

机构 * IIIT Delhi(德里印度理工学院) KIIT Bhubaneswar(比哈尔理工学院) BITS Pilani(比什努学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Under review: 8 pages, 2 figures, 5 tables, 9 pages for appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14191 2025-05-27 cs.AI cs.CL 62%

AI Idea Bench 2025: AI Research Idea Generation Benchmark

Yansheng Qiu, Haoquan Zhang, Zhaopan Xu, Ming Li, Diping Song, Zheng Wang, Kaipeng Zhang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13825 2025-05-27 cs.AI cs.CL 62%

AgentOccam: A Simple Yet Strong Baseline for LLM-Based Web Agents

Ke Yang, Yao Liu, Sapana Chaudhary, Rasool Fakoor, Pratik Chaudhari, George Karypis, Huzefa Rangwala

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17897 2025-05-26 cs.AI cs.CL 62%

T2I-Eval-R1: Reinforcement Learning-Driven Reasoning for Interpretable Text-to-Image Evaluation

Zi-Ao Ma, Tian Lan, Rong-Cheng Tu, Shu-Hang Liu, Heyan Huang, Zhijing Wu, Chen Xu, Xian-Ling Mao

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17265 2025-05-26 cs.CL cs.AI 62%

CaseReportBench: An LLM Benchmark Dataset for Dense Information Extraction in Clinical Case Reports

Xiao Yu Cindy Zhang, Carlos R. Ferreira, Francis Rossignol, Raymond T. Ng, Wyeth Wasserman, Jian Zhu

机构 * University of British Columbia(不列颠哥伦比亚大学) National Institutes of Health(美国国家卫生研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17149 2025-05-26 cs.CL cs.AI 62%

Large Language Models for Predictive Analysis: How Far Are They?

Qin Chen, Yuanyi Ren, Xiaojun Ma, Yuyang Shi

机构 * Peking University(北京大学) Harvard University(哈佛大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17119 2025-05-26 cs.CL cs.LG 62%

Systematic Evaluation of Machine-Generated Reasoning and PHQ-9 Labeling for Depression Detection Using Large Language Models

Zongru Shao, Xin Wang, Zhanyang Liu, Chenhan Wang, K. P. Subbalakshmi

机构 * Silicon Austria Labs(硅 Austria 实验室) Jiangnan University(江南大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 安全评测 :DPO(abstract);分类 cs.CL、cs.LG

Comments 8 pages without references

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21077 2025-05-26 cs.CL cs.LG cs.NE 62%

Genetic Instruct: Scaling up Synthetic Generation of Coding Instructions for Large Language Models

Somshubra Majumdar, Vahid Noroozi, Mehrzad Samadi, Sean Narenthiran, Aleksander Ficek, Wasi Uddin Ahmad, Jocelyn Huang, Jagadeesh Balam, Boris Ginsburg

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

Comments Accepted to be presented in ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15916 2025-05-23 cs.CL cs.AI 62%

BR-TaxQA-R: A Dataset for Question Answering with References for Brazilian Personal Income Tax Law, including case law

Juvenal Domingos Júnior, Augusto Faria, E. Seiti de Oliveira, Erick de Brito, Matheus Teotonio, Andre Assumpção, Diedre Carmo, Roberto Lotufo, Jayr Pereira

机构 * Universidade Estadual de Campinas(坎皮纳斯州立大学) Universidade Federal do Cariri(卡拉里联邦大学) National Center for State Courts(州法院国家中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15116 2025-05-22 cs.LG cs.AI cs.SI 62%

Graph Foundation Models: A Comprehensive Survey

Zehong Wang, Zheyuan Liu, Tianyi Ma, Jiazheng Li, Zheyuan Zhang, Xingbo Fu, Yiyang Li, Zhengqing Yuan, Wei Song, Yijun Ma, Qingkai Zeng, Xiusi Chen, Jianan Zhao, Jundong Li, Meng Jiang, Pietro Lio, Nitesh Chawla, Chuxu Zhang, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) University of Connecticut(康涅狄格大学) University of Virginia(弗吉尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Cambridge(剑桥大学) Mila - Québec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments Github Repo: https://github.com/Zehong-Wang/Awesome-Foundation-Models-on-Graphs. 93 pages, 438 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14178 2025-05-21 cs.CL cs.AI 62%

Tokenization Constraints in LLMs: A Study of Symbolic and Arithmetic Reasoning Limits

Xiang Zhang, Juntai Cao, Jiaqi Wei, Yiwei Xu, Chenyu You

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13546 2025-05-21 cs.AI cs.CL cs.MA 62%

Prompt Stability Matters: Evaluating and Optimizing Auto-Generated Prompt in General-Purpose Systems

Ke Chen, Yufei Zhou, Xitong Zhang, Haohan Wang

机构 * School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院) Department of Economics, Duke University(杜克大学经济系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13965 2025-05-21 cs.CL cs.AI 62%

CAFES: A Collaborative Multi-Agent Framework for Multi-Granular Multimodal Essay Scoring

Jiamin Su, Yibo Yan, Zhuoran Gao, Han Zhang, Xiang Liu, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Beijing Future Brain Education Technology Co., Ltd.(北京未来脑教育科技有限公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments arXiv admin note: substantial text overlap with arXiv:2502.11916

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13488 2025-05-21 cs.CL cs.CY 62%

Source framing triggers systematic evaluation bias in Large Language Models

Federico Germani, Giovanni Spitale

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13157 2025-05-20 cs.CL cs.AI 62%

Role-Playing Evaluation for Large Language Models

Yassine El Boudouri, Walter Nuninger, Julian Alvarez, Yvan Peter

机构 * Univ. Lille, CNRS, Centrale Lille, UMR 9189 CRIStAL(里尔大学、国家科学研究中心、里尔中央理工大学、UMR 9189 CRIStAL)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12327 2025-05-20 cs.RO cs.AI cs.LG 62%

Robust Planning for Autonomous Driving via Mixed Adversarial Diffusion Predictions

Albert Zhao, Stefano Soatto

机构 * Samueli School of Engineering, Computer Science Department, University of California, Los Angeles(加州大学洛杉矶分校计算机科学系桑德利学校)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments IEEE International Conference on Robotics and Automation (ICRA) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12058 2025-05-20 cs.AI cs.CL 62%

Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation

Vincent Koc

机构 * Comet ML, Inc.(Comet ML公司)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments 28 pages, 7 figures, 3 tables. Includes expanded appendix & full score matrices. Dataset & code: HF Hub + GitHub + Pypi links in abstract. Core data and code Apache-2.0; synthetic packs eval-only

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11812 2025-05-20 cs.LG cs.CL q-bio.QM 62%

VenusX: Unlocking Fine-Grained Functional Understanding of Proteins

Yang Tan, Wenrui Gou, Bozitao Zhong, Liang Hong, Huiqun Yu, Bingxin Zhou

机构 * Shanghai Jiao Tong University(上海交通大学) East China University of Science and Technology(东华大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

Comments 29 pages, 3 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11178 2025-05-19 cs.CV cs.AI cs.CL 62%

CompAlign: Improving Compositional Text-to-Image Generation with a Complex Benchmark and Fine-Grained Feedback

Yixin Wan, Kai-Wei Chang

机构 * Department of Computer Science University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10050 2025-05-16 cs.LG cs.AI 62%

Financial Fraud Detection Using Explainable AI and Stacking Ensemble Methods

Fahad Almalki, Mehedi Masud

机构 * Computer Science Department, College of Computers and Information Technology, Taif University(计算机科学系,计算机与信息科技学院,泰夫大学) Department of Computer Science, Taif University(计算机科学系,泰夫大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09747 2025-05-16 cs.CY cs.AI 62%

Healthy Distrust in AI systems

Benjamin Paaßen, Suzana Alpsancar, Tobias Matzner, Ingrid Scharlau

机构 * Bielefeld University(比勒菲尔德大学) Paderborn University(帕德博恩大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07853 2025-05-14 cs.CL cs.AI 62%

CrashSage: A Large Language Model-Centered Framework for Contextual and Interpretable Traffic Crash Analysis

Hao Zhen, Jidong J. Yang

机构 * Smart Mobility and Infrastructure Lab College of Engineering University of Georgia(智能移动与基础设施实验室 工程学院 佐治亚大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04830 2025-05-14 cs.CL cs.AI 62%

Cite Before You Speak: Enhancing Context-Response Grounding in E-commerce Conversational LLM-Agents

Jingying Zeng, Hui Liu, Zhenwei Dai, Xianfeng Tang, Chen Luo, Samarth Varshney, Zhen Li, Qi He

机构 * Amazon(亚马逊)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12275 2025-05-13 cs.AI cs.CL cs.MA 62%

Integrating Expert Knowledge into Logical Programs via LLMs

Franciszek Górski, Oskar Wysocki, Marco Valentino, Andre Freitas

机构 * Multimedia Systems Department, Gdansk University of Technology, Poland(格但斯克技术大学多媒体系统系,波兰) Department of Computer Science, University of Manchester, United Kingdom(曼彻斯特大学计算机科学系,英国) National Biomarker Centre (NBC), CRUK Manchester Institute, United Kingdom(英国CRUK曼彻斯特研究所国家生物标记中心) Idiap Research Institute, Martigny, Switzerland(瑞士马尔蒂尼Idiap研究所)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06886 2025-05-13 cs.CV cs.AI cs.LG cs.NE 62%

Mice to Machines: Neural Representations from Visual Cortex for Domain Generalization

Ahmed Qazi, Hamd Jalil, Asim Iqbal

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 8 figures, 1 table

Journal ref In Proceedings of the AAAI Conference on Artificial Intelligence. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04673 2025-05-09 cs.CL cs.AI 62%

REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM

Madhur Jindal, Saurabh Deshpande

机构 * Microsoft(微软)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments 13 pages (8 main), to be published in IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04666 2025-05-09 cs.CL cs.IR cs.LG 62%

Fine-Tuning Large Language Models and Evaluating Retrieval Methods for Improved Question Answering on Building Codes

Mohammad Aqib, Mohd Hamza, Qipei Mei, Ying Hei Chui

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04637 2025-05-09 cs.CL cs.AI 62%

Adaptive Token Boundaries: Integrating Human Chunking Mechanisms into Multimodal LLMs

Dongxing Yu

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04528 2025-05-08 cs.AI cs.CL cs.LO 62%

Beyond Theorem Proving: Formulation, Framework and Benchmark for Formal Problem-Solving

Qi Liu, Xinhao Zheng, Renqiu Xia, Xingzhi Qi, Qinxiang Cao, Junchi Yan

机构 * Sch. of Computer Science & Sch. of Artificial Intelligence, Shanghai Jiao Tong University(计算机科学学院与人工智能学院,上海交通大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 42 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03302 2025-05-06 cs.CL cs.AI 62%

Noise Augmented Fine Tuning for Mitigating Hallucinations in Large Language Models

Afshin Khadangi, Amir Sartipi, Igor Tchappi, Ramin Bahmani

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏