arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9346 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9346 篇

2505.20322 2025-06-04 cs.CL cs.AI cs.CV cs.IR cs.LG 67%

Beyond Prompt Engineering: Robust Behavior Control in LLMs via Steering Target Atoms

Mengru Wang, Ziwen Xu, Shengyu Mao, Shumin Deng, Zhaopeng Tu, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Tencent(腾讯) National University of Singapore(新加坡国立大学) NUS-NCS Joint Lab(新加坡国立大学NCS联合实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08367 2025-06-04 cs.AI cs.CL cs.CV cs.LG 67%

MCU: An Evaluation Framework for Open-Ended Game Agents

Xinyue Zheng, Haowei Lin, Kaichen He, Zihao Wang, Zilong Zheng, Yitao Liang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref ICML 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18754 2025-06-02 cs.CL cs.AI cs.LG 67%

Few-Shot Optimization for Sensor Data Using Large Language Models: A Case Study on Fatigue Detection

Elsen Ronando, Sozo Inoue

机构 * Graduate School of Life Science and Systems Engineering, Kyushu Institute of Technology(九州工学院生命科学与系统工程研究生院) Department of Informatics, Universitas 17 Agustus 1945 Surabaya(Surabaya 17 August 1945 大学信息系)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 43 pages, 18 figures. Accepted for publication in MDPI Sensors (2025). Final version before journal publication

Journal ref Sensors 2025, 25, 3324

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15210 2025-06-02 cs.LG cs.AI cs.CL 67%

PairBench: Are Vision-Language Models Reliable at Comparing What They See?

Aarash Feizi, Sai Rajeswar, Adriana Romero-Soriano, Reihaneh Rabbany, Valentina Zantedeschi, Spandana Gella, João Monteiro

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22356 2025-05-29 cs.LG cs.AI cs.CY stat.ML 67%

Suitability Filter: A Statistical Framework for Classifier Evaluation in Real-World Deployment Settings

Angéline Pouget, Mohammad Yaghini, Stephan Rabanser, Nicolas Papernot

机构 * ETH Zurich(苏黎世联邦理工学院) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19757 2025-05-27 cs.SE cs.AI cs.CL cs.LG 67%

CIDRe: A Reference-Free Multi-Aspect Criterion for Code Comment Quality Measurement

Maria Dziuba, Valentin Malykh

机构 * MTS AI(MTS人工智能公司) ITMO University(ITMO大学) IITU University(IITU大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19696 2025-05-27 cs.CV cs.MM eess.IV 67%

Modeling Beyond MOS: Quality Assessment Models Must Integrate Context, Reasoning, and Multimodality

Mohamed Amine Kerkouri, Marouane Tliba, Aladine Chetouani, Nour Aburaed, Alessandro Bruno

机构 * R&D Lab F-Initiatives(F-Initiatives研发实验室) Université d’Orleans(奥尔良大学) Université Sorbonne Paris Nord(巴黎-索邦大学) University of Dubai(迪拜大学) IULM University(IULM大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16880 2025-05-27 cs.CL cs.AI cs.LG 67%

CORAL: Learning Consistent Representations across Multi-step Training with Lighter Speculative Drafter

Yepeng Weng, Dianwen Mei, Huishi Qiu, Xujie Chen, Li Liu, Jiang Tian, Zhongchao Shi

机构 * AI Lab, Lenovo Research(联想研究院人工智能实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ACL 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02539 2025-05-27 cs.CV cs.AI cs.CL cs.LG 67%

Parrot: Multilingual Visual Instruction Tuning

Hai-Long Sun, Da-Wei Zhou, Yang Li, Shiyin Lu, Chao Yi, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, De-Chuan Zhan, Han-Jia Ye

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ICML 2025. Code and dataset are available at: https://github.com/AIDC-AI/Parrot

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18464 2025-05-27 cs.HC cs.AI cs.CL cs.CY 67%

From Reddit to Generative AI: Evaluating Large Language Models for Anxiety Support Fine-tuned on Social Media Data

Ugur Kursuncu, Trilok Padhi, Gaurav Sinha, Abdulkadir Erol, Jaya Krishna Mandivarapu, Christopher R. Larrison

机构 * Georgia State University(佐治亚州立大学) University of Georgia(佐治亚大学) Microsoft(微软) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15477 2025-05-22 cs.CV 67%

MediConfusion: Can you trust your AI radiologist? Probing the reliability of multimodal medical foundation models

Mohammad Shahab Sepehri, Zalan Fabian, Maryam Soltanolkotabi, Mahdi Soltanolkotabi

机构 * Department of Electrical and Computer Engineering, University of Southern California(电气与计算机工程系,南加州大学) Department of Radiology and Imaging Sciences, University of Utah(放射学与影像科学系,犹他大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

Comments 24 Pages, 9 figures, The Thirteenth International Conference on Learning Representations (ICLR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11200 2025-05-19 cs.SD cs.AI cs.CL cs.HC cs.LG eess.AS 67%

Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese

Xihuai Wang, Ziyi Zhao, Siyu Ren, Shao Zhang, Song Li, Xiaoyu Li, Ziwen Wang, Lin Qiu, Guanglu Wan, Xuezhi Cao, Xunliang Cai, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10257 2025-05-16 cs.CV 67%

Sage Deer: A Super-Aligned Driving Generalist Is Your Copilot

Hao Lu, Jiaqi Tang, Jiyao Wang, Yunfan LU, Xu Cao, Qingyong Hu, Yin Wang, Yuting Zhang, Tianxin Xie, Yunpeng Zhang, Yong Chen, Jiayu. Gao, Bin Huang, Dengbo He, Shuiguang Deng, Hao Chen, Ying-Cong Chen

专题命中 安全评测 :alignment(abstract);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08818 2025-05-15 cs.CY cs.AI cs.LG 67%

Position: Restructuring of Categories and Implementation of Guidelines Essential for VLM Adoption in Healthcare

Amara Tariq, Rimita Lahiri, Charles Kahn, Imon Banerjee

机构 * Amara Tariq, Ph.D(博士) Rimita Lahiri, Ph.D(博士) Charles Kahn, M.D(医学博士) Imon Banerjee, Ph.D(博士)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 15 pages, 2, tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06246 2025-05-13 cs.CY cs.AI cs.LG stat.AP 67%

United States Road Accident Prediction using Random Forest Predictor

Dominic Parosh Yamarthi, Haripriya Raman, Shamsad Parvin

机构 * Computer Science and Engineering University at Buffalo(计算机科学与工程大学布法罗分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 5 Pages, 8 Figures

Journal ref IEEE Access (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18086 2025-05-02 cs.RO cs.AI cs.CL cs.GR cs.LG 67%

Generating Traffic Scenarios via In-Context Learning to Learn Better Motion Planner

Aizierjiang Aiersilan

机构 * Aizierjiang Aiersilan(独立研究者)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments We are excited to announce that this paper has been accepted for oral presentation at the AAAI 2025 Main Conference. We are grateful for the insightful feedback from the reviewers and look forward to contributing to the discussions at AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20769 2025-04-30 cs.CL cs.AI cs.LG 67%

Chain-of-Defensive-Thought: Structured Reasoning Elicits Robustness in Large Language Models against Reference Corruption

Wenxiao Wang, Parsa Hosseini, Soheil Feizi

机构 * Department of Computer Science, University of Maryland, College Park, Maryland, USA(计算机科学系,马里兰大学,College Park,马里兰,美国)

专题命中 安全评测 :prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13261 2025-04-21 cs.CL cs.AI cs.CY cs.HC cs.SI 67%

CPG-EVAL: A Multi-Tiered Benchmark for Evaluating the Chinese Pedagogical Grammar Competence of Large Language Models

Dong Wang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 12 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13216 2025-04-21 cs.CL cs.AI cs.LG 67%

KFinEval-Pilot: A Comprehensive Benchmark Suite for Korean Financial Language Understanding

Bokwang Hwang, Seonkyu Lim, Taewoong Kim, Yongjae Geun, Sunghyun Bang, Sohyun Park, Jihyun Park, Myeonggyu Lee, Jinwoo Lee, Yerin Kim, Jinsun Yoo, Jingyeong Hong, Jina Park, Yongchan Kim, Suhyun Kim, Younggyun Hahm, Yiseul Lee, Yejee Kang, Chanhyuk Yoon, Chansu Lee, Heeyewon Jeong, Jiyeon Lee, Seonhye Gu, Hyebin Kang, Yousang Cho, Hangyeol Yoo, KyungTae Lim

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10738 2025-04-16 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

CleanMAP: Distilling Multimodal LLMs for Confidence-Driven Crowdsourced HD Map Updates

Ankit Kumar Shaw, Kun Jiang, Tuopu Wen, Chandan Kumar Sah, Yining Shi, Mengmeng Yang, Diange Yang, Xiaoli Lian

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Kun Jiang, Mengmeng Yang and Diange Yang are Corresponding Author. The main paper and supplementary material are both included here, total 23 pages (main paper is 10 pages and supplementary material is 13 pages), total 17 figures (6 figures in main paper and 11 figures in supplementary material), this paper is Accepted to CVPR WDFM-AD Workshop 2025, The code will be available at https://Ankit-Zefan.github.io/CleanMap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08281 2025-04-14 cs.CL cs.AI cs.LG 67%

ELSA: A Style Aligned Dataset for Emotionally Intelligent Language Generation

Vishal Gandhi, Sagar Gandhi

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07174 2025-04-11 cs.CL cs.AI cs.LG 67%

HypoEval: Hypothesis-Guided Evaluation for Natural Language Generation

Mingxuan Li, Hanchen Li, Chenhao Tan

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 22 pages, 3 figures, code link: https://github.com/ChicagoHAI/HypoEval-Gen

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10144 2025-04-09 cs.CL cs.AI cs.LG cs.LO cs.PL 67%

NLP Verification: Towards a General Methodology for Certifying Robustness

Marco Casadio, Tanvi Dinkar, Ekaterina Komendantskaya, Luca Arnaboldi, Matthew L. Daggitt, Omri Isac, Guy Katz, Verena Rieser, Oliver Lemon

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04373 2025-04-08 cs.CL cs.AI cs.LG 67%

StyleRec: A Benchmark Dataset for Prompt Recovery in Writing Style Transformation

Shenyang Liu, Yang Gao, Shaoyan Zhai, Liqiang Wang

专题命中 安全评测 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 2024 IEEE International Conference on Big Data (BigData)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12784 2025-04-08 cs.AI cs.CL cs.LG 67%

JudgeBench: A Benchmark for Evaluating LLM-based Judges

Sijun Tan, Siyuan Zhuang, Kyle Montgomery, William Y. Tang, Alejandro Cuadron, Chenguang Wang, Raluca Ada Popa, Ion Stoica

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00398 2025-04-04 cs.SD cs.AI cs.CL cs.LG eess.AS 67%

TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification

Nishit Anand, Ashish Seth, Ramani Duraiswami, Dinesh Manocha

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to SALMA Workshop ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00882 2025-04-02 cs.DB cs.AI cs.CL cs.IR cs.LG 67%

CrackSQL: A Hybrid SQL Dialect Translation System Powered by Large Language Models

Wei Zhou, Yuyang Gao, Xuanhe Zhou, Guoliang Li

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Extension of our SIGMOD 2025 paper. Please refer to source code available at: https://github.com/weAIDB/CrackSQL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08814 2025-03-31 cs.AI cs.CL cs.CY 67%

SAIF: A Comprehensive Framework for Evaluating the Risks of Generative AI in the Public Sector

Kyeongryul Lee, Heehyeon Kim, Joyce Jiyoung Whang

专题命中 安全评测 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 6 pages, 2 figures, 1 tables. AI for Public Missions (AIPM) Workshop at the 39th AAAI Conference on Artificial Intelligence (AAAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10661 2025-03-25 cs.CV 67%

CeTAD: Towards Certified Toxicity-Aware Distance in Vision Language Models

Xiangyu Yin, Jiaxu Liu, Zhen Chen, Jinwei Hu, Yi Dong, Xiaowei Huang, Wenjie Ruan

专题命中 安全评测 :jailbreak(abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11355 2025-03-25 cs.CL cs.AI cs.CR cs.CY 67%

Nuclear Deployed: Analyzing Catastrophic Risks in Decision-making of Autonomous LLM Agents

Rongwu Xu, Xiaojian Li, Shuo Chen, Wei Xu

专题命中 安全评测 :harmlessness(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Please visit https://llm-catastrophic-risks.github.io for a quick tour of our research. Our code is available at https://github.com/pillowsofwind/LLM-CBRN-Risks

详情

展开后加载摘要…

URL PDF HTML 收藏