arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2406.14496 2024-06-21 cs.CV cs.CL 57%

African or European Swallow? Benchmarking Large Vision-Language Models for Fine-Grained Object Classification

Gregor Geigle, Radu Timofte, Goran Glavaš

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13968 2024-06-21 cs.LG 57%

Recent Advances in Traffic Accident Analysis and Prediction: A Comprehensive Review of Machine Learning Techniques

Noushin Behboudi, Sobhan Moosavi, Rajiv Ramnath

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments A review paper, 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12739 2024-06-19 cs.CL 57%

Self-Distillation for Model Stacking Unlocks Cross-Lingual NLU in 200+ Languages

Fabian David Schmidt, Philipp Borchert, Ivan Vulić, Goran Glavaš

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09334 2024-06-19 cs.AI 57%

AuditLLM: A Tool for Auditing Large Language Models Using Multiprobe Approach

Maryam Amirizaniani, Elias Martin, Tanya Roosta, Aman Chadha, Chirag Shah

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01065 2024-06-19 cs.CV cs.AI 57%

BEV-TSR: Text-Scene Retrieval in BEV Space for Autonomous Driving

Tao Tang, Dafeng Wei, Zhengyu Jia, Tian Gao, Changwei Cai, Chengkai Hou, Peng Jia, Kun Zhan, Haiyang Sun, Jingchen Fan, Yixing Zhao, Fu Liu, Xiaodan Liang, Xianpeng Lang, Yang Wang

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11745 2024-06-18 cs.IR cs.CL 57%

Multi-Layer Ranking with Large Language Models for News Source Recommendation

Wenjia Zhang, Lin Gui, Rob Procter, Yulan He

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments Accepted by the SIGIR 2024. arXiv admin note: text overlap with arXiv:2305.04825

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.01717 2024-06-18 stat.ML cs.LG stat.AP 57%

Characterizing the contribution of dependent features in XAI methods

Ahmed Salih, Ilaria Boscolo Galazzo, Zahra Raisi-Estabragh, Steffen E. Petersen, Gloria Menegaz, Petia Radeva

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 17 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10618 2024-06-18 cs.CL 57%

Enhancing Role-playing Systems through Aggressive Queries: Evaluation and Improvement

Yihong Tang, Jiao Ou, Che Liu, Fuzheng Zhang, Di Zhang, Kun Gai

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments After our paper was submitted to the conference for review, it was found that there were major problems, so it was revised by more than 80%, which can basically be regarded as new work

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10061 2024-06-17 cs.LG 57%

TACCO: Task-guided Co-clustering of Clinical Concepts and Patient Visits for Disease Subtyping based on EHR Data

Ziyang Zhang, Hejie Cui, Ran Xu, Yuzhang Xie, Joyce C. Ho, Carl Yang

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments 11 pages, 5 figures, to be published in Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09397 2024-06-14 cs.CV cs.AI 57%

Aligning Vision Models with Human Aesthetics in Retrieval: Benchmarks and Algorithms

Miaosen Zhang, Yixuan Wei, Zhen Xing, Yifei Ma, Zuxuan Wu, Ji Li, Zheng Zhang, Qi Dai, Chong Luo, Xin Geng, Baining Guo

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments 28 pages, 26 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00343 2024-06-14 cs.CL 57%

Beyond Metrics: Evaluating LLMs' Effectiveness in Culturally Nuanced, Low-Resource Real-World Scenarios

Millicent Ochieng, Varun Gumma, Sunayana Sitaram, Jindong Wang, Vishrav Chaudhary, Keshet Ronen, Kalika Bali, Jacki O'Neill

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09012 2024-06-14 cs.CL 57%

Bayesian Statistical Modeling with Predictors from LLMs

Michael Franke, Polina Tsvilodub, Fausto Carcassi

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments 20 pages, 10 figures, parallel submission to a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08633 2024-06-14 cs.CL cs.HC cs.IR 57%

Unraveling Code-Mixing Patterns in Migration Discourse: Automated Detection and Analysis of Online Conversations on Reddit

Fedor Vitiugin, Sunok Lee, Henna Paakki, Anastasiia Chizhikova, Nitin Sawhney

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments 10 pages, 3 figures, Workshop Proceedings of the 18th International AAAI Conference on Web and Social Media

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09871 2024-06-14 cs.SD cs.AI cs.MM eess.AS 57%

MuChin: A Chinese Colloquial Description Benchmark for Evaluating Language Models in the Field of Music

Zihao Wang, Shuyu Li, Tao Zhang, Qi Wang, Pengfei Yu, Jinyang Luo, Yan Liu, Ming Xi, Kejun Zhang

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted by International Joint Conference on Artificial Intelligence 2024 (IJCAI 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.08144 2024-06-14 cs.AI 57%

Mobile-Env: Building Qualified Evaluation Benchmarks for LLM-GUI Interaction

Danyang Zhang, Zhennan Shen, Rui Xie, Situo Zhang, Tianbao Xie, Zihan Zhao, Siyuan Chen, Lu Chen, Hongshen Xu, Ruisheng Cao, Kai Yu

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07168 2024-06-12 cs.CL 57%

Teaching Language Models to Self-Improve by Learning from Language Feedback

Chi Hu, Yimin Hu, Hang Cao, Tong Xiao, Jingbo Zhu

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Findings of ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07844 2024-06-12 cs.SE cs.CL 57%

Mercury: A Code Efficiency Benchmark for Code Large Language Models

Mingzhe Du, Anh Tuan Luu, Bin Ji, Qian Liu, See-Kiong Ng

专题命中 安全评测 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13478 2024-06-12 cs.IR cs.CL cs.CV cs.MM 57%

SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval

Siwei Wu, Yizhi Li, Kang Zhu, Ge Zhang, Yiming Liang, Kaijing Ma, Chenghao Xiao, Haoran Zhang, Bohao Yang, Wenhu Chen, Wenhao Huang, Noura Al Moubayed, Jie Fu, Chenghua Lin

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments camera-ready version for ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12755 2024-06-12 cs.CY 57%

Towards Risk Analysis of the Impact of AI on the Deliberate Biological Threat Landscape

Matthew E. Walsh

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

Comments 15 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.08252 2024-06-11 cs.CV cs.AI 57%

Parameter-Efficient Fine-Tuning for Medical Image Analysis: The Missed Opportunity

Raman Dutt, Linus Ericsson, Pedro Sanchez, Sotirios A. Tsaftaris, Timothy Hospedales

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted as Oral Presentation at MIDL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05251 2024-06-11 cs.LG cs.SE 57%

Automated Trustworthiness Testing for Machine Learning Classifiers

Steven Cho, Seaton Cousins-Baxter, Stefano Ruberto, Valerio Terragni

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09748 2024-06-11 cs.LG cs.SE 57%

VNN: Verification-Friendly Neural Networks with Hard Robustness Guarantees

Anahita Baninajjar, Ahmed Rezine, Amir Aminifar

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04752 2024-06-10 cs.CL 57%

CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models

Ling Shi, Deyi Xiong

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments 28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01931 2024-06-07 cs.CL 57%

VariErr NLI: Separating Annotation Error from Human Label Variation

Leon Weber-Genzel, Siyao Peng, Marie-Catherine de Marneffe, Barbara Plank

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments 14 pages, accepted at ACL 2024 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11905 2024-06-06 cs.CL 57%

Learning to Edit: Aligning LLMs with Knowledge Editing

Yuxin Jiang, Yufei Wang, Chuhan Wu, Wanjun Zhong, Xingshan Zeng, Jiahui Gao, Liangyou Li, Xin Jiang, Lifeng Shang, Ruiming Tang, Qun Liu, Wei Wang

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments 17 pages, 8 figures, 9 tables. ACL 2024 main camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01041 2024-06-06 cs.CL 57%

Language Model Decoding as Direct Metrics Optimization

Haozhe Ji, Pei Ke, Hongning Wang, Minlie Huang

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments 33 pages, 3 figures

Journal ref The Twelfth International Conference on Learning Representations (ICLR 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01256 2024-06-04 cs.CV cs.AI 57%

Augmented Commonsense Knowledge for Remote Object Grounding

Bahram Mohammadi, Yicong Hong, Yuankai Qi, Qi Wu, Shirui Pan, Javen Qinfeng Shi

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00872 2024-06-04 cs.CV cs.AI 57%

OLIVE: Object Level In-Context Visual Embeddings

Timothy Ossowski, Junjie Hu

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18672 2024-06-04 cs.CV cs.CL 57%

LLM-based Hierarchical Concept Decomposition for Interpretable Fine-Grained Image Classification

Renyi Qu, Mark Yatskar

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12063 2024-06-04 cs.CL 57%

CLAMBER: A Benchmark of Identifying and Clarifying Ambiguous Information Needs in Large Language Models

Tong Zhang, Peixin Qin, Yang Deng, Chen Huang, Wenqiang Lei, Junhong Liu, Dingnan Jin, Hongru Liang, Tat-Seng Chua

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments Accepted to ACL 2024. Camera Ready. Our dataset is available at https://github.com/zt991211/CLAMBER

详情

展开后加载摘要…

URL PDF HTML 收藏