arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9380 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9380 篇

2402.12451 2024-06-07 cs.CV cs.AI cs.CL cs.MM 62%

The Revolution of Multimodal Large Language Models: A Survey

Davide Caffagni, Federico Cocchi, Luca Barsellotti, Nicholas Moratelli, Sara Sarto, Lorenzo Baraldi, Lorenzo Baraldi, Marcella Cornia, Rita Cucchiara

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments ACL 2024 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00645 2024-06-06 cs.LG cs.AI cs.CV 62%

FuRL: Visual-Language Models as Fuzzy Rewards for Reinforcement Learning

Yuwei Fu, Haichao Zhang, Di Wu, Wei Xu, Benoit Boulet

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00862 2024-06-05 cs.CL cs.AI 62%

NewsBench: A Systematic Evaluation Framework for Assessing Editorial Capabilities of Large Language Models in Chinese Journalism

Miao Li, Ming-Bin Chen, Bo Tang, Shengbin Hou, Pengyu Wang, Haiying Deng, Zhiyu Li, Feiyu Xiong, Keming Mao, Peng Cheng, Yi Luo

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments Long paper, ACL 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01943 2024-06-05 cs.CL cs.AI 62%

Enhancing Trust in LLMs: Algorithms for Comparing and Interpreting LLMs

Nik Bear Brown

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments An extensive survey of the literature specifying algorithms and techniques enhancing the trustworthiness and understanding of Large Language Models (LLMs)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15447 2024-06-05 cs.CL cs.AI 62%

Decoding Compressed Trust: Scrutinizing the Trustworthiness of Efficient LLMs Under Compression

Junyuan Hong, Jinhao Duan, Chenhui Zhang, Zhangheng Li, Chulin Xie, Kelsey Lieberman, James Diffenderfer, Brian Bartoldson, Ajay Jaiswal, Kaidi Xu, Bhavya Kailkhura, Dan Hendrycks, Dawn Song, Zhangyang Wang, Bo Li

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments Accepted to ICML'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01364 2024-06-04 cs.CR cs.AI cs.CL 62%

BELLS: A Framework Towards Future Proof Benchmarks for the Evaluation of LLM Safeguards

Diego Dorn, Alexandre Variengien, Charbel-Raphaël Segerie, Vincent Corruble

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01333 2024-06-04 cs.CL cs.AI 62%

Probing Language Models for Pre-training Data Detection

Zhenhua Liu, Tong Zhu, Chuanyuan Tan, Haonan Lu, Bing Liu, Wenliang Chen

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL-2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01748 2024-06-04 cs.CL cs.AI 62%

NeuSpeech: Decode Neural signal as Speech

Yiqian Yang, Yiqun Duan, Qiang Zhang, Hyejeong Jo, Jinni Zhou, Won Hee Lee, Renjing Xu, Hui Xiong

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17267 2024-05-31 cs.CL cs.AI 62%

Enhancing Low-Resource Relation Representations through Multi-View Decoupling

Chenghao Fan, Wei Wei, Xiaoye Qu, Zhenyi Lu, Wenfeng Xie, Yu Cheng, Dangyang Chen

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted to AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11592 2024-05-29 cs.LG cs.CL 62%

Revisiting Zeroth-Order Optimization for Memory-Efficient LLM Fine-Tuning: A Benchmark

Yihua Zhang, Pingzhi Li, Junyuan Hong, Jiaxiang Li, Yimeng Zhang, Wenqing Zheng, Pin-Yu Chen, Jason D. Lee, Wotao Yin, Mingyi Hong, Zhangyang Wang, Sijia Liu, Tianlong Chen

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05400 2024-05-28 cs.LG cs.AI cs.CV stat.ML 62%

Investigating the Corruption Robustness of Image Classifiers with Random Lp-norm Corruptions

Georg Siedel, Weijia Shao, Silvia Vock, Andrey Morozov

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments Camera-ready version submitted to VISAPP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16128 2024-05-28 cs.AI cs.CL 62%

How Well Do Deep Learning Models Capture Human Concepts? The Case of the Typicality Effect

Siddhartha K. Vemuri, Raj Sanjay Shah, Sashank Varma

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments To appear at CogSci 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15320 2024-05-27 cs.DL cs.AI cs.CL 62%

Using Large Language Models to Enrich the Documentation of Datasets for Machine Learning

Joan Giner-Miguelez, Abel Gómez, Jordi Cabot

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14307 2024-05-24 cs.LG cs.AI 62%

AdaGMLP: AdaBoosting GNN-to-MLP Knowledge Distillation

Weigang Lu, Ziyu Guan, Wei Zhao, Yaming Yang

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments Accepted by KDD 2024

Journal ref KDD 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02675 2024-05-24 cs.LG cs.AI cs.CR 62%

Verifiable evaluations of machine learning models using zkSNARKs

Tobin South, Alexander Camuto, Shrey Jain, Shayla Nguyen, Robert Mahari, Christian Paquin, Jason Morton, Alex 'Sandy' Pentland

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06713 2024-05-22 cs.CL cs.AI 62%

Unveiling the Competitive Dynamics: A Comparative Evaluation of American and Chinese LLMs

Zhenhui Jiang, Jiaxin Li, Yang Liu

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments There was a miscommunication among the co-authors, resulting in the accidental submission of this paper to arXiv. We are in need of withdrawing the paper from your platform

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05144 2024-05-15 cs.CY cs.LG 62%

Improving Automated Distractor Generation for Math Multiple-choice Questions with Overgenerate-and-rank

Alexander Scarlatos, Wanyong Feng, Digory Smith, Simon Woodhead, Andrew Lan

专题命中 安全评测 :alignment(abstract);分类 cs.CY、cs.LG

Comments BEA workshop NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02178 2024-05-14 cs.CL cs.AI 62%

Assessing and Verifying Task Utility in LLM-Powered Applications

Negar Arabzadeh, Siqing Huo, Nikhil Mehta, Qinqyun Wu, Chi Wang, Ahmed Awadallah, Charles L. A. Clarke, Julia Kiseleva

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments arXiv admin note: text overlap with arXiv:2402.09015

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00704 2024-05-13 cs.CL cs.AI 62%

A Survey on the Real Power of ChatGPT

Ming Liu, Ran Liu, Ye Zhu, Hua Wang, Youyang Qu, Rongsheng Li, Yongpan Sheng, Wray Buntine

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13023 2024-05-08 cs.CL cs.AI 62%

GraphGPT: Graph Instruction Tuning for Large Language Models

Jiabin Tang, Yuhao Yang, Wei Wei, Lei Shi, Lixin Su, Suqi Cheng, Dawei Yin, Chao Huang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted by SIGIR'2024, full paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11831 2024-05-07 cs.LG cs.AI 62%

Locally-Minimal Probabilistic Explanations

Yacine Izza, Kuldeep S. Meel, Joao Marques-Silva

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00897 2024-05-07 cs.LG cs.AI cs.SE 62%

Machine Learning Robustness: A Primer

Houssem Ben Braiek, Foutse Khomh

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17778 2024-04-30 cs.CL cs.AI 62%

MRScore: Evaluating Radiology Report Generation with LLM-based Reward System

Yunyi Liu, Zhanyu Wang, Yingshu Li, Xinyu Liang, Lingqiao Liu, Lei Wang, Luping Zhou

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03892 2024-04-30 cs.CV cs.AI cs.LG eess.IV 62%

Enhancing Breast Cancer Diagnosis in Mammography: Evaluation and Integration of Convolutional Neural Networks and Explainable AI

Maryam Ahmed, Tooba Bibi, Rizwan Ahmed Khan, Sidra Nasir

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03627 2024-04-29 cs.CL cs.AI 62%

Multimodal Large Language Models to Support Real-World Fact-Checking

Jiahui Geng, Yova Kementchedjhieva, Preslav Nakov, Iryna Gurevych

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13668 2024-04-29 cs.CL cs.AI cs.CV 62%

MAIRA-1: A specialised large multimodal model for radiology report generation

Stephanie L. Hyland, Shruthi Bannur, Kenza Bouzid, Daniel C. Castro, Mercy Ranjit, Anton Schwaighofer, Fernando Pérez-García, Valentina Salvatelli, Shaury Srivastav, Anja Thieme, Noel Codella, Matthew P. Lungren, Maria Teodora Wetscherek, Ozan Oktay, Javier Alvarez-Valle

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 9 tables, 5 figures. v2 adds test IDs and image encoder citation. v3 fixes error in NPV/specificity

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.07007 2024-04-29 cs.LG cs.AI stat.ML 62%

Interpretable Representations in Explainable AI: From Theory to Practice

Kacper Sokol, Peter Flach

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments Published in the *Special Issue on Explainable and Interpretable Machine Learning and Data Mining* of the Springer *Data Mining and Knowledge Discovery* journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.02498 2024-04-26 cs.CL cs.LG 62%

Honest Students from Untrusted Teachers: Learning an Interpretable Question-Answering Pipeline from a Pretrained Language Model

Jacob Eisenstein, Daniel Andor, Bernd Bohnet, Michael Collins, David Mimno

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

Comments added details about a human evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01693 2024-04-23 cs.CL cs.AI 62%

Quality of Answers of Generative Large Language Models vs Peer Patients for Interpreting Lab Test Results for Lay Patients: Evaluation Study

Zhe He, Balu Bhasuran, Qiao Jin, Shubo Tian, Karim Hanna, Cindy Shavor, Lisbeth Garcia Arguello, Patrick Murray, Zhiyong Lu

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13060 2024-04-23 cs.CY cs.AI 62%

The Necessity of AI Audit Standards Boards

David Manheim, Sammy Martin, Mark Bailey, Mikhail Samin, Ross Greutzmacher

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏