arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9380 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9380 篇

2310.14053 2024-02-27 cs.LG cs.CL cs.SE 62%

Beyond Accuracy: Evaluating Self-Consistency of Code Large Language Models with IdentityChain

Marcus J. Min, Yangruibo Ding, Luca Buratti, Saurabh Pujar, Gail Kaiser, Suman Jana, Baishakhi Ray

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.13925 2024-02-27 cs.LG cs.AI cs.CV cs.SE 62%

Quality at the Tail of Machine Learning Inference

Zhengxin Yang, Wanling Gao, Chunjie Luo, Lei Wang, Fei Tang, Xu Wen, Jianfeng Zhan

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15905 2024-02-27 cs.CV cs.AI cs.LG 62%

Explainable Contrastive and Cost-Sensitive Learning for Cervical Cancer Classification

Ashfiqun Mustari, Rushmia Ahmed, Afsara Tasnim, Jakia Sultana Juthi, G M Shahariar

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments Accepted and presented in 26th International Conference on Computer and Information Technology (ICCIT 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12560 2024-02-21 cs.CL cs.AI 62%

CausalGym: Benchmarking causal interpretability methods on linguistic tasks

Aryaman Arora, Dan Jurafsky, Christopher Potts

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 9 pages main text, 26 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16578 2024-02-20 cs.CL cs.AI 62%

Leveraging Professional Radiologists' Expertise to Enhance LLMs' Evaluation for Radiology Reports

Qingqing Zhu, Xiuying Chen, Qiao Jin, Benjamin Hou, Tejas Sudharshan Mathai, Pritam Mukherjee, Xin Gao, Ronald M Summers, Zhiyong Lu

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08846 2024-02-15 cs.CL cs.AI cs.MM cs.SD eess.AS 62%

An Embarrassingly Simple Approach for LLM with Strong ASR Capacity

Ziyang Ma, Guanrou Yang, Yifan Yang, Zhifu Gao, Jiaming Wang, Zhihao Du, Fan Yu, Qian Chen, Siqi Zheng, Shiliang Zhang, Xie Chen

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Working in progress and will open-source soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07028 2024-02-13 cs.CL cs.LG 62%

Semi-Supervised Learning for Bilingual Lexicon Induction

Paul Garnier, Gauthier Guinet

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06954 2024-02-13 cs.LG cs.CL cs.DC cs.MA 62%

OpenFedLLM: Training Large Language Models on Decentralized Private Data via Federated Learning

Rui Ye, Wenhao Wang, Jingyi Chai, Dihan Li, Zexi Li, Yinda Xu, Yaxin Du, Yanfeng Wang, Siheng Chen

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

Comments 28 pages, 3 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05940 2024-02-12 cs.LG cs.AI stat.ME 62%

Causal Relationship Network of Risk Factors Impacting Workday Loss in Underground Coal Mines

Shangsi Ren, Cameron A. Beeche, Zhiyi Shi, Maria Acevedo Garcia, Katherine Zychowski, Shuguang Leng, Pedram Roghanchi, Jiantao Pu

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments 5 figures 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05151 2024-02-09 cs.LG cs.AI 62%

CrashFormer: A Multimodal Architecture to Predict the Risk of Crash

Amin Karimi Monsefi, Pouya Shiri, Ahmad Mohammadshirazi, Nastaran Karimi Monsefi, Ron Davies, Sobhan Moosavi, Rajiv Ramnath

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments The paper is accepted In 1st ACM SIGSPATIAL International Workshop on Advances in Urban-AI (UrbanAI 23), November 13, 2023, Hamburg, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07034 2024-02-09 cs.CL cs.AI 62%

Sensitivity, Performance, Robustness: Deconstructing the Effect of Sociodemographic Prompting

Tilman Beck, Hendrik Schuff, Anne Lauscher, Iryna Gurevych

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments EACL 2024 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01364 2024-02-08 cs.CL cs.LG 62%

Continual Learning for Large Language Models: A Survey

Tongtong Wu, Linhao Luo, Yuan-Fang Li, Shirui Pan, Thuy-Trang Vu, Gholamreza Haffari

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02008 2024-02-06 cs.CL cs.AI 62%

How well do LLMs cite relevant medical references? An evaluation framework and analyses

Kevin Wu, Eric Wu, Ally Cassasola, Angela Zhang, Kevin Wei, Teresa Nguyen, Sith Riantawan, Patricia Shi Riantawan, Daniel E. Ho, James Zou

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.09917 2024-02-01 cs.AI cs.HC cs.LG 62%

Evaluation of Human-Understandability of Global Model Explanations using Decision Tree

Adarsa Sivaprasad, Ehud Reiter, Nava Tintarev, Nir Oren

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08121 2024-01-17 cs.LG cs.AI cs.SY eess.SY 62%

CycLight: learning traffic signal cooperation with a cycle-level strategy

Gengyue Han, Xiaohan Liu, Xianyue Peng, Hao Wang, Yu Han

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06513 2024-01-15 cs.SE cs.AI cs.LG 62%

ML-On-Rails: Safeguarding Machine Learning Models in Software Systems A Case Study

Hala Abdelkader, Mohamed Abdelrazek, Scott Barnett, Jean-Guy Schneider, Priya Rani, Rajesh Vasa

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05778 2024-01-12 cs.CL cs.AI 62%

Risk Taxonomy, Mitigation, and Assessment Benchmarks of Large Language Model Systems

Tianyu Cui, Yanling Wang, Chuanpu Fu, Yong Xiao, Sijia Li, Xinhao Deng, Yunpeng Liu, Qinglin Zhang, Ziyi Qiu, Peiyang Li, Zhixing Tan, Junwu Xiong, Xinyu Kong, Zujie Wen, Ke Xu, Qi Li

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02452 2024-01-09 cs.CY cs.AI 62%

The Compute Divide in Machine Learning: A Threat to Academic Contribution and Scrutiny?

Tamay Besiroglu, Sage Andrus Bergerson, Amelia Michael, Lennart Heim, Xueyun Luo, Neil Thompson

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09862 2024-01-08 cs.LG cs.AI eess.SP 62%

Towards a population-informed approach to the definition of data-driven models for structural dynamics

G. Tsialiamanis, N. Dervilis, D. J. Wagg, K. Worden

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Journal ref Mechanical Systems and Signal Processing, Volume 200, 1 October 2023, 110581

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02132 2024-01-05 cs.CL cs.AI 62%

DCR-Consistency: Divide-Conquer-Reasoning for Consistency Evaluation and Improvement of Large Language Models

Wendi Cui, Jiaxin Zhang, Zhuohang Li, Lopez Damien, Kamalika Das, Bradley Malin, Sricharan Kumar

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15218 2024-01-05 cs.LG cs.AI cs.CV 62%

Multi-modal Machine Learning for Vehicle Rating Predictions Using Image, Text, and Parametric Data

Hanqi Su, Binyang Song, Faez Ahmed

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments The paper submitted to IDETC/CIE2023, the International Design Engineering Technical Conferences & Computers and Information in Engineering Conference, has been accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01044 2024-01-03 cs.SD cs.AI cs.CL eess.AS 62%

Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation

Jinlong Xue, Yayue Deng, Yingming Gao, Ya Li

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Demo and implementation at https://auffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17584 2024-01-01 cs.LG cs.AI stat.ML 62%

Interpretable and Explainable Machine Learning Methods for Predictive Process Monitoring: A Systematic Literature Review

Nijat Mehdiyev, Maxim Majlatow, Peter Fettke

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03149 2023-12-29 cs.LG cs.AI cs.CV 62%

Attributing Learned Concepts in Neural Networks to Training Data

Nicholas Konz, Charles Godfrey, Madelyn Shapiro, Jonathan Tu, Henry Kvinge, Davis Brown

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments ATTRIB Workshop at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14203 2023-12-25 q-fin.PM cs.CL cs.LG 62%

Shai: A large language model for asset management

Zhongyang Guo, Guanran Jiang, Zhongdan Zhang, Peng Li, Zhefeng Wang, Yinchun Wang

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18893 2023-12-15 cs.LG cs.AI cs.NE 62%

Ever Evolving Evaluator (EV3): Towards Flexible and Reliable Meta-Optimization for Knowledge Distillation

Li Ding, Masrour Zoghi, Guy Tennenholtz, Maryam Karimzadehgan

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2023 Workshop on Adaptive Experimental Design and Active Learning in the Real World (RealML)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03126 2023-12-11 cs.AI cs.LG 62%

Learning Curricula in Open-Ended Worlds

Minqi Jiang

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments PhD dissertation

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03764 2023-12-08 cs.LG cs.AI 62%

Similarity-based Knowledge Transfer for Cross-Domain Reinforcement Learning

Sergio A. Serrano, Jose Martinez-Carranza, L. Enrique Sucar

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17946 2023-12-01 cs.CV cs.AI cs.CL 62%

DreamSync: Aligning Text-to-Image Generation with Image Understanding Feedback

Jiao Sun, Deqing Fu, Yushi Hu, Su Wang, Royi Rassin, Da-Cheng Juan, Dana Alon, Charles Herrmann, Sjoerd van Steenkiste, Ranjay Krishna, Cyrus Rashtchian

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14711 2023-11-28 cs.CY cs.AI 62%

Towards Publicly Accountable Frontier LLMs: Building an External Scrutiny Ecosystem under the ASPIRE Framework

Markus Anderljung, Everett Thornton Smith, Joe O'Brien, Lisa Soder, Benjamin Bucknall, Emma Bluemke, Jonas Schuett, Robert Trager, Lacey Strahm, Rumman Chowdhury

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY

Comments Accepted to Workshop on Socially Responsible Language Modelling Research (SoLaR) at the 2023 Conference on Neural Information Processing Systems (NeurIPS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏