arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9380 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9380 篇

2311.09184 2024-07-15 cs.CL cs.LG 62%

Benchmarking Generation and Evaluation Capabilities of Large Language Models for Instruction Controllable Summarization

Yixin Liu, Alexander R. Fabbri, Jiawen Chen, Yilun Zhao, Simeng Han, Shafiq Joty, Pengfei Liu, Dragomir Radev, Chien-Sheng Wu, Arman Cohan

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

Comments NAACL 2024 Findings, GitHub Repo: https://github.com/yale-nlp/InstruSum, LLM-evaluators Leaderboard: https://huggingface.co/spaces/yale-nlp/InstruSumEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06645 2024-07-12 cs.LG cs.CL 62%

Entropy Law: The Story Behind Data Compression and LLM Performance

Mingjia Yin, Chuhan Wu, Yufei Wang, Hao Wang, Wei Guo, Yasheng Wang, Yong Liu, Ruiming Tang, Defu Lian, Enhong Chen

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06564 2024-07-10 cs.CL cs.AI 62%

Combining Knowledge Graphs and Large Language Models

Amanda Kau, Xuzeng He, Aishwarya Nambissan, Aland Astudillo, Hui Yin, Amir Aryani

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04370 2024-07-10 cs.LG cs.AI 62%

Regulating Model Reliance on Non-Robust Features by Smoothing Input Marginal Density

Peiyu Yang, Naveed Akhtar, Mubarak Shah, Ajmal Mian

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07362 2024-07-10 cs.LG cs.AI cs.CV 62%

Challenging Forgets: Unveiling the Worst-Case Forget Sets in Machine Unlearning

Chongyu Fan, Jiancheng Liu, Alfred Hero, Sijia Liu

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05036 2024-07-09 cs.CL cs.LG 62%

Enhance the Robustness of Text-Centric Multimodal Alignments

Ting-Yu Yen, Yun-Da Tsai, Keng-Te Liao, Shou-De Lin

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04050 2024-07-08 cs.CL cs.AI 62%

Deep Content Understanding Toward Entity and Aspect Target Sentiment Analysis on Foundation Models

Vorakit Vorakitphan, Milos Basic, Guilhaume Leroy Meline

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Proceedings of the 41 st International Conference on Machine Learning, Vienna, Austria. PMLR 235, 2024. Copyright 2024 by the author(s)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01231 2024-07-02 cs.CL cs.AI 62%

MIRAI: Evaluating LLM Agents for Event Forecasting

Chenchen Ye, Ziniu Hu, Yihe Deng, Zijie Huang, Mingyu Derek Ma, Yanqiao Zhu, Wei Wang

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments 66 pages, 8 figures, 6 tables; Website: https://mirai-llm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00197 2024-07-02 cs.AI cs.LG 62%

Tradeoffs When Considering Deep Reinforcement Learning for Contingency Management in Advanced Air Mobility

Luis E. Alvarez, Marc W. Brittain, Steven D. Young

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00541 2024-07-02 cs.CL cs.AI cs.IR 62%

Answering real-world clinical questions using large language model based systems

Yen Sia Low, Michael L. Jackson, Rebecca J. Hyde, Robert E. Brown, Neil M. Sanghavi, Julian D. Baldwin, C. William Pike, Jananee Muralidharan, Gavin Hui, Natasha Alexander, Hadeel Hassan, Rahul V. Nene, Morgan Pike, Courtney J. Pokrzywa, Shivam Vedak, Adam Paul Yan, Dong-han Yao, Amy R. Zipursky, Christina Dinh, Philip Ballentine, Dan C. Derieg, Vladimir Polony, Rehan N. Chawdry, Jordan Davies, Brigham B. Hyde, Nigam H. Shah, Saurabh Gombar

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments 28 pages (2 figures, 3 tables) inclusive of 8 pages of supplemental materials (4 supplemental figures and 4 supplemental tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19614 2024-07-01 cs.LG cs.AI 62%

A Survey on Data Quality Dimensions and Tools for Machine Learning

Yuhan Zhou, Fengjiao Tu, Kewei Sha, Junhua Ding, Haihua Chen

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments This paper has been accepted by The 6th IEEE International Conference on Artificial Intelligence Testing (IEEE AITest 2024) as an invited paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18192 2024-06-28 cs.CL cs.AI 62%

Methodology of Adapting Large English Language Models for Specific Cultural Contexts

Wenjing Zhang, Siqi Xiao, Xuejiao Lei, Ning Wang, Huazheng Zhang, Meijuan An, Bikun Yang, Zhaoxiang Liu, Kai Wang, Shiguo Lian

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08704 2024-06-28 cs.CL cs.AI 62%

Can Large Language Models Follow Concept Annotation Guidelines? A Case Study on Scientific and Financial Domains

Marcio Fonseca, Shay B. Cohen

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments ACL 2024 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18049 2024-06-27 cs.CL cs.AI 62%

Improving Entity Recognition Using Ensembles of Deep Learning and Fine-tuned Large Language Models: A Case Study on Adverse Event Extraction from Multiple Sources

Yiming Li, Deepthi Viswaroopan, William He, Jianfu Li, Xu Zuo, Hua Xu, Cui Tao

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15752 2024-06-25 eess.AS cs.AI cs.CL 62%

TacoLM: GaTed Attention Equipped Codec Language Model are Efficient Zero-Shot Text to Speech Synthesizers

Yakun Song, Zhuo Chen, Xiaofei Wang, Ziyang Ma, Guanrou Yang, Xie Chen

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments INTERSPEECH 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17174 2024-06-25 cs.CV cs.AI cs.LG 62%

Visual Explanations of Image-Text Representations via Multi-Modal Information Bottleneck Attribution

Ying Wang, Tim G. J. Rudner, Andrew Gordon Wilson

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments Published in Advances in Neural Information Processing Systems 36 (NeurIPS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15109 2024-06-24 cs.CL cs.LG 62%

Brain-Like Language Processing via a Shallow Untrained Multihead Attention Network

Badr AlKhamissi, Greta Tuckute, Antoine Bosselut, Martin Schrimpf

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14232 2024-06-21 cs.LG cs.AI 62%

Enhancing robustness of data-driven SHM models: adversarial training with circle loss

Xiangli Yang, Xijie Deng, Hanwei Zhang, Yang Zou, Jianxi Yang

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16421 2024-06-21 cs.CL cs.CY 62%

CDEval: A Benchmark for Measuring the Cultural Dimensions of Large Language Models

Yuhang Wang, Yanxu Zhu, Chao Kong, Shuyu Wei, Xiaoyuan Yi, Xing Xie, Jitao Sang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

Comments Accepted by the Cross-Cultural Considerations in NLP Workshop @ ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12929 2024-06-21 cs.CR cs.AI cs.LG 62%

RMF: A Risk Measurement Framework for Machine Learning Models

Jan Schröder, Jakub Breier

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted at CSA@ARES 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12223 2024-06-19 cs.CL cs.CY 62%

ToxiCloakCN: Evaluating Robustness of Offensive Language Detection in Chinese with Cloaking Perturbations

Yunze Xiao, Yujia Hu, Kenny Tsu Wei Choo, Roy Ka-wei Lee

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

Comments 10 pages,5 Tables, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10977 2024-06-18 cs.LG cs.AI cs.SY eess.SY math.OC 62%

Generative AI and Process Systems Engineering: The Next Frontier

Benjamin Decardi-Nelson, Abdulelah S. Alshehri, Akshay Ajagekar, Fengqi You

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Journal ref Computers & Chemical Engineering, Volume 187, August 2024, 108723

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09388 2024-06-14 cs.CV cs.AI cs.LG 62%

Exploring the Spectrum of Visio-Linguistic Compositionality and Recognition

Youngtaek Oh, Pyunghwan Ahn, Jinhyung Kim, Gwangmo Song, Soonyoung Lee, In So Kweon, Junmo Kim

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments Accepted to CVPRW 2024 on 'What is Next in Multimodal Foundation Models?'. Code: https://github.com/ytaek-oh/vl_compo

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01193 2024-06-13 cs.CL cs.AI 62%

RAGged Edges: The Double-Edged Sword of Retrieval-Augmented Chatbots

Philip Feldman, James R. Foulds, Shimei Pan

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments 7 Pages, 1 Figure, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07036 2024-06-12 cs.CL cs.AI 62%

Paying More Attention to Source Context: Mitigating Unfaithful Translations from Large Language Model

Hongbin Zhang, Kehai Chen, Xuefeng Bai, Yang Xiang, Min Zhang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06474 2024-06-11 cs.AI cs.CL 62%

Towards a Personal Health Large Language Model

Justin Cosentino, Anastasiya Belyaeva, Xin Liu, Nicholas A. Furlotte, Zhun Yang, Chace Lee, Erik Schenck, Yojan Patel, Jian Cui, Logan Douglas Schneider, Robby Bryant, Ryan G. Gomes, Allen Jiang, Roy Lee, Yun Liu, Javier Perez, Jameson K. Rogers, Cathy Speed, Shyam Tailor, Megan Walker, Jeffrey Yu, Tim Althoff, Conor Heneghan, John Hernandez, Mark Malhotra, Leor Stern, Yossi Matias, Greg S. Corrado, Shwetak Patel, Shravya Shetty, Jiening Zhan, Shruthi Prabhakara, Daniel McDuff, Cory Y. McLean

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments 72 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05079 2024-06-10 cs.CL cs.LG 62%

SUMIE: A Synthetic Benchmark for Incremental Entity Summarization

Eunjeong Hwang, Yichao Zhou, Beliz Gunel, James Bradley Wendt, Sandeep Tata

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

Comments 24 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15485 2024-06-10 cs.CL cs.AI 62%

Evaluating the Efficacy of Large Language Models in Identifying Phishing Attempts

Het Patel, Umair Rehman, Farkhund Iqbal

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03997 2024-06-07 cs.AI cs.LG 62%

HackAtari: Atari Learning Environments for Robust and Continual Reinforcement Learning

Quentin Delfosse, Jannis Blüml, Bjarne Gregori, Kristian Kersting

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments 9 main pages, 4 pages references, 19 pages of appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16775 2024-06-07 cs.CL cs.AI 62%

A Comprehensive Evaluation of Quantization Strategies for Large Language Models

Renren Jin, Jiangcun Du, Wuwei Huang, Wei Liu, Jian Luan, Bin Wang, Deyi Xiong

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏