arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9380 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9380 篇

2404.04167 2024-09-16 cs.CL cs.AI 62%

Chinese Tiny LLM: Pretraining a Chinese-Centric Large Language Model

Xinrun Du, Zhouliang Yu, Songyang Gao, Ding Pan, Yuyang Cheng, Ziyang Ma, Ruibin Yuan, Xingwei Qu, Jiaheng Liu, Tianyu Zheng, Xinchen Luo, Guorui Zhou, Wenhu Chen, Ge Zhang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07808 2024-09-13 cs.CV cs.AI cs.LG cs.RO 62%

What Matters to Enhance Traffic Rule Compliance of Imitation Learning for End-to-End Autonomous Driving

Hongkuan Zhou, Wei Cao, Aifen Sui, Zhenshan Bing

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07088 2024-09-12 cs.CL cs.AI 62%

Ontology-Free General-Domain Knowledge Graph-to-Text Generation Dataset Synthesis using Large Language Model

Daehee Kim, Deokhyung Kang, Sangwon Ryu, Gary Geunbae Lee

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06072 2024-09-11 cs.CL cs.LG 62%

DetoxBench: Benchmarking Large Language Models for Multitask Fraud & Abuse Detection

Joymallya Chakraborty, Wei Xia, Anirban Majumder, Dan Ma, Walid Chaabene, Naveed Janvekar

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

Comments 12 pages

Journal ref Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15381 2024-09-10 cs.LG cs.AI 62%

Advances and Open Challenges in Federated Foundation Models

Chao Ren, Han Yu, Hongyi Peng, Xiaoli Tang, Bo Zhao, Liping Yi, Alysa Ziying Tan, Yulan Gao, Anran Li, Xiaoxiao Li, Zengxiang Li, Qiang Yang

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments Survey of Federated Foundation Models (FedFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15166 2024-09-10 cs.CL cs.AI physics.ao-ph 62%

Pixels and Predictions: Potential of GPT-4V in Meteorological Imagery Analysis and Forecast Communication

John R. Lawson, Joseph E. Trujillo-Falcón, David M. Schultz, Montgomery L. Flora, Kevin H. Goebbert, Seth N. Lyman, Corey K. Potvin, Adam J. Stepanek

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments Supplementary material PDF attached. Submitted to Artificial Intelligence for the Earth Systems (American Meteorological Society) on 18 April 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04478 2024-09-10 cs.LG cs.AI cs.NE 62%

Evaluating Open-Source Sparse Autoencoders on Disentangling Factual Knowledge in GPT-2 Small

Maheep Chaudhary, Atticus Geiger

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02326 2024-09-05 cs.CL cs.AI 62%

Arctic-SnowCoder: Demystifying High-Quality Data in Code Pretraining

Yuxiang Wei, Hojae Han, Rajhans Samdani

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01138 2024-09-04 cs.CV cs.AI cs.HC cs.LG 62%

Generating Synthetic Satellite Imagery for Rare Objects: An Empirical Comparison of Models and Metrics

Tuong Vy Nguyen, Johannes Hoster, Alexander Glaser, Kristian Hildebrand, Felix Biessmann

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments Presented at KI 2024 - 47th German Conference on AI, 2nd Workshop on Public Interest AI, 23 September, 2024, Wuerzburg, DE

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00347 2024-09-04 cs.LG cs.CL 62%

Chatting Up Attachment: Using LLMs to Predict Adult Bonds

Paulo Soares, Sean McCurdy, Andrew J. Gerber, Peter Fonagy

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14219 2024-09-04 cs.CL cs.AI 62%

Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone

Marah Abdin, Jyoti Aneja, Hany Awadalla, Ahmed Awadallah, Ammar Ahmad Awan, Nguyen Bach, Amit Bahree, Arash Bakhtiari, Jianmin Bao, Harkirat Behl, Alon Benhaim, Misha Bilenko, Johan Bjorck, Sébastien Bubeck, Martin Cai, Qin Cai, Vishrav Chaudhary, Dong Chen, Dongdong Chen, Weizhu Chen, Yen-Chun Chen, Yi-Ling Chen, Hao Cheng, Parul Chopra, Xiyang Dai, Matthew Dixon, Ronen Eldan, Victor Fragoso, Jianfeng Gao, Mei Gao, Min Gao, Amit Garg, Allie Del Giorno, Abhishek Goswami, Suriya Gunasekar, Emman Haider, Junheng Hao, Russell J. Hewett, Wenxiang Hu, Jamie Huynh, Dan Iter, Sam Ade Jacobs, Mojan Javaheripi, Xin Jin, Nikos Karampatziakis, Piero Kauffmann, Mahoud Khademi, Dongwoo Kim, Young Jin Kim, Lev Kurilenko, James R. Lee, Yin Tat Lee, Yuanzhi Li, Yunsheng Li, Chen Liang, Lars Liden, Xihui Lin, Zeqi Lin, Ce Liu, Liyuan Liu, Mengchen Liu, Weishung Liu, Xiaodong Liu, Chong Luo, Piyush Madan, Ali Mahmoudzadeh, David Majercak, Matt Mazzola, Caio César Teodoro Mendes, Arindam Mitra, Hardik Modi, Anh Nguyen, Brandon Norick, Barun Patra, Daniel Perez-Becker, Thomas Portet, Reid Pryzant, Heyang Qin, Marko Radmilac, Liliang Ren, Gustavo de Rosa, Corby Rosset, Sambudha Roy, Olatunji Ruwase, Olli Saarikivi, Amin Saied, Adil Salim, Michael Santacroce, Shital Shah, Ning Shang, Hiteshi Sharma, Yelong Shen, Swadheen Shukla, Xia Song, Masahiro Tanaka, Andrea Tupini, Praneetha Vaddamanu, Chunyu Wang, Guanhua Wang, Lijuan Wang, Shuohang Wang, Xin Wang, Yu Wang, Rachel Ward, Wen Wen, Philipp Witte, Haiping Wu, Xiaoxia Wu, Michael Wyatt, Bin Xiao, Can Xu, Jiahang Xu, Weijian Xu, Jilong Xue, Sonali Yadav, Fan Yang, Jianwei Yang, Yifan Yang, Ziyi Yang, Donghan Yu, Lu Yuan, Chenruidong Zhang, Cyril Zhang, Jianwen Zhang, Li Lyna Zhang, Yi Zhang, Yue Zhang, Yunan Zhang, Xiren Zhou

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15897 2024-08-29 cs.CY cs.HC cs.LG 62%

Red-Teaming for Generative AI: Silver Bullet or Security Theater?

Michael Feffer, Anusha Sinha, Wesley Hanwen Deng, Zachary C. Lipton, Hoda Heidari

专题命中 安全评测 :safety(abstract);分类 cs.CY、cs.LG

Comments AIES 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17700 2024-08-28 cs.CL cs.LG 62%

RAVEL: Evaluating Interpretability Methods on Disentangling Language Model Representations

Jing Huang, Zhengxuan Wu, Christopher Potts, Mor Geva, Atticus Geiger

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

Comments Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (ACL 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11925 2024-08-23 cs.AI cs.CY 62%

An Open Knowledge Graph-Based Approach for Mapping Concepts and Requirements between the EU AI Act and International Standards

Julio Hernandez, Delaram Golpayegani, Dave Lewis

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY

Comments This work was presented at the 9th International Symposium on Language & Knowledge Engineering (LKE 2024) Dublin, Ireland, 4 - 6 June, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08374 2024-08-19 cs.CL cs.LG 62%

Evaluating Text Classification Robustness to Part-of-Speech Adversarial Examples

Anahita Samadi, Allison Sullivan

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05799 2024-08-15 cs.CL cs.AI cs.MA q-fin.GN 62%

Designing Heterogeneous LLM Agents for Financial Sentiment Analysis

Frank Xing

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03943 2024-08-09 cs.HC cs.AI cs.LG 62%

Building Machines that Learn and Think with People

Katherine M. Collins, Ilia Sucholutsky, Umang Bhatt, Kartik Chandra, Lionel Wong, Mina Lee, Cedegao E. Zhang, Tan Zhi-Xuan, Mark Ho, Vikash Mansinghka, Adrian Weller, Joshua B. Tenenbaum, Thomas L. Griffiths

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03562 2024-08-08 cs.CL cs.AI 62%

A Comparison of LLM Finetuning Methods & Evaluation Metrics with Travel Chatbot Use Case

Sonia Meyer, Shreya Singh, Bertha Tam, Christopher Ton, Angel Ren

专题命中 安全评测 :RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02357 2024-08-06 cs.AI cs.LG math.OC math.PR 62%

On the consistent reasoning paradox of intelligence and optimal trust in AI: The power of 'I don't know'

Alexander Bastounis, Paolo Campodonico, Mihaela van der Schaar, Ben Adcock, Anders C. Hansen

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments 12 pages and 50 pages of supplementary material, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19324 2024-07-30 cs.LG cs.CY 62%

Deep Learning Based Crime Prediction Models: Experiments and Analysis

Rittik Basak Utsha, Muhtasim Noor Alif, Yeasir Rayhan, Tanzima Hashem, Mohammad Eunus Ali

专题命中 安全评测 :safety(abstract);分类 cs.CY、cs.LG

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17987 2024-07-26 cs.CL cs.AI 62%

Multi-step Inference over Unstructured Data

Aditya Kalyanpur, Kailash Karthik Saravanakumar, Victor Barres, CJ McFate, Lori Moon, Nati Seifu, Maksim Eremeev, Jose Barrera, Abraham Bautista-Castillo, Eric Brown, David Ferrucci

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18327 2024-07-23 cs.CL cs.AI 62%

$\forall$uto$\exists$val: Autonomous Assessment of LLMs in Formal Synthesis and Interpretation Tasks

Rushang Karia, Daniel Bramblett, Daksh Dobhal, Pulkit Verma, Siddharth Srivastava

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16977 2024-07-22 eess.SY cs.AI cs.LG cs.SY 62%

Reliability Quantification of Deep Reinforcement Learning-based Control

Hitoshi Yoshioka, Hirotada Hashimoto

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments 18 pages and 17 figures

Journal ref Algorithms 2024, 17(7), 314

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07202 2024-07-19 cs.CV cs.AI cs.CL 62%

UMBRAE: Unified Multimodal Brain Decoding

Weihao Xia, Raoul de Charette, Cengiz Öztireli, Jing-Hao Xue

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments ECCV 2024. Project: https://weihaox.github.io/UMBRAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12018 2024-07-18 cs.CL cs.AI 62%

Empirical Evaluation of Public HateSpeech Datasets

Sadar Jaf, Basel Barakat

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 12 tables, 1 algorithm pseudocode, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11121 2024-07-17 cs.CV cs.AI cs.LG 62%

Towards Adversarially Robust Vision-Language Models: Insights from Design Choices and Prompt Formatting Techniques

Rishika Bhagwatkar, Shravan Nayak, Reza Bayat, Alexis Roger, Daniel Z Kaplan, Pouya Bashivan, Irina Rish

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02544 2024-07-17 cs.CV cs.AI cs.LG 62%

LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language Model

Dilxat Muhtar, Zhenshi Li, Feng Gu, Xueliang Zhang, Pengfeng Xiao

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments 36 pages, 10 figures. Github https://github.com/NJU-LHRS/LHRS-Bot

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10457 2024-07-16 cs.CL cs.AI 62%

The Good, The Bad, and The Greedy: Evaluation of LLMs Should Not Ignore Non-Determinism

Yifan Song, Guoyin Wang, Sujian Li, Bill Yuchen Lin

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09221 2024-07-15 cs.AI cs.CY 62%

Evaluating AI Evaluation: Perils and Prospects

John Burden

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03855 2024-07-15 cs.LG cs.AI 62%

Challenges in Mechanistically Interpreting Model Representations

Satvik Golechha, James Dao

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments 9 pages, ICML 2024 Workshop on Mechanistic Interpretability

详情

展开后加载摘要…

URL PDF HTML 收藏