arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1847 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1847 篇

2406.05315 2025-02-25 cs.CL cs.AI cs.LG 67%

Aligned at the Start: Conceptual Groupings in LLM Embeddings

Mehrdad Khatir, Sanchit Kabra, Chandan K. Reddy

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14143 2025-02-21 cs.MA cs.AI cs.CY cs.ET cs.LG 67%

Multi-Agent Risks from Advanced AI

Lewis Hammond, Alan Chan, Jesse Clifton, Jason Hoelscher-Obermaier, Akbir Khan, Euan McLean, Chandler Smith, Wolfram Barfuss, Jakob Foerster, Tomáš Gavenčiak, The Anh Han, Edward Hughes, Vojtěch Kovařík, Jan Kulveit, Joel Z. Leibo, Caspar Oesterheld, Christian Schroeder de Witt, Nisarg Shah, Michael Wellman, Paolo Bova, Theodor Cimpeanu, Carson Ezell, Quentin Feuillade-Montixi, Matija Franklin, Esben Kran, Igor Krawczuk, Max Lamparth, Niklas Lauffer, Alexander Meinke, Sumeet Motwani, Anka Reuel, Vincent Conitzer, Michael Dennis, Iason Gabriel, Adam Gleave, Gillian Hadfield, Nika Haghtalab, Atoosa Kasirzadeh, Sébastien Krier, Kate Larson, Joel Lehman, David C. Parkes, Georgios Piliouras, Iyad Rahwan

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments Cooperative AI Foundation, Technical Report #1

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10868 2025-01-31 cs.AI cs.CL cs.CY cs.HC 67%

From Google Gemini to OpenAI Q* (Q-Star): A Survey of Reshaping the Generative Artificial Intelligence (AI) Research Landscape

Timothy R. McIntosh, Teo Susnjak, Tong Liu, Paul Watters, Malka N. Halgamuge

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16451 2024-12-24 cs.LG cs.AI cs.CL 67%

Correcting Large Language Model Behavior via Influence Function

Han Zhang, Zhuo Zhang, Yi Zhang, Yuanzhao Zhai, Hanyang Peng, Yu Lei, Yue Yu, Hui Wang, Bin Liang, Lin Gui, Ruifeng Xu

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10939 2024-12-17 cs.CY cs.AI cs.CL cs.HC 67%

Human-Centric NLP or AI-Centric Illusion?: A Critical Investigation

Piyapath T Spencer

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Preprint to be published in Proceedings of PACLIC38

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00067 2024-11-25 cs.AI cs.CY cs.LG 67%

Transformers in Healthcare: A Survey

Subhash Nerella, Sabyasachi Bandyopadhyay, Jiaqing Zhang, Miguel Contreras, Scott Siegel, Aysegul Bumin, Brandon Silva, Jessica Sena, Benjamin Shickel, Azra Bihorac, Kia Khezeli, Parisa Rashidi

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

Journal ref Transformers and large language models in healthcare: A review, Artificial Intelligence in Medicine, Volume 154, 2024, 102900,

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17459 2024-10-24 cs.LG cs.AI cs.CR cs.CY 67%

Data Obfuscation through Latent Space Projection (LSP) for Privacy-Preserving AI Governance: Case Studies in Medical Diagnosis and Finance Fraud Detection

Mahesh Vaijainthymala Krishnamoorthy

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 19 pages, 6 figures, submitted to Conference ICADCML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12142 2024-10-23 cs.LG cs.AI cs.CV cs.CY 67%

Slicing Through Bias: Explaining Performance Gaps in Medical Image Analysis using Slice Discovery Methods

Vincent Olesen, Nina Weng, Aasa Feragen, Eike Petersen

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments MICCAI 2024 Workshop on Fairness of AI in Medical Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13784 2024-10-21 cs.LG cs.AI cs.CY cs.SE 67%

The Model Openness Framework: Promoting Completeness and Openness for Reproducibility, Transparency, and Usability in Artificial Intelligence

Matt White, Ibrahim Haddad, Cailean Osborne, Xiao-Yang Yanglet Liu, Ahmed Abdelmonsef, Sachin Varghese, Arnaud Le Hors

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 28 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12700 2024-10-17 cs.CV cs.AI cs.CY cs.LG cs.MM 67%

Embedding an Ethical Mind: Aligning Text-to-Image Synthesis via Lightweight Value Optimization

Xingqi Wang, Xiaoyuan Yi, Xing Xie, Jia Jia

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

Comments Accepted by ACM Multimedia 2024. The dataset and code can be found at https://github.com/achernarwang/LiVO

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11143 2024-10-16 cs.CL cs.AI cs.LG 67%

LLM Unlearning via Loss Adjustment with Only Forget Data

Yaxuan Wang, Jiaheng Wei, Chris Yuhao Liu, Jinlong Pang, Quan Liu, Ankit Parag Shah, Yujia Bao, Yang Liu, Wei Wei

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01833 2024-10-04 cs.SE cs.HC 67%

Ethical software requirements from user reviews: A systematic literature review

Aakash Sorathiya, Gouri Ginde

专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16496 2024-09-26 cs.CY cs.AI cs.LG 67%

Articulation Work and Tinkering for Fairness in Machine Learning

Miriam Fahimi, Mayra Russo, Kristen M. Scott, Maria-Esther Vidal, Bettina Berendt, Katharina Kinder-Kurlanda

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11879 2024-08-23 cs.CL cs.AI cs.LG 67%

Beyond Labels: Aligning Large Language Models with Human-like Reasoning

Muhammad Rafsan Kabir, Rafeed Mohammad Sultan, Ihsanul Haque Asif, Jawad Ibn Ahad, Fuad Rahman, Mohammad Ruhul Amin, Nabeel Mohammed, Shafin Rahman

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted in ICPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10239 2024-08-21 cs.CY cs.AI cs.LG cs.SE 67%

A Conceptual Framework for Ethical Evaluation of Machine Learning Systems

Neha R. Gupta, Jessica Hullman, Hari Subramonyam

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11852 2024-08-16 cs.CY cs.AI cs.CL 67%

Risks from Language Models for Automated Mental Healthcare: Ethics and Structure for Implementation

Declan Grabb, Max Lamparth, Nina Vasan

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Updated with fine-tuned model results to match CoLM accepted camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04673 2024-08-12 cs.CL cs.AI cs.LG 67%

AutoFAIR : Automatic Data FAIRification via Machine Reading

Tingyan Ma, Wei Liu, Bin Lu, Xiaoying Gan, Yunqiang Zhu, Luoyi Fu, Chenghu Zhou

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01962 2024-08-06 cs.HC cs.AI cs.CL cs.CY cs.ET 67%

The Implications of Open Generative Models in Human-Centered Data Science Work: A Case Study with Fact-Checking Organizations

Robert Wolfe, Tanushree Mitra

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Accepted at Artificial Intelligence, Ethics, and Society 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19256 2024-07-30 cs.AI cs.CL cs.LG 67%

Stochastic Parrots or ICU Experts? Large Language Models in Critical Care Medicine: A Scoping Review

Tongyue Shi, Jun Ma, Zihan Yu, Haowei Xu, Minqi Xiong, Meirong Xiao, Yilin Li, Huiying Zhao, Guilan Kong

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15009 2024-07-24 cs.CY cs.AI cs.CL 67%

RogueGPT: dis-ethical tuning transforms ChatGPT4 into a Rogue AI in 158 Words

Alessio Buscemi, Daniele Proverbio

专题命中 AI治理与伦理 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01218 2024-07-02 cs.CL cs.AI cs.LG 67%

Self-Supervised Position Debiasing for Large Language Models

Zhongkun Liu, Zheng Chen, Mengqi Zhang, Zhaochun Ren, Pengjie Ren, Zhumin Chen

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by ACL 2024 findings, this is the camera-ready version; 21 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11780 2024-06-18 cs.LG cs.AI cs.CL 67%

Split, Unlearn, Merge: Leveraging Data Attributes for More Effective Unlearning in LLMs

Swanand Ravindra Kadhe, Farhan Ahmed, Dennis Wei, Nathalie Baracaldo, Inkit Padhi

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04064 2024-06-07 cs.CL cs.AI cs.CY 67%

Ask LLMs Directly, "What shapes your bias?": Measuring Social Bias in Large Language Models

Jisu Shin, Hoyun Song, Huije Lee, Soyeong Jeong, Jong C. Park

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Findings of ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06909 2024-05-14 cs.LG cs.AI cs.CY 67%

Fairness in Reinforcement Learning: A Survey

Anka Reuel, Devin Ma

专题命中 AI治理与伦理 :RLHF(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08605 2024-05-14 cs.CL cs.AI cs.CY cs.SI 67%

Exploring the Jungle of Bias: Political Bias Attribution in Language Models via Dependency Analysis

David F. Jenny, Yann Billeter, Mrinmaya Sachan, Bernhard Schölkopf, Zhijing Jin

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02822 2024-04-05 cs.CY cs.CL cs.LG 67%

Identifying Climate Targets in National Laws and Policies using Machine Learning

Matyas Juhasz, Tina Marchand, Roshan Melwani, Kalyan Dutia, Sarah Goodenough, Harrison Pim, Henry Franks

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.00225 2024-04-02 cs.AI cs.CY cs.LG 67%

Instructed to Bias: Instruction-Tuned Language Models Exhibit Emergent Cognitive Bias

Itay Itzhak, Gabriel Stanovsky, Nir Rosenfeld, Yonatan Belinkov

专题命中 AI治理与伦理 :RLHF(abstract);分类 cs.AI、cs.CY、cs.LG

Comments TACL 2024. Presented at ACL 2024. 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11053 2024-03-05 cs.CL cs.AI cs.CY 67%

Denevil: Towards Deciphering and Navigating the Ethical Values of Large Language Models via Instruction Learning

Shitong Duan, Xiaoyuan Yi, Peng Zhang, Tun Lu, Xing Xie, Ning Gu

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Accepted by ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06924 2023-06-16 cs.AI cs.CR cs.CY cs.LG 67%

TASRA: a Taxonomy and Analysis of Societal-Scale Risks from AI

Andrew Critch, Stuart Russell

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03503 2023-06-13 cs.CY cs.AI cs.CL 67%

Applying Standards to Advance Upstream & Downstream Ethics in Large Language Models

Jose Berengueres, Marybeth Sandell

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 8 pages, 4 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏