arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1852 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1852 篇

2410.20321 2024-10-29 cs.AI 57%

Effective Instruction Parsing Plugin for Complex Logical Query Answering on Knowledge Graphs

Xingrui Zhuo, Jiapu Wang, Gongqing Wu, Shirui Pan, Xindong Wu

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00227 2024-10-28 cs.CY 57%

From human-centered to social-centered artificial intelligence: Assessing ChatGPT's impact through disruptive events

Skyler Wang, Ned Cooper, Margaret Eby

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

Comments 14 pages. Published version

Journal ref Big Data & Society 11(1), 1-14 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17602 2024-10-24 cs.RO cs.AI 57%

Integrating Large Language Models for UAV Control in Simulated Environments: A Modular Interaction Approach

Abhishek Phadke, Alihan Hadimlioglu, Tianxing Chu, Chandra N Sekharan

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17555 2024-10-24 cs.AI 57%

FairDgcl: Fairness-aware Recommendation with Dynamic Graph Contrastive Learning

Wei Chen, Meng Yuan, Zhao Zhang, Ruobing Xie, Fuzhen Zhuang, Deqing Wang, Rui Liu

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

Comments 12 pages, submitted to TKDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13116 2024-10-22 cs.CL 57%

A Survey on Knowledge Distillation of Large Language Models

Xiaohan Xu, Ming Li, Chongyang Tao, Tao Shen, Reynold Cheng, Jinyang Li, Can Xu, Dacheng Tao, Tianyi Zhou

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11084 2024-10-16 cs.CL 57%

Gender Bias in Decision-Making with Large Language Models: A Study of Relationship Conflicts

Sharon Levy, William D. Adler, Tahilin Sanchez Karver, Mark Dredze, Michelle R. Kaufman

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

Comments EMNLP Findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09992 2024-10-15 cs.CL 57%

Evaluating Gender Bias of LLMs in Making Morality Judgements

Divij Bajaj, Yuanyuan Lei, Jonathan Tong, Ruihong Huang

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

Comments Accepted by EMNLP Findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07589 2024-10-11 cs.IR cs.CL 57%

No Free Lunch: Retrieval-Augmented Generation Undermines Fairness in LLMs, Even for Vigilant Users

Mengxuan Hu, Hongyi Wu, Zihan Guan, Ronghang Zhu, Dongliang Guo, Daiqing Qi, Sheng Li

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06566 2024-10-10 cs.CL 57%

Detecting Bias and Enhancing Diagnostic Accuracy in Large Language Models for Healthcare

Pardis Sadat Zahraei, Zahra Shakeri

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01420 2024-10-08 cs.CY 57%

Coordinated Disclosure of Dual-Use Capabilities: An Early Warning System for Advanced AI

Joe O'Brien, Shaun Ee, Jam Kraprayoon, Bill Anderson-Samways, Oscar Delaney, Zoe Williams

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

Comments 76 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15497 2024-10-02 cs.CY 57%

Foregrounding Artist Opinions: A Survey Study on Transparency, Ownership, and Fairness in AI Generative Art

Juniper Lovato, Julia Zimmerman, Isabelle Smith, Peter Dodds, Jennifer Karson

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16371 2024-09-26 cs.CL 57%

Do the Right Thing, Just Debias! Multi-Category Bias Mitigation Using LLMs

Amartya Roy, Danush Khanna, Devanshu Mahapatra, Vasanthakumar, Avirup Das, Kripabandhu Ghosh

专题命中 AI治理与伦理 :DPO(abstract);分类 cs.CL

Comments 17 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05247 2024-09-10 cs.CL 57%

Socially Responsible Data for Large Multilingual Language Models

Andrew Smart, Ben Hutchinson, Lameck Mbangula Amugongo, Suzanne Dikker, Alex Zito, Amber Ebinama, Zara Wudiri, Ding Wang, Erin van Liemt, João Sedoc, Seyi Olojo, Stanley Uwakwe, Edem Wornyo, Sonja Schmer-Galunder, Jamila Smith-Loud

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

Journal ref ACM conference on Equity and Access in Algorithms, Mechanisms, and Optimization, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12420 2024-08-23 cs.AI 57%

Dataset | Mindset = Explainable AI | Interpretable AI

Caesar Wu, Rajkumar Buyya, Yuan Fang Li, Pascal Bouvry

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10711 2024-08-21 cs.AI 57%

Investigating Context Effects in Similarity Judgements in Large Language Models

Sagar Uprety, Amit Kumar Jaiswal, Haiming Liu, Dawei Song

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

Comments Accepted at The First Workshop on AI Behavioral Science (AIBS 2024), held in conjunction with KDD 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10365 2024-08-21 cs.AI 57%

AI-Driven Review Systems: Evaluating LLMs in Scalable and Bias-Aware Academic Reviews

Keith Tyser, Ben Segev, Gaston Longhitano, Xin-Yu Zhang, Zachary Meeks, Jason Lee, Uday Garg, Nicholas Belsten, Avi Shporer, Madeleine Udell, Dov Te'eni, Iddo Drori

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10160 2024-08-19 cs.AI 57%

Reinforcement Learning from Multi-role Debates as Feedback for Bias Mitigation in LLMs

Ruoxi Cheng, Haoxuan Ma, Shuirong Cao, Jiaqi Li, Aihua Pei, Zhiqiang Wang, Pengliang Ji, Haoyu Wang, Jiaqi Huo

专题命中 AI治理与伦理 :RLHF(abstract);分类 cs.AI

Comments The first three authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07990 2024-08-06 cs.CV cs.AI 57%

OpenBias: Open-set Bias Detection in Text-to-Image Generative Models

Moreno D'Incà, Elia Peruzzo, Massimiliano Mancini, Dejia Xu, Vidit Goel, Xingqian Xu, Zhangyang Wang, Humphrey Shi, Nicu Sebe

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

Comments CVPR 2024 Highlight - Code: https://github.com/Picsart-AI-Research/OpenBias

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11733 2024-08-02 cs.CL 57%

How Are LLMs Mitigating Stereotyping Harms? Learning from Search Engine Studies

Alina Leidinger, Richard Rogers

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

Comments Accepted at AAAI/ACM AI, Ethics, and Society

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09241 2024-07-15 cs.CL 57%

The Sociolinguistic Foundations of Language Modeling

Jack Grieve, Sara Bartl, Matteo Fuoli, Jason Grafmiller, Weihang Huang, Alejandro Jawerbaum, Akira Murakami, Marcus Perlman, Dana Roemling, Bodo Winter

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.15399 2024-07-02 cs.CL 57%

Rethinking Machine Ethics -- Can LLMs Perform Moral Reasoning through the Lens of Moral Theories?

Jingyan Zhou, Minda Hu, Junan Li, Xiaoying Zhang, Xixin Wu, Irwin King, Helen Meng

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

Journal ref Findings of the Association for Computational Linguistics: NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11290 2024-07-01 cs.CL 57%

MBIAS: Mitigating Bias in Large Language Models While Retaining Context

Shaina Raza, Ananya Raval, Veronica Chatrath

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05506 2024-06-26 cs.CL 57%

Cross-Care: Assessing the Healthcare Implications of Pre-training Data on Language Model Bias

Shan Chen, Jack Gallifant, Mingye Gao, Pedro Moreira, Nikolaj Munch, Ajay Muthukkumar, Arvind Rajan, Jaya Kolluri, Amelia Fiske, Janna Hastings, Hugo Aerts, Brian Anthony, Leo Anthony Celi, William G. La Cava, Danielle S. Bitterman

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

Comments Submitted for review, data visualization tool available at: www.crosscare.net

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15376 2024-06-25 cs.CY cs.HC 57%

Crossing the principle-practice gap in AI ethics with ethical problem-solving

Nicholas Kluge Corrêa, James William Santos, Camila Galvão, Marcelo Pasetti, Dieine Schiavon, Faizah Naqvi, Robayet Hossain, Nythamar De Oliveira

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11661 2024-06-21 cs.CL 57%

Cultural Conditioning or Placebo? On the Effectiveness of Socio-Demographic Prompting

Sagnik Mukherjee, Muhammad Farid Adilazuarda, Sunayana Sitaram, Kalika Bali, Alham Fikri Aji, Monojit Choudhury

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09029 2024-06-14 cs.CY 57%

Fair by design: A sociotechnical approach to justifying the fairness of AI-enabled systems across the lifecycle

Marten H. L. Kaas, Christopher Burr, Zoe Porter, Berk Ozturk, Philippa Ryan, Michael Katell, Nuala Polo, Kalle Westerling, Ibrahim Habli

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03255 2024-06-06 cs.LG 57%

On the Maximal Local Disparity of Fairness-Aware Classifiers

Jinqiu Jin, Haoxuan Li, Fuli Feng

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.LG

Journal ref ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02622 2024-06-06 cs.CR cs.AI 57%

Safeguarding Large Language Models: A Survey

Yi Dong, Ronghui Mu, Yanghao Zhang, Siqi Sun, Tianle Zhang, Changshun Wu, Gaojie Jin, Yi Qi, Jinwei Hu, Jie Meng, Saddek Bensalem, Xiaowei Huang

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

Comments under review. arXiv admin note: text overlap with arXiv:2402.01822

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18346 2024-05-29 cs.AI 57%

Intelligent Clinical Documentation: Harnessing Generative AI for Patient-Centric Clinical Note Generation

Anjanava Biswas, Wrick Talukdar

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

Comments 15 pages, 7 figures

Journal ref International Journal of Innovative Science and Research Technology: Vol. 9 (2024): No. 5, 994-1008

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11668 2024-05-21 cs.CL 57%

Cyber Risks of Machine Translation Critical Errors : Arabic Mental Health Tweets as a Case Study

Hadeel Saadany, Ashraf Tantawy, Constantin Orasan

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏