arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9380 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9380 篇

2308.16781 2023-11-28 cs.AI cs.LG 62%

StratMed: Relevance Stratification between Biomedical Entities for Sparsity on Medication Recommendation

Xiang Li, Shunpan Liang, Yulei Hou, Tengfei Ma

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06622 2023-11-27 cs.AI cs.CL 62%

TrainerAgent: Customizable and Efficient Model Training through LLM-Powered Multi-Agent System

Haoyuan Li, Hao Jiang, Tianke Zhang, Zhelun Yu, Aoxiong Yin, Hao Cheng, Siming Fu, Yuhao Zhang, Wanggui He

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.03157 2023-11-27 cs.AI cs.CY cs.HC 62%

Examining the Differential Risk from High-level Artificial Intelligence and the Question of Control

Kyle A. Kilian, Christopher J. Ventura, Mark M. Bailey

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00603 2023-11-23 cs.CL cs.AI 62%

Faithful Explanations of Black-box NLP Models Using LLM-generated Counterfactuals

Yair Gat, Nitay Calderon, Amir Feder, Alexander Chapanin, Amit Sharma, Roi Reichart

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10766 2023-11-21 cs.CL cs.AI 62%

Value FULCRA: Mapping Large Language Models to the Multidimensional Spectrum of Basic Human Values

Jing Yao, Xiaoyuan Yi, Xiting Wang, Yifan Gong, Xing Xie

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15479 2023-11-20 stat.ML cs.AI cs.LG 62%

AutoDiff: combining Auto-encoder and Diffusion model for tabular data synthesizing

Namjoon Suh, Xiaofeng Lin, Din-Yin Hsieh, Merhdad Honarkhah, Guang Cheng

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09366 2023-11-17 cs.CL cs.AI 62%

LOKE: Linked Open Knowledge Extraction for Automated Knowledge Graph Construction

Jamie McCusker

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07469 2023-11-17 cs.CL cs.AI 62%

InCA: Rethinking In-Car Conversational System Assessment Leveraging Large Language Models

Ken E. Friedl, Abbas Goher Khan, Soumya Ranjan Sahoo, Md Rashad Al Hasan Rony, Jana Germies, Christian Süß

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14786 2023-11-14 cs.AI cs.LG cs.NE 62%

Evolutionary approaches to explainable machine learning

Ryan Zhou, Ting Hu

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06414 2023-11-14 cs.LG cs.CL 62%

Knowledge Graphs are not Created Equal: Exploring the Properties and Structure of Real KGs

Nedelina Teneva, Estevam Hruschka

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

Comments Accepted at NeurIPS 2023 New Frontiers in Graph Learning Workshop (NeurIPS GLFrontiers 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05374 2023-11-10 cs.CL cs.AI 62%

TencentLLMEval: A Hierarchical Evaluation of Real-World Capabilities for Human-Aligned LLMs

Shuyi Xie, Wenlin Yao, Yong Dai, Shaobo Wang, Donlin Zhou, Lifeng Jin, Xinhua Feng, Pengzhi Wei, Yujie Lin, Zhichao Hu, Dong Yu, Zhengyou Zhang, Jing Nie, Yuhong Liu

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03551 2023-11-08 cs.CL cs.AI 62%

Context Unlocks Emotions: Text-based Emotion Classification Dataset Auditing with Large Language Models

Daniel Yang, Aditya Kommineni, Mohammad Alshehri, Nilamadhab Mohanty, Vedant Modi, Jonathan Gratch, Shrikanth Narayanan

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.00543 2023-11-08 cs.LG cs.AI 62%

Curating Naturally Adversarial Datasets for Learning-Enabled Medical Cyber-Physical Systems

Sydney Pugh, Ivan Ruchkin, Insup Lee, James Weimer

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.09593 2023-11-01 cs.CL cs.LG 62%

EffEval: A Comprehensive Evaluation of Efficiency for MT Evaluation Metrics

Daniil Larionov, Jens Grünwald, Christoph Leiter, Steffen Eger

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

Comments Findings of EMNLP 2023; note the title and author change

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16934 2023-10-31 cs.CV cs.CL cs.CR cs.LG cs.MM 62%

On Evaluating Adversarial Robustness of Large Vision-Language Models

Yunqing Zhao, Tianyu Pang, Chao Du, Xiao Yang, Chongxuan Li, Ngai-Man Cheung, Min Lin

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16263 2023-10-26 cs.SE cs.AI cs.CL cs.CR 62%

Enhancing Large Language Models for Secure Code Generation: A Dataset-driven Study on Vulnerability Mitigation

Jiexin Wang, Liuwen Cao, Xitong Luo, Zhiping Zhou, Jiayuan Xie, Adam Jatowt, Yi Cai

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14878 2023-10-25 cs.CL cs.AI 62%

Leveraging GPT-4 for Automatic Translation Post-Editing

Vikas Raunak, Amr Sharaf, Yiren Wang, Hany Hassan Awadallah, Arul Menezes

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments EMNLP Findings 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13132 2023-10-24 cs.CL cs.AI 62%

Better to Ask in English: Cross-Lingual Evaluation of Large Language Models for Healthcare Queries

Yiqiao Jin, Mohit Chandra, Gaurav Verma, Yibo Hu, Munmun De Choudhury, Srijan Kumar

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13012 2023-10-24 cs.CL cs.AI 62%

H2O Open Ecosystem for State-of-the-art Large Language Models

Arno Candel, Jon McKinney, Philipp Singer, Pascal Pfeiffer, Maximilian Jeblick, Chun Ming Lee, Marcos V. Conde

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2023 Demo - ACL Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11466 2023-10-20 cs.LG cs.AI q-bio.QM 62%

Protein 3D Graph Structure Learning for Robust Structure-based Protein Property Prediction

Yufei Huang, Siyuan Li, Jin Su, Lirong Wu, Odin Zhang, Haitao Lin, Jingqi Qi, Zihan Liu, Zhangyang Gao, Yuyang Liu, Jiangbin Zheng, Stan. ZQ. Li

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10780 2023-10-19 cs.CR cs.AI cs.LG 62%

Demystifying Poisoning Backdoor Attacks from a Statistical Perspective

Ganghua Wang, Xun Xian, Jayanth Srinivasa, Ashish Kundu, Xuan Bi, Mingyi Hong, Jie Ding

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08511 2023-10-13 cs.CL cond-mat.mtrl-sci cs.AI 62%

HoneyBee: Progressive Instruction Finetuning of Large Language Models for Materials Science

Yu Song, Santiago Miret, Huan Zhang, Bang Liu

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.06869 2023-10-10 cs.CL cs.AI 62%

Large Language Models Meet Harry Potter: A Bilingual Dataset for Aligning Dialogue Agents with Characters

Nuo Chen, Yan Wang, Haiyun Jiang, Deng Cai, Yuhan Li, Ziyang Chen, Longyue Wang, Jia Li

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 14 pages

Journal ref EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02727 2023-10-05 stat.ML cs.AI cs.LG 62%

Functional trustworthiness of AI systems by statistically valid testing

Bernhard Nessler, Thomas Doms, Sepp Hochreiter

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments Position paper to the current regulation and standardization effort of AI in Europe

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02447 2023-10-05 cs.SI cs.CY cs.LG 62%

Machine learning assist nyc subway navigation safer and faster

Wencheng Bao, Shi Feng

专题命中 安全评测 :safety(abstract);分类 cs.CY、cs.LG

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15698 2023-09-28 cs.LG cs.AI 62%

Deep Model Fusion: A Survey

Weishi Li, Yong Peng, Miao Zhang, Liang Ding, Han Hu, Li Shen

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14673 2023-09-27 cs.LG cs.AI cs.IR cs.SI 62%

ALEX: Towards Effective Graph Transfer Learning with Noisy Labels

Jingyang Yuan, Xiao Luo, Yifang Qin, Zhengyang Mao, Wei Ju, Ming Zhang

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments Accepted by the ACM International Conference on Multimedia (MM) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.07425 2023-09-26 cs.CL cs.AI 62%

Robust and Explainable Identification of Logical Fallacies in Natural Language Arguments

Zhivar Sourati, Vishnu Priya Prasanna Venkatesh, Darshan Deshpande, Himanshu Rawlani, Filip Ilievski, Hông-Ân Sandlin, Alain Mermoud

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.16740 2023-09-21 cs.RO cs.AI cs.HC cs.LG 62%

Principles and Guidelines for Evaluating Social Robot Navigation Algorithms

Anthony Francis, Claudia Pérez-D'Arpino, Chengshu Li, Fei Xia, Alexandre Alahi, Rachid Alami, Aniket Bera, Abhijat Biswas, Joydeep Biswas, Rohan Chandra, Hao-Tien Lewis Chiang, Michael Everett, Sehoon Ha, Justin Hart, Jonathan P. How, Haresh Karnan, Tsang-Wei Edward Lee, Luis J. Manso, Reuth Mirksy, Sören Pirk, Phani Teja Singamaneni, Peter Stone, Ada V. Taylor, Peter Trautman, Nathan Tsoi, Marynel Vázquez, Xuesu Xiao, Peng Xu, Naoki Yokoyama, Alexander Toshev, Roberto Martín-Martín

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments 42 pages, 11 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05689 2023-09-13 cs.CL cs.AI 62%

Large Language Model for Science: A Study on P vs. NP

Qingxiu Dong, Li Dong, Ke Xu, Guangyan Zhou, Yaru Hao, Zhifang Sui, Furu Wei

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 73 pages

详情

展开后加载摘要…

URL PDF HTML 收藏