arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9380 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9380 篇

2404.12839 2024-04-22 cs.CV cs.AI cs.LG 62%

ECOR: Explainable CLIP for Object Recognition

Ali Rasekh, Sepehr Kazemi Ranjbar, Milad Heidari, Wolfgang Nejdl

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12274 2024-04-19 cs.CL cs.AI 62%

Advancing the Robustness of Large Language Models through Self-Denoised Smoothing

Jiabao Ji, Bairu Hou, Zhen Zhang, Guanhua Zhang, Wenqi Fan, Qing Li, Yang Zhang, Gaowen Liu, Sijia Liu, Shiyu Chang

专题命中 安全评测 :jailbreak(abstract);分类 cs.CL、cs.AI

Comments Accepted by NAACL 2024. Jiabao, Bairu, Zhen, Guanhua contributed equally. This is an updated version of the paper: arXiv:2307.07171

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11148 2024-04-18 cs.AI cs.LG 62%

Explainable Machine Learning System for Predicting Chronic Kidney Disease in High-Risk Cardiovascular Patients

Nantika Nguycharoen

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02977 2024-04-18 cs.CV cs.CL cs.LG 62%

T$^3$Bench: Benchmarking Current Progress in Text-to-3D Generation

Yuze He, Yushi Bai, Matthieu Lin, Wang Zhao, Yubin Hu, Jenny Sheng, Ran Yi, Juanzi Li, Yong-Jin Liu

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10552 2024-04-17 cs.CL cs.AI 62%

Unveiling the Misuse Potential of Base Large Language Models via In-Context Learning

Xiao Wang, Tianze Chen, Xianjun Yang, Qi Zhang, Xun Zhao, Dahua Lin

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01588 2024-04-16 astro-ph.CO cs.AI cs.LG 62%

Domain Adaptive Graph Neural Networks for Constraining Cosmological Parameters Across Multiple Data Sets

Andrea Roncoli, Aleksandra Ćiprijanović, Maggie Voetberg, Francisco Villaescusa-Navarro, Brian Nord

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments Accepted in Machine Learning and the Physical Sciences Workshop at NeurIPS 2023; 9 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08799 2024-04-16 cs.CV cs.AI cs.HC cs.LG 62%

Semantic Approach to Quantifying the Consistency of Diffusion Model Image Generation

Brinnae Bent

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments Accepted to 2024 CVPR 3rd Explainable AI for Computer Vision (XAI4CV) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03823 2024-04-08 cs.CR cs.CL cs.CY 62%

An Investigation into Misuse of Java Security APIs by Large Language Models

Zahra Mousavi, Chadni Islam, Kristen Moore, Alsharif Abuadbba, Muhammad Ali Babar

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.CY

Comments This paper has been accepted by ACM ASIACCS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02675 2024-04-04 cs.CY cs.AI 62%

Responsible Reporting for Frontier AI Development

Noam Kolt, Markus Anderljung, Joslyn Barnhart, Asher Brass, Kevin Esvelt, Gillian K. Hadfield, Lennart Heim, Mikel Rodriguez, Jonas B. Sandbrink, Thomas Woodside

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04647 2024-04-04 cs.CV cs.AI cs.LG 62%

Advancing Ante-Hoc Explainable Models through Generative Adversarial Networks

Tanmay Garg, Deepika Vemuri, Vineeth N Balasubramanian

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments Paper accepted in Human-Centric Representation Learning workshop at AAAI 2024 (https://hcrl-workshop.github.io/2024/). Paper accepted and presented at Deployable AI Workshop at AAAI-2024 (https://sites.google.com/view/dai-2024/home)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00862 2024-04-02 cs.CL cs.AI 62%

Bailong: Bilingual Transfer Learning based on QLoRA and Zip-tie Embedding

Lung-Chuan Chen, Zong-Ru Li

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00599 2024-04-02 cs.CL cs.AI cs.SE 62%

EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories

Jia Li, Ge Li, Xuanming Zhang, Yihong Dong, Zhi Jin

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Data: https://github.com/seketeam/EvoCodeBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11676 2024-04-01 cs.CL cs.AI 62%

A Multi-Aspect Framework for Counter Narrative Evaluation using Large Language Models

Jaylen Jones, Lingbo Mo, Eric Fosler-Lussier, Huan Sun

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 22 pages, camera-ready version; references added, typos corrected, methodology section expanded, additional table

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17219 2024-03-28 cs.HC cs.AI cs.CY 62%

SeSaMe: A Framework to Simulate Self-Reported Ground Truth for Mental Health Sensing Studies

Akshat Choube, Vedant Das Swain, Varun Mishra

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17373 2024-03-27 cs.CV cs.AI cs.LG 62%

AIDE: An Automatic Data Engine for Object Detection in Autonomous Driving

Mingfu Liang, Jong-Chyi Su, Samuel Schulter, Sparsh Garg, Shiyu Zhao, Ying Wu, Manmohan Chandraker

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted by CVPR-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12077 2024-03-20 cs.CL cs.AI cs.IR 62%

Evaluating Robustness of Generative Search Engine on Adversarial Factual Questions

Xuming Hu, Xiaochuan Li, Junzhe Chen, Yinghui Li, Yangning Li, Xiaoguang Li, Yasheng Wang, Qun Liu, Lijie Wen, Philip S. Yu, Zhijiang Guo

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments 21 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01382 2024-03-19 cs.CL cs.LG 62%

Compressing LLMs: The Truth is Rarely Pure and Never Simple

Ajay Jaiswal, Zhe Gan, Xianzhi Du, Bowen Zhang, Zhangyang Wang, Yinfei Yang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

Comments Accepted to ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09705 2024-03-18 cs.CL cs.AI cs.ET 62%

A Novel Nuanced Conversation Evaluation Framework for Large Language Models in Mental Health

Alexander Marrapese, Basem Suleiman, Imdad Ullah, Juno Kim

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04321 2024-03-15 cs.CV cs.AI cs.CL cs.MM 62%

Discriminative Probing and Tuning for Text-to-Image Generation

Leigang Qu, Wenjie Wang, Yongqi Li, Hanwang Zhang, Liqiang Nie, Tat-Seng Chua

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments CVPR 2024; project page: https://dpt-t2i.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07916 2024-03-14 cs.AI cs.LG 62%

Advancing Investment Frontiers: Industry-grade Deep Reinforcement Learning for Portfolio Optimization

Philip Ndikum, Serge Ndikum

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06088 2024-03-12 cs.CV cs.AI cs.LG eess.IV 62%

Towards In-Vehicle Multi-Task Facial Attribute Recognition: Investigating Synthetic Data and Vision Foundation Models

Esmaeil Seraj, Walter Talamonti

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments Manuscript under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08491 2024-03-12 cs.CL cs.LG 62%

Prometheus: Inducing Fine-grained Evaluation Capability in Language Models

Seungone Kim, Jamin Shin, Yejin Cho, Joel Jang, Shayne Longpre, Hwaran Lee, Sangdoo Yun, Seongjin Shin, Sungdong Kim, James Thorne, Minjoon Seo

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.11998 2024-03-12 cs.CL cs.AI 62%

LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset

Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Tianle Li, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zhuohan Li, Zi Lin, Eric P. Xing, Joseph E. Gonzalez, Ion Stoica, Hao Zhang

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.13096 2024-03-12 cs.CV cs.AI cs.LG 62%

Language-Driven Anchors for Zero-Shot Adversarial Robustness

Xiao Li, Wei Zhang, Yining Liu, Zhanhao Hu, Bo Zhang, Xiaolin Hu

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04803 2024-03-11 cs.CR cs.AI cs.DC cs.LG 62%

Enhancing Security in Federated Learning through Adaptive Consensus-Based Model Update Validation

Zahir Alsulaimawi

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02372 2024-03-06 cs.LG cs.AI cs.DB 62%

OTClean: Data Cleaning for Conditional Independence Violations using Optimal Transport

Alireza Pirhadi, Mohammad Hossein Moslemi, Alexander Cloninger, Mostafa Milani, Babak Salimi

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18587 2024-03-01 cs.NI cs.AI cs.LG 62%

At the Dawn of Generative AI Era: A Tutorial-cum-Survey on New Frontiers in 6G Wireless Intelligence

Abdulkadir Celik, Ahmed M. Eltawil

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13633 2024-02-28 cs.HC cs.AI cs.CL 62%

EvalLM: Interactive Evaluation of Large Language Model Prompts on User-Defined Criteria

Tae Soo Kim, Yoonjoo Lee, Jamin Shin, Young-Ho Kim, Juho Kim

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted to CHI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11698 2024-02-28 cs.CL cs.AI cs.CR 62%

DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models

Boxin Wang, Weixin Chen, Hengzhi Pei, Chulin Xie, Mintong Kang, Chenhui Zhang, Chejian Xu, Zidi Xiong, Ritik Dutta, Rylan Schaeffer, Sang T. Truong, Simran Arora, Mantas Mazeika, Dan Hendrycks, Zinan Lin, Yu Cheng, Sanmi Koyejo, Dawn Song, Bo Li

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2023 Outstanding Paper (Datasets and Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05391 2024-02-27 cs.AI cs.CV cs.IR cs.LG 62%

Knowledge Graphs Meet Multi-Modal Learning: A Comprehensive Survey

Zhuo Chen, Yichi Zhang, Yin Fang, Yuxia Geng, Lingbing Guo, Xiang Chen, Qian Li, Wen Zhang, Jiaoyan Chen, Yushan Zhu, Jiaqi Li, Xiaoze Liu, Jeff Z. Pan, Ningyu Zhang, Huajun Chen

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments Ongoing work; 41 pages (Main Text), 55 pages (Total), 11 Tables, 13 Figures, 619 citations; Paper list is available at https://github.com/zjukg/KG-MM-Survey

详情

展开后加载摘要…

URL PDF HTML 收藏