arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9346 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9346 篇

2404.01291 2024-06-19 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

Evaluating Text-to-Visual Generation with Image-to-Text Generation

Zhiqiu Lin, Deepak Pathak, Baiqi Li, Jiayao Li, Xide Xia, Graham Neubig, Pengchuan Zhang, Deva Ramanan

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments We open-source our data, model, and code at: https://github.com/linzhiqiu/t2v_metrics ; Project page: https://linzhiqiu.github.io/papers/vqascore

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00378 2024-06-18 cs.CL cs.AI cs.CY 67%

ValueDCG: Measuring Comprehensive Human Value Understanding Ability of Language Models

Zhaowei Zhang, Fengshuo Bai, Jun Gao, Yaodong Yang

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04845 2024-06-10 cs.CL cs.AI cs.DC cs.LG cs.MA 67%

FedLLM-Bench: Realistic Benchmarks for Federated Learning of Large Language Models

Rui Ye, Rui Ge, Xinyu Zhu, Jingyi Chai, Yaxin Du, Yang Liu, Yanfeng Wang, Siheng Chen

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03007 2024-06-06 cs.CL cs.AI cs.CR cs.LG 67%

BadAgent: Inserting and Activating Backdoor Attacks in LLM Agents

Yifei Wang, Dizhan Xue, Shengjie Zhang, Shengsheng Qian

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14472 2024-05-29 cs.CL cs.AI cs.CV cs.HC cs.LG 67%

Detoxifying Large Language Models via Knowledge Editing

Mengru Wang, Ningyu Zhang, Ziwen Xu, Zekun Xi, Shumin Deng, Yunzhi Yao, Qishen Zhang, Linyi Yang, Jindong Wang, Huajun Chen

专题命中 安全评测 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2024. Project website: https://zjunlp.github.io/project/SafeEdit Benchmark: https://huggingface.co/datasets/zjunlp/SafeEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16136 2024-05-28 cs.AI cs.CL cs.LG cs.SD eess.AS 67%

C3LLM: Conditional Multimodal Content Generation Using Large Language Models

Zixuan Wang, Qinkai Duan, Yu-Wing Tai, Chi-Keung Tang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15817 2024-05-20 cs.AI cs.CL cs.LG 67%

Identifying the Risks of LM Agents with an LM-Emulated Sandbox

Yangjun Ruan, Honghua Dong, Andrew Wang, Silviu Pitis, Yongchao Zhou, Jimmy Ba, Yann Dubois, Chris J. Maddison, Tatsunori Hashimoto

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03162 2024-05-07 cs.CV cs.AI cs.CL cs.LG 67%

Advancing Multimodal Medical Capabilities of Gemini

Lin Yang, Shawn Xu, Andrew Sellergren, Timo Kohlberger, Yuchen Zhou, Ira Ktena, Atilla Kiraly, Faruk Ahmed, Farhad Hormozdiari, Tiam Jaroensri, Eric Wang, Ellery Wulczyn, Fayaz Jamil, Theo Guidroz, Chuck Lau, Siyuan Qiao, Yun Liu, Akshay Goel, Kendall Park, Arnav Agharwal, Nick George, Yang Wang, Ryutaro Tanno, David G. T. Barrett, Wei-Hung Weng, S. Sara Mahdavi, Khaled Saab, Tao Tu, Sreenivasa Raju Kalidindi, Mozziyar Etemadi, Jorge Cuadros, Gregory Sorensen, Yossi Matias, Katherine Chou, Greg Corrado, Joelle Barral, Shravya Shetty, David Fleet, S. M. Ali Eslami, Daniel Tse, Shruthi Prabhakara, Cory McLean, Dave Steiner, Rory Pilgrim, Christopher Kelly, Shekoofeh Azizi, Daniel Golden

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01565 2024-05-06 cs.SE 67%

The Role of Code Proficiency in the Era of Generative AI

Gregorio Robles, Christoph Treude, Jesus M. Gonzalez-Barahona, Raula Gaikovina Kula

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

Comments submitted to Software Engineering 2030

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01413 2024-05-03 cs.CV cs.AI cs.CL cs.LG 67%

MiniGPT-3D: Efficiently Aligning 3D Point Clouds with Large Language Models using 2D Priors

Yuan Tang, Xu Han, Xianzhi Li, Qiao Yu, Yixue Hao, Long Hu, Min Chen

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18416 2024-05-02 cs.AI cs.CL cs.CV cs.LG 67%

Capabilities of Gemini Models in Medicine

Khaled Saab, Tao Tu, Wei-Hung Weng, Ryutaro Tanno, David Stutz, Ellery Wulczyn, Fan Zhang, Tim Strother, Chunjong Park, Elahe Vedadi, Juanma Zambrano Chaves, Szu-Yeu Hu, Mike Schaekermann, Aishwarya Kamath, Yong Cheng, David G. T. Barrett, Cathy Cheung, Basil Mustafa, Anil Palepu, Daniel McDuff, Le Hou, Tomer Golany, Luyang Liu, Jean-baptiste Alayrac, Neil Houlsby, Nenad Tomasev, Jan Freyberg, Charles Lau, Jonas Kemp, Jeremy Lai, Shekoofeh Azizi, Kimberly Kanada, SiWai Man, Kavita Kulkarni, Ruoxi Sun, Siamak Shakeri, Luheng He, Ben Caine, Albert Webson, Natasha Latysheva, Melvin Johnson, Philip Mansfield, Jian Lu, Ehud Rivlin, Jesper Anderson, Bradley Green, Renee Wong, Jonathan Krause, Jonathon Shlens, Ewa Dominowska, S. M. Ali Eslami, Katherine Chou, Claire Cui, Oriol Vinyals, Koray Kavukcuoglu, James Manyika, Jeff Dean, Demis Hassabis, Yossi Matias, Dale Webster, Joelle Barral, Greg Corrado, Christopher Semturs, S. Sara Mahdavi, Juraj Gottweis, Alan Karthikesalingam, Vivek Natarajan

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17120 2024-04-30 cs.CL cs.AI cs.LG 67%

Talking Nonsense: Probing Large Language Models' Understanding of Adversarial Gibberish Inputs

Valeriia Cherepanova, James Zou

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06579 2024-04-11 cs.CL cs.AI cs.LG 67%

Less is More for Improving Automatic Evaluation of Factual Consistency

Tong Wang, Ninad Kulkarni, Yanjun Qi

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted in NAACL24 Industry; 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06224 2024-04-10 cs.CL cs.AI cs.LG 67%

Low-Cost Generation and Evaluation of Dictionary Example Sentences

Bill Cai, Clarence Boon Liang Ng, Daniel Tan, Shelvia Hotama

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14652 2024-03-25 cs.CY cs.AI cs.CL cs.MM 67%

MemeCraft: Contextual and Stance-Driven Multimodal Meme Generation

Han Wang, Roy Ka-Wei Lee

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 8 pages, 7 figures, ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14641 2024-03-25 cs.CY cs.AI cs.LG 67%

Testing autonomous vehicles and AI: perspectives and challenges from cybersecurity, transparency, robustness and fairness

David Fernández Llorca, Ronan Hamon, Henrik Junklewitz, Kathrin Grosse, Lars Kunze, Patrick Seiniger, Robert Swaim, Nick Reed, Alexandre Alahi, Emilia Gómez, Ignacio Sánchez, Akos Kriston

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 44 pages, 8 figures, submitted to a peer-review journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10499 2024-03-18 cs.LG cs.AI cs.CL cs.CV 67%

Benchmarking Zero-Shot Robustness of Multimodal Foundation Models: A Pilot Study

Chenguang Wang, Ruoxi Jia, Xin Liu, Dawn Song

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05606 2024-03-12 cs.LG cs.AI cs.CL cs.CV 67%

A Concept-based Interpretable Model for the Diagnosis of Choroid Neoplasias using Multimodal Data

Yifan Wu, Yang Liu, Yue Yang, Michael S. Yao, Wenli Yang, Xuehui Shi, Lihong Yang, Dongjun Li, Yueming Liu, James C. Gee, Xuan Yang, Wenbin Wei, Shi Gu

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03067 2024-03-12 cs.AI cs.CL cs.LG cs.LO 67%

DeepOnto: A Python Package for Ontology Engineering with Deep Learning

Yuan He, Jiaoyan Chen, Hang Dong, Ian Horrocks, Carlo Allocca, Taehun Kim, Brahmananda Sapkota

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by the Semantic Web Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17588 2024-02-28 cs.CL cs.AI cs.LG 67%

Diagnosing Transformers: Illuminating Feature Spaces for Clinical Decision-Making

Aliyah R. Hsu, Yeshwanth Cherapanamjeri, Briton Park, Tristan Naumann, Anobel Y. Odisho, Bin Yu

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09939 2024-02-16 cs.AI cs.CL cs.HC cs.IR cs.LG 67%

Generative AI in the Construction Industry: A State-of-the-art Analysis

Ridwan Taiwo, Idris Temitope Bello, Sulemana Fatoama Abdulai, Abdul-Mugis Yussif, Babatunde Abiodun Salami, Abdullahi Saka, Tarek Zayed

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 74 pages, 11 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01748 2024-02-08 cs.NI cs.AI cs.CL cs.LG 67%

Large Multi-Modal Models (LMMs) as Universal Foundation Models for AI-Native Wireless Systems

Shengzhe Xu, Christo Kurisummoottil Thomas, Omar Hashash, Nikhil Muralidhar, Walid Saad, Naren Ramakrishnan

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.15812 2024-02-07 cs.LG cs.AI cs.CL 67%

Peering Through Preferences: Unraveling Feedback Acquisition for Aligning Large Language Models

Hritik Bansal, John Dang, Aditya Grover

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 31 pages, Accepted to ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02513 2024-02-06 cs.LG cs.AI cs.CL cs.NE 67%

Early stopping by correlating online indicators in neural networks

Manuel Vilares Ferro, Yerai Doval Mosquera, Francisco J. Ribadas Pena, Victor M. Darriba Bilbao

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 26 pages, 6 figures

Journal ref Neural Networks, 159 (2023), pp 109-124. ISSN 1879-2782. Elsevier

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17268 2024-01-31 cs.CL cs.AI cs.LG 67%

Weaver: Foundation Models for Creative Writing

Tiannan Wang, Jiamin Chen, Qingrui Jia, Shuai Wang, Ruoyu Fang, Huilin Wang, Zhaowei Gao, Chunzhao Xie, Chuou Xu, Jihong Dai, Yibin Liu, Jialong Wu, Shengwei Ding, Long Li, Zhiwei Huang, Xinle Deng, Teng Yu, Gangan Ma, Han Xiao, Zixin Chen, Danjun Xiang, Yunxia Wang, Yuanyuan Zhu, Yi Xiao, Jing Wang, Yiru Wang, Siran Ding, Jiayang Huang, Jiayi Xu, Yilihamu Tayier, Zhenyu Hu, Yuan Gao, Chengfeng Zheng, Yueshu Ye, Yihang Li, Lei Wan, Xinyue Jiang, Yujie Wang, Siyu Cheng, Zhule Song, Xiangru Tang, Xiaohua Xu, Ningyu Zhang, Huajun Chen, Yuchen Eleanor Jiang, Wangchunshu Zhou

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13086 2024-01-25 cs.CL cs.AI cs.LG 67%

Towards Trustable Language Models: Investigating Information Quality of Large Language Models

Rick Rejeleene, Xiaowei Xu, John Talburt

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11970 2023-12-20 cs.AI cs.CL cs.CY cs.MA 67%

Large Language Models Empowered Agent-based Modeling and Simulation: A Survey and Perspectives

Chen Gao, Xiaochong Lan, Nian Li, Yuan Yuan, Jingtao Ding, Zhilun Zhou, Fengli Xu, Yong Li

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10524 2023-12-19 cs.SE 67%

Comprehensive Evaluation of ChatGPT Reliability Through Multilingual Inquiries

Poorna Chander Reddy Puttaparthi, Soham Sanjay Deo, Hakan Gul, Yiming Tang, Weiyi Shang, Zhe Yu

专题命中 安全评测 :jailbreak(abstract);prompt injection(abstract)

Comments 10 pages, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01564 2023-12-05 cs.LG cs.AI cs.CL cs.CV 67%

APoLLo: Unified Adapter and Prompt Learning for Vision Language Models

Sanjoy Chowdhury, Sayan Nag, Dinesh Manocha

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at EMNLP 2023 (Main track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01837 2023-11-29 cs.CV cs.AI cs.CL cs.LG 67%

Extending CAM-based XAI methods for Remote Sensing Imagery Segmentation

Abdul Karim Gizzini, Mustafa Shukor, Ali J. Ghandour

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏