arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2408.17311 2024-09-02 cs.LG cs.CV 57%

Structuring a Training Strategy to Robustify Perception Models with Realistic Image Augmentations

Ahmed Hammam, Bharathwaj Krishnaswami Sreedhar, Nura Kawa, Tim Patzelt, Oliver De Candido

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15057 2024-08-28 cs.LG 57%

Subgroup Analysis via Model-based Rule Forest

I-Ling Cheng, Chan Hsu, Chantung Ku, Pei-Ju Lee, Yihuang Kang

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13031 2024-08-26 cs.CV cs.AI cs.NE 57%

VFM-Det: Towards High-Performance Vehicle Detection via Large Foundation Models

Wentao Wu, Fanghua Hong, Xiao Wang, Chenglong Li, Jin Tang

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments In Peer Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08565 2024-08-26 cs.CL 57%

Tuning Language Models by Proxy

Alisa Liu, Xiaochuang Han, Yizhong Wang, Yulia Tsvetkov, Yejin Choi, Noah A. Smith

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments COLM 2024 camera-ready, code available at https://github.com/alisawuffles/proxy-tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12599 2024-08-23 cs.CL 57%

Controllable Text Generation for Large Language Models: A Survey

Xun Liang, Hanyu Wang, Yezhaohui Wang, Shichao Song, Jiawei Yang, Simin Niu, Jie Hu, Dan Liu, Shunyu Yao, Feiyu Xiong, Zhiyu Li

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments 52 pages, 11 figures, 7 tables, 11 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12398 2024-08-23 cs.IR cs.CL 57%

A Comparative Analysis of Faithfulness Metrics and Humans in Citation Evaluation

Weijia Zhang, Mohammad Aliannejadi, Jiahuan Pei, Yifei Yuan, Jia-Hong Huang, Evangelos Kanoulas

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted by the First Workshop on Large Language Model for Evaluation in Information Retrieval (LLM4Eval@SIGIR2024), non-archival. arXiv admin note: substantial text overlap with arXiv:2406.15264

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02551 2024-08-23 cs.RO cs.LG cs.SY eess.SY 57%

Integrating DeepRL with Robust Low-Level Control in Robotic Manipulators for Non-Repetitive Reaching Tasks

Mehdi Heydari Shahna, Seyed Adel Alizadeh Kolagar, Jouni Mattila

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments This paper has been accepted at the International Conference on Mechatronics and Automation (ICMA 2024), sponsored by the IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11539 2024-08-22 cs.CY 57%

Research on the Application of Large Language Models in Automatic Question Generation: A Case Study of ChatGLM in the Context of High School Information Technology Curriculum

Yanxin Chen, Ling He

专题命中 安全评测 :alignment(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11288 2024-08-22 cs.AI 57%

Applying and Evaluating Large Language Models in Mental Health Care: A Scoping Review of Human-Assessed Generative Tasks

Yining Hua, Hongbin Na, Zehan Li, Fenglin Liu, Xiao Fang, David Clifton, John Torous

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10830 2024-08-21 cs.CL 57%

Fake News in Sheep's Clothing: Robust Fake News Detection Against LLM-Empowered Style Attacks

Jiaying Wu, Jiafeng Guo, Bryan Hooi

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments Accepted to KDD 2024 (Research Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07424 2024-08-20 stat.ML cs.LG 57%

Addressing Distribution Shift in RTB Markets via Exponential Tilting

Minji Kim, Seong Jin Lee, Bumsik Kim

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08422 2024-08-19 cs.CE cs.AI 57%

Assessing and Enhancing Large Language Models in Rare Disease Question-answering

Guanchu Wang, Junhao Ran, Ruixiang Tang, Chia-Yuan Chang, Chia-Yuan Chang, Yu-Neng Chuang, Zirui Liu, Vladimir Braverman, Zhandong Liu, Xia Hu

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13717 2024-08-19 cs.SE cs.AI 57%

CoDefeater: Using LLMs To Find Defeaters in Assurance Cases

Usman Gohar, Michael C. Hunter, Robyn R. Lutz, Myra B. Cohen

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments ASE 2024 NIER

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07933 2024-08-16 cs.CY cs.CR 57%

Adapting cybersecurity frameworks to manage frontier AI risks: A defense-in-depth approach

Shaun Ee, Joe O'Brien, Zoe Williams, Amanda El-Dakhakhni, Michael Aird, Alex Lintz

专题命中 安全评测 :safety(abstract);分类 cs.CY

Comments 79 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06766 2024-08-14 cs.LG 57%

Robust Black-box Testing of Deep Neural Networks using Co-Domain Coverage

Aishwarya Gupta, Indranil Saha, Piyush Rai

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 20 pages (including references), 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06724 2024-08-14 cs.DB cs.AI cs.SE 57%

Adaptive Data Quality Scoring Operations Framework using Drift-Aware Mechanism for Industrial Applications

Firas Bayram, Bestoun S. Ahmed, Erik Hallin

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 17 pages

Journal ref Journal of Systems and Software 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05446 2024-08-13 cs.CV cs.LG 57%

Ensemble everything everywhere: Multi-scale aggregation for adversarial robustness

Stanislav Fort, Balaji Lakshminarayanan

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments 34 pages, 25 figures, appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05025 2024-08-13 cs.CR cs.AI 57%

Rag and Roll: An End-to-End Evaluation of Indirect Prompt Manipulations in LLM-based Application Frameworks

Gianluca De Stefano, Lea Schönherr, Giancarlo Pellegrino

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03729 2024-08-13 cs.CV cs.AI 57%

TinyLVLM-eHub: Towards Comprehensive and Efficient Evaluation for Large Vision-Language Models

Wenqi Shao, Meng Lei, Yutao Hu, Peng Gao, Kaipeng Zhang, Fanqing Meng, Peng Xu, Siyuan Huang, Hongsheng Li, Yu Qiao, Ping Luo

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments accepted to IEEE Transactions on Big Data. Project Page: http://lvlm-ehub.opengvlab.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09373 2024-08-13 cs.CL 57%

PolygloToxicityPrompts: Multilingual Evaluation of Neural Toxic Degeneration in Large Language Models

Devansh Jain, Priyanshu Kumar, Samuel Gehman, Xuhui Zhou, Thomas Hartvigsen, Maarten Sap

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments Accepted to COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05060 2024-08-12 cs.CV cs.AI 57%

DeVAn: Dense Video Annotation for Video-Language Models

Tingkai Liu, Yunzhe Tao, Haogeng Liu, Qihang Fan, Ding Zhou, Huaibo Huang, Ran He, Hongxia Yang

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Published in 62nd ACL (2024) Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00981 2024-08-08 cs.HC cs.CL 57%

VisEval: A Benchmark for Data Visualization in the Era of Large Language Models

Nan Chen, Yuge Zhang, Jiahang Xu, Kan Ren, Yuqing Yang

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07632 2024-08-08 cs.LG q-bio.BM 57%

CardioGenAI: A Machine Learning-Based Framework for Re-Engineering Drugs for Reduced hERG Liability

Gregory W. Kyro, Matthew T. Martin, Eric D. Watt, Victor S. Batista

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12193 2024-08-06 cs.CL 57%

A Chinese Dataset for Evaluating the Safeguards in Large Language Models

Yuxia Wang, Zenan Zhai, Haonan Li, Xudong Han, Lizhi Lin, Zhenxuan Zhang, Jingru Zhao, Preslav Nakov, Timothy Baldwin

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments 14 pages

Journal ref ACL2024-Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01121 2024-08-05 cs.AI 57%

Being Accountable is Smart: Navigating the Technical and Regulatory Landscape of AI-based Services for Power Grid

Anna Volkova, Mahdieh Hatamian, Alina Anapyanova, Hermann de Meer

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments Author's version of the paper for International Conference on Information Technology for Social Good (GoodIT '24), September 4--6, 2024, Bremen, Germany. It is posted here for your personal use. Not for redistribution

Journal ref In International Conference on Information Technology for Social Good (GoodIT '24), September 4--6, 2024, Bremen, Germany. ACM, New York, NY, USA, 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00986 2024-08-05 cs.AI cs.LO 57%

A SAT-based approach to rigorous verification of Bayesian networks

Ignacy Stępka, Nicholas Gisolfi, Artur Dubrawski

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments Workshop on Explainable and Robust AI for Industry 4.0 & 5.0 (X-RAI) at European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15857 2024-08-05 cs.SE cs.AI cs.RO 57%

Automated System-level Testing of Unmanned Aerial Systems

Hassan Sartaj, Asmar Muqeet, Muhammad Zohaib Iqbal, Muhammad Uzair Khan

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments Published in Automated Software Engineering

Journal ref Autom Softw Eng 31, 64 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15699 2024-08-05 cs.CL 57%

FEEL: A Framework for Evaluating Emotional Support Capability with Large Language Models

Huaiwen Zhang, Yu Chen, Ming Wang, Shi Feng

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted to ICIC 2024

Journal ref Advanced Intelligent Computing Technology and Applications. ICIC 2024. Lecture Notes in Computer Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01651 2024-08-05 cs.LG 57%

Fool Your (Vision and) Language Model With Embarrassingly Simple Permutations

Yongshuo Zong, Tingyang Yu, Ruchika Chavhan, Bingchen Zhao, Timothy Hospedales

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments ICML 2024; v3 fix typo

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00257 2024-08-02 cs.AI 57%

RoCo:Robust Collaborative Perception By Iterative Object Matching and Pose Adjustment

Zhe Huang, Shuo Wang, Yongcai Wang, Wanting Li, Deying Li, Lei Wang

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments ACM MM2024

Journal ref Proceedings of the 32nd ACM International Conference on Multimedia (MM '24), October 28-November 1, 2024, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏