arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2307.08153 2024-03-12 cs.CL 57%

Analyzing Dataset Annotation Quality Management in the Wild

Jan-Christoph Klie, Richard Eckart de Castilho, Iryna Gurevych

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03808 2024-03-07 cs.RO cs.AI cs.SY eess.SY 57%

Confidence-Aware Decision-Making and Control for Tool Selection

Ajith Anil Meera, Pablo Lanillos

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03594 2024-03-07 cs.AI 57%

Assessing the Aesthetic Evaluation Capabilities of GPT-4 with Vision: Insights from Group and Individual Assessments

Yoshia Abe, Tatsuya Daikoku, Yasuo Kuniyoshi

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments 8 pages, 6 figures, submitted to The 38th Annual Conference of the Japanese Society for Artificial Intelligence, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17554 2024-02-28 cs.LG 57%

Evaluation of Predictive Reliability to Foster Trust in Artificial Intelligence. A case study in Multiple Sclerosis

Lorenzo Peracchio, Giovanna Nicora, Enea Parimbelli, Tommaso Mario Buonocore, Roberto Bergamaschi, Eleonora Tavazzi, Arianna Dagliati, Riccardo Bellazzi

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16005 2024-02-27 cs.CV cs.LG 57%

Adversarial-Robust Transfer Learning for Medical Imaging via Domain Assimilation

Xiaohui Chen, Tie Luo

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 28th Pacific-Asia Conference on Knowledge Discovery and Data Mining (PAKDD), May 2024, Taiwan

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11463 2024-02-27 cs.LG stat.ML 57%

Designing monitoring strategies for deployed machine learning algorithms: navigating performativity through a causal lens

Jean Feng, Adarsh Subbaswamy, Alexej Gossmann, Harvineet Singh, Berkman Sahiner, Mi-Ok Kim, Gene Pennello, Nicholas Petrick, Romain Pirracchio, Fan Xia

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04653 2024-02-27 cs.LG cs.CV cs.SY eess.SY 57%

From Data to Action: Exploring AI and IoT-driven Solutions for Smarter Cities

Tiago Dias, Tiago Fonseca, João Vitorino, Andreia Martins, Sofia Malpique, Isabel Praça

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments 10 pages, 8 Figures, accepted for DCAI2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13498 2024-02-22 cs.CL 57%

The Lay Person's Guide to Biomedicine: Orchestrating Large Language Models

Zheheng Luo, Qianqian Xie, Sophia Ananiadou

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.08486 2024-02-22 cs.CL cs.CV 57%

Understanding Multimodal Procedural Knowledge by Sequencing Multimodal Instructional Manuals

Te-Lin Wu, Alex Spangher, Pegah Alipoormolabashi, Marjorie Freedman, Ralph Weischedel, Nanyun Peng

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments In Proceedings of the Conference of the 60th Annual Meeting of the Association for Computational Linguistics (ACL), 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12685 2024-02-21 cs.AI 57%

XRL-Bench: A Benchmark for Evaluating and Comparing Explainable Reinforcement Learning Techniques

Yu Xiong, Zhipeng Hu, Ye Huang, Runze Wu, Kai Guan, Xingchen Fang, Ji Jiang, Tianze Zhou, Yujing Hu, Haoyu Liu, Tangjie Lyu, Changjie Fan

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12398 2024-02-21 cs.LG 57%

Primary and Secondary Factor Consistency as Domain Knowledge to Guide Happiness Computing in Online Assessment

Xiaohua Wu, Lin Li, Xiaohui Tao, Frank Xing, Jingling Yuan

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11481 2024-02-20 cs.CL 57%

DictLLM: Harnessing Key-Value Data Structures with Large Language Models for Enhanced Medical Diagnostics

YiQiu Guo, Yuchen Yang, Ya Zhang, Yu Wang, Yanfeng Wang

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11178 2024-02-20 cs.CL 57%

RENOVI: A Benchmark Towards Remediating Norm Violations in Socio-Cultural Conversations

Haolan Zhan, Zhuang Li, Xiaoxi Kang, Tao Feng, Yuncheng Hua, Lizhen Qu, Yi Ying, Mei Rianto Chandra, Kelly Rosalin, Jureynolds Jureynolds, Suraj Sharma, Shilin Qu, Linhao Luo, Lay-Ki Soon, Zhaleh Semnani Azad, Ingrid Zukerman, Gholamreza Haffari

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments work in progress. 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.10809 2024-02-15 cs.AI cs.RO 57%

Causal Explanations for Sequential Decision-Making in Multi-Agent Systems

Balint Gyevnar, Cheng Wang, Christopher G. Lucas, Shay B. Cohen, Stefano V. Albrecht

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments Accepted in 23rd International Conference on Autonomous Agents and Multi-Agent Systems (AAMAS), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15229 2024-02-14 cs.CY 57%

Evolving AI Risk Management: A Maturity Model based on the NIST AI Risk Management Framework

Ravit Dotan, Borhane Blili-Hamelin, Ravi Madhavan, Jeanna Matthews, Joshua Scarpino

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07827 2024-02-13 cs.CL 57%

Aya Model: An Instruction Finetuned Open-Access Multilingual Language Model

Ahmet Üstün, Viraat Aryabumi, Zheng-Xin Yong, Wei-Yin Ko, Daniel D'souza, Gbemileke Onilude, Neel Bhandari, Shivalika Singh, Hui-Lee Ooi, Amr Kayid, Freddie Vargus, Phil Blunsom, Shayne Longpre, Niklas Muennighoff, Marzieh Fadaee, Julia Kreutzer, Sara Hooker

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10181 2024-02-13 cs.LG 57%

Exploring the cloud of feature interaction scores in a Rashomon set

Sichao Li, Rong Wang, Quanling Deng, Amanda Barnard

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.08167 2024-02-12 cs.HC cs.CV cs.LG 57%

Where Does My Model Underperform? A Human Evaluation of Slice Discovery Algorithms

Nari Johnson, Ángel Alexander Cabrera, Gregory Plumb, Ameet Talwalkar

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments Proceedings of the AAAI Conference on Human Computation and Crowdsourcing, 11(1), 65-76. Best Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02632 2024-02-09 cs.SE cs.CL 57%

GIRT-Model: Automated Generation of Issue Report Templates

Nafiseh Nikeghbal, Amir Hossein Kargaran, Abbas Heydarnoori

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted to be published at the 21st IEEE/ACM International Conference on Mining Software Repositories (MSR 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05110 2024-02-08 cs.LG 57%

Opening the AI black box: program synthesis via mechanistic interpretability

Eric J. Michaud, Isaac Liao, Vedang Lad, Ziming Liu, Anish Mudide, Chloe Loughridge, Zifan Carl Guo, Tara Rezaei Kheirkhah, Mateja Vukelić, Max Tegmark

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02426 2024-02-07 cs.RO cs.CV cs.LG 57%

Hybrid-Prediction Integrated Planning for Autonomous Driving

Haochen Liu, Zhiyu Huang, Wenhui Huang, Haohan Yang, Xiaoyu Mo, Chen Lv

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02028 2024-02-06 cs.LG 57%

Unlearnable Examples For Time Series

Yujing Jiang, Xingjun Ma, Sarah Monazam Erfani, James Bailey

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01386 2024-02-06 cs.CL 57%

Can Language Models Be Tricked by Language Illusions? Easier with Syntax, Harder with Semantics

Yuhan Zhang, Edward Gibson, Forrest Davis

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments Accepted by The SIGNLL Conference on Computational Natural Language Learning 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00667 2024-02-02 cs.CL 57%

Improving Weak-to-Strong Generalization with Scalable Oversight and Ensemble Learning

Jitao Sang, Yuhang Wang, Jing Zhang, Yanxu Zhu, Chao Kong, Junhong Ye, Shuyu Wei, Jinlin Xiao

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05731 2024-01-31 cs.LO cs.CY cs.PL 57%

'Put the Car on the Stand': SMT-based Oracles for Investigating Decisions

Samuel Judson, Matthew Elacqua, Filip Cano, Timos Antonopoulos, Bettina Könighofer, Scott J. Shapiro, Ruzica Piskac

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.12312 2024-01-25 cs.CL 57%

Oolong: Investigating What Makes Transfer Learning Hard with Controlled Studies

Zhengxuan Wu, Alex Tamkin, Isabel Papadimitriou

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01651 2024-01-24 cs.CV cs.AI 57%

AIGCBench: Comprehensive Evaluation of Image-to-Video Content Generated by AI

Fanda Fan, Chunjie Luo, Wanling Gao, Jianfeng Zhan

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted to BenchCouncil Transactions on Benchmarks, Standards and Evaluations (TBench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00842 2024-01-23 q-bio.QM cs.LG 57%

ESM-NBR: fast and accurate nucleic acid-binding residue prediction via protein language model feature representation and multi-task learning

Wenwu Zeng, Dafeng Lv, Wenjuan Liu, Shaoliang Peng

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.10766 2024-01-22 cs.CV cs.AI 57%

On the Adversarial Robustness of Camera-based 3D Object Detection

Shaoyuan Xie, Zichao Li, Zeyu Wang, Cihang Xie

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments Transactions on Machine Learning Research, 2024. ISSN 2835-8856

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09267 2024-01-18 cs.LG 57%

Risk-Aware Accelerated Wireless Federated Learning with Heterogeneous Clients

Mohamed Ads, Hesham ElSawy, Hossam S. Hassanein

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏