arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2410.00863 2024-10-02 cs.CL 57%

On the Implications of Verbose LLM Outputs: A Case Study in Translation Evaluation

Eleftheria Briakou, Zhongtao Liu, Colin Cherry, Markus Freitag

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00699 2024-10-02 cs.LG stat.ML 57%

Investigating the Impact of Model Complexity in Large Language Models

Jing Luo, Huiyuan Wang, Weiran Huang

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00175 2024-10-02 cs.CL 57%

Adaptable Moral Stances of Large Language Models on Sexist Content: Implications for Society and Gender Discourse

Rongchen Guo, Isar Nejadgholi, Hillary Dawkins, Kathleen C. Fraser, Svetlana Kiritchenko

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments To be published at EMNLP2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09839 2024-10-02 cs.CV cs.AI 57%

Segment-Anything Models Achieve Zero-shot Robustness in Autonomous Driving

Jun Yan, Pengyu Wang, Danni Wang, Weiquan Huang, Daniel Watzenig, Huilin Yin

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments Accepted to IAVVC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08958 2024-10-01 cs.LG 57%

An Unsupervised Approach to Achieve Supervised-Level Explainability in Healthcare Records

Joakim Edin, Maria Maistro, Lars Maaløe, Lasse Borgholt, Jakob D. Havtorn, Tuukka Ruotsalo

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments Accepted to EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13475 2024-10-01 cs.RO cs.CV cs.LG cs.SY eess.SY 57%

Detecting and Mitigating System-Level Anomalies of Vision-Based Controllers

Aryaman Gupta, Kaustav Chakraborty, Somil Bansal

专题命中 安全评测 :safety(abstract);分类 cs.LG

Journal ref 2024/5/13 Conference 2024 IEEE International Conference on Robotics and Automation (ICRA) Pages 9953-9959 Publisher 2024 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17012 2024-09-26 cs.AI 57%

AI-Driven Risk-Aware Scheduling for Active Debris Removal Missions

Antoine Poupon, Hugo de Rohan Willner, Pierre Nikitits, Adam Abdin

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16899 2024-09-26 cs.RO cs.CL cs.HC 57%

Robotic Backchanneling in Online Conversation Facilitation: A Cross-Generational Study

Sota Kobuki, Katie Seaborn, Seiki Tokunaga, Kosuke Fukumori, Shun Hidaka, Kazuhiro Tamura, Koji Inoue, Tatsuya Kawahara, Mihoko Otake-Mastuura

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments Published at Proceedings of the 2023 32nd IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15740 2024-09-25 cs.AI cs.CV cs.NI 57%

Real-Time Pedestrian Detection on IoT Edge Devices: A Lightweight Deep Learning Approach

Muhammad Dany Alfikri, Rafael Kaliski

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 10 pages, 3 tables, 12 figures, article submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14907 2024-09-24 cs.CL 57%

Knowledge Planning in Large Language Models for Domain-Aligned Counseling Summarization

Aseem Srivastava, Smriti Joshi, Tanmoy Chakraborty, Md Shad Akhtar

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Full paper accepted at EMNLP 2024 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13741 2024-09-24 cs.CL cs.IR 57%

Knowing When to Ask -- Bridging Large Language Models and Data

Prashanth Radhakrishnan, Jennifer Chen, Bo Xu, Prem Ramaswami, Hannah Pho, Adriana Olmos, James Manyika, R. V. Guha

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments 39 pages - 25 page paper, 14 page Appendix, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10392 2024-09-24 cs.CL 57%

CKBP v2: Better Annotation and Reasoning for Commonsense Knowledge Base Population

Tianqing Fang, Quyet V. Do, Zihao Zheng, Weiqi Wang, Sehyun Choi, Zhaowei Wang, Yangqiu Song

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13940 2024-09-23 cs.CL 57%

A User-Centric Multi-Intent Benchmark for Evaluating Large Language Models

Jiayin Wang, Fengran Mo, Weizhi Ma, Peijie Sun, Min Zhang, Jian-Yun Nie

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12171 2024-09-19 cs.CR cs.AI 57%

Semantic Interoperability on Blockchain by Generating Smart Contracts Based on Knowledge Graphs

William Van Woensel, Oshani Seneviratne

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12076 2024-09-19 cs.LG 57%

Unsupervised Domain Adaptation Via Data Pruning

Andrea Napoli, Paul White

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11929 2024-09-19 cs.LG 57%

An Explainable Machine Learning Approach to Traffic Accident Fatality Prediction

Md. Asif Khan Rifat, Ahmedul Kabir, Armana Sabiha Huq

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments 10 Pages, 6 figures, 2 tables, 28th International Conference on Knowledge-Based and Intelligent Information & Engineering Systems (KES 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10883 2024-09-18 cs.CL 57%

CREAM: Comparison-Based Reference-Free ELO-Ranked Automatic Evaluation for Meeting Summarization

Ziwei Gong, Lin Ai, Harshsaiprasad Deshpande, Alexander Johnson, Emmy Phung, Zehui Wu, Ahmad Emami, Julia Hirschberg

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14367 2024-09-17 cs.CV cs.AI 57%

PoseBench: Benchmarking the Robustness of Pose Estimation Models under Corruptions

Sihan Ma, Jing Zhang, Qiong Cao, Dacheng Tao

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments Technical report. Project page: https://xymsh.github.io/PoseBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08887 2024-09-16 cs.CV cs.CL 57%

Visual Language Tracking with Multi-modal Interaction: A Robust Benchmark

Xuchen Li, Shiyu Hu, Xiaokun Feng, Dailing Zhang, Meiqi Wu, Jing Zhang, Kaiqi Huang

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07652 2024-09-13 stat.ML cs.LG math.ST stat.TH 57%

Gaussian Process Upper Confidence Bounds in Distributed Point Target Tracking over Wireless Sensor Networks

Xingchi Liu, Lyudmila Mihaylova, Jemin George, Tien Pham

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11774 2024-09-13 cs.LG cs.SY eess.SY 57%

Optimal Transport-Assisted Risk-Sensitive Q-Learning

Zahra Shahrooei, Ali Baheri

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05482 2024-09-10 astro-ph.SR astro-ph.EP astro-ph.IM cs.LG 57%

Advancing Machine Learning for Stellar Activity and Exoplanet Period Rotation

Fatemeh Fazel Hesar, Bernard Foing, Ana M. Heras, Mojtaba Raouf, Victoria Foing, Shima Javanmardi, Fons J. Verbeek

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments 15 pages, 8 figures. Submitted for publication in A&A

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05076 2024-09-10 cs.CV cs.AI 57%

PIP: Detecting Adversarial Examples in Large Vision-Language Models via Attention Patterns of Irrelevant Probe Questions

Yudong Zhang, Ruobing Xie, Jiansheng Chen, Xingwu Sun, Yu Wang

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments Accepted by ACM Multimedia 2024 BNI track (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04808 2024-09-10 cs.AI 57%

HULLMI: Human vs LLM identification with explainability

Prathamesh Dinesh Joshi, Sahil Pocker, Raj Abhijit Dandekar, Rajat Dandekar, Sreedath Panat

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09176 2024-09-10 cs.LG cs.CR 57%

Cross-Input Certified Training for Universal Perturbations

Changming Xu, Gagandeep Singh

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 23 pages, 6 figures, ECCV '24

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04693 2024-09-10 cs.AI 57%

MuAP: Multi-step Adaptive Prompt Learning for Vision-Language Model with Missing Modality

Ruiting Dai, Yuqiao Tan, Lisi Mo, Tao He, Ke Qin, Shuang Liang

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03598 2024-09-06 cs.LG cs.CV 57%

A practical approach to evaluating the adversarial distance for machine learning classifiers

Georg Siedel, Ekagra Gupta, Andrey Morozov

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments Accepted manuscript at International Mechanical Engineering Congress and Exposition IMECE2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01037 2024-09-04 cs.CL 57%

NYK-MS: A Well-annotated Multi-modal Metaphor and Sarcasm Understanding Benchmark on Cartoon-Caption Dataset

Ke Chang, Hao Li, Junzhao Zhang, Yunfang Wu

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12762 2024-09-04 cs.HC cs.AI 57%

Visual Verity in AI-Generated Imagery: Computational Metrics and Human-Centric Analysis

Memoona Aziz, Umair Rehman, Syed Ali Safi, Amir Zaib Abbasi

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02270 2024-09-04 cs.CL 57%

FENICE: Factuality Evaluation of summarization based on Natural language Inference and Claim Extraction

Alessandro Scirè, Karim Ghonim, Roberto Navigli

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments ACL 2024 camera ready. Code and data at https://github.com/Babelscape/FENICE

详情

展开后加载摘要…

URL PDF HTML 收藏